MOSS Transcribe Diarize 0.9B
Эта страница Soniqo описывает MOSS Transcribe Diarize 0.9B из локальной реализации speech-swift / speech-core. Ссылки на Hugging Face находятся ниже после заметок по интеграции.
Сначала внутренняя страница
Карточки и меню документации сначала ведут сюда; ссылки на исходную модель и бандлы остаются на этой странице.
Кратко
| Модель | MOSS Transcribe Diarize 0.9B |
|---|---|
| Роль | Пакетная транскрипция с созданными моделью метками говорящих и времени |
| Backend | CoreML с нативным Whisper-фронтендом на Accelerate |
| Вывод | Обычный текст и сегменты с временными метками и говорящими |
| Языки | Многоязычная модель транскрипции MOSS |
| Лицензия | Проверьте условия исходной модели и бандлов для предполагаемого использования |
| Статус | Доступно через speech transcribe --engine moss и Swift-продукт MossTranscribe |
| Источник | OpenMOSS-Team/MOSS-Transcribe-Diarize |
| Swift-продукт | MossTranscribe |
| CLI / runtime | speech transcribe --engine moss |
Использование
Фрагмент ниже соответствует текущему API или команде из speech-swift.
# INT8 — рекомендуемый вариант по умолчанию.
.build/release/speech transcribe recording.wav --engine moss
# Эталон FP16.
.build/release/speech transcribe recording.wav --engine moss --model fp16
Ссылки модели
- Бандл CoreML INT8
- Бандл CoreML FP16
- Документация модели speech-swift
- Документация инференса speech-swift
- Бенчмарк speech-swift
Заметки реализации
- Сопоставимый тест 80 английских клипов на M5 Pro: обе версии показали суммарный WER 8,16% и CER 5,90%.
- По двум запускам в обратном порядке INT8 дал объединённый RTF 0,070 (14,3× реального времени), FP16 — 0,079 (12,6×); выборочный пик RSS составил 2,38–2,40 ГБ и 3,69–3,74 ГБ.
- Среда Swift выполняет точную log-mel-предобработку Whisper, сборку MOSS-промпта с метками времени, подстановку аудиоэмбеддингов, обновление MLState, жадное декодирование и разбор структуры.
- INT8 сохраняет аудиоэнкодер и ввод-вывод декодера в FP16, применяя к декодеру симметричную линейную квантизацию INT8 block-32.
- Промпт и вывод делят фиксированный контекст на 1024 токена. Сейчас поддерживается только пакетный режим, а --stream отклоняется.