MOSS Transcribe Diarize 0.9B
Esta página da Soniqo documenta MOSS Transcribe Diarize 0.9B conforme a implementação local em speech-swift / speech-core. Os links do Hugging Face ficam abaixo das notas de integração.
Página interna primeiro
Cards e menus apontam primeiro para cá; os links do modelo fonte e dos bundles continuam disponíveis nesta página.
Visão geral
| Modelo | MOSS Transcribe Diarize 0.9B |
|---|---|
| Papel | Transcrição em lote com rótulos de locutor e timestamps gerados pelo modelo |
| Backend | CoreML com frontend Whisper nativo baseado no Accelerate |
| Saída | Transcrição simples e segmentos com locutor e timestamps |
| Idiomas | Modelo MOSS de transcrição multilíngue |
| Licença | Verifique os termos do modelo fonte e dos bundles para o uso pretendido |
| Status | Disponível via speech transcribe --engine moss e o produto Swift MossTranscribe |
| Fonte | OpenMOSS-Team/MOSS-Transcribe-Diarize |
| Produto Swift | MossTranscribe |
| CLI / runtime | speech transcribe --engine moss |
Uso
O trecho abaixo reflete a API ou comando atual exposto por speech-swift.
# INT8 é o padrão recomendado.
.build/release/speech transcribe recording.wav --engine moss
# Referência FP16.
.build/release/speech transcribe recording.wav --engine moss --model fp16
Links do modelo
- Bundle CoreML INT8
- Bundle CoreML FP16
- Documentação do modelo speech-swift
- Documentação de inferência speech-swift
- Benchmark do speech-swift
Notas de implementação
- Benchmark pareado de 80 clipes em inglês num M5 Pro: ambas as variantes atingiram WER agregado de 8,16% e CER de 5,90%.
- Agrupando duas execuções em ordem invertida, INT8 obteve RTF 0,070 (14,3× tempo real), contra 0,079 (12,6×) do FP16, com pico de RSS amostrado de 2,38–2,40 GB contra 3,69–3,74 GB.
- O runtime Swift implementa o pré-processamento log-mel Whisper exato, o prompt com marcadores de tempo MOSS, a injeção de embeddings de áudio, as atualizações de cache MLState, a decodificação gulosa e a análise estruturada.
- INT8 mantém o encoder de áudio e a E/S do decoder em FP16 e aplica quantização linear simétrica INT8 block-32 ao decoder.
- Prompt e saída compartilham um contexto fixo de 1024 tokens. O runtime atual é somente em lote e rejeita --stream.