MOSS Transcribe Diarize 0.9B
Esta página de Soniqo documenta MOSS Transcribe Diarize 0.9B tal como está implementado en speech-swift / speech-core. Los enlaces a Hugging Face aparecen debajo de las notas de integración.
Primero página interna
Las tarjetas y menús apuntan primero aquí; los enlaces al modelo fuente y a los bundles siguen disponibles en esta página.
Resumen
| Modelo | MOSS Transcribe Diarize 0.9B |
|---|---|
| Rol | Transcripción por lotes con etiquetas de hablante y marcas de tiempo generadas por el modelo |
| Backend | CoreML con frontend Whisper nativo basado en Accelerate |
| Salida | Transcripción plana y segmentos con hablante y marcas de tiempo |
| Idiomas | Modelo MOSS de transcripción multilingüe |
| Licencia | Verifica las condiciones del modelo fuente y de los bundles para el uso previsto |
| Estado | Disponible mediante speech transcribe --engine moss y el producto Swift MossTranscribe |
| Fuente | OpenMOSS-Team/MOSS-Transcribe-Diarize |
| Producto Swift | MossTranscribe |
| CLI / runtime | speech transcribe --engine moss |
Uso
El fragmento siguiente refleja la API o el comando actual expuesto por speech-swift.
# INT8 es la opción predeterminada recomendada.
.build/release/speech transcribe recording.wav --engine moss
# Referencia FP16.
.build/release/speech transcribe recording.wav --engine moss --model fp16
Enlaces del modelo
- Bundle CoreML INT8
- Bundle CoreML FP16
- Documentación del modelo speech-swift
- Documentación de inferencia speech-swift
- Benchmark de speech-swift
Notas de implementación
- Benchmark emparejado de 80 clips en inglés en un M5 Pro: ambas variantes obtuvieron WER agregado de 8,16% y CER de 5,90%.
- Al combinar dos ejecuciones con orden invertido, INT8 obtuvo RTF 0,070 (14,3× tiempo real) frente a 0,079 (12,6×) de FP16, con RSS máximo muestreado de 2,38–2,40 GB frente a 3,69–3,74 GB.
- El runtime Swift implementa el preprocesamiento log-mel Whisper exacto, el prompt con marcadores temporales MOSS, la inyección de embeddings de audio, las actualizaciones de caché MLState, la decodificación voraz y el análisis estructurado.
- INT8 conserva el codificador de audio y la E/S del decodificador en FP16 y aplica cuantización lineal simétrica INT8 block-32 al decodificador.
- Prompt y salida comparten un contexto fijo de 1024 tokens. El runtime actual es solo por lotes y rechaza --stream.