⚠ Traducción pendiente de actualización
La página canónica en inglés ya documenta el nuevo runtime MLX de 128K para audio largo, los benchmarks INT5/INT8 y el uso de memoria. Esta traducción aún describe principalmente el runtime CoreML anterior.
MOSS Transcribe Diarize 0.9B
Esta página de Soniqo documenta MOSS Transcribe Diarize 0.9B tal como está implementado en speech-swift / speech-core. Los enlaces a Hugging Face aparecen debajo de las notas de integración.
Primero página interna
Las tarjetas y menús apuntan primero aquí; los enlaces al modelo fuente y a los bundles siguen disponibles en esta página.
Resumen
| Modelo | MOSS Transcribe Diarize 0.9B |
|---|---|
| Rol | Transcripción por lotes con etiquetas de hablante y marcas de tiempo generadas por el modelo |
| Backend | CoreML con frontend Whisper nativo basado en Accelerate |
| Salida | Transcripción plana y segmentos con hablante y marcas de tiempo |
| Idiomas | Modelo MOSS de transcripción multilingüe |
| Licencia | Verifica las condiciones del modelo fuente y de los bundles para el uso previsto |
| Estado | Disponible mediante speech transcribe --engine moss y el producto Swift MossTranscribe |
| Fuente | OpenMOSS-Team/MOSS-Transcribe-Diarize |
| Producto Swift | MossTranscribe |
| CLI / runtime | speech transcribe --engine moss |
Uso
El fragmento siguiente refleja la API o el comando actual expuesto por speech-swift.
# INT8 es la opción predeterminada recomendada.
.build/release/speech transcribe recording.wav --engine moss
# Referencia FP16.
.build/release/speech transcribe recording.wav --engine moss --model fp16
Enlaces del modelo
- Bundle CoreML INT8
- Bundle CoreML FP16
- Documentación del modelo speech-swift
- Documentación de inferencia speech-swift
- Benchmark de speech-swift
Notas de implementación
- Benchmark emparejado de 80 clips en inglés en un M5 Pro: ambas variantes obtuvieron WER agregado de 8,16% y CER de 5,90%.
- Al combinar dos ejecuciones con orden invertido, INT8 obtuvo RTF 0,070 (14,3× tiempo real) frente a 0,079 (12,6×) de FP16, con RSS máximo muestreado de 2,38–2,40 GB frente a 3,69–3,74 GB.
- El runtime Swift implementa el preprocesamiento log-mel Whisper exacto, el prompt con marcadores temporales MOSS, la inyección de embeddings de audio, las actualizaciones de caché MLState, la decodificación voraz y el análisis estructurado.
- INT8 conserva el codificador de audio y la E/S del decodificador en FP16 y aplica cuantización lineal simétrica INT8 block-32 al decodificador.
- Prompt y salida comparten un contexto fijo de 1024 tokens. El runtime actual es solo por lotes y rechaza --stream.