MOSS Transcribe Diarize 0.9B
Cette page Soniqo documente MOSS Transcribe Diarize 0.9B tel qu'il est implémenté dans speech-swift / speech-core. Les liens Hugging Face sont placés après les notes d'intégration.
Page interne d'abord
Les cartes et menus pointent d'abord ici; les liens vers le modèle source et les bundles restent disponibles sur cette page.
Aperçu
| Modèle | MOSS Transcribe Diarize 0.9B |
|---|---|
| Rôle | Transcription par lots avec étiquettes de locuteur et horodatages générés par le modèle |
| Backend | CoreML avec frontend Whisper natif fondé sur Accelerate |
| Sortie | Transcription simple et segments horodatés attribués aux locuteurs |
| Langues | Modèle MOSS de transcription multilingue |
| Licence | Vérifiez les conditions du modèle source et des bundles pour l’usage prévu |
| État | Disponible via speech transcribe --engine moss et le produit Swift MossTranscribe |
| Source | OpenMOSS-Team/MOSS-Transcribe-Diarize |
| Produit Swift | MossTranscribe |
| CLI / runtime | speech transcribe --engine moss |
Utilisation
L'extrait ci-dessous suit l'API ou la commande actuellement exposée par speech-swift.
# INT8 est le choix par défaut recommandé.
.build/release/speech transcribe recording.wav --engine moss
# Référence FP16.
.build/release/speech transcribe recording.wav --engine moss --model fp16
Liens du modèle
- Bundle CoreML INT8
- Bundle CoreML FP16
- Documentation du modèle speech-swift
- Documentation d’inférence speech-swift
- Benchmark speech-swift
Notes d'implémentation
- Benchmark apparié de 80 clips anglais sur M5 Pro : les deux variantes atteignent 8,16% de WER agrégé et 5,90% de CER.
- Sur deux exécutions en ordre inversé, INT8 donne un RTF groupé de 0,070 (14,3× temps réel), contre 0,079 (12,6×) pour FP16, avec un pic RSS échantillonné de 2,38–2,40 Go contre 3,69–3,74 Go.
- Le runtime Swift prend en charge le prétraitement log-mel Whisper exact, le prompt à marqueurs temporels MOSS, l’injection des embeddings audio, les mises à jour du cache MLState, le décodage glouton et l’analyse structurée.
- INT8 conserve l’encodeur audio et les E/S du décodeur en FP16, puis applique au décodeur une quantification linéaire symétrique INT8 block-32.
- Le prompt et la sortie partagent un contexte fixe de 1024 tokens. Le runtime actuel fonctionne uniquement par lots et refuse --stream.