MOSS Transcribe Diarize 0.9B
Diese Soniqo-Seite dokumentiert MOSS Transcribe Diarize 0.9B aus der lokalen speech-swift / speech-core-Implementierung. Hugging-Face-Bundles sind nach den Integrationshinweisen verlinkt.
Zuerst interne Seite
Landing-Karten und Docs-Menüs führen zuerst hierher; Quellen- und Bundle-Links bleiben auf dieser Seite verfügbar.
Überblick
| Modell | MOSS Transcribe Diarize 0.9B |
|---|---|
| Rolle | Batchtranskription mit modellgenerierten Sprecherlabels und Zeitstempeln |
| Backend | CoreML mit nativem Accelerate-basiertem Whisper-Frontend |
| Ausgabe | Klartext-Transkript plus zeitgestempelte Sprechersegmente |
| Sprachen | Mehrsprachiges MOSS-Transkriptionsmodell |
| Lizenz | Bedingungen des Quellmodells und der Bundles für den vorgesehenen Einsatz prüfen |
| Status | Verfügbar über speech transcribe --engine moss und das Swift-Produkt MossTranscribe |
| Quelle | OpenMOSS-Team/MOSS-Transcribe-Diarize |
| Swift-Produkt | MossTranscribe |
| CLI / Laufzeit | speech transcribe --engine moss |
Verwendung
Das folgende Snippet entspricht der aktuellen API oder dem aktuellen Befehl aus speech-swift.
# INT8 ist die empfohlene Standardeinstellung.
.build/release/speech transcribe recording.wav --engine moss
# FP16-Referenz.
.build/release/speech transcribe recording.wav --engine moss --model fp16
Modelllinks
- CoreML-INT8-Bundle
- CoreML-FP16-Bundle
- speech-swift-Modelldokumentation
- speech-swift-Inferenzdokumentation
- speech-swift-Benchmark
Implementierungsnotizen
- Abgestimmter Benchmark mit 80 englischen Clips auf einem M5 Pro: Beide Varianten erreichten 8,16% aggregierte WER und 5,90% CER.
- Über zwei Läufe in umgekehrter Reihenfolge gepoolt erreichte INT8 RTF 0,070 (14,3× Echtzeit), FP16 0,079 (12,6×); die gemessene Spitzen-RSS lag bei 2,38–2,40 GB bzw. 3,69–3,74 GB.
- Die Swift-Laufzeit übernimmt exakte Whisper-log-mel-Vorverarbeitung, MOSS-Zeitmarker-Prompt, Audio-Embedding-Injektion, MLState-Cache-Aktualisierung, Greedy-Decodierung und strukturierte Ausgabeanalyse.
- INT8 behält Audio-Encoder und Decoder-I/O in FP16 und quantisiert den Decoder symmetrisch linear mit INT8 block-32.
- Prompt und Ausgabe teilen einen festen 1024-Token-Kontext. Die aktuelle Laufzeit arbeitet nur im Batchmodus und lehnt --stream ab.