MOSS Transcribe Diarize 0.9B
この Soniqo ページは、ローカルの speech-swift / speech-core 実装にある MOSS Transcribe Diarize 0.9B を説明します。Hugging Face バンドルへのリンクは統合メモの後にあります。
まずサイト内ページへ
ランディングカードとドキュメントメニューは先にこのページへ向け、ソースモデルとバンドルのリンクは本ページ内に残します。
概要
| モデル | MOSS Transcribe Diarize 0.9B |
|---|---|
| 役割 | モデル生成の話者ラベルとタイムスタンプを伴うバッチ文字起こし |
| バックエンド | Accelerate ベースのネイティブ Whisper フロントエンドを使用する CoreML |
| 出力 | プレーンな文字起こしと、話者付きタイムスタンプ区間 |
| 言語 | 多言語 MOSS 文字起こしモデル |
| ライセンス | 用途に応じてソースモデルとバンドルの利用条件を確認してください |
| 状態 | speech transcribe --engine moss と MossTranscribe Swift プロダクトから利用可能 |
| ソース | OpenMOSS-Team/MOSS-Transcribe-Diarize |
| Swift プロダクト | MossTranscribe |
| CLI / ランタイム | speech transcribe --engine moss |
使い方
以下のスニペットは、現在の speech-swift リポジトリが公開している API またはコマンドに合わせています。
# INT8 が推奨の既定値です。
.build/release/speech transcribe recording.wav --engine moss
# FP16 の参照版。
.build/release/speech transcribe recording.wav --engine moss --model fp16
モデルリンク
実装メモ
- M5 Pro 上の英語 80 クリップの同一ベンチマークでは、両版とも集約 WER 8.16%、CER 5.90% でした。
- 順序を反転した 2 回の実行を合算すると、INT8 は RTF 0.070(14.3× リアルタイム)、FP16 は 0.079(12.6×)で、ピーク RSS はそれぞれ 2.38–2.40 GB と 3.69–3.74 GB でした。
- Swift ランタイムが正確な Whisper log-mel 前処理、MOSS 時間マーカープロンプト、音声埋め込み注入、MLState キャッシュ更新、貪欲デコード、構造化出力解析を担当します。
- INT8 版は音声エンコーダーとデコーダー I/O を FP16 のまま保ち、デコーダーに対称線形 INT8 block-32 量子化を適用します。
- プロンプトと出力は固定 1024-token コンテキストを共有します。現在はバッチ専用で、--stream は拒否されます。