MOSS Transcribe Diarize 0.9B
หน้านี้ของ Soniqo อธิบาย MOSS Transcribe Diarize 0.9B ตาม implementation ใน speech-swift / speech-core ส่วนลิงก์ Hugging Face อยู่ใต้หมายเหตุการใช้งาน
เข้าหน้าในเว็บก่อน
การ์ดหน้าแรกและเมนูเอกสารจะชี้มาที่หน้านี้ก่อน ส่วนลิงก์ไปยัง source model และ bundle ยังอยู่ในหน้านี้
ภาพรวม
| โมเดล | MOSS Transcribe Diarize 0.9B |
|---|---|
| บทบาท | การถอดเสียงแบบแบตช์พร้อมป้ายผู้พูดและเวลาที่โมเดลสร้าง |
| Backend | CoreML พร้อมส่วนหน้า Whisper แบบเนทีฟที่ใช้ Accelerate |
| Output | ข้อความถอดเสียงและช่วงเวลาที่ระบุผู้พูด |
| ภาษา | โมเดลถอดเสียง MOSS หลายภาษา |
| License | โปรดตรวจสอบเงื่อนไขของโมเดลต้นทางและ bundle ให้เหมาะกับการใช้งาน |
| สถานะ | ใช้งานผ่าน speech transcribe --engine moss และผลิตภัณฑ์ Swift ชื่อ MossTranscribe |
| Source | OpenMOSS-Team/MOSS-Transcribe-Diarize |
| Swift product | MossTranscribe |
| CLI / runtime | speech transcribe --engine moss |
การใช้งาน
snippet ด้านล่างตรงกับ API หรือคำสั่งปัจจุบันใน speech-swift
# แนะนำให้ใช้ INT8 เป็นค่าเริ่มต้น
.build/release/speech transcribe recording.wav --engine moss
# รุ่นอ้างอิง FP16
.build/release/speech transcribe recording.wav --engine moss --model fp16
ลิงก์โมเดล
- bundle CoreML INT8
- bundle CoreML FP16
- เอกสารโมเดล speech-swift
- เอกสารการอนุมาน speech-swift
- benchmark ของ speech-swift
หมายเหตุ implementation
- benchmark เดียวกันด้วยคลิปภาษาอังกฤษ 80 คลิปบน M5 Pro: ทั้งสองรุ่นได้ WER รวม 8.16% และ CER 5.90%
- เมื่อรวมการรันสองครั้งโดยสลับลำดับ INT8 มี RTF 0.070 (14.3× real-time) ส่วน FP16 มี 0.079 (12.6×) และ RSS สูงสุดที่วัดได้คือ 2.38–2.40 GB เทียบกับ 3.69–3.74 GB
- runtime Swift ดูแลการประมวลผล Whisper log-mel ที่ตรงกัน การสร้าง prompt พร้อมเครื่องหมายเวลา MOSS การใส่ audio embedding การอัปเดตแคช MLState การถอดรหัสแบบ greedy และการแยกผลลัพธ์แบบมีโครงสร้าง
- INT8 คง audio encoder และ decoder I/O เป็น FP16 พร้อมใช้การ quantize แบบ symmetric linear INT8 block-32 กับ decoder
- Prompt และ output ใช้ context คงที่ 1024 token ร่วมกัน ปัจจุบัน runtime รองรับเฉพาะแบบแบตช์และไม่ยอมรับ --stream