โอเพนซอร์ส · Apache 2.0 · ทำงานออฟไลน์ทั้งหมด

เสียงพูดบนอุปกรณ์
สำหรับผลิตภัณฑ์จริง

การถอดเสียงพร้อมแยกผู้พูด การโคลนเสียงแบบ zero-shot และการสังเคราะห์เสียงพูดยาว — ทำงานบน Apple Silicon, Android, Windows และ Linux แบบฝังตัว ไม่ต้องใช้ API บนคลาวด์ ไม่มีการคิดเงินรายนาที และไม่มีข้อมูลออกจากอุปกรณ์

เริ่มต้นใช้งาน Stenograf

ความทรงจำส่วนตัวสำหรับบทสนทนา

GitHub
Apple · Homebrew
brew install speech
Android · Gradle
implementation("audio.soniqo:speech:0.0.9")
บทความและวิดีโอล่าสุด
บทความทั้งหมด
September 27, 2026 · Soniqo’s Blog

GLiNER2.5-Decide and Jev: a decision model you run, and one you call.

Open-weight GLiNER2.5-Decide in MLX Swift against TypeSafe’s hosted Jev: what each offers, what the published benchmark compared, and local measurements: 7.6 ms per request at 0.85 GB with INT8.

อ่าน
YouTube · ภาพยนตร์แนวคิด

Stenograf — จากบทสนทนาสู่การลงมือทำ

ภาพยนตร์แนวคิดที่สำรวจวิสัยทัศน์ของ Stenograf ในการเปลี่ยนบทสนทนาให้เป็นขั้นตอนต่อไปที่มีประโยชน์

รับชม
บล็อกของ Ivan · บทความภาษาอังกฤษ

NVIDIA Nemotron VoiceChat บน Apple Silicon: เสียงฟูลดูเพล็กซ์พร้อมเครื่องมือ

จาก Moshi และ PersonaPlex สู่ VoiceChat: เสียงฟูลดูเพล็กซ์จัดการการพูดแทรกและเครื่องมือ MCP อย่างไร และไปป์ไลน์คำสั่งขนาดเล็กบน Android เหมาะกับงานแบบไหน

อ่าน
YouTube · 2 นาที 33 วินาที

ฟูลดูเพล็กซ์บน MacBook พร้อมเรียกใช้เครื่องมือจริง

เซสชันจริงที่รัน NVIDIA Nemotron VoiceChat 11B ในเครื่อง: การพูดหนึ่งเทิร์น การพูดแทรกกลางประโยค และการเรียกใช้เครื่องมือ MCP เข้าสู่ Apple Reminders อย่างสมบูรณ์ RTF 0.92 บน M5 Pro และไม่มีข้อมูลใดออกจากเครื่อง

ดู
สิ่งที่คุณสร้างได้

สามกลุ่มกรณีใช้งานบนอุปกรณ์

แต่ละกลุ่มครอบคลุมหลายกรณีย่อยที่ประกอบขึ้นจากคอมโพเนนต์ของ Soniqo ส่งเสียงเข้ามา แล้วได้บทสนทนา ข้อความถอด หรือเสียงที่สร้างขึ้น — แบบโลคัล เรียลไทม์

การสนทนา

เอเจนต์เสียง

สร้างอินเตอร์เฟซที่เน้นเสียงเป็นหลัก — ตั้งแต่ speech-to-speech แบบ full-duplex ไปจนถึงไปป์ไลน์ประกอบที่ปลุกด้วยคำสั่งปลุก ทั้งหมดทำงานในเครื่อง

Learn more
การเข้าใจเสียง

การถอดเสียงเป็นข้อความ

แปลงเสียงเป็นข้อความที่มีโครงสร้าง — สตรีมมิ่งเรียลไทม์สำหรับคำบรรยายสดและการบอกพิมพ์ การประมวลผลแบบแบตช์ความแม่นยำสูงสำหรับคลังเก็บ พร้อมการแยกผู้พูดเพื่อระบุชื่อแต่ละคน

Learn more
การสร้างเนื้อหา

การสังเคราะห์เสียงพูด

สังเคราะห์เสียงพูดด้วยเสียงใดก็ได้ — โคลนเสียงในไม่กี่วินาที อ่านหนังสือเสียงได้นับชั่วโมง หรือสร้างพอดแคสต์หลายผู้พูด ทำงานออฟไลน์ทั้งหมด

Learn more
คอมโพเนนต์ทั้งหมด

มากกว่าสามสิบโมเดล หนึ่งสแต็ก

ไปป์ไลน์กรณีใช้งานด้านบนสร้างจากโมเดลเหล่านี้ เลือกคอมโพเนนต์เพื่ออ่านสถาปัตยกรรม CLI Swift API และ benchmark ทั้งหมดทำงานบน Apple Silicon ส่วนใหญ่ทำงานบน Android และ Linux ด้วย

ข้อความเป็นเสียงพูด