VoiceChat 11B
การรับรู้ FastConformer แบบ causal ป้อนช่องข้อความและฟังก์ชันของ Nemotron-H เสียงพูดสร้างด้วย EAR-TTS decoder แยกที่มีเงื่อนไขจากข้อความ — ไม่ใช่ head บนโมเดลภาษา — พร้อม neural codec 22.05 kHz
อินเทอร์เฟซที่เน้นเสียงมีสามรูปแบบ — โมเดล speech-to-speech แบบ full-duplex ที่เป็น native, ไปป์ไลน์ wake → VAD → ASR → LLM → TTS ที่คุณควบคุมทุกส่วน และการปลุกด้วยคำสั่งสำหรับใช้งานแบบแฮนด์ฟรี ทั้งหมดทำงานบนอุปกรณ์ ไม่มี cloud API และเสียงไม่ออกจากอุปกรณ์
โมเดลสนทนาพร้อมใช้ ไปป์ไลน์ประกอบที่ควบคุมได้ทีละขั้น หรือ trigger คำปลุกขนาดเล็ก ทุกแบบทำงานบนอุปกรณ์ทั้งหมด
โมเดล native สตรีมเสียงไมค์เป็นเสียงตอบกลับโดยไม่มีขอบเขตเทิร์นแบบ ASR → LLM → TTS ดั้งเดิม เลือก stack แบบไม่สมมาตรของ VoiceChat หรือ stream ตระกูล Moshi ของ PersonaPlex
คำปลุก → VAD → ASR แบบ streaming → LLM บนอุปกรณ์ → TTS ควบคุมแต่ละขั้น ดู transcript และสลับ engine ได้อย่างอิสระ สร้าง Siri ของคุณเอง
Trigger แบบแฮนด์ฟรีสำหรับทุก voice flow รองรับคีย์เวิร์ดกำหนดเองและ threshold รายวลี ใช้พื้นที่ต่ำกว่า 5 MB บนอุปกรณ์ และเร็วกว่าเรียลไทม์ 26 เท่า
ทั้งสองรับเสียงพูดต่อเนื่องและสร้างเสียงพูดโดยไม่มีขอบเขตเทิร์นแบบ ASR → LLM → TTS ดั้งเดิม ข้อความยังคงอยู่ภายในโมเดลได้ในฐานะ stream การให้เหตุผลและควบคุมที่จัดแนวกัน
การรับรู้ FastConformer แบบ causal ป้อนช่องข้อความและฟังก์ชันของ Nemotron-H เสียงพูดสร้างด้วย EAR-TTS decoder แยกที่มีเงื่อนไขจากข้อความ — ไม่ใช่ head บนโมเดลภาษา — พร้อม neural codec 22.05 kHz
PersonaPlex เริ่มจากน้ำหนัก Moshi และสร้างแบบจำลองเสียงผู้ใช้ ข้อความเอเจนต์ และเสียงเอเจนต์ร่วมกันผ่าน stream ของ Mimi และ Depformer รองรับการฟังและพูดพร้อมกัน prompt บทบาทแบบข้อความ และ prompt เสียงแบบออดิโอ
BESTOW เป็นสายงาน SpeechLLM แบบ streaming ก่อนหน้าของ NVIDIA แต่แปลงเสียงพูดเป็นข้อความ จึงไม่ใช่โมเดล S2S แบบ duplex ส่วน Moshi และ PersonaPlex อธิบายตระกูล multi-stream และ SALM-Duplex อธิบายการสร้างแบบจำลอง duplex แบบไม่สมมาตรที่มีประสิทธิภาพ Full-Duplex-Bench ประเมินช่วงหยุด การตอบรับสั้น การผลัดกันพูด และการขัดจังหวะ ซึ่ง RTF วัดไม่ได้
เซสชันจริงที่รัน NVIDIA Nemotron VoiceChat 11B ในเครื่อง: การพูดหนึ่งเทิร์น การพูดแทรกกลางประโยค และการเรียกใช้เครื่องมือ MCP เข้าสู่ Apple Reminders อย่างสมบูรณ์ RTF 0.92 บน M5 Pro ใช้หน่วยความจำ 7.5 GB และไม่มีข้อมูลใดออกจากเครื่อง