กรณีใช้งาน · การสนทนา

เสียงเข้า
เสียงออก

อินเทอร์เฟซที่เน้นเสียงมีสามรูปแบบ — โมเดล speech-to-speech แบบ full-duplex ที่เป็น native, ไปป์ไลน์ wake → VAD → ASR → LLM → TTS ที่คุณควบคุมทุกส่วน และการปลุกด้วยคำสั่งสำหรับใช้งานแบบแฮนด์ฟรี ทั้งหมดทำงานบนอุปกรณ์ ไม่มี cloud API และเสียงไม่ออกจากอุปกรณ์

สามกรณีย่อย

เลือกรูปแบบที่เหมาะกับผลิตภัณฑ์

โมเดลสนทนาพร้อมใช้ ไปป์ไลน์ประกอบที่ควบคุมได้ทีละขั้น หรือ trigger คำปลุกขนาดเล็ก ทุกแบบทำงานบนอุปกรณ์ทั้งหมด

Speech-to-speech แบบ native

สองตระกูลโมเดล สองดีไซน์ duplex

ทั้งสองรับเสียงพูดต่อเนื่องและสร้างเสียงพูดโดยไม่มีขอบเขตเทิร์นแบบ ASR → LLM → TTS ดั้งเดิม ข้อความยังคงอยู่ภายในโมเดลได้ในฐานะ stream การให้เหตุผลและควบคุมที่จัดแนวกัน

สาย SALM-Duplex · ไม่สมมาตร

VoiceChat 11B

การรับรู้ FastConformer แบบ causal ป้อนช่องข้อความและฟังก์ชันของ Nemotron-H เสียงพูดสร้างด้วย EAR-TTS decoder แยกที่มีเงื่อนไขจากข้อความ — ไม่ใช่ head บนโมเดลภาษา — พร้อม neural codec 22.05 kHz

สถาปัตยกรรม
16 kHz → causal FastConformer
Nemotron-H · text + function
separate EAR-TTS → 22.05 kHz codec
วัดในเครื่อง
RTF 0.92–0.94
M5 Pro · 48 GB · Release · protected-head INT5
44.3–46.7 ms first spoken text token · 74.0–76.4 ms first playable audio
76.2–78.6 ms frame p95 · ~8.70 GB peak RSS
ตระกูล Moshi · multi-stream

PersonaPlex 7B

PersonaPlex เริ่มจากน้ำหนัก Moshi และสร้างแบบจำลองเสียงผู้ใช้ ข้อความเอเจนต์ และเสียงเอเจนต์ร่วมกันผ่าน stream ของ Mimi และ Depformer รองรับการฟังและพูดพร้อมกัน prompt บทบาทแบบข้อความ และ prompt เสียงแบบออดิโอ

สถาปัตยกรรม
Moshi weights
Mimi RVQ + Depformer
user audio ↔ agent text ↔ agent audio
วัดในเครื่อง
RTF ~1.4
M2 Max · 8-bit
~112 ms / step · 18 selectable voices
~9.1 GB bundle · ~11 GB peak RAM
RTF คือเวลาที่ใช้สร้างจริงหารด้วยความยาวเสียงเอาต์พุต ค่าต่ำกว่า 1 จึงรักษา streaming บนอุปกรณ์ที่ทดสอบได้ การวัดใช้ Mac ต่างรุ่นจึงไม่ใช่การจัดอันดับโมเดล เอาต์พุตแรกและ throughput ต่อ frame เป็นค่าคำนวณหลัง warm-up ไม่ใช่ latency การผลัดกันพูดที่เรียนรู้
งานวิจัยที่เกี่ยวข้อง

สายสถาปัตยกรรมและการประเมิน duplex

BESTOW เป็นสายงาน SpeechLLM แบบ streaming ก่อนหน้าของ NVIDIA แต่แปลงเสียงพูดเป็นข้อความ จึงไม่ใช่โมเดล S2S แบบ duplex ส่วน Moshi และ PersonaPlex อธิบายตระกูล multi-stream และ SALM-Duplex อธิบายการสร้างแบบจำลอง duplex แบบไม่สมมาตรที่มีประสิทธิภาพ Full-Duplex-Bench ประเมินช่วงหยุด การตอบรับสั้น การผลัดกันพูด และการขัดจังหวะ ซึ่ง RTF วัดไม่ได้

เปรียบเทียบการตั้งค่า API, bundle และ benchmark
speech voice-chat · เซสชันที่บันทึกจริง

ฟูลดูเพล็กซ์บน MacBook พร้อมเรียกใช้เครื่องมือจริง

เซสชันจริงที่รัน NVIDIA Nemotron VoiceChat 11B ในเครื่อง: การพูดหนึ่งเทิร์น การพูดแทรกกลางประโยค และการเรียกใช้เครื่องมือ MCP เข้าสู่ Apple Reminders อย่างสมบูรณ์ RTF 0.92 บน M5 Pro ใช้หน่วยความจำ 7.5 GB และไม่มีข้อมูลใดออกจากเครื่อง

อ่านเพิ่มเติม

คู่มือคอมโพเนนต์