Trường hợp sử dụng · Hội thoại

Giọng nói vào.
Giọng nói ra.

Ba dạng giao diện ưu tiên giọng nói — các mô hình speech-to-speech song công toàn phần nguyên bản, pipeline ghép wake → VAD → ASR → LLM → TTS mà bạn kiểm soát hoàn toàn, và kích hoạt bằng từ khóa để sử dụng rảnh tay. Tất cả chạy trên thiết bị, không API đám mây, âm thanh không rời thiết bị.

Ba trường hợp con

Chọn dạng phù hợp với sản phẩm.

Mô hình hội thoại dùng ngay, pipeline có thể ghép với quyền kiểm soát từng bước, hoặc bộ kích hoạt từ khóa gọn nhẹ. Mỗi lựa chọn đều chạy hoàn toàn trên thiết bị.

Speech-to-speech nguyên bản

Hai họ mô hình, hai thiết kế song công.

Cả hai nhận giọng nói liên tục và tạo giọng nói mà không có ranh giới lượt ASR → LLM → TTS cổ điển. Văn bản vẫn có thể tồn tại bên trong mô hình như một luồng suy luận và điều khiển được căn chỉnh.

Dòng SALM-Duplex · bất đối xứng

VoiceChat 11B

Nhận thức FastConformer nhân quả cấp dữ liệu cho các kênh văn bản và hàm của Nemotron-H. Giọng nói được tạo bởi decoder EAR-TTS riêng có điều kiện văn bản — không phải một head trên mô hình ngôn ngữ — cùng codec thần kinh 22,05 kHz.

Kiến trúc
16 kHz → causal FastConformer
Nemotron-H · text + function
separate EAR-TTS → 22.05 kHz codec
Đo cục bộ
RTF 0.92–0.94
M5 Pro · 48 GB · Release · protected-head INT5
44.3–46.7 ms first spoken text token · 74.0–76.4 ms first playable audio
76.2–78.6 ms frame p95 · ~8.70 GB peak RSS
Họ Moshi · đa luồng

PersonaPlex 7B

PersonaPlex khởi tạo từ trọng số Moshi và cùng mô hình hóa âm thanh người dùng, văn bản tác nhân và âm thanh tác nhân qua các luồng Mimi và Depformer. Mô hình hỗ trợ nghe-nói đồng thời, prompt vai trò bằng văn bản và prompt giọng bằng âm thanh.

Kiến trúc
Moshi weights
Mimi RVQ + Depformer
user audio ↔ agent text ↔ agent audio
Đo cục bộ
RTF ~1.4
M2 Max · 8-bit
~112 ms / step · 18 selectable voices
~9.1 GB bundle · ~11 GB peak RAM
RTF là thời gian tạo thực tế chia cho độ dài âm thanh đầu ra; dưới 1 có thể duy trì streaming trên thiết bị đã thử. Các lần đo dùng những máy Mac khác nhau nên không phải bảng xếp hạng mô hình. Đầu ra đầu tiên và thông lượng frame là số đo tính toán sau warm-up, không phải độ trễ đổi lượt đã học.
Nghiên cứu liên quan

Dòng kiến trúc và đánh giá song công.

BESTOW đại diện cho dòng SpeechLLM streaming trước đó của NVIDIA, nhưng ánh xạ giọng nói thành văn bản chứ không phải mô hình S2S song công. Moshi và PersonaPlex mô tả họ đa luồng, còn SALM-Duplex mô tả mô hình song công bất đối xứng hiệu quả. Full-Duplex-Bench đánh giá khoảng dừng, phản hồi ngắn, đổi lượt và ngắt lời — các hành vi tương tác mà RTF không thể hiện.

So sánh thiết lập, API, bundle và benchmark
speech voice-chat · phiên ghi lại

Song công hoàn toàn trên MacBook, gọi công cụ thật.

Một phiên thực tế chạy NVIDIA Nemotron VoiceChat 11B cục bộ: một lượt nói, một lần ngắt lời giữa câu, và một lệnh gọi công cụ MCP hoàn chỉnh vào Apple Reminders. RTF 0,92 trên M5 Pro, 7,5 GB thường trú, không có gì rời khỏi máy.

Đọc thêm

Hướng dẫn thành phần.