VoiceChat 11B
Nhận thức FastConformer nhân quả cấp dữ liệu cho các kênh văn bản và hàm của Nemotron-H. Giọng nói được tạo bởi decoder EAR-TTS riêng có điều kiện văn bản — không phải một head trên mô hình ngôn ngữ — cùng codec thần kinh 22,05 kHz.
Ba dạng giao diện ưu tiên giọng nói — các mô hình speech-to-speech song công toàn phần nguyên bản, pipeline ghép wake → VAD → ASR → LLM → TTS mà bạn kiểm soát hoàn toàn, và kích hoạt bằng từ khóa để sử dụng rảnh tay. Tất cả chạy trên thiết bị, không API đám mây, âm thanh không rời thiết bị.
Mô hình hội thoại dùng ngay, pipeline có thể ghép với quyền kiểm soát từng bước, hoặc bộ kích hoạt từ khóa gọn nhẹ. Mỗi lựa chọn đều chạy hoàn toàn trên thiết bị.
Các mô hình nguyên bản truyền âm thanh micro thành giọng nói đầu ra mà không có ranh giới lượt ASR → LLM → TTS cổ điển. Chọn stack bất đối xứng của VoiceChat hoặc các luồng thuộc họ Moshi của PersonaPlex.
Từ khóa → VAD → ASR streaming → LLM trên thiết bị → TTS. Kiểm soát từng bước, xem được bản ghi và tự do đổi engine. Xây dựng Siri của riêng bạn.
Bộ kích hoạt rảnh tay cho mọi luồng giọng nói. Từ khóa tùy chỉnh với ngưỡng theo cụm, dưới 5 MB trên thiết bị, nhanh hơn thời gian thực 26×.
Cả hai nhận giọng nói liên tục và tạo giọng nói mà không có ranh giới lượt ASR → LLM → TTS cổ điển. Văn bản vẫn có thể tồn tại bên trong mô hình như một luồng suy luận và điều khiển được căn chỉnh.
Nhận thức FastConformer nhân quả cấp dữ liệu cho các kênh văn bản và hàm của Nemotron-H. Giọng nói được tạo bởi decoder EAR-TTS riêng có điều kiện văn bản — không phải một head trên mô hình ngôn ngữ — cùng codec thần kinh 22,05 kHz.
PersonaPlex khởi tạo từ trọng số Moshi và cùng mô hình hóa âm thanh người dùng, văn bản tác nhân và âm thanh tác nhân qua các luồng Mimi và Depformer. Mô hình hỗ trợ nghe-nói đồng thời, prompt vai trò bằng văn bản và prompt giọng bằng âm thanh.
BESTOW đại diện cho dòng SpeechLLM streaming trước đó của NVIDIA, nhưng ánh xạ giọng nói thành văn bản chứ không phải mô hình S2S song công. Moshi và PersonaPlex mô tả họ đa luồng, còn SALM-Duplex mô tả mô hình song công bất đối xứng hiệu quả. Full-Duplex-Bench đánh giá khoảng dừng, phản hồi ngắn, đổi lượt và ngắt lời — các hành vi tương tác mà RTF không thể hiện.
Một phiên thực tế chạy NVIDIA Nemotron VoiceChat 11B cục bộ: một lượt nói, một lần ngắt lời giữa câu, và một lệnh gọi công cụ MCP hoàn chỉnh vào Apple Reminders. RTF 0,92 trên M5 Pro, 7,5 GB thường trú, không có gì rời khỏi máy.