VoiceChat 11B
La perception FastConformer causale alimente les canaux texte et fonction de Nemotron-H. La parole est produite par un décodeur EAR-TTS séparé et conditionné par le texte — pas par une tête sur le modèle de langage — puis par un codec neuronal à 22,05 kHz.
