VoiceChat 11B
A percepção FastConformer causal alimenta os canais de texto e função do Nemotron-H. A fala é produzida por um decoder EAR-TTS separado e condicionado por texto — não por uma head no modelo de linguagem — e um codec neural de 22,05 kHz.
