VoiceChat 11B
La percepción FastConformer causal alimenta los canales de texto y funciones de Nemotron-H. La voz se genera con un decodificador EAR-TTS independiente condicionado por texto — no con un cabezal sobre el modelo de lenguaje — y un códec neuronal de 22,05 kHz.
