VoiceChat 11B
Kausale FastConformer-Wahrnehmung speist die Text- und Funktionskanäle von Nemotron-H. Sprache wird durch einen separaten, textkonditionierten EAR-TTS-Decoder — nicht durch einen Head auf dem Sprachmodell — und einen neuronalen 22,05-kHz-Codec erzeugt.
