NVIDIA打破对话AI的两难选择:传统级联系统(ASR→LLM→TTS)可自定义声音和角色但对话生硬,全双工模型(如Moshi)对话自然却锁定单一声音。PersonaPlex首次同时实现两者——通过语音嵌入+文本提示混合驱动,支持任意角色/声音设定,保留打断、回馈、自然话轮转换等实时互动能力。基于7B参数的Moshi架构,在Fisher英语语料(1217小时真实对话)+ 合成客服/助手数据(2250小时)上训练,核心发现包括:从预训练权重起步仅需不到5000小时定向数据即可实现任务跟随;真实录音与合成数据可解耦融合,用真实语音模式补足合成声音的行为丰富度;在太空紧急场景等训练分布之外的对话中展现出泛化能力。代码MIT开源,模型采用NVIDIA Open Model License。对做语音交互、对话系统、AI基础设施的读者有实质参考价值。