每天听简报,了解最新科技、AI、软件资讯
现在的语音助手大多分不清跟自己说话的到底是谁,电话客服那种一对一演示把这个短板遮住了。英伟达开源了一个新模型,叫Nemotron 3 Diarization,专门在真实对话里持续追踪说话人身份,商业授权友好。原作者实测发现,哪怕只给一秒钟的语音片段,识别质量也很稳定,足够撑起语音助手的场景。他还把模型接到一台叫Reachy Mini的机器人上,配合在DGX Spark上跑的语音对话系统。机器人当场认出新的说话人,主动问对方叫什么名字,然后记住这个声音。这个模型开源当天就适配了Transformers库,可以直接拿来用。
进度保存在本设备 · 登录同步