NVIDIA在Hugging Face发布开源说话人分离模型Nemotron 3 Diarization,1亿参数,最多追踪8位说话人,支持重叠语音,单检查点兼顾离线与实时流式。采用31层Transformer编码器,输出每位说话人活跃概率,延迟分四档,最低0.32秒。在Voice Arena基准排名第一,DER为14.72%,较前代平均降低41%。权重以OpenMDW 1.1发布,允许商用,经NeMo在NVIDIA GPU运行。
完成下面两步后,将自动完成登录并继续当前操作。