会议ASR大模型需直接处理真实会议中的远场、混响、噪声、重叠说话及术语等复杂情况,而非依赖外部前端。模型应内生声学鲁棒性、多说话人结构、长上下文理解和克制生成能力,输出含说话人、时间戳的结构化记录,以支撑摘要、问答等上层应用,减少误差传播。
完成下面两步后,将自动完成登录并继续当前操作。