音频语言模型(ALMs)推动语音理解向多任务生成转型。西工大与南京大学等合作提出MSU-Bench评测基准,专注于多说话人对话理解,涵盖16个子任务。研究表明,现有模型在说话人定位和对话推理方面仍存在不足,未来需优化以提升多说话人理解能力。
生成式AI技术在图像领域取得突破,OmniGen和OmniGen2模型提供统一的多任务生成解决方案。OmniGen2通过独立解码路径提升灵活性,克服了多模态解耦的局限性。
完成下面两步后,将自动完成登录并继续当前操作。