MiniMax发布新一代开源视频模型H3,具备全模态精准控制和AI原生后期能力,支持文字、图片、视频、音频混合输入。测试显示,H3能高效生成产品宣传片、品牌片、广告和游戏UI视频,精准替换物体、背景和镜头角度,并自动完成转场、配乐和文字渲染。它降低了视频制作门槛,让非专业用户也能快速产出完整Demo,同时开源特性帮助企业自主搭建视频生产能力,推动AI视频进入商业生产。
面壁智能发布了MiniCPM-o 4.5,这是首个全双工全模态大模型,支持视频、音频和文本流输入,能够在个人电脑上运行,具备实时感知和主动交互能力,提升用户体验。该模型在多项评测中表现优异,适用于智能助手和无障碍服务,但在稳定性和复杂场景处理上仍有不足。
戴盟机器人发布了全球最大规模的全模态物理世界数据集Daimon-Infinity,涵盖触觉、视觉等多维信息,计划形成数百万小时的数据。该数据集将用于真实场景的物理交互,推动具身智能的发展,并已开源10000小时高质量数据,构建了外发式数据采集网络,形成完整的数据处理闭环。
国家数据局首次确认“词元”为Token的标准译名,标志着AI技术向全模态发展。模思智能通过语音切入,推动统一Token结构,提升情境理解能力,已成为国内领先的全模态模型公司。
小米于3月18日发布了三款自研大模型:MiMo-V2-Pro、MiMo-V2-Omni和MiMo-V2-TTS,旨在提升智能体的任务执行、全模态理解和声音合成能力。MiMo-V2-Pro在全球智能模型中排名第八,支持高强度任务;MiMo-V2-Omni具备文本、视觉和语音的全模态交互能力;MiMo-V2-TTS实现多方言和情感转折的声音合成。这些大模型将推动小米AI与硬件的深度融合。
OpenBMB推出的MiniCPM-o-4.5模型仅用9B参数实现全模态能力,强调跨模态对齐与推理效率,适合主流GPU部署,具备高性能与轻量化优势。
文心5.0正式发布,参数达到2.4万亿,具备全模态能力,表现优异。其在文本和视觉理解方面多次夺冠,展现出强大的知识整合与创造力。通过原生全模态建模,提升了理解与生成的协同能力,已广泛应用于多个行业,未来发展值得关注。
百度文心大模型5.0正式上线,参数达到2.4万亿,具备全模态理解与生成能力,支持文本、图像、音频和视频等多种信息。该技术采用统一自回归架构,提升推理效率,显著增强多模理解、代码生成和创意写作能力。百度千帆平台已支持企业用户便捷调用文心5.0,助力各行业应用。
Uni-MoE-2.0-Omni是哈尔滨工业大学深圳分校研发的全模态大型模型,支持文本、图像、音频和视频的理解与生成。基于Qwen2.5-7B模型,采用动态容量路由和渐进式监督学习,显著提升了跨模态推理能力,尤其在视频理解和长语音处理方面表现优异。
多模态人工智能正向全模态大模型发展,但评测体系滞后。美团LongCat团队提出UNO-Bench,提供高质量评测基准,有效评估模型的单模态与全模态能力,揭示“组合定律”,推动AI行业发展。
文心5.0正式发布,支持文字、图像、音频和视频的全模态输入与输出,具备强大的理解与生成能力。其在多模态理解和情感分析方面表现突出,能够精准捕捉细节并进行复杂推理。新技术采用统一架构,提升训练与推理效率,参数规模超过2.4万亿,标志着百度在大模型领域的突破。
阿里巴巴发布了开源全模态大模型Qwen2.5-Omni-7B,支持文本、音频、图像和视频的实时交互,性能优于同类模型。该模型轻量化,适合在手机等终端上部署,开发者可免费商用。
Ola模型是一种全模态语言模型,具备图像、视频和音频理解的强大能力。其采用渐进式模态对齐策略,逐步提升模型性能。在多个基准测试中,Ola超越了现有的专用模型,推动了全模态理解的研究进展。
完成下面两步后,将自动完成登录并继续当前操作。