多模态推理采用EPD拆分,将视觉编码、预填充、解码分队列调度,以缓解图片请求阻塞文字请求的队头阻塞。NVIDIA测试显示,图片密集负载下首字延迟最高快5倍,但长输出或轻媒体收益小甚至倒退。该方案适合多图、短答、混合流量场景;单图、长输出、低并发不宜拆分。
ECCV 2026在瑞典举行,中国钛动科技牵头举办MARS2 Workshop,聚焦智能体商业与多模态推理。其挑战赛设三条赛道,吸引64支团队,字节系The Boys夺两冠。结果显示AI看懂广告易,但跨片段推理与营销意图理解仍难。钛动还推出钛极大模型与Navos平台,AI营销收入占比达89.5%。
Meta推出的Muse Spark 1.1现已在AI Gateway上可用。这是一种多模态推理模型,支持文本、图像、视频、PDF和音频输入,适用于代理任务。该模型能够并行调用工具,提供结构化输出和内置搜索功能。用户可通过AI SDK使用Muse Spark 1.1,并在AI Gateway上跟踪模型使用情况和成本。
本周Python的热门话题包括PyPI供应链漏洞、浏览器中的完整Python GUI应用开发以及分发Python应用的简单方法。值得关注的项目有用于构建全栈系统的“foundry”和一种高精度低位LLM推理算法“auto-round”。文章还讨论了行为导向的并发、快速网格布尔运算和提升多模态推理性能的方法。
Modular发布了Gemma 4,展示了AI编码代理在复杂系统工程任务中的能力。五个前沿模型成功重建了Wan 2.1文本到视频推理管道,证明了MAX图形API的有效性,并展示了调试和工程纪律的重要性,能够在新框架中构建完整的多模态推理系统。
文心大模型5.0正式上线,参数达到2.4万亿,提升了智能体与工具调用能力。PaddleOCR-VL-1.5发布,解决了曲面文档解析问题,并新增67个数据集,支持多模态推理与视频理解。社区活动包括文心Moment大会与AICA架构师培养计划,促进AI技术应用与开发者交流。
谷歌推出了Gemini 3 Flash,这是一款更小更快的模型,性能接近Gemini 3 Pro,尤其在多模态推理和编码方面表现优异,API使用成本相对较低。尽管成本上升,但效率和速度显著提升,适合开发者和消费者。
谷歌推出Nano Banana Pro,结合图像生成与Gemini多模态推理,能够将结构化内容转化为图表和信息图,提升语言理解与图像合成的结合。用户反馈积极,支持多语言文本渲染,适用于包装和UI预览等场景。该模型可合并多张参考图像,保持一致性并输出高分辨率图像,标志着基于推理的图像生成成为新标准。
OpenAI研究科学家Łukasz Kaiser指出,AI并未减缓,而是从预训练转向推理模型。GPT-5.1是稳定性迭代,未来将重点发展多模态推理和家用机器人,AI将改变工作方式但不会消失。
阿里千问的视觉理解模型Qwen3-VL和Qwen2.5-VL在最新空间推理基准测试中表现优异,超越Gemini 3和GPT-5.1等国际顶尖模型,但仍未达到人类80分的基准。Qwen3-VL在视觉感知和多模态推理方面取得重大突破,已开源不同版本并上线千问APP供用户体验。
罗福莉在小米入职不到10天便发布了首篇论文,介绍了全球首个跨具身智能与自动驾驶的开源模型MiMo-Embodied。该模型在29个基准测试中表现优异,成功融合了这两个领域,解决了知识迁移难题,提升了多模态推理能力。
谷歌于11月18日发布了Gemini 3,具备卓越的推理能力和用户需求理解能力。Gemini 3 Pro模型在AI基准测试中表现优异,特别是在数学和多模态推理方面。同时,新推出的Google Antigravity平台支持复杂软件开发任务,Gemini 3已在多个平台上线,Gemini 3 Deep Think模式也已开放给测试人员。
谷歌推出了Gemini 3 Pro,这是其基础模型系列的最新版本,支持多种产品,表现出色,尤其在多模态推理任务和编码方面优于前一版本。此外,谷歌还将推出Gemini 3 Deep Think,以进一步提升性能。
Gemini 3 Pro模型已通过Vercel AI Gateway发布,专注于编码和多模态推理。测试显示其指令遵循和响应一致性显著提升,正确率比前代提高17%。该模型在前端生成和多轮交互中表现优异,适合开发者使用。
计算机视觉国际大会(ICCV)是顶级会议之一,专注于视频理解和多模态推理,涵盖时间表示、实时对话生成和视觉大语言模型等研究,推动了计算机视觉领域的发展。
OpenAI在比赛中表现不佳,AI能迅速解决复杂问题,而人类队伍则需多次尝试。Gemini开源代码,OpenAI未公开,可能因代码不优雅或出于战略考虑。Anthropic未参赛,因多模态推理要求高。美国大学未获金牌引发思考。
本文探讨了EmbodiedOneVision模型,该模型通过交错的视觉-文本-动作预训练,实现灵活的多模态推理与动作生成。EO-1采用统一架构,结合离散自回归解码与连续流匹配,提升机器人控制的泛化能力,并强调多模态数据的重要性,提出新的训练方法以优化推理与执行的整合。
快手开源了多模态推理模型Keye-VL 1.5,具备128k上下文、0.1秒视频定位和跨模态推理能力。该模型在视频理解和推理方面表现优异,能够准确判断物品出现的时间并详细描述场景,在多个基准测试中取得领先成绩。
2025年上半年AI领域的核心趋势包括智能代理产品的兴起,AI编程的重要性提升,模型能力特别是在多模态推理方面的增强,以及行业竞争加剧,算力成为关键因素。
SeePhys新基准显示,当前顶尖AI模型在物理图像理解方面的准确率仅为55%。该基准涵盖从初中到博士的多模态物理问题,强调视觉信息对模型推理的重要性,揭示了多模态推理的巨大挑战。
完成下面两步后,将自动完成登录并继续当前操作。