Transformer 将进化为混合架构,结合注意力机制、长程状态和外部记忆等模块,以更高效地处理信息并支持多模态输入。硬件发展将影响架构设计,评估方式将变得复杂,强调系统协作和可控性。理解 Transformer 的成功在于其抽象层次和应对未来挑战的能力。
原力灵机推出的DW0.5具身世界模型,结合DFOL2.0框架,降低了60%的真机数据需求。DW0.5通过模拟动作后果与价值反馈,提升机器人在复杂环境中的学习能力,支持多模态输入,增强训练效率和成本效益。该模型在多个基准测试中表现优异,已实现闭环流程,未来将应用于具身智能领域。
Google于6月11日开源了基于离散扩散技术的文本生成模型DiffusionGemma。该模型具有高效的生成速度,能够以最高1100 Token/s的速度同时生成整个文本块,采用26B参数的混合专家设计,支持256K Token长上下文和多模态输入。尽管标准版Gemma 4在生成质量上更优,DiffusionGemma展示了新的发展方向。
今日,MiniMax M3正式上线,京东云JoyBuilder平台已接入该模型,提升推理效率。MiniMax M3支持1M超长上下文和多模态输入能力。京东云提供高性能推理服务,帮助企业快速应用大模型,提升运维效率,未来将深化合作,构建开放的AI生态。
第三方评测机构Artificial Analysis发布报告称,Qwen3.5 27B和Gemma 4 31B在智能水平上接近GPT-5。Qwen3.5在推理能力上表现优异,但知识准确性仍有不足。两款模型支持多模态输入,适合本地部署,降低使用门槛。Gemma 4系列在多种应用场景中表现出色,具备强大的推理和语言处理能力。
千问推出“表格Agent”,用户可以通过自然语言直接生成和编辑Excel文件。该功能支持自动信息检索和多轮对话,能够处理PDF和图片等多模态输入,生成结构化表格。用户只需简单提问,即可获得可下载的Excel文件,提升了表格处理的易用性。
谷歌推出Gemma 4系列模型,基于Gemini 3技术,体积小巧,适用于智能手机等边缘设备。该模型支持多模态输入,优化了参数效率和上下文长度,性能接近Kimi-K2.5。Gemma 4采用Apache 2.0开源许可证,允许商业使用,旨在为安卓设备的AI化做好准备。
Seedance 2.0 是一款先进的中国 AI 视频生成模型,支持多模态输入,能够高效生成高质量视频,解决了传统模型的诸多问题。用户只需上传素材,AI 即可自动生成复杂场景和动作,提升创作便利性。尽管引发了关于视频真实性的伦理讨论,Seedance 2.0 的强大功能使其成为视频创作的新标杆。
Gitee 企业版推出马建仓 AI 助手,优化了任务入口整合、多模态输入和角色理解,提升了使用效率和需求描述灵活性。未来将推出“AI 队友”功能,增强协作体验。
文章讨论了MAI-UI智能体框架,该框架以图形界面为中心,支持从小型到超大规模模型(2B至235B)的交互体验,旨在将基础模型能力应用于真实世界任务,提供设备与云的协同、事件感知和多模态输入支持。
Marble是新发布的3D世界生成模型,支持文本和图片输入,用户可以生成完整的3D场景并进行深度编辑,提供多种导出格式。其多模态输入和编辑能力超越现有工具,降低了3D建模的门槛。李飞飞强调空间智能的重要性,Marble旨在让AI理解三维空间。
AI生成的视频越来越真实,但仍面临“恐怖谷”效应。清华大学与字节跳动推出的HuMo框架,通过多模态输入和渐进式训练,提升视频生成效果,解决声音、表情与动作的协同问题,适合创作者和开发者使用。
在2025年Deploy London大会上,Gradient AI平台推出新功能,简化AI应用开发,支持多模态输入,包括图像模型和知识库自动索引。企业可通过虚拟私有云(VPC)提升安全性,Gradient AI代理开发工具包(ADK)和Genie将帮助开发者高效构建多代理系统。
谷歌的Gemini 2.5 Deep Think模型通过平行思维技术解决创造性问题,在2025年国际数学奥林匹克中表现优异,获得金牌。新版本在推理深度和速度之间取得平衡,适合日常使用,采用新型强化学习技术,支持多模态输入,尽管存在查询限制,但在多个基准测试中表现出色。
本文分析了π0模型在机器人控制中的应用,重点介绍了模型的配置、训练、推理及注意力机制优化,并强调了与LeRobot框架的集成及多模态输入处理。
结构化输出为AI提供了秩序,LangChain简化了多模态输入(文本、图像、音频等)的处理,提升了工作效率和一致性,便于API连接。
xAI的Grok 3在AI开发中表现突出,具备强大功能。Cursor集成了Grok 3和Grok 3 Mini,开发者可免费使用。Grok 3在推理能力上显著提升,支持多模态输入,用户可通过Cursor轻松启用Grok 3 Mini,提高编程效率。
本研究探讨了视觉语言模型在理解虚拟物体方面的不足,测试了AI系统的场景理解能力,发现其在处理虚拟对象时表现不佳,揭示了多模态输入处理的局限性。
随着Gemini 2.0 Flash的推出,检索增强生成(RAG)的必要性受到质疑。Gemini 2.0 Flash具备实时文档搜索和多模态输入处理,能够直接处理大文档,提升用户体验。尽管RAG在复杂系统中仍有应用,但未来可能会被更高效的模型取代。
Midjourney 7和GPT-Image-1是两种先进的AI图像生成工具。Midjourney 7侧重艺术表现和个性化,适合创意探索;而GPT-Image-1强调多模态输入和API集成,适合设计师和开发者。两者在生成速度、成本和功能上各有优势,用户可根据需求选择合适的工具。
完成下面两步后,将自动完成登录并继续当前操作。