小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
图片一多首字就慢?用EPD拆开多模态推理三段路

多模态推理采用EPD拆分,将视觉编码、预填充、解码分队列调度,以缓解图片请求阻塞文字请求的队头阻塞。NVIDIA测试显示,图片密集负载下首字延迟最高快5倍,但长输出或轻媒体收益小甚至倒退。该方案适合多图、短答、混合流量场景;单图、长输出、低并发不宜拆分。

图片一多首字就慢?用EPD拆开多模态推理三段路

Java for You Java for You · 2026-09-13T03:45:24Z
ECCV上,顶尖学者们开始研究如何让AI做生意了

ECCV 2026在瑞典举行,中国钛动科技牵头举办MARS2 Workshop,聚焦智能体商业与多模态推理。其挑战赛设三条赛道,吸引64支团队,字节系The Boys夺两冠。结果显示AI看懂广告易,但跨片段推理与营销意图理解仍难。钛动还推出钛极大模型与Navos平台,AI营销收入占比达89.5%。

ECCV上,顶尖学者们开始研究如何让AI做生意了

量子位 量子位 · 2026-09-10T10:17:46Z
Muse Spark 1.1现已在AI Gateway上可用

Meta推出的Muse Spark 1.1现已在AI Gateway上可用。这是一种多模态推理模型,支持文本、图像、视频、PDF和音频输入,适用于代理任务。该模型能够并行调用工具,提供结构化输出和内置搜索功能。用户可通过AI SDK使用Muse Spark 1.1,并在AI Gateway上跟踪模型使用情况和成本。

Muse Spark 1.1现已在AI Gateway上可用

Vercel News Vercel News · 2026-07-09T00:00:00Z
2026年5月17日Python周刊摘要

本周Python的热门话题包括PyPI供应链漏洞、浏览器中的完整Python GUI应用开发以及分发Python应用的简单方法。值得关注的项目有用于构建全栈系统的“foundry”和一种高精度低位LLM推理算法“auto-round”。文章还讨论了行为导向的并发、快速网格布尔运算和提升多模态推理性能的方法。

2026年5月17日Python周刊摘要

Python Hub Weekly Python Hub Weekly · 2026-05-17T18:00:00Z
Modular:前沿编码代理如何在MAX上构建视频扩散管道

Modular发布了Gemma 4,展示了AI编码代理在复杂系统工程任务中的能力。五个前沿模型成功重建了Wan 2.1文本到视频推理管道,证明了MAX图形API的有效性,并展示了调试和工程纪律的重要性,能够在新框架中构建完整的多模态推理系统。

Modular:前沿编码代理如何在MAX上构建视频扩散管道

Modular Blog Modular Blog · 2026-04-16T00:00:00Z
飞桨星河社区月度报告(2026年1月)

文心大模型5.0正式上线,参数达到2.4万亿,提升了智能体与工具调用能力。PaddleOCR-VL-1.5发布,解决了曲面文档解析问题,并新增67个数据集,支持多模态推理与视频理解。社区活动包括文心Moment大会与AICA架构师培养计划,促进AI技术应用与开发者交流。

飞桨星河社区月度报告(2026年1月)

百度大脑 百度大脑 · 2026-02-10T10:55:58Z
谷歌新推出的Gemini 3 Flash以较低成本与前沿模型竞争

谷歌推出了Gemini 3 Flash,这是一款更小更快的模型,性能接近Gemini 3 Pro,尤其在多模态推理和编码方面表现优异,API使用成本相对较低。尽管成本上升,但效率和速度显著提升,适合开发者和消费者。

谷歌新推出的Gemini 3 Flash以较低成本与前沿模型竞争

The New Stack The New Stack · 2025-12-17T16:00:25Z
谷歌推出Nano Banana Pro,具备基于推理的多模态图像合成

谷歌推出Nano Banana Pro,结合图像生成与Gemini多模态推理,能够将结构化内容转化为图表和信息图,提升语言理解与图像合成的结合。用户反馈积极,支持多语言文本渲染,适用于包装和UI预览等场景。该模型可合并多张参考图像,保持一致性并输出高分辨率图像,标志着基于推理的图像生成成为新标准。

谷歌推出Nano Banana Pro,具备基于推理的多模态图像合成

InfoQ InfoQ · 2025-12-02T11:52:00Z

OpenAI研究科学家Łukasz Kaiser指出,AI并未减缓,而是从预训练转向推理模型。GPT-5.1是稳定性迭代,未来将重点发展多模态推理和家用机器人,AI将改变工作方式但不会消失。

Transformer作者爆料GPT-5.1内幕!OpenAI内部命名规则变乱了

量子位 量子位 · 2025-11-30T05:18:27Z

阿里千问的视觉理解模型Qwen3-VL和Qwen2.5-VL在最新空间推理基准测试中表现优异,超越Gemini 3和GPT-5.1等国际顶尖模型,但仍未达到人类80分的基准。Qwen3-VL在视觉感知和多模态推理方面取得重大突破,已开源不同版本并上线千问APP供用户体验。

超越Gemini3、GPT5.1,阿里千问登顶空间推理全球冠军

量子位 量子位 · 2025-11-26T07:27:11Z

罗福莉在小米入职不到10天便发布了首篇论文,介绍了全球首个跨具身智能与自动驾驶的开源模型MiMo-Embodied。该模型在29个基准测试中表现优异,成功融合了这两个领域,解决了知识迁移难题,提升了多模态推理能力。

罗福莉首个小米成果!开源具身大模型

量子位 量子位 · 2025-11-22T07:20:13Z

谷歌于11月18日发布了Gemini 3,具备卓越的推理能力和用户需求理解能力。Gemini 3 Pro模型在AI基准测试中表现优异,特别是在数学和多模态推理方面。同时,新推出的Google Antigravity平台支持复杂软件开发任务,Gemini 3已在多个平台上线,Gemini 3 Deep Think模式也已开放给测试人员。

派早报:Google 发布 Gemini 3、Cloudflare 引发网络故障等

少数派 少数派 · 2025-11-19T00:54:21Z
谷歌推出Gemini 3 Pro

谷歌推出了Gemini 3 Pro,这是其基础模型系列的最新版本,支持多种产品,表现出色,尤其在多模态推理任务和编码方面优于前一版本。此外,谷歌还将推出Gemini 3 Deep Think,以进一步提升性能。

谷歌推出Gemini 3 Pro

The New Stack The New Stack · 2025-11-18T22:00:27Z
Vercel与谷歌合作推出Gemini 3 Pro预览版

Gemini 3 Pro模型已通过Vercel AI Gateway发布,专注于编码和多模态推理。测试显示其指令遵循和响应一致性显著提升,正确率比前代提高17%。该模型在前端生成和多轮交互中表现优异,适合开发者使用。

Vercel与谷歌合作推出Gemini 3 Pro预览版

Vercel News Vercel News · 2025-11-18T13:00:00Z
ICCV 2025 | 美团论文精选及多模态推理竞赛冠军方法分享

计算机视觉国际大会(ICCV)是顶级会议之一,专注于视频理解和多模态推理,涵盖时间表示、实时对话生成和视觉大语言模型等研究,推动了计算机视觉领域的发展。

ICCV 2025 | 美团论文精选及多模态推理竞赛冠军方法分享

美团技术团队 美团技术团队 · 2025-10-27T00:00:00Z
AI 在 ICPC world final 战胜人类的一天

OpenAI在比赛中表现不佳,AI能迅速解决复杂问题,而人类队伍则需多次尝试。Gemini开源代码,OpenAI未公开,可能因代码不优雅或出于战略考虑。Anthropic未参赛,因多模态推理要求高。美国大学未获金牌引发思考。

AI 在 ICPC world final 战胜人类的一天

INTJer INTJer · 2025-09-18T00:00:00Z

本文探讨了EmbodiedOneVision模型,该模型通过交错的视觉-文本-动作预训练,实现灵活的多模态推理与动作生成。EO-1采用统一架构,结合离散自回归解码与连续流匹配,提升机器人控制的泛化能力,并强调多模态数据的重要性,提出新的训练方法以优化推理与执行的整合。

EmbodiedOneVision——单个模型中集成离散自回归解码与连续流匹配去噪:Qwen 2.5 VL加两个MLP头完成具身推理、动作生成

结构之法 算法之道 结构之法 算法之道 · 2025-09-07T14:02:10Z

快手开源了多模态推理模型Keye-VL 1.5,具备128k上下文、0.1秒视频定位和跨模态推理能力。该模型在视频理解和推理方面表现优异,能够准确判断物品出现的时间并详细描述场景,在多个基准测试中取得领先成绩。

视频理解新标杆,快手多模态推理模型开源:128k上下文+0.1秒级视频定位+跨模态推理

量子位 量子位 · 2025-09-05T13:39:24Z

2025年上半年AI领域的核心趋势包括智能代理产品的兴起,AI编程的重要性提升,模型能力特别是在多模态推理方面的增强,以及行业竞争加剧,算力成为关键因素。

一份报告看尽2025上半年AI核心趋势,应用、模型、技术、行业全覆盖| 量子位智库

量子位 量子位 · 2025-08-11T06:46:27Z

SeePhys新基准显示,当前顶尖AI模型在物理图像理解方面的准确率仅为55%。该基准涵盖从初中到博士的多模态物理问题,强调视觉信息对模型推理的重要性,揭示了多模态推理的巨大挑战。

AI连电路图都看不懂?SeePhys新基准暴击多模态短板,正确率仅55%

量子位 量子位 · 2025-05-29T07:08:08Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码