Firefox 157 发布,最大亮点是 Nova UI,对浏览器面板、侧边栏和菜单进行视觉革新。新版支持 WebRTC 视频通话硬件 AV1 解码,修复 HDR 视频问题,改进变速播放时的音视频同步,并移除亚马逊内置搜索引擎。
VLX-Seek是OmAI Lab推出的细粒度视觉语言模型,面向机器人、无人机等边缘具身视觉场景,结合语言理解与区域级视觉感知,支持目标定位、指代理解、区域OCR、描述与计数,并引入目标缺失拒识机制,为具身智能连接环境感知与行动决策提供基础能力。
麻省理工学院可感知城市实验室新书《AI如何看城市》探讨视觉AI对城市研究的价值与风险。作者指出,AI可大规模分析图像数据,用于交通、污染、绿化等研究,但普遍监控会侵犯隐私,训练偏差也可能强化社会偏见。AI并非中立,应审慎、批判且创造性地使用。
上海交大团队提出EgoInteract系统,用于EgoLink挑战赛Track 2的第一人称社会场景交互任务。该系统包含场景感知服务Agent与范围受限自纠正Agent,通过证据账本统一视觉假设、工具观测与对话状态,防止无依据的状态变更。官方评测中排名第一,联合成功率0.844,微平均准确率0.916。消融实验显示场景规则贡献最大,纠正机制提供针对性防护。
ReferTrack是一种用于具身视觉跟踪(EVT)的“指代-再跟踪”范式,机器人仅靠单摄像头,根据自然语言指令识别目标并规划轨迹跟随。它先从检测到的带索引边界框目录中选择目标,再预测航点。通过滑动窗口队列和TVBI token注入目标几何特征,保留运动线索。模型结合自建Refer-QA数据联合训练,强化指代能力,实现端到端策略,提升拥挤场景下的跟踪鲁棒性。
H公司发布NeoMME系列双向编码器,采用单塔架构同时处理文本与图像块,移除视觉塔和因果解码器。其中NeoMME-Retriever-260M在ViDoRe v3基准上达到0.523 nDCG@10,性能媲美3.75B模型,但体积小14倍。该模型支持高效索引压缩,但纯文本检索能力较弱。
商汤科技发布SenseNova-U1.5-8B-MoT统一多模态模型,支持图像生成、编辑与理解,提升4K画质和文字渲染。HyperAI官网更新数据集、教程及百科词条,涵盖语音、地震数据及多模态模型部署,并预告9月截稿顶会。
科学家首次绘制出雄性果蝇完整神经连接图谱,包含超16.6万个神经元,由HHMI和谷歌合作完成。该图谱结合AI技术,有助于理解大脑功能,并发现雌雄果蝇脑部差异。此成果为神经科学研究提供重要资源,并推动视觉、味觉等行为研究。
DeepSeek发布首个多模态实验模型V4-Flash-Vision-Exp,新增视觉理解能力,可处理图像图表等复杂任务,性能提升至36.5,多模态评测表现优异。HyperAI已上线部署教程,支持一键运行。
RoboPocket系统利用智能手机作为边缘计算设备,通过实时反馈和AR视觉前瞻,统一数据采集、训练和测试角色,实现无机器人的即时策略迭代。它采用同构夹爪和感知完备设计确保数据质量,并通过主动验证和时空同步支持多设备协作,降低机器人学习门槛。
DeepSeek发布V4 Flash Vision Exp,支持图像输入,价格低于Gemini 3.7 Flash。测试显示两者在图表、发票和日志分析中准确率相当,均能识别陷阱。DeepSeek成本约为Gemini三分之一,但速度慢一倍多,且高峰期价格翻倍。建议批量处理选DeepSeek,实时任务用Gemini。
Cohere发布文档解析模型Parse(parse-v5.0),为2.3B参数视觉语言模型,可将PDF、PPT等转为带HTML表格和边界框的Markdown。API定价每千页1.5美元,Model Vault月费2500美元起。ParseBench得分79.2为自报子集分数,未含图表和视觉定位维度。专用容量月处理超167万页才划算。
2026年8月,全国视觉智能标准化工作组与AVS工作组在上海召开第98次会议,审议78份提案,涵盖视频、音频、基因压缩等领域。会议推进AVS4视频编码标准,采纳智能编码技术,并计划10月召开产业需求研讨会。同时,各分组输出多项标准文档,包括三维体视频、触觉编码等,并确定下次会议于12月在深圳举行。
本文介绍“内化视觉思维”(IVT)框架,用于视频推理。IVT在训练时预测未来帧的潜在表征,推理时直接生成答案,无需生成中间图像。相比视觉思维链(Visual CoT),IVT性能相当或更优,且延迟降低5倍以上,表明显式像素生成在推理中并非必需,可提升效率与准确性。
2026年8月21日,DeepSeek下架免费模型并上线视觉模型API,同日OpenRouter出现匿名模型Ox Alpha,免费且支持多模态。网友测试发现其Tokenizer与智谱GLM完全一致,推测为智谱未发布的多模态模型,但小米因历史匿名测试套路也被怀疑。Ox Alpha免费一周疑为压力测试,身份成谜。
DeepSeek发布V4-Flash-Vision-Exp多模态模型,视觉能力免费,定价与纯文本版一致,单图最高384 token,价格远低于GPT-4o。性能接近Opus-4.8,但细节识别有限,支持600张图批量处理,受分辨率限制。模型为实验性质,不建议生产使用,旨在收集真实数据优化。
DeepSeek悄然上线视觉模型V4-Flash-Vision-Exp,价格与文本版持平,图片按Token计费,纯文本能力不变,多模态Agent能力大幅提升,但部分测试有退步。此举旨在让Agent“看见”屏幕,提升效率,同时开放Files API构建生态。实验性质或为商业策略,引发开发者对性价比和潜在涨价的讨论。
DeepSeek发布多模态视觉理解模型V4-Flash-Vision-Exp,上线API平台,补齐视觉能力。该模型纯文本能力与V4-Flash持平,多模态Agent能力接近Opus-4.8,支持PPT生成、网站重构等场景。API按token计费,图片最多384 tokens,价格与V4-Flash一致,并推出免费Files API,降低开发者接入门槛。
ZCode用户使用纯文本模型deepseek-v4-flash无法识别图片。通过安装zcode-deepseek-eye技能,配置视觉子Agent(如mimo-v2.5)作为“眼睛”,主模型遇到图片时自动转交处理,无感提升功能。安装需重启并配置,选错模型可重配,密钥自持,旧会话需新开。方案保留性价比,解决识图需求。
OpenCode Senses是一款本地运行的视觉插件,无需API密钥,通过Moondream2模型实现图像识别、OCR和对象检测等13种工具,所有分析在本地GPU完成,300毫秒内返回结果。它采用自动注入证据机制,将图像内容标记为不可信观测数据,防止提示注入攻击。该插件免费、开源、跨平台,适合代码截图和UI测试,但性能上限低于云端大模型。
完成下面两步后,将自动完成登录并继续当前操作。