商汤科技发布SenseNova-U1.5-8B-MoT统一多模态模型,支持图像生成、编辑与理解,提升4K画质和文字渲染。HyperAI官网更新数据集、教程及百科词条,涵盖语音、地震数据及多模态模型部署,并预告9月截稿顶会。
DeepSeek发布首个多模态实验模型V4-Flash-Vision-Exp,新增视觉理解能力,可处理图像图表等复杂任务,性能提升至36.5,多模态评测表现优异。HyperAI已上线部署教程,支持一键运行。
智谱发布并开源GLM-5.3-Flash多模态模型,性能超GLM-5.2,与Claude Opus 4.8持平。商汤大装置提供国产算力支持,通过异构混推技术提升服务性能3倍,成本与英伟达GPU相当,推动国产算力规模化商用,日均Token服务量达2.42万亿。
智谱发布开源原生多模态模型GLM-5.3-Flash,采用MoE架构,支持文本图像输入及百万Token上下文,性能与Claude Opus 4.8持平,API定价大幅降低。同时,Perplexity推出端侧AI智能体,明基发布专业显示器,Google推出语音转文本模型及视频生成模型,英伟达发布定制高带宽内存,微软Xbox推出光盘数字化功能。
DeepSeek推出多模态模型DeepSeek-V4-Flash-Vision-Exp,图片最多占384个Token,通过三级压缩技术大幅降低成本。模型侧重OCR和图像描述,非人脸识别,故认错人属设计初衷问题。API成本可预测,推理快,多模态能力接近Opus-4.8,体现低价高效理念。
2026年8月21日,DeepSeek下架免费模型并上线视觉模型API,同日OpenRouter出现匿名模型Ox Alpha,免费且支持多模态。网友测试发现其Tokenizer与智谱GLM完全一致,推测为智谱未发布的多模态模型,但小米因历史匿名测试套路也被怀疑。Ox Alpha免费一周疑为压力测试,身份成谜。
DeepSeek发布V4-Flash-Vision-Exp多模态模型,视觉能力免费,定价与纯文本版一致,单图最高384 token,价格远低于GPT-4o。性能接近Opus-4.8,但细节识别有限,支持600张图批量处理,受分辨率限制。模型为实验性质,不建议生产使用,旨在收集真实数据优化。
DeepSeek推出多模态模型deepseek-v4-flash-vision-exp,新增视觉理解能力,支持图片输入,提升多模态Agent任务表现。模型延续V4-Flash文本能力,定价按token计费,图片最高换算384 tokens。同步推出Files API,支持文件复用,降低开发者调用门槛,推动Agent从文本处理走向复杂任务执行。
Mux 团队分享了 stream.new 应用内容审核系统的三次迭代历程。从 2021 年使用 Google 和 Hive 视觉 API 检测帧,到 2025 年采用 @mux/ai 工具包,利用多模态模型通过自然语言问题识别盗版等内容,再到 2026 年迁移至 Mux Robots 原生服务,简化了代码并提升了审核能力。每次升级都减少了定制代码,使审核更高效、准确。
IDC报告显示,2025年中国AI视频云市场近10亿元,智能媒体生产与处理赛道增速达427%,音视频AI实时互动增长223%。AI正重构内容供给体系,多模态模型成核心引擎,竞争转向工业化能力比拼,未来将进入Agent-Native时代。
本文解析多模态模型核心技术:CLIP对比学习依赖大batch与温度参数;视觉接入语言模型有projector、cross-attention、指令微调三种方式,各有分辨率瓶颈、压缩损失和幻觉问题;SAM专注像素级分割,与聊天VLM是不同产品线;融合时机决定部署成本,统一token接口仍存争议。
阿里巴巴发布Qwen3.8-Max,2.4万亿参数多模态模型,支持百万token上下文,采用稀疏专家和混合注意力架构,并承诺下周开源权重。专家质疑其自评基准可信度,强调需外部验证和稳健测试框架。模型在自主编码和长任务执行上表现突出,但成本、安全及实际采用率仍是关键考量。
杭州联汇科技完成数亿元融资,由前海母基金领投,杭州政府基金参投。公司开源VLX-Seek 1.5多模态模型,性能超越英伟达同级产品,无人机场景准确率提升62.9%。资金将用于技术迭代和物理AI商业化,已落地AIPC、具身智能及视障辅助应用。
阿里巴巴发布Qwen3.8-Max多模态模型,拥有2.4万亿参数,采用稀疏混合专家架构,每次激活约950亿参数。该模型面向复杂任务,可自主运行数天,如构建应用、复现研究等。定价为每百万输入令牌2美元,输出6美元。权重将开源,但自托管需大量GPU资源,适合大型机构。性能接近Anthropic和OpenAI模型,但独立验证尚待进行。
商汤开源轻量级多模态模型SenseNova U1.5-Lite-Preview,支持4K直出、指哪改哪的图像编辑。该模型能理解复杂信息图、复刻设计框架、局部修改文字或氛围,并融合多张参考图。基于NEO-Unify架构,在8B-MoT参数下实现视觉理解、生成与编辑统一,评测成绩较上代提升,但仍是早期预览版。
该研究提出Beacon框架,通过MA-TE双维度和强化学习训练,解决多模态模型视觉推理中工具滥用问题。实验显示,Beacon显著降低工具调用频率,保持推理准确性,并验证了模式切换与工具效果的正相关性及模型泛化能力。
Black Forest Labs发布FLUX 3多模态模型,统一学习图像、视频和音频,基于Self-Flow方法。视频生成最长20秒含原生音频,在偏好测试中优于多数竞品,但训练计算超95%用于视频。访问受限,优先开放视频和动作内容。
Vivix发布实时交互多模态模型A1,支持用户与虚拟角色实时视频通话,角色能行动、互动并持续响应。配套W1模型可改变剧情走向。A1通过MJD蒸馏、原生NVFP4和VMI基础设施,实现近30B参数在消费级GPU上实时推理,延迟低于0.6秒,单卡吞吐超10000 video tokens/s,已开放内测。
FLUX 3 是黑森林实验室推出的多模态模型,支持多模态输入输出,未公布LLM底座,推测为Qwen系列。目前独此一家,其他如GPT、Gemini均为agent实现。
Om AI发布全球首个端侧流式多模态模型VLX,旨在实现持续感知、精准定位和行动决策。VLX包含三款模型:Flow负责实时感知,Seek进行精确定位,Go实现行动。该系统专为物理世界设计,能够在手机、无人机等设备上高效运行,满足实时响应需求。
完成下面两步后,将自动完成登录并继续当前操作。