小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
SenseNova-U1.5-8B-MoT 统一生成与理解,解锁原生多模态创作;DeepSeek-V4-Flash-Vision-Exp 拓展视觉理解新能力

商汤科技发布SenseNova-U1.5-8B-MoT统一多模态模型,支持图像生成、编辑与理解,提升4K画质和文字渲染。HyperAI官网更新数据集、教程及百科词条,涵盖语音、地震数据及多模态模型部署,并预告9月截稿顶会。

SenseNova-U1.5-8B-MoT 统一生成与理解,解锁原生多模态创作;DeepSeek-V4-Flash-Vision-Exp 拓展视觉理解新能力

HyperAI超神经 HyperAI超神经 · 2026-09-05T09:47:19Z
在线教程 | 视觉Agent来了!DeepSeek-V4新模型跑分暴涨,ApexBench冲到36.5

DeepSeek发布首个多模态实验模型V4-Flash-Vision-Exp,新增视觉理解能力,可处理图像图表等复杂任务,性能提升至36.5,多模态评测表现优异。HyperAI已上线部署教程,支持一键运行。

在线教程 | 视觉Agent来了!DeepSeek-V4新模型跑分暴涨,ApexBench冲到36.5

HyperAI超神经 HyperAI超神经 · 2026-09-02T14:05:45Z
智谱 GLM-5.3-Flash上线,商汤大装置提供国产算力支持

智谱发布并开源GLM-5.3-Flash多模态模型,性能超GLM-5.2,与Claude Opus 4.8持平。商汤大装置提供国产算力支持,通过异构混推技术提升服务性能3倍,成本与英伟达GPU相当,推动国产算力规模化商用,日均Token服务量达2.42万亿。

智谱 GLM-5.3-Flash上线,商汤大装置提供国产算力支持

量子位 量子位 · 2026-08-28T04:06:16Z

智谱发布开源原生多模态模型GLM-5.3-Flash,采用MoE架构,支持文本图像输入及百万Token上下文,性能与Claude Opus 4.8持平,API定价大幅降低。同时,Perplexity推出端侧AI智能体,明基发布专业显示器,Google推出语音转文本模型及视频生成模型,英伟达发布定制高带宽内存,微软Xbox推出光盘数字化功能。

派早报:智谱开源 GLM-5.3-Flash 原生多模态模型等

少数派 少数派 · 2026-08-28T00:29:37Z
一张图最多384个Token:DeepSeek多模态模型背后的“极限压缩”艺术 - 蝈蝈俊

DeepSeek推出多模态模型DeepSeek-V4-Flash-Vision-Exp,图片最多占384个Token,通过三级压缩技术大幅降低成本。模型侧重OCR和图像描述,非人脸识别,故认错人属设计初衷问题。API成本可预测,推理快,多模态能力接近Opus-4.8,体现低价高效理念。

一张图最多384个Token:DeepSeek多模态模型背后的“极限压缩”艺术 - 蝈蝈俊

蝈蝈俊 蝈蝈俊 · 2026-08-21T23:23:00Z
神秘模型Ox Alpha免费无限量:DeepSeek新视觉模型?智谱、小米?

2026年8月21日,DeepSeek下架免费模型并上线视觉模型API,同日OpenRouter出现匿名模型Ox Alpha,免费且支持多模态。网友测试发现其Tokenizer与智谱GLM完全一致,推测为智谱未发布的多模态模型,但小米因历史匿名测试套路也被怀疑。Ox Alpha免费一周疑为压力测试,身份成谜。

神秘模型Ox Alpha免费无限量:DeepSeek新视觉模型?智谱、小米?

极道 极道 · 2026-08-21T23:03:00Z
DeepSeek V4 Flash视觉模型上线,600张图一锅端!

DeepSeek发布V4-Flash-Vision-Exp多模态模型,视觉能力免费,定价与纯文本版一致,单图最高384 token,价格远低于GPT-4o。性能接近Opus-4.8,但细节识别有限,支持600张图批量处理,受分辨率限制。模型为实验性质,不建议生产使用,旨在收集真实数据优化。

DeepSeek V4 Flash视觉模型上线,600张图一锅端!

极道 极道 · 2026-08-21T22:14:00Z
突发| DeepSeek 多模态模型上新,鲸鱼终于开「天眼」了

DeepSeek推出多模态模型deepseek-v4-flash-vision-exp,新增视觉理解能力,支持图片输入,提升多模态Agent任务表现。模型延续V4-Flash文本能力,定价按token计费,图片最高换算384 tokens。同步推出Files API,支持文件复用,降低开发者调用门槛,推动Agent从文本处理走向复杂任务执行。

突发| DeepSeek 多模态模型上新,鲸鱼终于开「天眼」了

爱范儿 爱范儿 · 2026-08-21T10:23:24Z
多谢,Mux 机器人:stream.new 的机器人之路

Mux 团队分享了 stream.new 应用内容审核系统的三次迭代历程。从 2021 年使用 Google 和 Hive 视觉 API 检测帧,到 2025 年采用 @mux/ai 工具包,利用多模态模型通过自然语言问题识别盗版等内容,再到 2026 年迁移至 Mux Robots 原生服务,简化了代码并提升了审核能力。每次升级都减少了定制代码,使审核更高效、准确。

多谢,Mux 机器人:stream.new 的机器人之路

Mux Blog - Video technology and more Mux Blog - Video technology and more · 2026-08-20T17:05:10Z
IDC首发AI视频云报告:市场规模近10亿,行业迈入“AI重塑多媒体创作与交互”新纪元

IDC报告显示,2025年中国AI视频云市场近10亿元,智能媒体生产与处理赛道增速达427%,音视频AI实时互动增长223%。AI正重构内容供给体系,多模态模型成核心引擎,竞争转向工业化能力比拼,未来将进入Agent-Native时代。

IDC首发AI视频云报告:市场规模近10亿,行业迈入“AI重塑多媒体创作与交互”新纪元

实时互动网 实时互动网 · 2026-08-17T03:53:51Z

本文解析多模态模型核心技术:CLIP对比学习依赖大batch与温度参数;视觉接入语言模型有projector、cross-attention、指令微调三种方式,各有分辨率瓶颈、压缩损失和幻觉问题;SAM专注像素级分割,与聊天VLM是不同产品线;融合时机决定部署成本,统一token接口仍存争议。

【Transformer 与注意力机制】46|多模态融合:CLIP、Flamingo、LLaVA、SAM

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-06T00:00:00Z
阿里巴巴Qwen3.8-Max反响:“披着开源外衣的API商业模式”

阿里巴巴发布Qwen3.8-Max,2.4万亿参数多模态模型,支持百万token上下文,采用稀疏专家和混合注意力架构,并承诺下周开源权重。专家质疑其自评基准可信度,强调需外部验证和稳健测试框架。模型在自主编码和长任务执行上表现突出,但成本、安全及实际采用率仍是关键考量。

阿里巴巴Qwen3.8-Max反响:“披着开源外衣的API商业模式”

The New Stack The New Stack · 2026-08-04T14:47:35Z
资本重仓端侧物理AI:前海母基金数亿元押注,Om AI联汇加速端侧AI商业化落地

杭州联汇科技完成数亿元融资,由前海母基金领投,杭州政府基金参投。公司开源VLX-Seek 1.5多模态模型,性能超越英伟达同级产品,无人机场景准确率提升62.9%。资金将用于技术迭代和物理AI商业化,已落地AIPC、具身智能及视障辅助应用。

资本重仓端侧物理AI:前海母基金数亿元押注,Om AI联汇加速端侧AI商业化落地

量子位 量子位 · 2026-08-04T06:47:06Z
阿里巴巴的AI连续编码16天,所有提交都在GitHub上

阿里巴巴发布Qwen3.8-Max多模态模型,拥有2.4万亿参数,采用稀疏混合专家架构,每次激活约950亿参数。该模型面向复杂任务,可自主运行数天,如构建应用、复现研究等。定价为每百万输入令牌2美元,输出6美元。权重将开源,但自托管需大量GPU资源,适合大型机构。性能接近Anthropic和OpenAI模型,但独立验证尚待进行。

阿里巴巴的AI连续编码16天,所有提交都在GitHub上

The New Stack The New Stack · 2026-08-03T19:23:47Z
这个新生图模型有点夯:4K直出的,国产的,开源的!

商汤开源轻量级多模态模型SenseNova U1.5-Lite-Preview,支持4K直出、指哪改哪的图像编辑。该模型能理解复杂信息图、复刻设计框架、局部修改文字或氛围,并融合多张参考图。基于NEO-Unify架构,在8B-MoT参数下实现视觉理解、生成与编辑统一,评测成绩较上代提升,但仍是早期预览版。

这个新生图模型有点夯:4K直出的,国产的,开源的!

量子位 量子位 · 2026-08-03T11:59:32Z
一分钟读论文:《Beacon:通过强化学习实现智能视觉推理》

该研究提出Beacon框架,通过MA-TE双维度和强化学习训练,解决多模态模型视觉推理中工具滥用问题。实验显示,Beacon显著降低工具调用频率,保持推理准确性,并验证了模式切换与工具效果的正相关性及模型泛化能力。

一分钟读论文:《Beacon:通过强化学习实现智能视觉推理》

Micropaper Micropaper · 2026-08-02T00:00:00Z
Black Forest Labs发布FLUX 3:用于图像、视频、音频和机器人动作预测的多模态流模型

Black Forest Labs发布FLUX 3多模态模型,统一学习图像、视频和音频,基于Self-Flow方法。视频生成最长20秒含原生音频,在偏好测试中优于多数竞品,但训练计算超95%用于视频。访问受限,优先开放视频和动作内容。

Black Forest Labs发布FLUX 3:用于图像、视频、音频和机器人动作预测的多模态流模型

实时互动网 实时互动网 · 2026-07-27T02:15:48Z
全新统一流式架构,Vivix灵动时刻正式发布首个实时互动模型

Vivix发布实时交互多模态模型A1,支持用户与虚拟角色实时视频通话,角色能行动、互动并持续响应。配套W1模型可改变剧情走向。A1通过MJD蒸馏、原生NVFP4和VMI基础设施,实现近30B参数在消费级GPU上实时推理,延迟低于0.6秒,单卡吞吐超10000 video tokens/s,已开放内测。

全新统一流式架构,Vivix灵动时刻正式发布首个实时互动模型

量子位 量子位 · 2026-07-25T03:21:53Z
FLUX 3

FLUX 3 是黑森林实验室推出的多模态模型,支持多模态输入输出,未公布LLM底座,推测为Qwen系列。目前独此一家,其他如GPT、Gemini均为agent实现。

FLUX 3

唐霜 唐霜 · 2026-07-24T07:29:04Z
CVPR 2026最热方向,被一家杭州团队率先跑进了端侧!

Om AI发布全球首个端侧流式多模态模型VLX,旨在实现持续感知、精准定位和行动决策。VLX包含三款模型:Flow负责实时感知,Seek进行精确定位,Go实现行动。该系统专为物理世界设计,能够在手机、无人机等设备上高效运行,满足实时响应需求。

CVPR 2026最热方向,被一家杭州团队率先跑进了端侧!

量子位 量子位 · 2026-06-27T12:19:42Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码