小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
陆川手搓历史现场,王珞丹熬夜抽卡,阿里全模态开始兜底生产

阿里云栖大会发布全模态模型矩阵,涵盖千问基座、图像、视频、语音、音乐及世界模型。导演陆川借助AI仅用5天复原明代爆炸场景,准确率超95%。阿里判断三年内将出现原生全模态统一生成模型,AI正从单项生成走向理解完整叙事、协同完成复杂任务。

陆川手搓历史现场,王珞丹熬夜抽卡,阿里全模态开始兜底生产

量子位 量子位 · 2026-09-22T15:59:35Z
阿里公布全模态模型新进展,Qwen4和下代视频模型均在训练中

2026云栖大会上,阿里公布大模型进展:Qwen3.8-Max在编程与办公领域表现强劲,Qwen4已投入训练,未来参数将扩至5至10万亿。多模态方面,Qwen-Image-3.1、Qwen-Audio-3.1、Wan3.0等均居全球前列。阿里还公布RSI自我进化技术,模型可零人工干预自主迭代。Qwen系列全面开源,下载量超30亿次,成为全球AI开源社区基座模型。

阿里公布全模态模型新进展,Qwen4和下代视频模型均在训练中

量子位 量子位 · 2026-09-22T03:42:43Z
原生全模态技术战略闭环,智象(HiDream.ai)发布具身世界模型HiDream-O1-Embodied

智象未来发布具身世界模型HiDream-O1-Embodied,强化机器人物理感知与动态预判,在RoboColiseum扰动适应榜单登顶。模型通过全模态底座、多视角融合及非理想条件训练提升鲁棒性,并采用“真实基座+生成增强”数据策略,与交互式世界模型互补,构建统一世界模型基座。

原生全模态技术战略闭环,智象(HiDream.ai)发布具身世界模型HiDream-O1-Embodied

量子位 量子位 · 2026-09-07T06:03:34Z
WRC 2026|原生全模态世界模型:从模拟世界到交互世界

智象未来CEO梅涛在世界机器人大会论坛上演讲,提出高IQ不等于全能,强调世界模型对具身智能的重要性。公司发布原生全模态交互式世界模型HiDream-O1-World,支持多模态输入和长时程时空一致性,应用于AI影游、仿真和3D生成,并构建“数据—认知—行动—反馈”闭环飞轮,推动Physical AI商业化。

WRC 2026|原生全模态世界模型:从模拟世界到交互世界

量子位 量子位 · 2026-08-24T05:04:52Z
15亿参数挑战机器人控制,MiniCPM-RobotManip正式开源;覆盖文本/图/视频/动作序列,英伟达发布全模态模型Cosmos3-Edge

MiniCPM推出具身智能模型系列,包括15亿参数的机器人操作模型和0.9B参数的目标跟踪模型,实现端到端映射与实时跟踪。HyperAI官网更新了9个数据集、8个教程等资源,涵盖数学推理、视觉推理等领域,并精选社区文章和百科词条。

15亿参数挑战机器人控制,MiniCPM-RobotManip正式开源;覆盖文本/图/视频/动作序列,英伟达发布全模态模型Cosmos3-Edge

HyperAI超神经 HyperAI超神经 · 2026-07-31T06:41:12Z
如何使用HTML、CSS和少量JavaScript创建无障碍弹窗和模态框

本文介绍如何使用HTML的<dialog>标签和popover属性创建无障碍弹窗和模态框,无需复杂框架。通过command和commandfor属性或JavaScript的showModal()方法实现模态框,show()方法用于非模态对话框。文章还涵盖定位技巧、::backdrop样式定制,并提醒避免直接使用Flex/Grid布局,以及处理背景滚动问题。

如何使用HTML、CSS和少量JavaScript创建无障碍弹窗和模态框

freeCodeCamp.org freeCodeCamp.org · 2026-07-17T20:34:10Z
一分钟读论文:《Omni-Decision:一种面向全模态问答的渐进式证据状态Agent系统》

Meta AI提出Omni-Decision系统,通过显式证据状态管理(含确认证据、冲突、依赖关系、开放需求)提升多模态问答的可观测性。在OmniGAIA和WorldSense基准上分别达45.6%和58.3%准确率,显著优于基线。该方法无需训练,可即插即用,增强Agent可解释性与调试能力。

一分钟读论文:《Omni-Decision:一种面向全模态问答的渐进式证据状态Agent系统》

Micropaper Micropaper · 2026-07-14T00:00:00Z
通过先进的模态条件和交互驯服文本到声音视频生成

该研究聚焦于文本到声音视频生成(T2SV),旨在从文本生成同步音频的视频。为解决文本条件瓶颈和跨模态特征交互机制不明确的问题,提出了交叉参考重写器(CRR)框架,通过提取语义锚点和生成解耦的字幕对,消除模态干扰,缩小训练与推理之间的差距。

通过先进的模态条件和交互驯服文本到声音视频生成

Apple Machine Learning Research Apple Machine Learning Research · 2026-07-07T00:00:00Z
在线教程丨16GB笔记本跑出接近26B MoE性能,Gemma 4 12B基于创新架构统一处理文本/图像/声音三种模态

Google DeepMind 发布了新款多模态模型 Gemma 4 12B,参数为120亿,但在多项测试中表现接近260亿参数的模型。其无编码器架构显著降低了推理延迟和内存占用,支持音频输入,并可在普通笔记本上运行,降低了部署成本,为开发者提供了接近顶级性能的选择。

在线教程丨16GB笔记本跑出接近26B MoE性能,Gemma 4 12B基于创新架构统一处理文本/图像/声音三种模态

HyperAI超神经 HyperAI超神经 · 2026-06-10T03:09:51Z
斑马智能推出行业首个全模态端侧大模型AutoOmni

斑马智能在高通峰会上推出全模态端侧大模型AutoOmni,具备低延迟、高精准和保隐私特性,响应时间小于500毫秒。该模型提升了自然交互度和服务链接成功率。斑马智能与高通合作,已与69家车企合作,落地超1000万辆智能汽车。

斑马智能推出行业首个全模态端侧大模型AutoOmni

全球TMT-美通国际 全球TMT-美通国际 · 2026-06-08T10:20:14Z

Agnes AI宣布无限期免费开放全模态API,涵盖文本、图像和视频,简化开发者工作流程。这一举措在AI行业引发关注,尤其在Token成本高企的背景下,减轻了开发者的经济压力。Agnes AI的模型在国际榜单上表现优异,免费政策可能促使其他实验室调整定价策略,推动AI能力基础设施化发展。

有人把全模态API免费了,这次玩真的

孙威的阳光海 孙威的阳光海 · 2026-06-02T09:22:19Z
今天起,无限期免费!全球首个全模态API开放,Top 10 AI Lab出手

Agnes AI正式向全球开发者免费开放文本、图片和视频API,旨在降低使用门槛,促进创作与开发。其模型能够生成高质量的交互稿、图像和视频,支持多种应用场景,简化操作以推动AI技术的实际应用。

今天起,无限期免费!全球首个全模态API开放,Top 10 AI Lab出手

量子位 量子位 · 2026-06-01T07:57:16Z
Chat SDK 现在支持按钮和模态框上的回调 URL

文章介绍了如何在Chat SDK中暂停和恢复工作流运行。通过创建工作流Webhook并将其URL传递给按钮的callbackUrl属性,可以实现状态报告请求的审批卡功能。用户可以通过按钮批准、发送或取消请求,相关数据会发送到指定的端点。

Chat SDK 现在支持按钮和模态框上的回调 URL

Vercel News Vercel News · 2026-05-20T00:00:00Z
面向电商直播场景的全模态大模型推理加速方案

本文介绍了电商直播场景下的全模态理解大模型TLiveOmni在vLLM框架下的推理部署与量化优化。通过自定义插件和修复多模态Token排布,解决了vLLM对Omni模型支持不足的问题。采用SmoothQuant与GPTQ的复合量化方案,构建了5000条高质量数据的校准集,确保模型效果。最终在H20与RTX 4090上测试,推理加速达2.5至3.5倍,精度损失控制在1.5%以内。

面向电商直播场景的全模态大模型推理加速方案

实时互动网 实时互动网 · 2026-04-29T10:39:31Z
戴盟机器人发布全模态物理世界数据集Daimon-Infinity

戴盟机器人发布了全球最大规模的全模态物理世界数据集Daimon-Infinity,涵盖触觉、视觉等多维信息,计划形成数百万小时的数据。该数据集将用于真实场景的物理交互,推动具身智能的发展,并已开源10000小时高质量数据,构建了外发式数据采集网络,形成完整的数据处理闭环。

戴盟机器人发布全模态物理世界数据集Daimon-Infinity

全球TMT-美通国际 全球TMT-美通国际 · 2026-04-21T08:33:07Z
智象未来完成新一轮融资,全力打造下一代原生全模态世界模型

智象未来(HiDream.ai)近日完成超5亿元融资,资金将用于研发下一代全模态世界模型及市场拓展。公司在多模态生成式AI领域表现突出,已覆盖3000万用户和4万企业客户,推出多款创新产品,推动AI技术商业化。

智象未来完成新一轮融资,全力打造下一代原生全模态世界模型

量子位 量子位 · 2026-04-16T06:40:06Z
小米MiMo大模型首次推出Token Plan,单次订阅可满足全模态Agent任务需求

小米推出MiMo大模型的Token Plan,提供四种订阅方案,满足不同开发者需求。该计划透明计费,支持灵活调用多种模型,无使用时间限制,提升用户体验。

小米MiMo大模型首次推出Token Plan,单次订阅可满足全模态Agent任务需求

量子位 量子位 · 2026-04-03T05:44:33Z
国产玩家亮剑世界模型!把全模态卷到顶后,天工AI不藏了

天工AI在中关村论坛发布了三款多模态模型Matrix-Game 3.0、SkyReels V4和Mureka V9,标志着其向AI平台经济的迈进。这些模型在游戏、视频和音乐领域实现了实时交互和高质量生成,构建了可交互的世界模型。天工AI的“3+1战略”旨在整合这些能力,推动AI内容的规模化生产。

国产玩家亮剑世界模型!把全模态卷到顶后,天工AI不藏了

量子位 量子位 · 2026-03-27T14:08:24Z
从Token到词元:全模态时代的基模与交互入口

国家数据局首次确认“词元”为Token的标准译名,标志着AI技术向全模态发展。模思智能通过语音切入,推动统一Token结构,提升情境理解能力,已成为国内领先的全模态模型公司。

从Token到词元:全模态时代的基模与交互入口

量子位 量子位 · 2026-03-27T04:11:18Z
模态窗口与新页面:用户体验决策树

在用户体验设计中,选择模态窗口或新页面非常重要。模态窗口适合独立任务,有助于用户保持上下文,但可能造成干扰;新页面则适合复杂的多步骤工作流程。设计时应优先考虑非阻塞对话框,以提高用户效率。

模态窗口与新页面:用户体验决策树

Articles on Smashing Magazine — For Web Designers And Developers Articles on Smashing Magazine — For Web Designers And Developers · 2026-03-19T15:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码