小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
15亿参数挑战机器人控制,MiniCPM-RobotManip正式开源;覆盖文本/图/视频/动作序列,英伟达发布全模态模型Cosmos3-Edge

MiniCPM推出具身智能模型系列,包括15亿参数的机器人操作模型和0.9B参数的目标跟踪模型,实现端到端映射与实时跟踪。HyperAI官网更新了9个数据集、8个教程等资源,涵盖数学推理、视觉推理等领域,并精选社区文章和百科词条。

15亿参数挑战机器人控制,MiniCPM-RobotManip正式开源;覆盖文本/图/视频/动作序列,英伟达发布全模态模型Cosmos3-Edge

HyperAI超神经 HyperAI超神经 · 2026-07-31T06:41:12Z
如何使用HTML、CSS和少量JavaScript创建无障碍弹窗和模态框

本文介绍如何使用HTML的<dialog>标签和popover属性创建无障碍弹窗和模态框,无需复杂框架。通过command和commandfor属性或JavaScript的showModal()方法实现模态框,show()方法用于非模态对话框。文章还涵盖定位技巧、::backdrop样式定制,并提醒避免直接使用Flex/Grid布局,以及处理背景滚动问题。

如何使用HTML、CSS和少量JavaScript创建无障碍弹窗和模态框

freeCodeCamp.org freeCodeCamp.org · 2026-07-17T20:34:10Z
一分钟读论文:《Omni-Decision:一种面向全模态问答的渐进式证据状态Agent系统》

Meta AI提出Omni-Decision系统,通过显式证据状态管理(含确认证据、冲突、依赖关系、开放需求)提升多模态问答的可观测性。在OmniGAIA和WorldSense基准上分别达45.6%和58.3%准确率,显著优于基线。该方法无需训练,可即插即用,增强Agent可解释性与调试能力。

一分钟读论文:《Omni-Decision:一种面向全模态问答的渐进式证据状态Agent系统》

Micropaper Micropaper · 2026-07-14T00:00:00Z
通过先进的模态条件和交互驯服文本到声音视频生成

该研究聚焦于文本到声音视频生成(T2SV),旨在从文本生成同步音频的视频。为解决文本条件瓶颈和跨模态特征交互机制不明确的问题,提出了交叉参考重写器(CRR)框架,通过提取语义锚点和生成解耦的字幕对,消除模态干扰,缩小训练与推理之间的差距。

通过先进的模态条件和交互驯服文本到声音视频生成

Apple Machine Learning Research Apple Machine Learning Research · 2026-07-07T00:00:00Z
在线教程丨16GB笔记本跑出接近26B MoE性能,Gemma 4 12B基于创新架构统一处理文本/图像/声音三种模态

Google DeepMind 发布了新款多模态模型 Gemma 4 12B,参数为120亿,但在多项测试中表现接近260亿参数的模型。其无编码器架构显著降低了推理延迟和内存占用,支持音频输入,并可在普通笔记本上运行,降低了部署成本,为开发者提供了接近顶级性能的选择。

在线教程丨16GB笔记本跑出接近26B MoE性能,Gemma 4 12B基于创新架构统一处理文本/图像/声音三种模态

HyperAI超神经 HyperAI超神经 · 2026-06-10T03:09:51Z
斑马智能推出行业首个全模态端侧大模型AutoOmni

斑马智能在高通峰会上推出全模态端侧大模型AutoOmni,具备低延迟、高精准和保隐私特性,响应时间小于500毫秒。该模型提升了自然交互度和服务链接成功率。斑马智能与高通合作,已与69家车企合作,落地超1000万辆智能汽车。

斑马智能推出行业首个全模态端侧大模型AutoOmni

全球TMT-美通国际 全球TMT-美通国际 · 2026-06-08T10:20:14Z

Agnes AI宣布无限期免费开放全模态API,涵盖文本、图像和视频,简化开发者工作流程。这一举措在AI行业引发关注,尤其在Token成本高企的背景下,减轻了开发者的经济压力。Agnes AI的模型在国际榜单上表现优异,免费政策可能促使其他实验室调整定价策略,推动AI能力基础设施化发展。

有人把全模态API免费了,这次玩真的

孙威的阳光海 孙威的阳光海 · 2026-06-02T09:22:19Z
今天起,无限期免费!全球首个全模态API开放,Top 10 AI Lab出手

Agnes AI正式向全球开发者免费开放文本、图片和视频API,旨在降低使用门槛,促进创作与开发。其模型能够生成高质量的交互稿、图像和视频,支持多种应用场景,简化操作以推动AI技术的实际应用。

今天起,无限期免费!全球首个全模态API开放,Top 10 AI Lab出手

量子位 量子位 · 2026-06-01T07:57:16Z
Chat SDK 现在支持按钮和模态框上的回调 URL

文章介绍了如何在Chat SDK中暂停和恢复工作流运行。通过创建工作流Webhook并将其URL传递给按钮的callbackUrl属性,可以实现状态报告请求的审批卡功能。用户可以通过按钮批准、发送或取消请求,相关数据会发送到指定的端点。

Chat SDK 现在支持按钮和模态框上的回调 URL

Vercel News Vercel News · 2026-05-20T00:00:00Z
面向电商直播场景的全模态大模型推理加速方案

本文介绍了电商直播场景下的全模态理解大模型TLiveOmni在vLLM框架下的推理部署与量化优化。通过自定义插件和修复多模态Token排布,解决了vLLM对Omni模型支持不足的问题。采用SmoothQuant与GPTQ的复合量化方案,构建了5000条高质量数据的校准集,确保模型效果。最终在H20与RTX 4090上测试,推理加速达2.5至3.5倍,精度损失控制在1.5%以内。

面向电商直播场景的全模态大模型推理加速方案

实时互动网 实时互动网 · 2026-04-29T10:39:31Z
戴盟机器人发布全模态物理世界数据集Daimon-Infinity

戴盟机器人发布了全球最大规模的全模态物理世界数据集Daimon-Infinity,涵盖触觉、视觉等多维信息,计划形成数百万小时的数据。该数据集将用于真实场景的物理交互,推动具身智能的发展,并已开源10000小时高质量数据,构建了外发式数据采集网络,形成完整的数据处理闭环。

戴盟机器人发布全模态物理世界数据集Daimon-Infinity

全球TMT-美通国际 全球TMT-美通国际 · 2026-04-21T08:33:07Z
智象未来完成新一轮融资,全力打造下一代原生全模态世界模型

智象未来(HiDream.ai)近日完成超5亿元融资,资金将用于研发下一代全模态世界模型及市场拓展。公司在多模态生成式AI领域表现突出,已覆盖3000万用户和4万企业客户,推出多款创新产品,推动AI技术商业化。

智象未来完成新一轮融资,全力打造下一代原生全模态世界模型

量子位 量子位 · 2026-04-16T06:40:06Z
小米MiMo大模型首次推出Token Plan,单次订阅可满足全模态Agent任务需求

小米推出MiMo大模型的Token Plan,提供四种订阅方案,满足不同开发者需求。该计划透明计费,支持灵活调用多种模型,无使用时间限制,提升用户体验。

小米MiMo大模型首次推出Token Plan,单次订阅可满足全模态Agent任务需求

量子位 量子位 · 2026-04-03T05:44:33Z
国产玩家亮剑世界模型!把全模态卷到顶后,天工AI不藏了

天工AI在中关村论坛发布了三款多模态模型Matrix-Game 3.0、SkyReels V4和Mureka V9,标志着其向AI平台经济的迈进。这些模型在游戏、视频和音乐领域实现了实时交互和高质量生成,构建了可交互的世界模型。天工AI的“3+1战略”旨在整合这些能力,推动AI内容的规模化生产。

国产玩家亮剑世界模型!把全模态卷到顶后,天工AI不藏了

量子位 量子位 · 2026-03-27T14:08:24Z
从Token到词元:全模态时代的基模与交互入口

国家数据局首次确认“词元”为Token的标准译名,标志着AI技术向全模态发展。模思智能通过语音切入,推动统一Token结构,提升情境理解能力,已成为国内领先的全模态模型公司。

从Token到词元:全模态时代的基模与交互入口

量子位 量子位 · 2026-03-27T04:11:18Z
模态窗口与新页面:用户体验决策树

在用户体验设计中,选择模态窗口或新页面非常重要。模态窗口适合独立任务,有助于用户保持上下文,但可能造成干扰;新页面则适合复杂的多步骤工作流程。设计时应优先考虑非阻塞对话框,以提高用户效率。

模态窗口与新页面:用户体验决策树

Articles on Smashing Magazine — For Web Designers And Developers Articles on Smashing Magazine — For Web Designers And Developers · 2026-03-19T15:00:00Z
EMBridge:通过跨模态表示学习提升肌电信号的手势泛化能力

EMBridge是一个跨模态表示学习框架,旨在通过将表面肌电信号(sEMG)与高质量结构化数据对齐,提升手势识别的准确性。该框架采用查询变换器和对比学习目标,实现了零样本手势分类,展示了在可穿戴设备上进行手势识别的潜力。

EMBridge:通过跨模态表示学习提升肌电信号的手势泛化能力

Apple Machine Learning Research Apple Machine Learning Research · 2026-03-03T00:00:00Z
AI工具尝鲜:从"模态爆发"到"生态耕耘"

字节跳动的SeedDance引发关注,AI商业化应用迎来爆发。对话助手转变为知识调度引擎,竞争加剧。模型编排成为趋势,开发者可根据任务选择合适模型。图像生成和音频技术不断进步,开源社区仍是创新源泉。视频生成技术提升,AI应用潜力巨大。

AI工具尝鲜:从"模态爆发"到"生态耕耘"

Sekyoro的博客小屋 Sekyoro的博客小屋 · 2026-02-11T13:22:06Z

面壁智能推出的全模态模型MiniCPM-o4.5,具备边看边听和主动应答能力,能够实时识别环境变化并进行对话。与传统AI不同,它支持全双工交互,提升了用户体验,适用于多种场景,标志着端侧AI的新发展方向。

面壁智能开源全模态模型MiniCPM-o4.5,边看边听还能主动抢答

量子位 量子位 · 2026-02-05T15:19:59Z
“2.4万亿+原生全模态”是怎样炼成的?文心5.0技术报告首公开

PaddleFormers将降低多模态模型的训练和应用门槛,帮助开发者提升业务能力,推动多模态模型在更多场景中的应用。

“2.4万亿+原生全模态”是怎样炼成的?文心5.0技术报告首公开

百度大脑 百度大脑 · 2026-02-05T12:40:45Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码