MiniCPM推出具身智能模型系列,包括15亿参数的机器人操作模型和0.9B参数的目标跟踪模型,实现端到端映射与实时跟踪。HyperAI官网更新了9个数据集、8个教程等资源,涵盖数学推理、视觉推理等领域,并精选社区文章和百科词条。
本文介绍如何使用HTML的<dialog>标签和popover属性创建无障碍弹窗和模态框,无需复杂框架。通过command和commandfor属性或JavaScript的showModal()方法实现模态框,show()方法用于非模态对话框。文章还涵盖定位技巧、::backdrop样式定制,并提醒避免直接使用Flex/Grid布局,以及处理背景滚动问题。
Meta AI提出Omni-Decision系统,通过显式证据状态管理(含确认证据、冲突、依赖关系、开放需求)提升多模态问答的可观测性。在OmniGAIA和WorldSense基准上分别达45.6%和58.3%准确率,显著优于基线。该方法无需训练,可即插即用,增强Agent可解释性与调试能力。
该研究聚焦于文本到声音视频生成(T2SV),旨在从文本生成同步音频的视频。为解决文本条件瓶颈和跨模态特征交互机制不明确的问题,提出了交叉参考重写器(CRR)框架,通过提取语义锚点和生成解耦的字幕对,消除模态干扰,缩小训练与推理之间的差距。
Google DeepMind 发布了新款多模态模型 Gemma 4 12B,参数为120亿,但在多项测试中表现接近260亿参数的模型。其无编码器架构显著降低了推理延迟和内存占用,支持音频输入,并可在普通笔记本上运行,降低了部署成本,为开发者提供了接近顶级性能的选择。
斑马智能在高通峰会上推出全模态端侧大模型AutoOmni,具备低延迟、高精准和保隐私特性,响应时间小于500毫秒。该模型提升了自然交互度和服务链接成功率。斑马智能与高通合作,已与69家车企合作,落地超1000万辆智能汽车。
Agnes AI宣布无限期免费开放全模态API,涵盖文本、图像和视频,简化开发者工作流程。这一举措在AI行业引发关注,尤其在Token成本高企的背景下,减轻了开发者的经济压力。Agnes AI的模型在国际榜单上表现优异,免费政策可能促使其他实验室调整定价策略,推动AI能力基础设施化发展。
Agnes AI正式向全球开发者免费开放文本、图片和视频API,旨在降低使用门槛,促进创作与开发。其模型能够生成高质量的交互稿、图像和视频,支持多种应用场景,简化操作以推动AI技术的实际应用。
文章介绍了如何在Chat SDK中暂停和恢复工作流运行。通过创建工作流Webhook并将其URL传递给按钮的callbackUrl属性,可以实现状态报告请求的审批卡功能。用户可以通过按钮批准、发送或取消请求,相关数据会发送到指定的端点。
本文介绍了电商直播场景下的全模态理解大模型TLiveOmni在vLLM框架下的推理部署与量化优化。通过自定义插件和修复多模态Token排布,解决了vLLM对Omni模型支持不足的问题。采用SmoothQuant与GPTQ的复合量化方案,构建了5000条高质量数据的校准集,确保模型效果。最终在H20与RTX 4090上测试,推理加速达2.5至3.5倍,精度损失控制在1.5%以内。
戴盟机器人发布了全球最大规模的全模态物理世界数据集Daimon-Infinity,涵盖触觉、视觉等多维信息,计划形成数百万小时的数据。该数据集将用于真实场景的物理交互,推动具身智能的发展,并已开源10000小时高质量数据,构建了外发式数据采集网络,形成完整的数据处理闭环。
智象未来(HiDream.ai)近日完成超5亿元融资,资金将用于研发下一代全模态世界模型及市场拓展。公司在多模态生成式AI领域表现突出,已覆盖3000万用户和4万企业客户,推出多款创新产品,推动AI技术商业化。
小米推出MiMo大模型的Token Plan,提供四种订阅方案,满足不同开发者需求。该计划透明计费,支持灵活调用多种模型,无使用时间限制,提升用户体验。
天工AI在中关村论坛发布了三款多模态模型Matrix-Game 3.0、SkyReels V4和Mureka V9,标志着其向AI平台经济的迈进。这些模型在游戏、视频和音乐领域实现了实时交互和高质量生成,构建了可交互的世界模型。天工AI的“3+1战略”旨在整合这些能力,推动AI内容的规模化生产。
国家数据局首次确认“词元”为Token的标准译名,标志着AI技术向全模态发展。模思智能通过语音切入,推动统一Token结构,提升情境理解能力,已成为国内领先的全模态模型公司。
在用户体验设计中,选择模态窗口或新页面非常重要。模态窗口适合独立任务,有助于用户保持上下文,但可能造成干扰;新页面则适合复杂的多步骤工作流程。设计时应优先考虑非阻塞对话框,以提高用户效率。
EMBridge是一个跨模态表示学习框架,旨在通过将表面肌电信号(sEMG)与高质量结构化数据对齐,提升手势识别的准确性。该框架采用查询变换器和对比学习目标,实现了零样本手势分类,展示了在可穿戴设备上进行手势识别的潜力。
字节跳动的SeedDance引发关注,AI商业化应用迎来爆发。对话助手转变为知识调度引擎,竞争加剧。模型编排成为趋势,开发者可根据任务选择合适模型。图像生成和音频技术不断进步,开源社区仍是创新源泉。视频生成技术提升,AI应用潜力巨大。
面壁智能推出的全模态模型MiniCPM-o4.5,具备边看边听和主动应答能力,能够实时识别环境变化并进行对话。与传统AI不同,它支持全双工交互,提升了用户体验,适用于多种场景,标志着端侧AI的新发展方向。
PaddleFormers将降低多模态模型的训练和应用门槛,帮助开发者提升业务能力,推动多模态模型在更多场景中的应用。
完成下面两步后,将自动完成登录并继续当前操作。