小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
Wan 3.0现已上线AI网关

阿里云Wan 3.0视频模型已上线AI网关,支持文生视频、图生视频、首尾帧及参考生成,输出最长30秒、30fps、最高1080p并含音频。提供轮询、异步任务及Webhook三种生成方式,支持图像、视频、音频参考,简化了多模型流程。

Wan 3.0现已上线AI网关

Vercel News Vercel News · 2026-08-25T00:00:00Z
等等,MiniMax H3不是刚发布吗?怎么就卷到几分钱的价格了……

秘塔AI上线MiniMax H3视频模型,用户无需部署或配置环境,打开网页即可使用。生成视频价格低至0.09元/秒,5秒视频不到五毛钱,2K版本也仅0.15元/秒。该模型支持文生视频、图生视频等功能,大幅降低了创作门槛和试错成本,让普通创作者能轻松将创意转化为视频。

等等,MiniMax H3不是刚发布吗?怎么就卷到几分钱的价格了……

量子位 量子位 · 2026-08-05T13:47:51Z
电车难题难倒AI视频模型:续写测试揭开世界模型的隐患

视频模型通过观察人类视频,不仅学习动作,还吸收了人类的“下意识选择”和偏见,形成一套“潜规则决策系统”。在电车难题测试中,模型倾向于逃避选择,如预测火车故障而非撞人,反映出“决策规避”和统计平均行为。这种偏见若用于行动模型,可能导致AI过度保守或行为偏差,需正视其放大效应,避免自动化灾难。

电车难题难倒AI视频模型:续写测试揭开世界模型的隐患

极道 极道 · 2026-08-04T03:45:00Z
模型如何边看边听、边回应:实时流式多模态模型技术路线

本文调研实时多模态视频模型,提出L0-L3能力分级,区分“支持视频”的四种层次。核心在于“可流式性”插入的层级:客户端采帧、分块编码、共享时间轴、显式触发、异步思考、模态专家或原生AV2AV。文章分析Qwen3.5-Omni、MiniCPM-o、ROMA、DuplexOmni、ELLSA、Wan-Streamer等方案,强调真正的实时取决于状态增量更新、说话时机可学习及音视频因果生成,并给出选型建议。

模型如何边看边听、边回应:实时流式多模态模型技术路线

NotionNext BLOG NotionNext BLOG · 2026-08-01T00:00:00Z
视频后期,危!MiniMax H3手绘即特效,多模态的「Coding时刻」来了

MiniMax发布开源视频模型H3,支持端到端生成带特效、字幕、转场的完整视频,默认2K分辨率,文字渲染和音频驱动表现优秀,价格低于主流模型。模型采用全模态输入和Omni架构,提升可控性,并开源以支持私有部署,被视为视频生成进入商用阶段的标志。

视频后期,危!MiniMax H3手绘即特效,多模态的「Coding时刻」来了

量子位 量子位 · 2026-07-31T08:28:30Z
我和「二次元老公」约上会了!全球首个可以玩的实时交互模型,Xmax X2.0发布

Xmax AI发布了实时交互视频模型X2.0,具备实时换装和角色变换功能,用户可与虚拟角色深度互动。该模型通过毫秒级响应和多种交互方式提升用户体验,适用于电商和直播等领域。X2.0的API将推动视频行业变革,降低创作门槛,重塑人机交互方式。

我和「二次元老公」约上会了!全球首个可以玩的实时交互模型,Xmax X2.0发布

量子位 量子位 · 2026-07-15T08:09:57Z
Gemini CLI 对接 Seedance MCP

本文介绍了如何在Gemini CLI中接入Seedance MCP,使用11个视频模型生成短视频。用户需注册AceData Cloud并获取API Token,通过命令行或手动配置即可使用,示例包括生成舞蹈和美食制作视频。

Gemini CLI 对接 Seedance MCP

静觅 静觅 · 2026-07-02T20:44:56Z
Gemini CLI 对接 Seedance MCP

Gemini CLI 现已支持 Seedance MCP,用户可通过 API Token 调用 11 个视频模型生成短视频,配置简单,支持竖屏 9:16 格式,适合舞蹈和美食制作等场景。

Gemini CLI 对接 Seedance MCP

静觅 静觅 · 2026-06-03T21:06:14Z
从高拟真到真可用,LongCat-Video-Avatar 1.5 正式开源

美团开源了LongCat-Video-Avatar 1.5数字人视频模型,提升了唇形同步、稳定性和多人互动能力。通过优化音频特征提取和数据处理,该模型在复杂场景中表现优异,生成效率提高15倍,适用于电商直播和教学等多种场景,推动数字人视频的实际应用。

从高拟真到真可用,LongCat-Video-Avatar 1.5 正式开源

美团技术团队 美团技术团队 · 2026-05-25T00:00:00Z
通过学习长期运动嵌入实现高效运动学生成

本文探讨了通过学习长期运动嵌入来高效生成运动的技术。研究表明,利用大规模轨迹获得的运动嵌入,可以更有效地生成长时间的真实运动,以满足文本提示或空间指令的目标。通过压缩运动嵌入并训练条件流匹配模型,生成的运动分布优于现有视频模型和特定任务方法。

通过学习长期运动嵌入实现高效运动学生成

Apple Machine Learning Research Apple Machine Learning Research · 2026-04-24T00:00:00Z

谷歌推出Veo 3.1 Lite视频模型,成本低于Veo 3.1 Fast,支持文本和图像转视频,提供灵活的画幅和分辨率。4月7日将降低Veo 3.1 Fast价格,以便更多开发者使用。

使用Veo 3.1 Lite构建,我们最具成本效益的视频生成模型

The Keyword The Keyword · 2026-03-31T16:00:00Z
杀进全球榜TOP2!国产视频模型黑马刚刚出现了

国产视频模型SkyReels-V4近期在全球视频大模型排行榜中跃升至第二位,展现出强大的多模态生成能力,支持文本、图像、视频和音频的组合输入,实现精准控制和专业级视频修复,推动视频创作全流程一体化。

杀进全球榜TOP2!国产视频模型黑马刚刚出现了

量子位 量子位 · 2026-02-27T08:04:54Z
AI Gateway上的Kling视频模型

Kling 3.0视频模型已在AI Gateway上线,支持从文本和图像生成高质量视频,具备多场景叙事和音频生成等功能,适合专业用户,提供无代码实验平台。

AI Gateway上的Kling视频模型

Vercel News Vercel News · 2026-02-19T13:00:00Z

DeepMind提出了“帧链”(CoF)概念,旨在赋予视频模型通用视觉理解能力。Veo 3模型通过简单提示生成视频,展现出感知、建模和操控能力,能够处理多种视觉任务。尽管在特定任务上不及专用模型,但其性能正在快速提升,未来有望成为机器视觉的“通用基础模型”。

DeepMind率先提出CoF:视频模型有自己的思维链

量子位 量子位 · 2025-09-28T03:47:25Z
这个AI生图神器首次发布视频模型:不卷分辨率,但网友直呼画面惊艳超预期|附提示词

Midjourney推出首个视频模型,用户可将图像转换为视频,支持手动和自动模式。视频保持超现实美学,但功能尚显粗糙,分辨率仅为480p,缺乏音效和时间轴编辑。未来将继续开发3D模型和实时系统,旨在构建完整的内容生产体系。

这个AI生图神器首次发布视频模型:不卷分辨率,但网友直呼画面惊艳超预期|附提示词

爱范儿 爱范儿 · 2025-06-19T03:46:11Z
Meta推出V-JEPA 2,一种用于物理推理的视频世界模型

Meta推出V-JEPA 2,这是一种新型视频世界模型,旨在提升机器对物理环境的理解和预测能力。该模型经过两阶段训练,首先自监督预训练超过一百万小时的视频,然后在62小时的机器人数据上微调。V-JEPA 2在机器人操作任务中表现优异,成功率达65%至80%。

Meta推出V-JEPA 2,一种用于物理推理的视频世界模型

InfoQ InfoQ · 2025-06-13T18:20:00Z

文章探讨了语言模型(LLM)与视频模型在学习能力上的差异。尽管视频数据更丰富,LLM却通过简单算法展现出更复杂的认知能力。作者将AI比作“柏拉图洞穴”,指出AI只能模仿人类知识,无法自主探索。未来的目标是让AI能够直接与物理世界互动,突破对人类知识的依赖。

不是视频模型“学习”慢,而是LLM走捷径|18万引大牛Sergey Levine

量子位 量子位 · 2025-06-10T09:15:50Z
Runway表示其最新的AI视频模型能够生成一致的场景和人物

AI初创公司Runway推出了Gen-4视频模型,能够在多个镜头中生成一致的场景和人物。该模型允许用户通过单一参考图像生成角色和物体,提供更好的故事连贯性和控制力。用户只需描述构图,模型便能从多个角度生成一致的输出。

Runway表示其最新的AI视频模型能够生成一致的场景和人物

The Verge The Verge · 2025-04-01T18:31:20Z
Luma AI 的 Ray2 视频模型现已在 Amazon Bedrock 中可用

Luma AI 的 Ray2 视频模型已在 Amazon Bedrock 上推出,能够通过文本生成高质量视频,支持多种应用场景,如内容创作和广告。用户可通过 API 轻松生成不同角度和风格的视频。

Luma AI 的 Ray2 视频模型现已在 Amazon Bedrock 中可用

亚马逊AWS官方博客 亚马逊AWS官方博客 · 2025-01-24T08:24:38Z
拿下近3亿元融资后,爱诗上线新模型,AI视频生成速度杀入10秒大关

爱诗科技的PixVerse V3.5视频模型实现接近实时的生成速度,显著提升运动控制和画质,支持多种动画风格,降低影视制作门槛,提供流畅的内容创作体验。

拿下近3亿元融资后,爱诗上线新模型,AI视频生成速度杀入10秒大关

机器之心 机器之心 · 2024-12-30T05:08:26Z
  • <<
  • <
  • 1 (current)
  • 2
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码