谷歌在Display & Video 360中推出竖屏视频统一购买方案,支持跨渠道程序化购买和衡量竖屏视频广告,并借助Gemini优化投放与全漏斗衡量。测试中,联合利华Hellmann’s与WPP Media独立触达提升24%,单用户成本降低25%。
IvyCraft是一款AI内容生成平台,可导入PDF、论文、网页等资料,让AI理解后生成PPT、信息图、播客、视频等,生成结果支持继续编辑,避免重做。适合研究生、教师、职场人士和创作者,将已有资料快速转化为可用成品。
Shotcut 26.9 发布,新增音频自动闪避、音量控制、轨道电平表和虚拟片段调整功能,支持 FFmpeg 9.0,提升音频质量与时间线性能,界面更现代,改进外部插件管理,并修复多项错误与安全问题。
MPA报告显示,2026年亚洲七大市场内容投资约151亿美元,电视预算下滑,流媒体和本土电影成为增长主力。印度流媒体投资首次超过电视,体育是关键差异化因素。行业需通过重组、协作和AI降本,保护内容优势,将庞大受众转化为可持续回报。
Dalet与法新社合作,将C2PA内容溯源标准引入视频工作流,开展可验证来源与历史记录的概念验证,预计2027年一季度完成。双方认为,在AI生成内容冲击信任的背景下,C2PA能为真实新闻提供可验证证书,将信任与人工监督嵌入内容全生命周期。
AI视频生成正从扩散模型转向代码模型。Claude Opus 5.5用Three.js重做《桃花源记》3D交互版,不生成画面,而是写代码让浏览器渲染可交互场景。代码模型优势在可控性:每帧可查可改,算力可复用;视频模型擅长感知真实感。两者并非取代,而是分工——代码决定发生什么,视频模型决定看起来怎样。OpenAI已优先投入Codex。
Video-to-BT框架利用视觉语言模型将人类示教视频分解为子任务并生成行为树,结合实时场景感知与反应式控制执行机器人装配。系统通过世界状态监控和恢复机制应对动态扰动,失败时触发重新规划,并引入人在回路验证,提升长时程装配任务的泛化性与鲁棒性。
Adobe以3.4亿美元收购AI视频图像增强公司Topaz Labs。Topaz将保留独立品牌,其技术已用于Firefly和Photoshop,可提升分辨率并保持自然细节,支持设备端或云端处理。整合后创作者无需切换工具,影视机构也能将存档内容现代化。CEO Eric Yang加入Adobe,客户支持不变。
谷歌将Google Vids开放给所有Google及Workspace用户,借助Gemini Omni 1.1 Flash模型免费生成高清视频,支持延长场景、精确设定时长、1080p高清生成,并内置SynthID水印。即将推出Gemini 3.8 Flash-Lite文字转语音,支持100多种语言。适用于创业者、小商家、企业营销和社区组织。
Figure、Dyna与亮源新创探索用人类视频预训练机器人。Figure的Index预训练将陌生家庭任务成功率从9%提升至56%,但未公开规模与闭环成功率的关系;Dyna验证人类视频规模扩大可持续提升真机表现;亮源新创用互联网视频验证迁移缩放定律。核心问题是人类经验能否成为可扩展的机器人预训练数据。
作者因给视频加字幕需用昂贵软件或上传在线工具,便自建纯浏览器运行的“字幕工作室”:拖入MP4即可在时间轴分段写字、调样式并预览,导出无水印带字幕视频。它用WebCodecs逐帧解码编码,mp4box解析、mp4-muxer封装,音频尽量直转。全程本地处理,视频不上传,状态存IndexedDB,适合桌面Chrome或Edge。
作者用Codex配合GPT-6 Astra,仅凭一段大白话提示词,48分钟自动完成圆桌视频剪辑:识别主持人及本人片段、本地跑ASR生成字幕、对齐时间轴并导出720p成片,按订阅配额摊销成本约8元。作者认为这预示杰文斯悖论:剪辑门槛降至一句话,普通人海量闲置素材将被激活,Agent用户将从程序员扩展到大众,Token消耗量级将大幅增长。
本文以滑雪影片《The Ultimate Run》为例,介绍视频AI的分层处理工作流:帧处理单幅画面,镜头识别画面切换,场景聚合语义段落,关键时刻和章节面向观众。核心原则是按需选取最小视频片段,避免逐帧分析的高成本,并根据内容类型灵活组合信号。
2026云栖大会上,阿里公布大模型进展:Qwen3.8-Max在编程与办公领域表现强劲,Qwen4已投入训练,未来参数将扩至5至10万亿。多模态方面,Qwen-Image-3.1、Qwen-Audio-3.1、Wan3.0等均居全球前列。阿里还公布RSI自我进化技术,模型可零人工干预自主迭代。Qwen系列全面开源,下载量超30亿次,成为全球AI开源社区基座模型。
火山引擎推出AI MediaKit理解式视频编辑引擎,采用自研ReFM残差流匹配作为修复主干,解决字幕擦除难题。该方案通过多模态语义理解区分应擦除的后期叠加文字与应保留的场景固有文字,以残差编辑替代从噪声重建,结合局部与全局引导及Latent精准回贴,实现4步采样下的无痕修复。支持50多种语种,适配批量生产与多算力部署。
Valve在Steam测试版中推出实验性视频编解码器Pyrowave,由VKD3D-Proton开发者Hans-Kristian Arntzen打造,支持Windows、macOS和Linux。其带宽是其他流媒体编解码器的5到10倍,适合千兆局域网,基于Vulkan API,延迟极低,支持HDR和YUV 4:4:4,可在Steam远程游玩高级设置中启用。
Higgsfield AI 借助 GPT-6 Astra,将单条广告快速生成上百个变体,帮助小企业定制多国版本视频广告。该模型支持长程任务规划,使一名工程师一天内交付新功能,加速创意工具上市。
剪映在抖音创作者大会发布PC端“剪映Hub”和手机端升级,打通AI视频生成与剪辑。Hub内可完成脚本、分镜、素材生成,一键跳转多轨道剪辑,支持AI智能延长、局部编辑、音画调整及剪映助手。手机端新增随拍成片和语音剪辑,整合分散流程,降低操作负担。
清华大学与生数科技推出 Vidu S2,包含 Avatar 和 Editing 两个模型,支持实时 720p 数字人生成、动态参考图更新、视频流风格迁移、虚拟试穿、人物与背景替换,以及实时空间视频生成。本周还推荐了 NCP-ArchPreview、SenseNova-U1.5、Benchmark Radar、Atria Dawn、Dream-RSI 等 8 篇 AI 前沿论文。
形界智能发布Genesis1.0,探索实时互动视频生成,使视频从一次性生成变为持续理解并回应用户的互动世界。其Era系列模型覆盖虚拟人、AI陪伴、体感交互等场景,通过理解与生成同一模型降低延迟。安全方面,形界与数美科技合作,将实时围栏融入生成链路,坚持安全优先,兼顾交互体验。
完成下面两步后,将自动完成登录并继续当前操作。