➡️
继续阅读
-
信也AI数字人直播间实践:从单条视频到可复用生产系统
本文介绍AI数字人直播间的多模态生产链路,涵盖素材处理、动作迁移、视频生成、声音合成、口型驱动及直播编排。通过ComfyUI节点化工作流、参考视频约束、独...
-
谷歌推出Gemini智能体视频理解功能
谷歌推出Gemini 3.7 Flash等模型的智能体视频理解功能,通过动态扫描视频片段,将令牌消耗降低88%,成本降低66%,准确率提升7%。该功能支持...
-
Meta刚刚在实时转录领域击败了OpenAI和Google
Meta推出实时语音识别模型Muse Voice Transcribe,支持70多种语言、区分20多位说话者及长对话,在基准测试中词错误率3.1%,优于竞...
-
推出Gemini智能体视频理解功能
谷歌推出Gemini模型的智能体视频理解功能,支持3.7 Flash等版本,通过动态搜索和工具调用,将分析成本降低66%、令牌消耗减少88%,准确率提升7...
-
试用Google Pics:在Google Workspace中轻松创建和编辑图像
Google推出AI图像工具Google Pics,基于Nano Banana模型,提供精准编辑、对象分割、图像内文字修改与翻译、协作及多版本生成等功能。...
-
Google Pics:比Canva更AI的创意设计工具
Google推出新创意设计工具Google Pics,集成于Workspace,基于Gemini和Nano Banana模型,提供AI图像生成与编辑功能,...