推出 Gemini 3.8 Live,搭载实时虚拟形象
内容提要
谷歌发布Gemini 3.8 Live with Live Avatar,为对话AI加入实时视觉形象,结合低延迟视频与语音,实现精准唇形同步、自然表情和流畅对话,支持97种语言无缝切换,并可在对话中异步调用工具。该功能面向企业,支持预设及定制虚拟形象,输出均带SynthID水印,现已在Gemini Enterprise上线。
延伸解读
企业级实时虚拟形象的应用方向
文章指出,Live Avatar 面向企业,可用于客户服务或交互式导览等场景。它通过低延迟视频与语音结合,提供精准唇形同步和自然表情,让数字交流更丰富、更易用。企业可利用预设或定制虚拟形象来匹配品牌需求,但定制功能目前仅通过企业允许列表提供。
异步工具调用如何维持对话流畅
Live Avatar 支持异步工具调用,能在对话进行的同时在后台触发工具并获取数据。文章以酒店入住办理为例,说明它可以在不中断对话的情况下处理复杂任务。这意味着企业代理可以在保持连续交流的同时完成信息查询或操作,提升交互效率。
多语言同步与视觉一致性
该功能原生支持多语言语音到语音同步,可在97种语言之间无缝切换,并动态调整唇形和表情,而不会降低视频保真度或产生视觉漂移。文章展示了对话中途切换语言时,唇形和表情能自适应变化,这有助于企业服务全球用户时保持自然体验。
水印与安全透明度
所有由该AI产品生成的输出都带有SynthID水印,这种不可感知的水印直接嵌入音频和视频中,旨在帮助检测AI生成内容,减少错误信息和误归属。文章强调Live Avatar在设计时遵循严格的安全措施以尊重身份,并建议查阅模型卡了解全面的安全与负责任部署方法。
Q&A
Gemini 3.8 Live with Live Avatar 是什么?
Gemini 3.8 Live with Live Avatar 是谷歌推出的为对话式 AI 增加实时视觉形象的功能,通过将实时对话能力与低延迟流媒体视频原生结合,实现近乎实时的视觉呈现,让 AI 能够聆听、观看并说话,拥有动态的视觉人格。
Live Avatar 如何实现更自然的对话体验?
Live Avatar 通过精确的唇形同步、自然的表情和流畅的轮流对话,同时处理视觉和音频输入,生成富有表现力的音频和视频响应,从而带来更自然、更直观的对话体验。
Live Avatar 支持哪些语言?
Live Avatar 支持 97 种语言,具备原生多语言语音到语音同步能力,能够在对话中无缝切换语言,同时动态调整唇形同步和表情,不会降低视频保真度或引入视觉漂移。
企业如何定制自己的 Live Avatar?
企业可以通过提供高质量的参考图像,生成完全动画化、响应式的虚拟形象,同时保留参考肖像、品牌风格或角色身份。定制虚拟形象创建目前仅通过企业允许列表提供。
Live Avatar 如何确保 AI 生成内容的透明性?
所有由 AI 产品生成的输出都带有 SynthID 水印,这种不可感知的水印直接嵌入音频和视频输出中,帮助确保 AI 生成内容可被检测,以减少错误信息和错误归属。
Live Avatar 在哪里可以使用?
Gemini 3.8 Live with Live Avatar 已在 Gemini Enterprise 中上线,企业用户可以通过 API 文档开始使用。