推出 Gemini 3.8 Live 与 Live Avatar
内容提要
谷歌发布Gemini 3.8 Live with Live Avatar,为实时对话模型加入近实时视频生成,实现精准唇形同步、自然表情与流畅对话。该功能支持多模态交互、异步工具调用,可无缝切换97种语言,并提供可定制虚拟形象。所有AI生成内容均嵌入SynthID水印以保障透明度。目前已在Gemini Enterprise上线。
延伸解读
企业级实时虚拟形象的应用场景
Live Avatar 将实时视频生成与语音结合,为企业提供具有视觉形象的对话代理。文章指出,该功能可用于客户服务或交互式导览,通过精准唇形同步、自然表情和流畅对话,提升数字交互的丰富性和可访问性。目前该功能已在 Gemini Enterprise 上线,企业可借此扩展虚拟服务。
异步工具调用如何保持对话流畅
Live Avatar 支持异步工具调用,能在后台触发工具并获取数据,同时继续当前对话。这意味着在处理复杂任务(如酒店入住登记)时,对话不会中断。这种设计让虚拟形象在保持连续存在感的同时,借助 Gemini 的推理能力完成多步骤操作,提升交互效率。
多语言支持与视觉一致性
Live Avatar 具备原生多语言语音到语音同步能力,可在 97 种语言间无缝切换,并动态调整唇形和表情,而不会降低视频保真度或产生视觉漂移。这使得企业能够为全球用户提供自然、一致的对话体验,无需担心语言切换导致的视觉不协调。
定制虚拟形象与透明度保障
企业除了使用预设虚拟形象库,还可通过高质量参考图生成定制动画形象,保留参考 likeness、品牌风格或角色身份。目前定制功能仅通过企业允许列表提供。所有 AI 生成内容均嵌入 SynthID 水印,以帮助检测 AI 生成内容,减少误传和错误归属。
Q&A
Gemini 3.8 Live with Live Avatar 是什么?
Gemini 3.8 Live with Live Avatar 是谷歌推出的新功能,为实时对话模型加入近实时视频生成,实现精准唇形同步、自然表情与流畅对话,使AI能听、看、说,并具有动态视觉形象。
Live Avatar 如何实现更自然的对话?
Live Avatar 通过同时处理视觉和音频输入,生成富有表现力的音频和视频,并具备精准唇形同步、自然表情和流畅的轮流对话能力,从而模拟人类多模态交流。
Live Avatar 支持哪些语言?
Live Avatar 支持97种语言,具备原生多语言语音到语音同步能力,能在对话中无缝切换语言,且唇形同步和表情会动态适应,不会降低视频保真度或产生视觉漂移。
企业如何定制自己的 Live Avatar?
企业可以通过提供高质量参考图像,生成完全动画化、响应式的虚拟形象,同时保留参考肖像、品牌风格或角色身份。定制功能目前仅通过企业允许列表提供。
Live Avatar 如何确保AI生成内容的透明度?
所有AI生成内容都嵌入了SynthID水印,这种不可感知的水印直接编织在音频和视频输出中,有助于确保AI生成内容可被检测,从而减少错误信息和错误归属。
Gemini 3.8 Live with Live Avatar 目前在哪里可用?
Gemini 3.8 Live with Live Avatar 已在 Gemini Enterprise 上线,用户可以通过API文档开始使用。