推出 Gemini 3.8 Live 与 Live Avatar

💡 原文英文,约600词,阅读约需2分钟。
📝

内容提要

谷歌发布Gemini 3.8 Live with Live Avatar,为实时对话模型加入近实时视频生成,实现精准唇形同步、自然表情与流畅对话。该功能支持多模态交互、异步工具调用,可无缝切换97种语言,并提供可定制虚拟形象。所有AI生成内容均嵌入SynthID水印以保障透明度。目前已在Gemini Enterprise上线。

🔎

延伸解读

企业级实时虚拟形象的应用场景

Live Avatar 将实时视频生成与语音结合,为企业提供具有视觉形象的对话代理。文章指出,该功能可用于客户服务或交互式导览,通过精准唇形同步、自然表情和流畅对话,提升数字交互的丰富性和可访问性。目前该功能已在 Gemini Enterprise 上线,企业可借此扩展虚拟服务。

异步工具调用如何保持对话流畅

Live Avatar 支持异步工具调用,能在后台触发工具并获取数据,同时继续当前对话。这意味着在处理复杂任务(如酒店入住登记)时,对话不会中断。这种设计让虚拟形象在保持连续存在感的同时,借助 Gemini 的推理能力完成多步骤操作,提升交互效率。

多语言支持与视觉一致性

Live Avatar 具备原生多语言语音到语音同步能力,可在 97 种语言间无缝切换,并动态调整唇形和表情,而不会降低视频保真度或产生视觉漂移。这使得企业能够为全球用户提供自然、一致的对话体验,无需担心语言切换导致的视觉不协调。

定制虚拟形象与透明度保障

企业除了使用预设虚拟形象库,还可通过高质量参考图生成定制动画形象,保留参考 likeness、品牌风格或角色身份。目前定制功能仅通过企业允许列表提供。所有 AI 生成内容均嵌入 SynthID 水印,以帮助检测 AI 生成内容,减少误传和错误归属。

Q&A

Gemini 3.8 Live with Live Avatar 是什么?

Gemini 3.8 Live with Live Avatar 是谷歌推出的新功能,为实时对话模型加入近实时视频生成,实现精准唇形同步、自然表情与流畅对话,使AI能听、看、说,并具有动态视觉形象。

Live Avatar 如何实现更自然的对话?

Live Avatar 通过同时处理视觉和音频输入,生成富有表现力的音频和视频,并具备精准唇形同步、自然表情和流畅的轮流对话能力,从而模拟人类多模态交流。

Live Avatar 支持哪些语言?

Live Avatar 支持97种语言,具备原生多语言语音到语音同步能力,能在对话中无缝切换语言,且唇形同步和表情会动态适应,不会降低视频保真度或产生视觉漂移。

企业如何定制自己的 Live Avatar?

企业可以通过提供高质量参考图像,生成完全动画化、响应式的虚拟形象,同时保留参考肖像、品牌风格或角色身份。定制功能目前仅通过企业允许列表提供。

Live Avatar 如何确保AI生成内容的透明度?

所有AI生成内容都嵌入了SynthID水印,这种不可感知的水印直接编织在音频和视频输出中,有助于确保AI生成内容可被检测,从而减少错误信息和错误归属。

Gemini 3.8 Live with Live Avatar 目前在哪里可用?

Gemini 3.8 Live with Live Avatar 已在 Gemini Enterprise 上线,用户可以通过API文档开始使用。

🏷️

标签

➡️

继续阅读