推出 Gemini 3.8 Live,搭载实时虚拟形象

💡 原文英文,约600词,阅读约需3分钟。
📝

内容提要

谷歌发布Gemini 3.8 Live with Live Avatar,为对话AI加入实时视觉形象,结合低延迟视频与语音,实现精准唇形同步、自然表情和流畅对话,支持97种语言无缝切换,并可在对话中异步调用工具。该功能面向企业,支持预设及定制虚拟形象,输出均带SynthID水印,现已在Gemini Enterprise上线。

🔎

延伸解读

企业级实时虚拟形象的应用方向

文章指出,Live Avatar 面向企业,可用于客户服务或交互式导览等场景。它通过低延迟视频与语音结合,提供精准唇形同步和自然表情,让数字交流更丰富、更易用。企业可利用预设或定制虚拟形象来匹配品牌需求,但定制功能目前仅通过企业允许列表提供。

异步工具调用如何维持对话流畅

Live Avatar 支持异步工具调用,能在对话进行的同时在后台触发工具并获取数据。文章以酒店入住办理为例,说明它可以在不中断对话的情况下处理复杂任务。这意味着企业代理可以在保持连续交流的同时完成信息查询或操作,提升交互效率。

多语言同步与视觉一致性

该功能原生支持多语言语音到语音同步,可在97种语言之间无缝切换,并动态调整唇形和表情,而不会降低视频保真度或产生视觉漂移。文章展示了对话中途切换语言时,唇形和表情能自适应变化,这有助于企业服务全球用户时保持自然体验。

水印与安全透明度

所有由该AI产品生成的输出都带有SynthID水印,这种不可感知的水印直接嵌入音频和视频中,旨在帮助检测AI生成内容,减少错误信息和误归属。文章强调Live Avatar在设计时遵循严格的安全措施以尊重身份,并建议查阅模型卡了解全面的安全与负责任部署方法。

❓

Q&A

Gemini 3.8 Live with Live Avatar 是什么?

Gemini 3.8 Live with Live Avatar 是谷歌推出的为对话式 AI 增加实时视觉形象的功能,通过将实时对话能力与低延迟流媒体视频原生结合,实现近乎实时的视觉呈现,让 AI 能够聆听、观看并说话,拥有动态的视觉人格。

Live Avatar 如何实现更自然的对话体验?

Live Avatar 通过精确的唇形同步、自然的表情和流畅的轮流对话,同时处理视觉和音频输入,生成富有表现力的音频和视频响应,从而带来更自然、更直观的对话体验。

Live Avatar 支持哪些语言?

Live Avatar 支持 97 种语言,具备原生多语言语音到语音同步能力,能够在对话中无缝切换语言,同时动态调整唇形同步和表情,不会降低视频保真度或引入视觉漂移。

企业如何定制自己的 Live Avatar?

企业可以通过提供高质量的参考图像,生成完全动画化、响应式的虚拟形象,同时保留参考肖像、品牌风格或角色身份。定制虚拟形象创建目前仅通过企业允许列表提供。

Live Avatar 如何确保 AI 生成内容的透明性?

所有由 AI 产品生成的输出都带有 SynthID 水印,这种不可感知的水印直接嵌入音频和视频输出中,帮助确保 AI 生成内容可被检测,以减少错误信息和错误归属。

Live Avatar 在哪里可以使用?

Gemini 3.8 Live with Live Avatar 已在 Gemini Enterprise 中上线,企业用户可以通过 API 文档开始使用。

🏷️

标签

➡️

继续阅读