内容提要
谷歌发布Gemini 3.8 Live更新,新增“Live Avatar”功能,用户可与AI对话并看到实时动画形象回应。该形象支持对口型、面部表情、97种语言切换且不损失画质,并可在对话中显示信息。目前仅面向Gemini Enterprise客户,提供预设形象并允许企业自建,输出带SynthID水印。
延伸解读
企业专属的实时数字人
Live Avatar目前仅面向Gemini Enterprise客户,普通用户无法使用。企业可从预设形象库中选择,也可根据自身需求创建专属形象。这种策略表明谷歌优先将实时数字人技术落地于商业场景,如客服、培训或品牌互动,而非直接面向大众消费市场。
多语言口型同步的技术突破
Live Avatar支持97种语言,并能在切换语言时不损失画质、不出现视觉漂移,口型动画也能与所说语言匹配。这意味着AI形象在跨语言交流时能保持自然连贯,对于跨国企业开展多语言服务具有实用价值,减少了以往数字人切换语言时的生硬感。
水印与身份保护的双重考量
谷歌为Live Avatar的输出添加了不可见的SynthID水印,并设置了尊重身份的保护措施。这反映出在生成式AI形象日益逼真的背景下,谷歌试图在创新与滥用风险之间取得平衡,帮助识别AI生成内容,并防止未经授权模仿真实人物。
Q&A
Gemini 3.8 Live 的 Live Avatar 功能是什么?
Live Avatar 是谷歌在 Gemini 3.8 Live 更新中新增的功能,允许用户与 AI 对话时看到一个实时动画形象回应,该形象能对口型并展示不同的面部表情。
Live Avatar 支持哪些语言?切换语言时画质会下降吗?
Live Avatar 支持 97 种语言,并且可以在这些语言之间切换而不降低视频保真度或引入视觉漂移。
目前哪些用户可以使用 Live Avatar?
Live Avatar 目前仅面向 Gemini Enterprise 客户提供。
企业能否自定义 Live Avatar 的形象?
可以。谷歌会提供预设形象库供客户选择,同时也允许组织创建自己的形象。
Live Avatar 的输出是否带有水印或安全措施?
是的,Live Avatar 的输出带有不可见的 SynthID 水印,并配有旨在“尊重身份”的保障措施。
Gemini 3.8 Live 模型有什么特点?
谷歌表示 Gemini 3.8 Live 模型能够“近乎实时地处理视觉输入”。