PersonaLive是澳门大学等机构提出的实时肖像动画方案,通过流式金字塔去噪使4步扩散仅需一次前向,实现无限长视频生成。它利用三条条件通路分别处理身份、姿态和表情,并采用TensorRT融合优化提速。训练分三阶段,代码和权重已开源。
PersonaLive是澳门大学等机构提出的实时肖像动画方案,通过流式金字塔去噪,使不同噪声档位的帧共享一次UNet前向,实现4步去噪仅需1/4次计算,支持无限长视频流。它分离身份、姿态、表情三条条件通路,并用TensorRT融合加速。训练分三阶段,代码和权重已开源。
TikTok正在测试一款工具,允许创作者扫描并报告未经授权的AI深度伪造内容。该工具目前在部分美国创作者中进行测试,创作者需身份验证后,系统将扫描可能使用其肖像的AI生成内容。
《Mixtape》是一款关于青少年生活的游戏,玩家扮演音乐迷Stacey Rockford,和朋友们在夏日闲逛,讨论音乐和未来。游戏通过怀旧场景和角色发展,展现友情与成长的主题,真实反映青春的迷茫与探索。现已在多个平台上线。
英国所有18岁及以上的人均可参与“A National Portrait”项目,拍摄个人照片并生成数字肖像,展出至2026年10月27日。该项目结合AI技术与艺术创作,鼓励公众参与。5月14日将在国家肖像画廊举办免费绘画活动,并提供在线绘画课程。
在Next.js Conf和Ship AI活动中,团队推出了结合AI技术和怀旧元素的像素肖像交易卡体验。参与者拍照后可生成个性化的像素风格卡片,作为活动纪念品。该系统高效便捷,用户可在线生成卡片,并推出了Vercelf Yourself应用,允许用户创建节日主题的像素肖像。
YouTube推出了一项新的AI检测功能,帮助创作者识别和报告未经授权使用其肖像的内容。创作者在验证身份后,可以在YouTube Studio查看被标记的视频,并请求删除可能的AI生成内容。此功能将逐步向更多创作者开放,旨在帮助名人管理与其肖像相关的AI内容。
谷歌实验室推出了Scott Galloway(Prof G)肖像,旨在为用户提供决策指导。该肖像整合了Prof G的1200多部作品,利用Gemini 2.5 Flash模型,支持全球用户提问并获取建议。此次国际扩展覆盖印度、日本、德国、巴西和英国,展示了AI在知识获取中的潜力。
LivePortrait 是一款高效的肖像动画生成工具,支持精确编辑和音视频合并。deep-prove 是一个快速证明机器学习模型的框架,采用零知识加密,显著提升证明速度。splatter-image 实现快速3D重建,支持多类别模型。eaio 通过硬链接减少磁盘占用,ix 是设计自主GPT-4代理的平台。
定制月亮灯融合了月亮的柔和光辉与珍贵照片,营造温馨氛围,适合作为礼物,适用于各种特殊场合。设计过程简单,选择照片和灯型,最终得到独特的灯具,成为生活中的珍贵纪念。
本研究针对肖像模式短视频的音视频事件定位(AVEL)问题,提出了专用数据集AVE-PM,并改进了数据预处理和模型设计,显著提升了性能,为移动视频内容的AVEL研究奠定了基础。
本文解决了文本到图像扩散模型在生成多样肖像时,对阴影控制缺乏直观性的问题。我们提出了“阴影导演”,该方法在经过训练的扩散模型中提取和操作隐藏的阴影属性,只需少量合成图像和快速训练,能够实现对阴影形状、位置和强度的参数化控制,同时保留多样风格中的艺术完整性和身份。此方法为资源友好的可访问解决方案,具有广泛应用的潜力。
本研究解决了肖像视频编辑中缺乏灵活性和训练需求的问题,提出了一种无需训练的通用框架。该框架基于统一动画控制机制,支持不同条件下的肖像外观和嘴部编辑,显著提高了视频编辑的同步性和灵活性,具有广泛的应用潜力。
1999年出生的施文轩在美国西北大学攻读计算机博士学位。他受到深圳南方科技大学教授的影响,选择赴美深造。尽管面临压力与焦虑,他通过参加人工智能网络安全挑战赛找到了方向,计划在2025年发表论文,并关注行业实习。他的经历反映了许多中国留学生在学术与职业之间的挣扎。
本研究解决了当前基于扩散的方法在单图像3D肖像生成中常常出现的低保真和模糊纹理问题,主要因为跨视角一致性考虑不足。我们提出了一种混合先验扩散模型,它综合利用多视角先验来改善生成肖像的细节与一致性,实验结果表明,该方法能有效生成高几何精度和丰富细节的3D肖像。
机器人艺术家Ai-Da创作的《AI之神:艾伦・图灵肖像》在苏富比拍卖会上以108.48万美元成交,超出预期。这一作品通过摄像头和AI算法绘制,引发了对艺术本质的思考。
Live_iy 是一款应用,通过参考视频为静态肖像添加动态效果。用户上传肖像和参考视频后,利用 Segmind 的 API 将静态图像转化为动态视频。应用使用 React 和 Sass 构建,并集成了 Pinata 和 Segmind 的 API。界面设计直观,方便用户操作。
本文介绍了一种基于音频信号生成个性化逼真说话动画的系统,提出了IMavatar、3D感知生成对抗网络和Myportrait等新方法。这些方法通过深度学习和3D模型整合,提升了面部动画的质量和一致性,成功解决了高质量动态脸部生成的挑战。
本文介绍了一系列基于神经网络的头发渲染和建模方法,包括从单一图像生成3D头发模型、准确建模头发几何形状和外观,以及通过新框架实现高逼真度发型恢复。这些方法在多个实验中表现出优越的性能,克服了传统技术的局限性。
本文介绍了多种基于语音驱动的说话人脸合成技术,包括情感视频肖像、无监督学习的3D模型、一次性风格控制和变分风格转换模型。这些方法通过提取面部特征和风格,生成高质量的动态视频人像,显著提升了合成的自然性和表现力。实验结果显示,这些新技术在视觉质量和表达丰富性方面优于现有方法。
完成下面两步后,将自动完成登录并继续当前操作。