小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI

本研究提出AlignDiT模型,解决多模态语音生成问题,能够从文本、视频和音频合成高质量语音,提高可懂性和同步性。

AlignDiT: A Multimodal Alignment Diffusion Transformer for Synchronous Speech Generation

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2025-04-29T00:00:00Z

本研究提出了TARO框架,通过时间步自适应表示对齐和起始感知条件,显著提升视频到音频合成的质量和同步性。实验结果表明,TARO在音频质量和同步精度上优于现有方法,展现出卓越性能。

TARO:具有起始感知条件的时间步自适应表示对齐用于同步视频到音频合成

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2025-04-08T00:00:00Z

本研究提出MultiFoley模型,旨在解决视频音效生成中的艺术性与真实来源差异问题。该模型能够从静音视频和文本提示中生成高质量音效,显著提高音效的同步性和质量。

Video-Guided Foley Sound Effect Generation and Multimodal Control

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-11-26T00:00:00Z

本研究探讨视频到音频生成技术,提出了多种模型和方法,如OneShotA2V和T2AV,强调生成质量和同步性。通过音频引导视觉动画,建立了AVSync15基准,展示了模型在音频同步生成任务中的优越性能,为更真实的视听生成模型奠定了基础。

增强同步性的遮蔽式生成式视频 - 音频变换器

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-07-15T00:00:00Z

本文介绍了一种基于手势模板和语音音频的手势序列生成方法,使用嘴唇同步误差来评估模型的同步能力。该方法在保真度和同步性方面表现良好。

SynthoGestures: 面向驾驶场景的合成动态手势生成新框架

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2023-09-08T00:00:00Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码