LVSum是一个用于评估长视频摘要的新基准,包含72个跨13个领域的视频,平均时长16分钟,每个视频有最多10个人工摘要及时间参考。研究发现,转录文本比视觉帧对摘要质量贡献更大,模型与人类摘要仍有差距,且现有模型在时间定位、指令遵循和跨模态一致性上存在明显不足。
本文提出了一项新任务——从视频和转录文本生成语音(VTTS),旨在推动多模态语音生成技术的发展。我们介绍了Visatronic解码器模型,该模型将视觉、文本和语音嵌入统一的变换器中,通过自回归损失进行学习,简化了传统方法的复杂性,并在多模态语音生成中表现优越。相关代码和数据集将发布以促进进一步研究。
该脚本使用Google Gemini API自动提取YouTube播放列表的转录文本,并将其格式化为Markdown文件。它包括提取转录和AI优化两个阶段,确保内容结构一致,支持多语言和批量处理。
完成下面两步后,将自动完成登录并继续当前操作。