EnCLAP:基于神经音频编解码器和音频文本联合嵌入的自动音频字幕生成

💡 原文中文,约400字,阅读约需1分钟。
📝

内容提要

研究者提出了一种弱监督方法,利用音频和文本嵌入之间的相似性,通过重构文本和解码音频嵌入来训练模型,减轻了对配对目标数据的需求。实验证明,该方法在两个数据集上的性能达到了83%。

🏷️

标签

➡️

继续阅读