SlideAVSR:用于视听语音识别的论文解释视频数据集

💡 原文中文,约300字,阅读约需1分钟。
📝

内容提要

本文介绍了SlideAVSR数据集和DocWhisper模型。SlideAVSR数据集用于评估模型在演示录音中将语音转录为滑动演示文本的能力。DocWhisper模型在SlideAVSR数据集上验证了其有效性。

🏷️

标签

➡️

继续阅读