关于大型音视频语言模型中的音频幻觉

💡 原文中文,约300字,阅读约需1分钟。
📝

内容提要

本研究探讨了深度神经网络产生幻觉的原因,并提出了一种基于干扰的方法来评估自动语音识别模型的幻觉易发性。作者通过该方法成功区分了产生幻觉和不产生幻觉的模型,并研究了自动语音识别错误与数据集噪声之间的关系。最后,作者通过注入随机噪声的方式发现了诱导幻觉的方法。

🏷️

标签

➡️

继续阅读