多模态数据和资源高效的设备导向语音检测与大型基础模型

💡 原文中文,约400字,阅读约需1分钟。
📝

内容提要

本研究使用麦克风记录的信号来确定用户是否与虚拟助手交流。通过将语音识别系统和音频编码器的信号结合为大型语言模型的输入特征,实现了这一目标。使用低秩适应和前缀调整的组合进行数据训练,结果显示多模式方法的错误率更低(EER)。

🏷️

标签

➡️

继续阅读