利用视觉监督进行基于阵列的主动说话人检测和定位

💡 原文中文,约300字,阅读约需1分钟。
📝

内容提要

该文章介绍了一种商用设备上部署的低功耗边缘计算优化的实时因果神经网络活动说话人检测系统。该系统利用麦克风阵列和360度摄像机的数据进行活动说话人检测,并在计算预算耗尽时表现出优雅的降级。与传统的声源角估计方法不同,该系统利用检测到的头部位置学习查询可用的声学数据。该系统在现实的会议数据集上进行了训练和评估,包含具有挑战性的场景。

🏷️

标签

➡️

继续阅读