Speaker Identification: Achieving Robust Speaker Embeddings Using Pre-trained Multilingual Transformers

💡 原文英文,约100词,阅读约需1分钟。
📝

内容提要

本研究提出了一种新颖的WSI框架,利用预训练的Whisper模型在多语言环境中进行说话人识别。通过联合损失优化,该方法显著提升了非英语语言的识别性能。

🏷️

标签

➡️

继续阅读