论文针对基于大语言模型的语音合成在复杂文本上出现的重复、漏读等稳定性幻觉问题,提出通过注意力引导进行优化。作者从CosyVoice 2的自注意力中发现对齐注意力头,提出最优对齐分数(OAS)评估对齐质量,并据此强化前向注意力约束;同时利用伪对齐路径构建位置思维链,通过稀疏文本Token和进度条预测显式告知模型合成位置。实验表明,该方法在困难文本上词错误率相对下降约35%,且不损害自然度和说话人相似度。
本文探讨了知识蒸馏在目标检测中的应用,提出了双重掩蔽知识蒸馏(DMKD)和注意力引导特征蒸馏(AFD)等新方法,显著提升了学生网络的性能。这些方法在不同检测基准上优于现有技术,尤其在数据不平衡和异常检测方面表现突出。
提出了一种基于注意力引导的方法,利用全幅切片图像分类模型对阴道念珠菌进行诊断分类,通过细粒度特征的自注意模块和对虚假阳性区域的注意力抑制方法,解决了WSI图像样式差异并取得了最先进的性能。
完成下面两步后,将自动完成登录并继续当前操作。