语音增强(SE)面临数据、目标和任务等挑战,自监督学习(SSL)逐渐成为解决方案。SSL通过未配对数据学习和生成式方法,重塑了SE的训练目标。研究表明,SSL特征在增强任务中有效,未来将关注多任务统一增强、低信噪比生成模型及可控的语音生成。整体来看,SSL为SE提供了更强的先验和设计空间。
神经网络本质上是一个函数,通过输入输出结果来工作。训练过程是调整参数以使输出接近预期。深度学习利用多层结构和非线性激活函数来拟合复杂关系,能够有效处理高维数据。理解神经网络的关键在于明确输入、输出和参数的关系。
word2vec通过学习词的密集向量表示,利用对比算法捕捉词之间的语义关系。研究表明,word2vec在离散学习步骤中逐步增量学习概念,最终通过主成分分析(PCA)提取特征,为自然语言处理中的特征学习提供了重要基础。
本研究提出双头优化(DHO)框架,旨在解决资源有限环境中视觉语言模型(VLMs)的计算复杂性和训练成本问题。DHO通过独立学习标记数据和教师预测,显著提升特征学习效率,并在多个领域和数据集上超越传统基线。
本研究提出了一种多视角视觉提示调优网络(MVPT-NET),旨在提升乳腺X光照片中乳腺癌的检测能力。该方法基于单视图模型,创新性地适应多视图特征学习,实现高效调优,并在多机构数据集上取得了优异的检测效果。
本研究提出了一种新的半监督分割框架HDC,旨在解决胎儿超声图像中颈部结构的精确分割问题。该方法通过层次蒸馏机制和一致性学习,在低对比度和模糊边界条件下有效提升特征学习。实验结果表明,HDC在超声数据集上的表现优于现有模型,且计算开销更低。
本研究提出了一种基于小波的双分支网络,旨在提高多视角糖尿病视网膜病变检测的效果。通过交叉视图融合模块,减少信息冗余,显著提升了对局部病变特征及其全局依赖关系的学习能力。实验结果表明,该方法在大规模公共数据集上表现优异。
本研究提出了解析子空间路由(ASR)方法,以解决大语言模型在连续微调中出现的知识衰减问题。该方法有效地隔离特征学习,兼顾新旧知识,实验结果表明显著改善了现有方法的局限性。
DINO和DINOv2模型用于从未标记图像中学习特征,但训练复杂且不稳定。SimDINO和SimDINOv2通过引入编码率正则化项,简化了训练过程,提高了稳定性和效率,表现优于前者,适合视觉自监督学习。
本研究提出了一种通用方法,通过非线性特征学习和跨层特征聚合,检测大型语言模型(LLM)内部知识的准确性和可用性。结果表明,该方法在识别虚假信息和不实内容方面表现优异,并能有效引导模型输出新概念。
本研究提出了一种针对B模式超声图像的对比自监督学习方法,通过关系对比损失函数(RCL)提升特征学习。结果表明,该方法在乳腺超声数据集上显著优于传统监督分割,尤其在数据有限时展现出更强的泛化能力。
本研究提出Q-ASC系统,通过量子理念提升物联网声景分类的特征学习和抗噪能力,显著提高分类准确率,展示智能声感应用的潜力。
本研究评估了多种特征学习和预测方法,以提高小型和中型出版商学术文献的元数据提取效率和准确性。结果表明,不同方法在提取效果上存在显著差异,为未来研究提供了指导。
本研究提出了一种新颖的可视化解释方法UniCAM,旨在解决知识蒸馏中教师与学生之间知识转移的不透明性。实验结果表明,学生模型在教师的指导下能够更有效地学习相关特征。
本文介绍了一种新的卷积神经网络——预定义滤波卷积神经网络(PFCNN),其卷积核在训练过程中保持不变。尽管存在这一限制,PFCNN仍能有效学习复杂特征,为深度卷积神经网络的信息处理提供新的视角。
本研究探讨了预训练视觉变换器(ViT)对下游任务性能的影响,发现预训练特征并非必要。通过注意力转移,学生模型能够从零开始学习高质量特征,表现出良好的性能,为理解预训练提供了新的视角。
本研究探讨了多模态与单模态对比学习的理论差异,揭示信号与噪声比对泛化能力的影响,表明多模态学习显著提升特征学习效果,实证实验验证了这一发现。
本研究提出了多个新数据集和框架,探索视觉语言模型(VLMs)和多模态大型语言模型(MLLMs)的应用。研究发现,基于ImageNet和iNat2021的特征学习优于自我监督方法,且MLLMs在复杂任务中表现出色。通过自然语言交互减少标记工作量,提升了模型在图像分类和科学图表理解方面的性能,具有重要应用潜力。
本研究利用随机矩阵分析探讨全连接两层神经网络的特征学习及其与泛化能力的关系,揭示特征谱的渐进性质。结果显示,在最大学习率下,特征学习显著提升了泛化能力。
本文探讨了基于稀疏编码的特征学习与提取方法,提出了多种新算法以提升图像识别性能。研究表明,改进的卷积神经网络与稀疏特征抽样技术结合,能够在较低计算成本下实现高效的图像分类和语义分割。
完成下面两步后,将自动完成登录并继续当前操作。