新加坡国立大学与Sea AI Lab提出的OrchRM框架,通过自监督奖励建模,利用多智能体执行中的中间产物构建胜负对,显著提高了多智能体系统的编排效率。该方法无需昂贵的人工标注或完整的子代理执行,Token使用效率提升最高10倍,准确率平均提升约7.2%。OrchRM为多智能体系统的规模化部署提供了新路径。
语音增强(SE)面临数据、目标和任务等挑战,自监督学习(SSL)逐渐成为解决方案。SSL通过未配对数据学习和生成式方法,重塑了SE的训练目标。研究表明,SSL特征在增强任务中有效,未来将关注多任务统一增强、低信噪比生成模型及可控的语音生成。整体来看,SSL为SE提供了更强的先验和设计空间。
自监督学习(SSL)是一种无标签样本的机器学习方法。本文提出高斯过程自监督学习(GPSSL),通过高斯过程模型改进表示学习,克服传统SSL在生成相似观察对和不确定性量化方面的局限。GPSSL引入高斯先验,优化表示空间,实验结果显示其在分类和回归任务中优于传统方法,提高了准确性和不确定性控制。
智谱AI推出手机端智能助理框架Open-AutoGLM,利用视觉语言模型实现屏幕内容的深度理解与自动化操作。用户可通过自然语言指令完成任务,系统确保安全性并支持远程调试,已覆盖50余款主流应用,逐步成为全场景智能助手。
本文介绍了一种生成建模框架RepTok,该框架通过自监督视觉变换器获取单一连续潜在标记来表示图像。该方法在预训练的SSL编码器基础上微调语义标记嵌入,并与生成解码器联合训练。通过添加余弦相似度损失,保持潜在空间的平滑性。RepTok在ImageNet生成和文本到图像合成中表现出色,展示了微调SSL表示作为有效潜在空间的潜力。
本文探讨了通过引入有限视觉信息来减少自监督语音模型在多语言环境中的性能差距。研究表明,视觉信息对单语和双语模型均有益,尤其是双语模型的表现显著提升,零样本音素区分的多语言性能差距从31.5%降至8.04%。
机器之心数据服务现已上线,提供高效稳定的数据获取,简化数据爬取流程。
机器之心数据服务现已上线,提供高效稳定的数据获取服务,帮助用户轻松获取所需数据。
本文介绍了DiceHuBERT,一种用于压缩HuBERT的知识蒸馏框架。与传统方法不同,DiceHuBERT通过直接替换原始模型为学生模型,利用HuBERT的自蒸馏机制进行训练。实验结果显示,DiceHuBERT在音素识别和自动语音识别(ASR)性能上显著优于现有方法,提升超过21%和14%。
微软亚洲研究院与清华、北大联合提出强化预训练(RPT),将强化学习深度融入大语言模型(LLM)预训练,提升模型的推理能力和下一个token预测准确度。实验结果显示,RPT-14B在多种任务上优于传统模型,展现出更强的推理能力和潜力。
本文研究了六种自监督声学表示模型在心率估计中的表现,发现预训练模型的表示向量与基线方法相当,而自家CLAP模型在心率估计上表现更佳,误差更低。
本研究提出了一种新的自监督正样本采样技术(SSPS),有效克服了传统说话人验证方法的局限性。SSPS显著提高了验证性能,SimCLR-SSPS的错误率降低了58%,与DINO-SSPS表现相当。
本研究提出了一种新型自监督图表示学习方法Graffe,旨在解决扩散概率模型在图表示学习中的应用不足。该模型通过图编码器提炼源图,并指导扩散解码器去噪,从而在节点和图分类任务中实现领先性能。
本研究解决了共享单车系统中检测故障单车的难题,提出了一种新颖的自监督变压器框架(SSTransformer),有效结合了GPS轨迹和行程记录的时空特征。通过自监督预训练和后续的微调,该模型在真实数据集上的测试中显示出显著优于传统检测方法的性能,实现了高达97.81%的准确率,显著提高了共享单车的维护效率。
本研究提出了一种名为VCM的自监督视觉概念建模框架,旨在提高大型视觉-语言模型的效率。该方法通过隐式对比学习和视觉-语言微调,显著降低计算成本,同时在图像理解任务中保持优良性能。
本研究解决了医学成像中标签获取困难的问题,通过引入nn-MobileNet框架,采用BERT式自监督学习方法,利用大量未标记的视网膜图像进行预训练,以提高下游应用的性能。研究结果表明,此方法在阿尔茨海默病、帕金森病及多种视网膜疾病的识别中显著提升了表现,展示了在标签稀缺情况下,CNN的潜力。
本研究解决了当前大规模语言模型(LLM)推理技术对外部监督信号的依赖问题,提出了一种名为Genius的完全自监督自训练框架。通过引入逐步预见重采样策略和优势校准优化损失函数,Genius能够在没有外部辅助的情况下优化LLM,显著提升其推理能力,具有革命性的潜力。
本研究提出了一种自监督片段微调方法(SF²T),旨在提升视频大语言模型在细粒度理解方面的能力。通过利用视频特征进行训练,改善模型对视觉动态和细节的理解。同时,构建了新的基准数据集FineVidBench,以评估模型在场景和片段层面的表现,实验结果显示该方法显著提高了时空细节的捕捉和解释能力。
本研究提出了一种动态数据集修剪策略,以解决自监督学习在地球观察中的数据集策划不足问题,提升预训练数据集的多样性与平衡性,增强模型的迁移能力。
本研究针对文本识别变换器的预训练阶段提出了两种改进措施,从而解决了现有自监督学习方法对无标签数据的利用不足的问题。通过逐步增加掩蔽概率并修改损失函数,本研究的实验结果表明,该预训练方法在降低字符错误率方面有效,且在某些情况下,相较于迁移学习提升达30%。
完成下面两步后,将自动完成登录并继续当前操作。