COMPASS是一个评估工具,专注于现实旅行规划场景,将旅行规划视为约束偏好优化问题,要求在满足硬性约束的同时优化用户偏好。研究表明,现有模型在多服务协调任务中表现不佳,尤其是开源模型。COMPASS旨在通过实际用户场景评估代理优化用户偏好的能力。
本文探讨大型语言模型在金融任务中的应用,利用监督微调、偏好优化和强化学习等技术,显著提升模型性能,展现其在金融领域的广泛潜力。
ICLR(国际学习表征会议)是深度学习领域的重要会议,2025年排名第10。文章介绍了多篇论文,涉及大语言模型对齐、偏好优化和图像生成等技术,提出新方法和框架,提升模型性能与应用潜力。
本研究提出了2D-Curri-DPO框架,克服了传统偏好优化方法的局限性,通过建模复杂性和可区分性,提升了训练的稳定性和优化效果。实验结果表明,该框架在多个基准测试中表现优异。
本研究提出AdPO方法,旨在提高大规模视觉语言模型(LVLMs)在对抗攻击下的鲁棒性。通过将对抗训练重新定义为偏好优化,AdPO增强了模型生成正常输出的能力,实验结果表明其在多个任务中优于现有防御方法。
本研究提出了一种新的ReLU-based Preference Optimization (RePO)算法,旨在解决大型语言模型与人类偏好对齐中的计算和稳定性问题。RePO简化了调参过程,提升了模型性能,实验证明其在多个基础模型上优于现有方法DPO和SimPO。
本研究提出了一种基于信心奖励的偏好优化方法(CRPO),旨在提升机器翻译的数据质量。结果表明,CRPO在翻译准确性和数据效率方面优于现有方法,具有广泛的应用潜力。
本研究提出特征级约束偏好优化(FPO)方法,旨在提高大语言模型与人类偏好的对齐效率和训练稳定性。实验结果显示,FPO使赢率提升5.08%,并降低计算成本,为高效对齐提供了新方案。
在大型语言模型(LLM)中,优化响应以符合人类偏好至关重要。DPO(直接偏好优化)、ORPO(赔率比偏好优化)和PPO(近端策略优化)是三种关键技术,旨在提升用户体验。DPO通过分类损失直接优化响应,ORPO结合指令调优与偏好对齐,而PPO确保训练过程的稳定性。这些方法帮助生成更符合用户期望的响应。
本研究提出Align-SLM框架,通过偏好优化提升无文本口语语言模型(SLMs)的语义理解,解决其在语义连贯性和相关性方面的不足。实验结果表明,该方法在大多数基准测试中达到了SLMs的最新性能。
本研究提出了一种基于投票的偏好优化框架(VPO),通过贝叶斯最小均方误差估计器改进生成结果,显著增强了对齐多样主观偏好的能力,实验结果表明其性能优于现有方法。
该研究提出了$f$-散度偏好优化框架($f$-PO),旨在解决现有方法在与人类偏好对齐方面的不足,并通过实验验证了其在多个任务中的优越性,推动了语言模型对齐的发展。
本研究提出了一种多图像增强直接偏好优化(MIA-DPO)方法,旨在解决多图像任务中的数据稀缺和高标注成本问题。该方法通过构建选择/拒绝对,降低了标注成本,并在基准测试中提升了3.0%-4.3%的性能,同时改善了复杂场景的表现。
本文提出了一种新颖的偏好优化方法α-DPO,旨在提高大型语言模型与人类偏好的对齐效率和稳定性。通过引入动态奖励边界,α-DPO克服了传统方法的局限性,实验证明其在多种模型设置中表现优于现有技术,展现出显著潜力。
本研究提出了一种新的递归学习方法PRefLexOR,结合偏好优化与强化学习,以提升小型语言模型的推理深度和反思性。通过动态知识图谱,模型能够自我教学,迭代提升推理质量,尤其在生物材料科学领域展现出强大的适应性和应用潜力。
本文探讨了大型语言模型与人类价值观的对齐问题,提出了即时偏好优化(OPO)方法,通过外部记忆实时更新对齐规则。研究表明该方法在法律和道德领域有效,并引入了AI对齐对话以提升人机交互效率。同时,讨论了个性化对齐和细粒度质量信号的应用,强调人类反馈在训练中的重要性。
本文探讨了大型语言模型(LLMs)的对齐方法,包括强化学习与人类反馈(RLHF)和直接偏好优化(DPO)。研究提出了一种新方法混合偏好优化(MPO),结合了两者的优点,采用两阶段训练过程,实验结果显示MPO在对齐任务中表现优异,提升了模型的稳定性和性能。
本文研究了大规模语言模型对齐的主要方法,包括强化学习与人类反馈(RLHF)和直接偏好优化(DPO)。提出的新方法混合偏好优化(MPO)结合了两者的优点,实验验证了其有效性。DPO在无监督语言模型中表现更好且更稳定,RS-DPO方法在资源有限环境中提升了模型一致性。此外,研究还探讨了隐私保护对齐的效果。
完成下面两步后,将自动完成登录并继续当前操作。