本研究提出了角色扮演评估(RPEval)基准,旨在从情感理解、决策能力、道德一致性和角色一致性四个维度客观评估大语言模型的表现。
本文探讨了人工智能系统与人类价值观对齐的问题,提出了一种基于多智能体决策和人类认知模型的协作逆强化学习方法。研究强调道德价值对齐的重要性,并提出新的框架和奖励函数设计,以提高AI系统的道德一致性和透明性,确保其符合社会伦理标准。
大型语言模型在道德场景中一致性不足。研究提出语义图熵等度量,通过经验法则提升与人类判断的相关性;调查显示模型在明确道德情境多与常识一致,模糊情境则常表不确定且易受提问方式影响。另有研究用多阶段框架提升问答可靠性,并提出假设与组合一致性等概念,发现模型面对质疑时判断一致性显著下降。
完成下面两步后,将自动完成登录并继续当前操作。