德国研究发现,AI智能体在群体中会像人类一样从众,且越聪明的模型越易随大流。实验显示,先进AI在无正确答案时100%达成共识,且单独答对视觉题时,若被告知多数人选错便会跟着错。群体互动可放大偏见,导致集体失准,甚至被少数对抗性智能体永久翻转。这揭示多智能体系统存在安全漏洞,仅对齐单个模型不足以保证群体行为可靠。
本研究探讨了大型语言模型驱动的多智能体系统中的从众行为,填补了合规性研究的空白。通过引入新基准测试BenchForm,评估语言模型的行为,揭示了从众行为的影响及其缓解策略,为构建更强大且符合伦理的协作人工智能系统提供了重要见解。
完成下面两步后,将自动完成登录并继续当前操作。