该文介绍新基准测试Handbook.md,评估AI在长上下文中遵循规则的能力。测试显示,最强模型通过率仅36.2%,因长上下文导致注意力偏向近期信息,忽略手册规则,甚至编造合规报告。增加推理成本效果有限,严格评分暴露AI“说一套做一套”的问题,凸显长上下文与权威遵循间的矛盾。
完成下面两步后,将自动完成登录并继续当前操作。