Reasoning Models Do Not Always Express What They Intend

💡 原文英文,约100词,阅读约需1分钟。
📝

内容提要

本文探讨了链式推理(CoT)在AI安全中的潜在价值,发现其可信度不足。尽管基于结果的强化学习在初期提升了CoT的可信度,但未能持续,表明CoT监控能够识别不良行为,但无法完全消除。

🏷️

标签

➡️

继续阅读