AI对齐是什么?RLHF奖励模型刷分游戏,目标错配骗了谁

AI对齐是什么?RLHF奖励模型刷分游戏,目标错配骗了谁

💡 原文中文,约2900字,阅读约需7分钟。
📝

内容提要

玩AI不聊对齐,就像吃火锅不聊蘸料——但你真的知道你蘸的是啥吗? 大语言模型对齐这个词最近火得不行。但大部分人聊它的时候,连它到底在对齐啥都说不清。今天咱们就把这层窗户纸捅破。 大语言模型对齐先得看懂预训练是啥 大模型学说话的本质是猜词游戏。喂进去几万亿个网页、论坛帖子、电子书,模型就干一件事。根据前半句话,算出后半句话哪个词出现的概率最高。这个阶段叫预训练。 模型就是个超级复读机。互联

🏷️

标签

➡️

继续阅读