LIMA: Less Is More for Alignment 简读

LIMA: Less Is More for Alignment 简读

💡 原文中文,约2100字,阅读约需5分钟。
📝

内容提要

LIMA是一篇网红文,用SFT方案训练了一个模型,证实了表面对齐假设。该模型只用了1000条指令微调数据,但效果超过了使用52000条数据的Alpaca模型。LIMA验证了绝大部分的知识是在预训练阶段习得的,一定程度上也说明了有效的SFT甚至可以超越RLHF的结果。

🏷️

标签

➡️

继续阅读