传统计算机处理确定性问题,LLM则应对不确定问题,但可能出错。相比SFT,DPO、GRPO等基于RL的方法利用特定logits提升LLM解决不确定问题的质量。关键是从真实世界数据及LLM生成的数学、编程数据中挖掘logits。数学答案易验证,编程可通过测试用例自动验证,因此RL方法在这两领域效果显著。
完成下面两步后,将自动完成登录并继续当前操作。