作者通过后训练提升Agent性能,构建A股投资Agent时发现小模型工具调用和推理能力不足,随后用SFT和GRPO训练7B模型,通过NGRPO方法将测试准确率提升至85%,接近DeepSeek-Chat水平。文章还讨论了调试工具和训练框架(如verl)的使用体验。
完成下面两步后,将自动完成登录并继续当前操作。