该研究大规模探讨了非英语和多语言环境下的GRPO训练,发现用母语推理训练与英语训练效果差距小,且跨语言迁移强,但具体表现因模型和语言而异,某些语言训练可能导致其他语言能力严重退化。因此,RLVR虽能带来广泛跨语言收益,但需全面评估以检测特定语言退化。
文章反思中文拼音与方言的流失,感叹语言丰富度下降,并批评现代输入法导致书面语言退化。作者主张回归个体生活,重建内在丰富性,同时提及日常琐事如种菜、腌泡菜,并决定学习芒格的栅格模型,投资简单易懂的企业。
完成下面两步后,将自动完成登录并继续当前操作。