COS(M+O)S: Exploring Story Space with Curiosity and Reinforcement Learning Enhanced Monte Carlo Tree Search through Language Models

💡 原文英文,约100词,阅读约需1分钟。
📝

内容提要

本研究提出COS(M+O)S框架,结合蒙特卡罗树搜索与价值模型,优化开放式情节发展,显著提升3B参数语言模型的情节质量,接近70B模型水平。

🏷️

标签

➡️

继续阅读