精准揪出RL训练数据Bug,Prompt直出小游戏,IQuest-Q1夯爆了!

精准揪出RL训练数据Bug,Prompt直出小游戏,IQuest-Q1夯爆了!

💡 原文中文,约2900字,阅读约需7分钟。
📝

内容提要

IQuest Research推出IQuest-Q1模型,采用稀疏MoE架构,总参数320B、激活15B。实测中,该模型仅凭提示词即可生成反重力赛车、国庆小游戏等HTML游戏,并能排查RL训练中因多余空格导致的奖励曲线异常。模型参与自身研发迭代,在NL2Repo、CyberGym等基准表现不俗。团队此前提出ModularRSI自进化框架,强调AI应把复杂任务做对做完。

🔎

延伸解读

稀疏MoE架构的算力效率

IQuest-Q1采用稀疏MoE架构,总参数320B但每次推理仅激活15B参数。这种设计让模型在保持大参数规模的同时,显著降低单次计算开销,提升推理效率。对于需要快速响应的代码生成、游戏开发等场景,稀疏激活意味着更低的延迟和更高的吞吐,同时维持模型能力。

模型参与自身研发的闭环

文章提到,IQuest-Q1能提出研发方案,经人类研究者确认后,验证过的模型更新、训练资产和研究流程会流入下一轮迭代。这种自我迭代机制让每一轮积累的数据、配置和工具成为可复用资产,加速后续版本进化。这体现了AI从被动工具向主动参与研发的转变。

RL训练中的隐蔽Bug排查

实测中,IQuest-Q1成功定位了RL训练中因推理服务解码时多插入一个空格导致的奖励曲线异常。这个空格造成生成文本与回传历史错位,使前缀匹配断裂、多轮生成中断,前几轮训练失效。模型通过分析日志和代码库反向追查,修复后训练恢复正常,展示了其在工程排错中的实用价值。

从创意到工程的交付能力

IQuest-Q1既能根据简短提示生成可玩的HTML游戏,又能解决RL训练中的复杂Bug。这种从创意生成到工程排错的跨度,表明模型不仅注重回答质量,更强调交付经得起查验的成果。对于开发者,这意味着一个模型可覆盖原型设计、调试排错等多环节,提升工作效率。

❓

Q&A

IQuest-Q1模型的基本架构和参数规模是怎样的?

IQuest-Q1采用decoder-only Transformer主干,配稀疏MoE架构,总参数约320B,激活参数约15B。

IQuest-Q1在哪些基准测试中表现不错?

IQuest-Q1在仓库级代码生成NL2Repo、网络安全基准CyberGym、终端Terminal-Bench 2.1、代码长程任务DeepSWE v1.1、办公场景JobBench等复杂任务评测中均表现不俗。

IQuest-Q1如何帮助解决RL训练中的故障?

IQuest-Q1能分析训练日志和落盘轨迹,从代码库反向追查故障原因。例如,它曾定位到RL框架接入Scaffold时,推理服务在文本解码时额外插入了一个空格,导致前缀匹配断裂、多轮生成中断,修复后训练恢复正常。

IQuest-Q1能根据提示词生成游戏吗?

可以。例如,仅凭一段约200字的提示词,IQuest-Q1就能生成一个可在竖屏手机上直接玩的HTML游戏《国庆卧室保卫战》,包含NPC设定、血条、回血机制和随机彩蛋。

IQuest Research团队提出的ModularRSI自进化框架有什么效果?

ModularRSI框架将Agent在Terminal-Bench 2.0和SWE-Bench Verified的准确率分别从47.57%、73.40%提升至52.43%、76.45%,并能让Agent把习得的执行能力跨任务、跨模型直接复用,解决了自改进中信用分配与泛化的难题。

IQuest-Q1模型如何参与自身的研发迭代?

IQuest-Q1提出的研发方案若被人类研究者采纳,验证过的模型更新、训练资产和研究流程会流入下一轮迭代,被后续版本复用。每一轮积累的数据流程、训练配置、评估方法和工具也会转化为可复用的研发资产。

🏷️

标签

➡️

继续阅读