内容提要
北京中关村学院7名博士生用一个暑假从零训练出7B大模型ZGCM-1,并开源数据配方、权重、代码和日志。他们组建数百个Agent团队分担数据、实验、评测等工作,实践“AI4AI”范式,并按L1-L5评估Agent自主性。模型在部分推理和搜索评测中接近更大规模模型,团队已开始尝试400B、500B规模。
延伸解读
Agent团队如何分工协作
团队组建了数百个Agent,分化为数据、实验、评测等子团队,并搭建类似论坛的任务发布与汇报系统。Agent能依据质量要求编写清洗脚本、检查数据分布并自动调整规则,形成闭环;在实验中可监控日志、定位故障、优化I/O。研究者负责提出目标、设定约束和关键判断,Agent持续推进具体工作。
Agent自主性评级:L1-L5框架
团队将研发过程拆成11类任务,按L1到L5评估Agent自主性。实验监控和部署达到L4,即人给定目标与约束后,Agent可独立规划、执行并调整;模型架构和学习算法设计仍处于L2,主要辅助实现已有方案、运行预设实验。研究方向和关键设计选择仍需人类主导,距离AI独立承担整个研发过程尚有差距。
训练中的意外与诊断体系
一次训练中loss正常下降,模型能力却突然退步,追查发现是数据分片和shuffle环节导致实际数据比例波动。此后团队更密集保存中间checkpoint,追踪知识、数学、代码和推理等能力变化,并建立ACE原子能力评测体系,将能力拆成18类、183项,用2503个探针检查,一轮诊断约两三分钟,为排查提供具体依据。
长上下文与训练效率优化
为支持长推理、搜索和多轮工具调用,团队采用局部注意力与全局注意力结合的架构,将上下文从16K逐步扩展到64K、256K。在256K下,该设计相比全注意力方案带来约3.94倍吞吐提升,KV Cache占用降至约六分之一。结合Muon和FP8,并用延迟缩放与TWEO抑制极端激活值,在16K预训练中达到相同loss的效率比标准BF16/AdamW基线提高约4.2倍。
Q&A
7名博士生训练7B大模型用了多长时间?
他们用一个暑假(约3个月)从零训练出了7B大模型ZGCM-1。
ZGCM-1开源了哪些内容?
开源了各阶段训练数据和配方、模型权重、训练代码、中间checkpoint和日志。
ZGCM-1在评测中的表现如何?
在多项通用评测中与Qwen3-8B等同规模模型表现相近;在部分数学推理和搜索评测中,能与Qwen3-235B-A22B、GLM-5.1等更大规模模型比较。
团队如何用Agent分担研发工作?
他们组建了几百个Agent的团队,分头处理数据、跑实验、看日志、做评测,并搭建了类似论坛的任务发布与汇报系统,让任务有人接、进展有地方看、结果能被检查。
Agent在模型研发中的自主性评级如何?
团队将研发过程拆成11类任务,按L1-L5评级:实验监控和部署达到L4,Agent可独立规划、执行并调整;模型架构和学习算法设计仍在L2,更多是帮助实现已有方案。
训练中遇到了什么数据问题?如何解决?
一次训练中loss正常下降但模型能力突然退步,追查到数据分片和shuffle环节导致实际数据比例波动。之后团队更密集保存checkpoint,追踪能力变化,并建立ACE原子能力评测体系(18类、183项、2503个探针)进行诊断。
团队在模型架构上做了哪些优化来支持长上下文?
采用局部注意力与全局注意力结合的架构,将上下文从16K逐步扩展到64K、256K。在256K上下文下,相比全注意力方案带来约3.94倍吞吐提升,KV Cache占用降至约六分之一。
团队在训练效率方面有哪些改进?
结合Muon和FP8改善训练效率,用延迟缩放与TWEO抑制极端激活值,改善低精度训练稳定性。整套方案在16K预训练中达到相同loss的效率,相比标准BF16/AdamW基线提高约4.2倍。
团队从SFT阶段得到了哪些经验?
更严格的质量筛选让样本减少约44.9%,整体评测表现反而有所提升;长思维链数据比例过高会损害指令遵循;Agent数据不能脱离通用能力单独训练。
团队下一步计划是什么?
他们已经开始尝试400B、500B规模的模型,并继续探索7B阶段积累的方法在更大规模上的适用性,以及几百个Agent能承接多少新工作。