论文提出SPADE方法,让同一大模型同时扮演环境设计师和推理智能体,通过自生成可执行Python环境进行强化学习。在Qwen3-30B上,8个基准均分从50.2提升至58.3,增益集中在程序性推理和科学代码,竞争数学保持稳定。消融实验表明,自适应设计是关键,而非自播放大本身。
基于SPADE工具搭建终端溯源图系统,实现对终端场景下的攻击溯源与调查。
完成下面两步后,将自动完成登录并继续当前操作。