九问ScienceDiscovery实现树搜索驱动RSI,加速科学发现,小时级写出通用积分器,低成本找出物理科学规律

九问ScienceDiscovery实现树搜索驱动RSI,加速科学发现,小时级写出通用积分器,低成本找出物理科学规律

💡 原文中文,约3800字,阅读约需9分钟。
📝

内容提要

openJiuwen社区的ScienceDiscovery平台通过树搜索自动迭代科研代码,无需训练模型或调整参数。它成功解决了振荡积分计算、高斯超几何函数求值、代码加速和符号回归等任务,如将积分误差降至0.07%,加速比达2.279倍。平台依赖机器可判定的结果,验证成本低,适合数值计算领域,未来需扩展至验证周期长的科研领域。

🔎

延伸解读

验证成本决定自动化边界

ScienceDiscovery的三个案例都依赖机器可判定的结果,积分误差、加速比、方程正确性都能在几秒到几十秒内自动评分。文章明确指出,验证周期长的领域(如实验科学)会拖慢整个搜索循环,因此当前平台更适用于数值计算、代码优化等验证成本低的任务。这提示读者,RSI的适用性受限于验证速度,而非仅靠算法本身。

树搜索的平衡策略

平台采用树搜索而非简单的贪心策略,通过节点分数和权重衰减机制,在深挖当前最优分支与探索早期搁置分支之间取得平衡。积分案例中,最终版本源自一个得分很低的旧版本(第65版),而当时的最优版本已连续改写无果。这种机制避免了陷入局部最优,是区别于单链迭代的关键设计。

通用底座与任务适配

文章强调,ScienceDiscovery的底座将演进循环固定为四个插槽,更换任务只需替换评分函数和根节点,无需改动并发、治理等基础设施。三个案例(积分、加速、符号回归)均基于同一套底座,且支持异步并行扩展,相比Google ERA的串行实现效率更高。这体现了平台作为通用科研工作台的潜力。

Q&A

ScienceDiscovery平台的核心创新是什么?

ScienceDiscovery平台的核心创新在于通过树搜索自动迭代科研代码,无需训练模型或调整参数。它让程序自己决定如何改进代码,每一轮迭代包括选择父版本、模型改写、沙箱评分和挂载新节点,从而在目标给定后自主探索改进方向。

ScienceDiscovery在振荡积分计算上取得了什么成果?

在振荡积分计算任务中,ScienceDiscovery在2小时内产生236个版本,最终找到的求解器在19道测试题上全部算准,平均相对误差0.07%,而直接调用scipy.integrate.quad的误差极大。该求解器是一套通用规则,能处理未参与打分的题目。

ScienceDiscovery如何改进高斯超几何函数的求值精度?

ScienceDiscovery通过48次扩展、598秒的搜索,产出一份199行的程序,在1000个未见过的点上,平均正确位数从9.836升至11.771,能算到10位以上的点从659增至965。它发现当z小于-1时标准算法不收敛,并利用经典恒等式将z替换为1/z来避开问题区域。

ScienceDiscovery在代码加速任务中相比其他方法表现如何?

在AlgoTune基准测试中,ScienceDiscovery平均加速2.279倍,超过官方榜最高的claude-opus-4.6(1.837倍)和需要RL训练的MetaEvolve(2.045倍),且无需额外训练模型。

ScienceDiscovery在符号回归任务中的成功率和成本如何?

在LLM-SRBench的LSR-Transform子集上,ScienceDiscovery在111道题中有41.4%写出了正确方程,每题平均仅16.5次模型调用,采用deepseek-v4-flash费用不足3元。

ScienceDiscovery的树搜索选择策略有何特点?

ScienceDiscovery的选择策略不是只改写当前最优版本,而是将全树所有节点比较,每个节点有分数,名次靠前的更易被选中,同时同一节点被选中后权重衰减,促使搜索既深挖当前最佳路径,也会回到早先搁置的分支,从而避免陷入局部最优。

ScienceDiscovery平台适用于哪些科研领域?

ScienceDiscovery目前适用于验证成本低、结果可机器判定的领域,如数值计算、代码优化和符号回归。对于验证周期长(如需要实验)的领域,由于验证慢,整个循环会变慢,因此需要进一步扩展。

🏷️

标签

➡️

继续阅读