论文复现是科学基石,但机器学习领域面临可复现性危机。Inherent Labs团队训练了270亿参数的AI智能体Faraday,利用Codex GPT-5.5作为工具,在73%的分布内任务和60%的AI for Science任务上超越Claude和GPT-5.5。Faraday通过自动生成任务空间和稳定GRPO后训练,展现出更强的科学严谨性,能指导更大模型工作,提升复现能力。
本文介绍了Nix,一个强大的包管理器,支持原子回滚和多版本并行运行。Nix通过惰性求值和哈希计算确保软件构建的可复现性,简化了依赖管理,适合初学者使用。
AI研究面临可复现性危机,影响政策制定。论文指出,尽管AI论文数量迅速增长,但复现率较低。为确保有效治理,需提高可复现性标准,建议采取预注册、提供计算资源和报告负面结果等措施。
本文探讨了AI技能的设计与开发,强调可复现性和维护性的重要性。将AI视为协作者,Skills被定义为可重用的任务能力包,包含执行说明和参考资料。文章还讨论了混合式开发的必要性,以及如何将复杂任务拆分为可验证的阶段,以确保流程的稳定性和可追溯性。
在AI Agent系统开发中,复杂性并未消失,而是被平台吸收,导致开发者误以为简单。真正的挑战在于确保Agent的长期稳定性、可复现性和可进化性。尽管当前框架如LangChain降低了门槛,但仍需额外的工程支持以应对复杂任务。
自Deepseek-R1发布以来,研究者们在视觉语言模型(VLM)领域应用了RL Scaling。上海交通大学等团队提出了MAYE框架,以提升训练过程的透明性和可复现性,解决评估标准不一致的问题。MAYE提供了简洁的训练架构和标准化评估方案,帮助研究者更好地理解模型学习过程,推动RL在VLM领域的研究进展。
本研究提出了开源工具Evalica,旨在解决自然语言处理协议的可靠性和可复现性问题。该工具支持现代排行榜的创建,并通过Web界面、命令行和Python API优化模型评估流程。
本文介绍了一种用户友好的新几何符号求解器Newclid,支持命令行接口和GeoGebra输入,改进了可复现性和错误修复,解决了AlphaGeometry无法处理的问题,具有显著优势。
本文分享了作者对NixOS的使用体验,强调其声明式配置和可复现性。NixOS的包管理系统Nixpkgs包丰富,适合喜欢定制的用户,尽管学习曲线较陡。作者认为NixOS在系统维护和更新方面具有优势,未来发展前景乐观。
GPT-3.5模型泄露了470万个样本,存在数据污染问题,同时缺乏公平性和可复现性。
调研发现顶会Fuzzing论文缺乏可复现性、测试目标选择有限、比较对象不准确、实验环境存在问题、数据分析不充分。文章呼吁建立公开透明的公证机制,提高Fuzzing研究的质量和可信度。
本文介绍了使用Nix语言配置NixOS系统的两种方式:传统的/etc/nixos/configuration.nix方式和更推荐的Nix Flake方式。
完成下面两步后,将自动完成登录并继续当前操作。