Apodex 1.1是陈天桥投资的AI系统,专攻复杂科研任务,通过异步代理团队(最多150个子代理)和三层验证机制,处理原始数据、代码执行等全流程。它开源了36B模型和FrontierAgent框架,在基准测试中领先竞品。TRACES基准评估发现式AI的过程而非仅答案,但验证器递归问题仍待解。
ASI-Bench是由清华、MIT等机构构建的自主科研能力基准,包含60项覆盖11学科的项目级任务,通过B1至B4四级逐步减少人类方法指导来测试AI科研自主性。评测18套系统显示,B1平均分50.91,B3降至26.62,表明AI在方法落地和流程执行上仍有明显短板,距离独立完成开放式科研尚存差距。
大模型的发展凸显了推理数据的重要性,优质推理数据集支持复杂推理任务。HyperAI整理了多领域推理数据集,降低了使用门槛,促进科研与模型训练。
opentelemetry-go 是 Go 语言的 OpenTelemetry 实现,提供统一的 API 用于采集分布式追踪和指标数据,支持多平台兼容性和丰富的数据导出选项。Biomni 是生物医学 AI 代理,支持复杂科研任务,具备无代码界面。quiet-star 实现语言模型自我思考机制,提升推理质量。next14-tutorial 演示 Next.js 14,便于学习。rinha-de-algoritmos 是评估算法能力的平台。
作者感到生活满足但缺乏目标,对未来感到压力。他理解古代怀才不遇的人,觉得机会是关键。作者感到精神分裂,知识掌握不如以前,对周围失去兴趣。梦想也不再有希望。可能要忙于科研任务。
完成下面两步后,将自动完成登录并继续当前操作。