➡️
继续阅读
-
大多数编码代理基准测试忽略了大规模重构。这个没有。
新基准SWE-Bench ProMax评估AI编码代理的大规模重构能力,结果显示最佳模型仅解决41.2%任务。该基准包含170个实例、7种语言,经多阶段筛...
-
从美团 KDD 论文看 DataAgents:别只盯模型,先想清楚怎么落地
本文探讨了美团KDD论文及DataAgents智能体落地的工程挑战。作者指出,尽管智能体能够串联数据任务,但在生产环境中需关注日志追踪、失败回滚和权限边界...
-
神秘模型Ox Alpha爆料:暴打Fable5超GPT五成,日供百万亿算力
神秘模型Ox Alpha在OpenRouter匿名上线,编程测试中击败Claude Fable 5等头部模型,但身份成谜。指纹分析指向智谱GLM系列,可能...
-
从模型到生产力:星海图与产业朋友圈共探具身智能的下一站
星海图在2026世界机器人大会举办论坛,发布具身智能技术进展:G0.5基础模型升级并开源,Fast-WAM世界模型提速4倍,G-Fleet分布式强化学习系...
-
Kilo Code for JetBrains 自定义模型配置
本文介绍Kilo Code for JetBrains插件自定义模型配置方法。配置文件需放在用户环境,Remote Development时放在远程主机。...
-
DeepSeek最强悍的,从来不是训练模型,而是Infra - 蝈蝈俊
DeepSeek的核心优势在于其基础设施(Infra)能力,而非仅算法创新。其母公司幻方量化自2019年起投入巨资自建超算平台,积累了深厚工程经验。Dee...