➡️
继续阅读
-
大多数编码代理基准测试忽略了大规模重构。这个没有。
新基准SWE-Bench ProMax评估AI编码代理的大规模重构能力,结果显示最佳模型仅解决41.2%任务。该基准包含170个实例、7种语言,经多阶段筛...
-
【vLLM 学习】Distributed
本文介绍vLLM框架及其Helm图表部署方法,并展示一个使用Ray Data进行多节点分布式离线批处理推理的Python示例。示例通过LLMPredict...
-
从模型到生产力:星海图与产业朋友圈共探具身智能的下一站
星海图在2026世界机器人大会举办论坛,发布具身智能技术进展:G0.5基础模型升级并开源,Fast-WAM世界模型提速4倍,G-Fleet分布式强化学习系...
-
企业架构的六种场景:从"四大流派"到数字原生与 AI 原生 - 张善友
陈果将中国企业架构实践分为四派,实为四种应用场景,各有前提。文章补充了数字原生与AI原生企业两格:前者以组织调整替代蓝图,后者让Agent成为数字员工,需...
-
一分钟读论文:《SPADE:难度跟着能力长的自适应自博弈》
论文提出SPADE方法,让同一大模型同时扮演环境设计师和推理智能体,通过自生成可执行Python环境进行强化学习。在Qwen3-30B上,8个基准均分从5...
-
DeepSeek最强悍的,从来不是训练模型,而是Infra - 蝈蝈俊
DeepSeek的核心优势在于其基础设施(Infra)能力,而非仅算法创新。其母公司幻方量化自2019年起投入巨资自建超算平台,积累了深厚工程经验。Dee...