➡️
继续阅读
-
AI 范式雷达:《外壳走上台前:Agent 的竞争从换模型转向换 Harness》
FrontierHarness Eval评测显示,同一模型下不同执行外壳的任务通过率差异达16.7%,成本相差17倍,竞争焦点从模型转向外壳基准化。厂商如...
-
Allora Labs证明变异AI模型群体性能超单个优化模型
Allora Labs研究表明,在AI模型群体中引入随机变异可提升整体性能,超越单个优化模型。变异群体在环境变化时表现更优,最佳情况下约80%优于优化群体...
-
迅策科技发布TokenCloud一站式AI模型训推算力平台
迅策科技发布TokenCloud一站式AI模型训推算力平台,以异构算力为基础,构建四层协同生态,打通数据到Token全链路。平台支持GPU、NPU等统一调...
-
DeepSeek-V4 模型结构(7):结构决定系统
DeepSeek-V4模型采用混合压缩注意力(mHC),将KV缓存分为状态缓存和分页缓存,分别管理滑窗KV与压缩条目。上下文并行通过点对点通信和all-g...
-
DeepSeek-V4 模型结构(6):优化器与稳定性,Muon
DeepSeek-V4采用Muon优化器,通过谱范数最速下降实现逐矩阵正交化,用Newton-Schulz迭代逼近SVD,混合系数提升小奇异值并精确稳定大...
-
Kimi K3 模型结构(8):训练并行,一步训练里谁在等谁
本文介绍Kimi K3模型预训练的并行系统设计,聚焦MoE层expert并行。核心是MoonEP方案:每个rank预留E/R个冗余expert槽位,确保任...