➡️
继续阅读
-
DeepSeek采购160000颗华为AI芯片:专攻推理不碰训练
DeepSeek计划采购16万颗华为昇腾950DT芯片,用于内蒙古乌兰察布数据中心的推理任务,而非训练,订单约25.6亿美元。此举旨在降低成本、规避美国管...
-
DeepSeek乌兰察布一吉瓦算力中心订单全解析
DeepSeek计划在内蒙古乌兰察布建设1吉瓦算力中心,部署16万枚华为昇腾950DT芯片用于推理,总投资约25.6亿美元。此举旨在回应此前梁文锋言论泄露...
-
GPT-6 Astra空间推理91.8分超越人类:AGI时代真的来了吗!
GPT-6 Astra在空间推理测试中以91.8分超越人类基线80分,引发AGI时代讨论。但其ARC-AGI-3成绩从官方宣称的99.9%降至62.7%,...
-
推理服务的缓存与调度:前缀、多级存储、集群路由
本文讨论长上下文推理服务的缓存与调度优化。核心原则是缓存未命中比命中贵几个数量级,因此设计围绕复用展开:单实例内通过块哈希实现前缀缓存;KV池采用writ...
-
大模型不只是预测下一个词:RLVR让它自己跟自己下棋
大模型不再仅依赖预测下一个词,通过RLVR强化学习,它能自主探索解题路径,从模仿者转变为探索者。预训练如同背诵课文,而RLVR则类似自我解题,借助可验证奖...
-
DeepSeek-V4 模型结构(7):结构决定系统
DeepSeek-V4模型采用混合压缩注意力(mHC),将KV缓存分为状态缓存和分页缓存,分别管理滑窗KV与压缩条目。上下文并行通过点对点通信和all-g...