➡️
继续阅读
-
省 token 故事 · 各自为政 - 编程一生
多智能体并行虽高效,但每个智能体需独立上下文,重复阅读文件导致token成本高。自查不可靠,需独立质检。任务书应自包含且窄,验收独立派人,能串行则不并行。...
-
“我1%的工程师消耗了40%的token”:Coder与SpaceXAI为何要给开发者提供更好的工具
Coder推出Agent Relay服务,与SpaceXAI合作,使软件团队能在自有基础设施上运行编码代理,而Cursor负责云端推理。该方案针对银行、国...
-
DeepSeek-V4 模型结构(5):宽度维度,DeepSeekMoE 的四个改动
本文介绍DeepSeek-V4模型结构中MoE层的四处改动:路由打分从sigmoid改为sqrt(softplus)以消除饱和;前三层用固定hash ro...
-
DeepSeek-V4 模型结构(4):深度维度,mHC
该文详解DeepSeek-V4的mHC残差结构:将单条残差流拓宽为4条,通过读、写、混三算子连接子层。为保稳定,混合矩阵被约束为双随机矩阵(非负、行和列和...
-
DeepSeek-V4 模型结构(3):序列维度(下),HCA、混合排布与零件
本文详解DeepSeek-V4模型结构:HCA将128个token压缩为一条目,无需稀疏选择;CSA与HCA交错排布,确保全局信息不丢失;滑窗分支弥补压缩...
-
DeepSeek-V4 模型结构(2):序列维度(中),Lightning Indexer 与稀疏选择
本文介绍DeepSeek-V4模型中的压缩稀疏注意力(CSA)机制。KV缓存每4个token压缩为一条,1M上下文仍有26万条目,故用lightning ...