➡️
继续阅读
-
推理服务的缓存与调度:前缀、多级存储、集群路由
本文讨论长上下文推理服务的缓存与调度优化。核心原则是缓存未命中比命中贵几个数量级,因此设计围绕复用展开:单实例内通过块哈希实现前缀缓存;KV池采用writ...
-
Kimi K3 模型结构(10):RL 与服务,状态住在哪里
本文介绍Kimi K3模型在1M上下文强化学习与线上服务中的系统设计,核心是状态管理。KV块和KDA状态通过write-back策略在GPU与DRAM池间...
-
Claude Fable 5.1 对比 Fable 5:在实际工作中,我无法区分它们。
Anthropic发布Claude Fable 5.1,宣称在编码和知识工作上有重大进步,基准测试得分翻倍。但作者用四个真实任务测试新旧模型,发现两者准确...
-
姚班校友主导,Claude攻克费马大定理首个完整形式化证明
Anthropic宣布Claude用11天完成费马大定理的端到端形式化证明,生成约1300万行Lean代码和超3万个中间定理,规模超Mathlib五倍。通...
-
从AI代码到可信软件:工程约束的实践
文章探讨了“工程约束”如何通过仓库强制执行标准,确保AI生成代码的质量与问责。它强调权限、质量门、证据和可观测性,并描述了从辅助到自主的成熟度阶段。核心是...
-
AI原生工程实践:AI工程师与前沿部署工程师如何利用Claude Code、Codex和Gemini进行开发
本文介绍AI原生软件开发生命周期(SDLC)框架,涵盖计划、设计、构建、测试、部署、维护六阶段。核心是通过意图、规格、计划等文档驱动开发,将瓶颈从编码转向...