➡️
继续阅读
-
推理服务的缓存与调度:前缀、多级存储、集群路由
本文讨论长上下文推理服务的缓存与调度优化。核心原则是缓存未命中比命中贵几个数量级,因此设计围绕复用展开:单实例内通过块哈希实现前缀缓存;KV池采用writ...
-
Kimi K3 模型结构(10):RL 与服务,状态住在哪里
本文介绍Kimi K3模型在1M上下文强化学习与线上服务中的系统设计,核心是状态管理。KV块和KDA状态通过write-back策略在GPU与DRAM池间...
-
这个世界模型训练完就“退场”,机器人反而更能干了
光象科技联合清华发布物理原生世界模型ActEffect,训练时预测动作后果并优化策略,执行时退出部署以降低成本。在LIBERO等基准测试中成功率领先,已用...
-
早报|苹果将迎来史上最大产品发布潮/微信小微内测Agent间沟通/何庭波发布「韬定律」新论文
苹果将迎来史上最大产品发布潮,包括折叠屏iPhone和iPhone 18 Pro;GPT-6 Astra全量发布;Anthropic用Claude完成费马...
-
“对混乱的发布感到抱歉”:OpenAI推出GPT-6 Astra,但开发者被拒之门外
OpenAI发布GPT-6 Astra,但发布过程混乱,CEO Sam Altman道歉。API和ChatGPT订阅用户尚未获得广泛访问权限,预计先从Pr...
-
微软称几乎无人通过其聊天机器人获取《纽约时报》文章
微软在版权诉讼中辩称,其AI助手Copilot极少复制新闻或书籍内容。在820万条聊天记录中,仅不到1%包含至少16个匹配词,与《纽约时报》等出版商作品有...