➡️
继续阅读
-
机器人不能停下来等模型:星尘发布 SmoothRL,让在线强化学习跟上大模型的异步推理
星尘智能发布SmoothRL框架,解决真实机器人异步执行中的在线强化学习问题。该框架仅对实际执行的动作进行学习,并保持训练与部署节奏一致。在投掷、戴笔帽、...
-
苹果9月9日发布会前瞻
苹果将于9月9日举行发布会,可能推出iPhone 18 Pro系列、首款折叠屏iPhone Ultra,并更新Apple Watch和AirPods。基础...
-
英伟达买下Hugging Face的真正算盘
英伟达买下Hugging Face的真正算盘 英伟达为什么用129.3亿美金收购Hugging Face?这期从129303的Unicode表情与英伟达...
-
2026 09 06 HackerNews
2026-09-06 Hacker News Top Stories # Anthropic 团队用 Claude AI 在11天内完成了费马大...
-
推理服务的缓存与调度:前缀、多级存储、集群路由
本文讨论长上下文推理服务的缓存与调度优化。核心原则是缓存未命中比命中贵几个数量级,因此设计围绕复用展开:单实例内通过块哈希实现前缀缓存;KV池采用writ...
-
显存账本:每张卡上住着什么,搬走付什么
本文介绍训练大模型时显存管理的通用记账方法。显存分为五类:权重、梯度、优化器状态、激活和通信缓冲。前三类由参数量和并行度决定,激活随输入长度增长,优化空间...