➡️
继续阅读
-
大模型不只是预测下一个词:RLVR让它自己跟自己下棋
大模型不再仅依赖预测下一个词,通过RLVR强化学习,它能自主探索解题路径,从模仿者转变为探索者。预训练如同背诵课文,而RLVR则类似自我解题,借助可验证奖...
-
并行策略总览:六个维度各切什么、怎么通信
本文介绍大模型并行训练的核心概念,将DP、TP、SP、PP、EP、CP六种并行方式按切分维度、显存减少、通信开销和等待关系列表对比。并行本质是切分模型并引...
-
机器人不能停下来等模型:星尘发布 SmoothRL,让在线强化学习跟上大模型的异步推理
星尘智能发布SmoothRL框架,解决真实机器人异步执行中的在线强化学习问题。该框架仅对实际执行的动作进行学习,并保持训练与部署节奏一致。在投掷、戴笔帽、...
-
Linux Kernel 7.1已经结束生命周期不再提供更新 用户应尽快升级到7.2系列
Linux Kernel 7.1系列已结束支持,最终版7.1.13于9月2日发布,含76项修复。该非LTS版本生命周期短,官方建议用户升级至7.2系列或L...
-
用 ChatGPT 定时任务做一个 Hacker News 中文摘要网站
作者利用ChatGPT定时任务自动抓取Hacker News前30条,生成中文摘要并筛选兴趣内容,通过Eleventy构建静态网站hn-digest并发布...
-
CEO的1元年薪起源 - 编程一生
本文介绍了多个商业现象的起源:手机系统更新导致变慢源于安迪-比尔定理,即软件消耗硬件提升;CEO拿1元年薪始于克莱斯勒和乔布斯,象征共渡难关;公司延迟上市...