➡️
继续阅读
-
大模型不只是预测下一个词:RLVR让它自己跟自己下棋
大模型不再仅依赖预测下一个词,通过RLVR强化学习,它能自主探索解题路径,从模仿者转变为探索者。预训练如同背诵课文,而RLVR则类似自我解题,借助可验证奖...
-
并行策略总览:六个维度各切什么、怎么通信
本文介绍大模型并行训练的核心概念,将DP、TP、SP、PP、EP、CP六种并行方式按切分维度、显存减少、通信开销和等待关系列表对比。并行本质是切分模型并引...
-
让 Apple Watch 记录的每一趟游泳数据更有意义:即刻游
即刻游是一款配合Apple Watch使用的游泳训练应用,核心功能包括详细记录游泳数据(如SWOLF、分段数据、心率区间)、自定义训练计划、AI分析提供专...
-
一分钟读论文:《数据喂饱了,算法还饿着》
清华大学团队研究发现,在线蒸馏中仅用一条训练query即可覆盖全量数据71.5%的学生状态,恢复大部分收益。瓶颈不在数据供给,而在算法吸收效率。多教师设定...
-
数据并行与 ZeRO:三级分片各省多少
本文介绍数据并行与ZeRO优化技术。ZeRO通过三级分片(优化器状态、梯度、权重)减少显存占用,前两级不增通信量,第三级需额外all-gather。ZeR...
-
结构化应用数据的Dataclasses
本文介绍Python dataclass如何替代易出错的配置字典,构建结构化、可维护的数据模型。涵盖组合嵌套记录、用default_factory处理可变...