➡️
继续阅读
-
一分钟读论文:《数据喂饱了,算法还饿着》
清华大学团队研究发现,在线蒸馏中仅用一条训练query即可覆盖全量数据71.5%的学生状态,恢复大部分收益。瓶颈不在数据供给,而在算法吸收效率。多教师设定...
-
数据并行与 ZeRO:三级分片各省多少
本文介绍数据并行与ZeRO优化技术。ZeRO通过三级分片(优化器状态、梯度、权重)减少显存占用,前两级不增通信量,第三级需额外all-gather。ZeR...
-
Kimi K3 模型结构(6):输入端与零件,MoonViT-V2、MTP、Per-Head Muon
Kimi K3模型采用从零训练的MoonViT-V2视觉编码器,27层、patch14结构,支持高分辨率图像token化;MTP层预训练后微调为EAGLE...
-
结构化应用数据的Dataclasses
本文介绍Python dataclass如何替代易出错的配置字典,构建结构化、可维护的数据模型。涵盖组合嵌套记录、用default_factory处理可变...
-
Facet-0——用价值引导的 RL 教会 VLA 精密装配:动作–力觉联合预测,让接触可预测、可估值(把价值写进接触那一瞬)
Facet-0提出将接触视为动作的可预测结果,通过语义—接触表征联合生成动作与预期腕部扭矩,并基于ManuFacet-1K数据集训练。部署时用Action...
-
How Figma Uses AI Agents for Security
The engineering team at software company Figma recently documented how they b...