➡️
继续阅读
-
Qwen3.8: 从 0 到 1 用 Rust 重写 Mooncake: Suncake
本文介绍作者用Rust重写Mooncake存储模块为Suncake项目,通过Qoder和Qwen3.8从零开发,仅用37个提交完成。相比C++版,性能提升...
-
Kimi K3 模型结构(9):显存,把 2.8T 塞进 GPU
本文详解Kimi K3模型训练中的显存优化策略,通过账本形式分析权重、激活等内存占用,并介绍六项关键技术:均衡PP rank激活、统一激活管理器、MoE反...
-
通过专用GPU内核生成实现极致效率
Proteus系统利用智能体自动生成GPU专用内核,针对不同模型和运行时形状实现极致性能优化。通过严格验证、防作弊检查及知识层管理,Proteus为Qwe...
-
CPU + GPU:为何AI平台工程是一个异构基础设施问题
AI基础设施不应只关注GPU,而应视为CPU、内存、存储和网络协同工作的整体系统。平台团队需匹配各阶段资源需求,而非孤立优化GPU。通过Kubernete...
-
显存账本:每张卡上住着什么,搬走付什么
本文介绍训练大模型时显存管理的通用记账方法。显存分为五类:权重、梯度、优化器状态、激活和通信缓冲。前三类由参数量和并行度决定,激活随输入长度增长,优化空间...
-
数据并行与 ZeRO:三级分片各省多少
本文介绍数据并行与ZeRO优化技术。ZeRO通过三级分片(优化器状态、梯度、权重)减少显存占用,前两级不增通信量,第三级需额外all-gather。ZeR...