➡️
继续阅读
-
Kimi K3 模型结构(9):显存,把 2.8T 塞进 GPU
本文详解Kimi K3模型训练中的显存优化策略,通过账本形式分析权重、激活等内存占用,并介绍六项关键技术:均衡PP rank激活、统一激活管理器、MoE反...
-
DeepSeek-V4 模型结构(4):深度维度,mHC
该文详解DeepSeek-V4的mHC残差结构:将单条残差流拓宽为4条,通过读、写、混三算子连接子层。为保稳定,混合矩阵被约束为双随机矩阵(非负、行和列和...
-
Kimi K3 模型结构(4):深度维度,Attention Residuals
本文解析Kimi K3模型中的Attention Residuals(注意力残差)结构。该机制将残差连接视为深度方向上的RNN,通过可学习伪query对e...
-
通过专用GPU内核生成实现极致效率
Proteus系统利用智能体自动生成GPU专用内核,针对不同模型和运行时形状实现极致性能优化。通过严格验证、防作弊检查及知识层管理,Proteus为Qwe...
-
营销人员使用Genie One的五个方法
本文介绍Databricks Genie One如何赋能营销团队,将数据转化为行动。它作为AI助手,帮助营销人员绕过分析师瓶颈,直接查询活动、客户和管道数...
-
CPU + GPU:为何AI平台工程是一个异构基础设施问题
AI基础设施不应只关注GPU,而应视为CPU、内存、存储和网络协同工作的整体系统。平台团队需匹配各阶段资源需求,而非孤立优化GPU。通过Kubernete...