➡️
继续阅读
-
Kimi K3 模型结构(4):深度维度,Attention Residuals
本文解析Kimi K3模型中的Attention Residuals(注意力残差)结构。该机制将残差连接视为深度方向上的RNN,通过可学习伪query对e...
-
特斯拉Cybercab刚上路就遭调查
美国国家公路交通安全管理局(NHTSA)对特斯拉Cybercab展开调查,因其缺乏后视镜、踏板和方向盘等联邦安全标准要求的传统部件。特斯拉未申请豁免,涉及...
-
2026年可用的5个免费LLM API提供商
本文介绍了五个提供免费LLM API的服务商:GroqCloud(高速推理)、OpenRouter(多模型试用)、Cloudflare Workers A...
-
显存账本:每张卡上住着什么,搬走付什么
本文介绍训练大模型时显存管理的通用记账方法。显存分为五类:权重、梯度、优化器状态、激活和通信缓冲。前三类由参数量和并行度决定,激活随输入长度增长,优化空间...
-
数据并行与 ZeRO:三级分片各省多少
本文介绍数据并行与ZeRO优化技术。ZeRO通过三级分片(优化器状态、梯度、权重)减少显存占用,前两级不增通信量,第三级需额外all-gather。ZeR...
-
流水线并行:1F1B、虚拟段与气泡
本文介绍流水线并行中气泡的产生与优化。将模型按层切段、批次分微批后,段间等待形成气泡。四代调度各改一点:GPipe先全前向再全反向,显存高;1F1B改交替...