小语言模型优化第三法为按长度分桶批处理:逐条推理受内存带宽限制效率低,普通批处理因填充浪费算力;按token长度排序后分批,各批仅填充至局部最大值,可将填充开销降至约8%,吞吐量提升近一倍。需左填充、只取末位logits,并核对结果与逐条推理一致。
完成下面两步后,将自动完成登录并继续当前操作。