苹果研究人员的论文指出,少量“超级权重”在大型语言模型(LLM)中对功能影响显著。识别这些权重有助于模型压缩,提升资源受限设备的性能。研究表明,保留超级权重和激活可显著改善压缩质量,推动未来研究。
研究表明,大型语言模型中的少量异常参数对模型质量至关重要。修剪这些参数可能显著降低文本生成能力。我们提出了一种无数据的方法来识别这些“超级权重”,并发现它们会导致罕见的大激活异常。保留这些激活可以提升量化效果,并提供常见LLM的超级权重坐标索引。
该研究探讨了大型语言模型中的“超级权重”,即显著大于其他参数的权重,这些权重对模型的行为和性能具有重要影响。研究者分析了多个模型的权重分布,并提出了识别和管理超级权重的方法。
完成下面两步后,将自动完成登录并继续当前操作。