不是所有专家都是平等的:用于混合专家大型语言模型的高效专家修剪和跳过

💡 原文中文,约500字,阅读约需2分钟。
📝

内容提要

该研究发布了一系列开源的混合专家语言模型,参数范围从650M到34B,训练语料超过1T个标记。研究发现混合专家模型中的路由决策主要基于标记ID,可能导致性能下降。为了改进混合专家语言模型设计,提出了减轻问题和改进策略。

🏷️

标签

➡️

继续阅读