Upsampling or Weighting? Balanced Training on Highly Imbalanced Datasets

💡 原文英文,约100词,阅读约需1分钟。
📝

内容提要

本研究探讨了多语言环境中低资源语言数据稀缺导致的训练不均衡问题。通过理论与实证分析,证明了上采样和加权损失的等效性及其在不同梯度下降方法下的差异。提出的Cooldown策略有效加快了收敛速度,避免了过拟合。

🏷️

标签

➡️

继续阅读