本文研究了将分类流映射(CFM)方法扩展到大规模语言建模。作者训练了17亿参数的流模型,通过自蒸馏实现仅需4步推理即可生成高质量文本,并保持接近数据级的熵。他们还提出了半离散设置下的似然界,用于标准语言模型基准评分,结果与离散扩散方法相当。文章还探讨了大规模训练中的挑战,并提供了损失加权和时间调度的实用建议。
完成下面两步后,将自动完成登录并继续当前操作。