ICML最佳论文曾被ICLR拒稿,Pika联创参与,一作已入职OpenAI

💡 原文中文,约1600字,阅读约需4分钟。
📝

内容提要

ICML 2024最佳论文曾被ICLR 2024拒绝。该论文提出了一种新的离散扩散语言建模方法,在大多数任务中表现优于GPT-2。然而,由于实验不完整和缺乏与其他扩散模型的比较,最终被拒绝。作者之一已加入OpenAI,并将在ICML 2024上展示这项工作。

🔎

延伸解读

审稿分歧与最终决定

五位审稿人给出88665的分数,其中两位给出8分高分,普遍肯定论文的论点。但领域主席最终拒稿,主要原因是实验部分不完整,缺少与其他扩散模型基线的比较,且论文中关于扩散模型表现不及自回归模型的说法可能不够准确。这反映了评审中创新性与实验完备性之间的权衡。

从被拒到最佳论文的启示

该论文曾被ICLR 2024拒稿,后获ICML 2024最佳论文。类似情况也出现在Mamba上。这提示读者,会议评审结果并非论文质量的最终定论,作者根据审稿意见完善实验和对比后,论文价值可能得到更充分认可。

SEDD方法的核心改进

论文针对扩散模型在离散数据上表现不佳的问题,提出分数熵损失函数,构建了分数熵扩散模型(SEDD)。在主要语言建模任务上,SEDD在语言扩散模型中表现最佳,零样本困惑度击败GPT-2,并能生成高质量无条件样本,通过直接参数化概率比实现高度可控。

❓

Q&A

这篇被拒的论文主要研究什么内容?

这篇论文主要研究了一种新的离散扩散语言建模方法,旨在提高扩散模型在语言建模任务中的性能。

为什么这篇论文在ICLR 2024被拒绝?

论文被拒的主要原因是实验部分不完整,缺乏与其他扩散模型的比较。

这篇论文的作者有哪些背景?

论文由斯坦福大学的团队撰写,Pika创始人之一孟晨琳参与,且一作已加入OpenAI。

这篇论文提出了什么新的方法?

论文提出了一种新的损失函数分数熵(score entropy),构建了分数熵扩散模型(SEDD)。

这篇论文在实验中与GPT-2的比较结果如何?

在多数任务中,论文提出的方法表现优于GPT-2,尤其在零样本困惑度任务上击败了GPT-2。

审稿人对这篇论文的评价如何?

审稿人普遍肯定了论文的论点,但也提出了拼写错误和实验细节不足的问题。

🏷️

标签

➡️

继续阅读