开源大模型新王干翻GPT-4o,新技术可纠正自己幻觉,数学99.2分刷爆测试集

💡 原文中文,约2900字,阅读约需7分钟。
📝

内容提要

开源大模型Reflection 70B通过新训练技术实现自我纠正,击败其他模型,在数学基准测试中得分99.2%。Reflection 70B能回答错误问题,官方将发布更大的Reflection 405B。Reflection 70B使用Reflection-Tuning训练方法,能够在推理过程中纠正错误。模型由HyperWriteAI的CEO Mutt Shumer带领的小团队开发。

🔎

延伸解读

自我纠正机制如何工作

Reflection 70B通过Reflection-Tuning训练方法,让模型在推理过程中检测并纠正错误。模型在<thinking>标签内输出推理,若发现错误则用<reflection>标签标记并纠正,最终在<output>标签内给出答案。这种结构化输出将内部思考与最终答案分离,提高了推理的准确性和可靠性。

基准测试成绩的含金量

在GSM8K数学基准上,Reflection 70B得分99.2%,超越Llama 3.1 405B、GPT-4o等模型。网友测试表明,模型能正确回答GSM8K中本身答案错误的问题,说明其准确率并非来自记忆测试集。此外,基准测试已通过LLM Decontaminator检查污染,隔离<output>部分单独测试,进一步保证了成绩的可信度。

小团队挑战大厂

Reflection 70B由HyperWriteAI的CEO Mutt Shumer带领的小团队开发。Mutt Shumer是连续创业者,曾创立多家AI和软件公司。该模型基于Llama 3.1 70B Instruct,使用标准Llama聊天格式并引入特殊tokens。小团队能做出超越顶流闭源模型的开源成果,显示了开源社区的创新活力。

使用建议与未来计划

官方建议使用Reflection 70B时设置temperature为0.7,top_p为0.95,并在Prompt末尾附加“Think carefully.”以提高准确性。模型权重已公开,API访问由Hyperbolic Labs提供。官方还表示下周将发布更大的Reflection 405B,预计性能将大幅优于Sonnet和GPT-4o,值得期待。

Q&A

Reflection 70B模型的主要创新是什么?

Reflection 70B模型的主要创新是采用Reflection-Tuning训练方法,能够在推理过程中自我纠正错误。

Reflection 70B在数学基准测试中的表现如何?

Reflection 70B在数学基准测试GSM8K中得分99.2%,超越了其他模型。

Reflection 70B的开发团队是谁?

Reflection 70B的开发团队由HyperWriteAI的CEO Mutt Shumer领导。

Reflection 70B如何处理错误问题?

Reflection 70B能够回答错误问题,表明其准确率并非来自记忆测试集,而是通过自我纠正实现的。

未来是否会有更强大的Reflection模型?

是的,官方将发布更大的Reflection 405B,预计性能将大幅优于现有模型。

Reflection 70B的推理过程是怎样的?

Reflection 70B的推理过程分为独立步骤,使用<thinking>和</thinking>标签输出推理,并在<output>标签内提供最终答案。

🏷️

标签

➡️

继续阅读