【Transformer 与注意力机制】38|GPT 系列:从续写到助手,每一代到底改变了什么

💡 原文中文,约7600字,阅读约需18分钟。
📝

内容提要

本文回顾GPT系列发展:GPT-1确立Decoder-only预训练,GPT-2展现zero-shot潜力,GPT-3引入上下文学习,InstructGPT通过RLHF实现指令对齐,ChatGPT以对话形态普及,GPT-4迈向多模态。Decoder-only因训练简单、接口通用、扩展清晰而胜出,但存在推理延迟、长上下文成本、幻觉和对齐代价。

🔎

延伸解读

从“续写”到“助手”:接口变化比参数增长更关键

文章强调,GPT系列的成功不仅是模型变大,更在于任务接口的演变:从GPT-1的下游微调,到GPT-2的zero-shot提示,再到GPT-3的上下文学习,最终通过InstructGPT和ChatGPT实现指令对齐。这一过程表明,模型能力感知的转变依赖于如何与用户交互,而非单纯堆参数。

Decoder-only胜出的工程逻辑

Decoder-only路线因训练目标统一、生成接口通用、扩展规律清晰而成为主流。其自回归结构还便于推理优化,如KV Cache和连续批处理。但文章也指出,这并非完美,推理延迟、长上下文成本、幻觉和对齐代价是固有挑战,需在工程和训练中持续缓解。

GPT-4的公开信息边界

文章提醒,GPT-4的参数量、训练数据等细节未公开,讨论时应基于技术报告和系统卡,避免传播未经证实的传言。其多模态能力和安全评估是公开重点,但架构细节仍属未知,这要求读者在引用时保持严谨。

Q&A

GPT-1 的核心贡献是什么?

GPT-1 确立了 Decoder-only 的预训练架构,使用标准自回归语言模型(预测下一个 token)进行预训练,并证明了生成式预训练可以为下游任务提供有用的语言表示,但当时仍依赖下游微调。

GPT-2 在任务处理方式上有什么关键转变?

GPT-2 展示了 zero-shot 的潜力,通过将任务改写成 prompt(如翻译任务写成“Translate English to French: ...”),让模型直接续写答案,无需为每个任务单独微调,提出了语言模型本身可以作为任务接口的方向。

什么是 in-context learning?GPT-3 是如何体现的?

In-context learning 是指在上下文中提供任务说明和少量示例,模型不更新参数,仅通过上下文推断任务模式并生成答案。GPT-3 通过 few-shot 示例展示了这一能力,使模型能临时适应不同任务。

InstructGPT 与 GPT-3 的主要区别是什么?

GPT-3 是纯语言模型,目标是续写最可能的文本,而 InstructGPT 通过 RLHF(基于人类反馈的强化学习)将模型对齐到人类偏好,使其更擅长遵循指令、避免有害回答、承认不确定性,从“会续写”变成“会听话”。

ChatGPT 在技术上的本质是什么?

ChatGPT 本质上仍是基于 next-token prediction 的语言模型,但经过对话格式和对齐训练,使其能在多轮对话中保持上下文、遵循指令、拒绝不当请求,成为“助手模型”。产品形态改变了模型能力被感知的方式。

关于 GPT-4,公开信息能确认哪些内容?

公开信息确认 GPT-4 是一个大规模多模态模型,在许多专业和学术基准上表现强于 GPT-3.5,并系统描述了安全评估、红队测试、对齐和部署风险。但参数量、训练数据、计算量和完整架构等细节未公开。

为什么 Decoder-only 路线成为大语言模型时代的主流?

原因包括:训练目标简单统一(next-token prediction 无需人工标注)、生成接口通用(任务可写成文本输入输出)、scaling 行为清晰(存在规模规律)、推理系统可围绕自回归结构优化(如 KV Cache)。

GPT 路线存在哪些代价?

主要代价包括:推理延迟(自回归串行生成)、长上下文成本(attention 和 KV Cache 开销大)、幻觉(生成内容可能事实错误)、对齐成本(需要大量指令数据和安全评估)。

🏷️

标签

➡️

继续阅读