
ChatGPT 之所以「像个人」,源头可以追溯到一篇 2022 年 3 月的论文——OpenAI 的 InstructGPT(论文标题《Training language models to follow instructions with human feedback》)。它第一次系统性地证明:让模型变大的方向不对,「用人类反馈去对齐」才是让模型真正有用的关键。读懂这篇论文,你就读懂了 RLHF(基于人类反馈的强化学习)这条如今主导大模型对齐的技术路线的起点。
一、论文速览卡
| 论文标题 | Training language models to follow instructions with human feedback |
| 作者 | Long Ouyang, Jeff Wu, Xu Jiang, Diogo Almeida, Carroll L. Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, John Schulman, Jacob Hilton, Fraser Kelton, Luke Miller, Maddie Simens, Amanda Askell, Peter Welinder, Paul Christiano, Jan Leike, Ryan Lowe |
| 机构 | OpenAI |
| arXiv | 2203.02155(2022 年 3 月 4 日提交) |
| 核心方法 | 三步管线:监督微调(SFT)→ 训练奖励模型(RM)→ 用 PPO 做强化学习(RLHF) |
| 基座模型 | GPT-3(1.3B / 6B / 175B 三个规模都做了) |
| 一句话结论 | 1.3B 的 InstructGPT 在人类偏好上击败了 175B 的 GPT-3,且更真实、毒性更低、对公共 NLP 任务的性能几乎无损失。 |
二、为什么这篇论文值得精读
这篇论文的价值,在于它用一组干净的实验回答了一个当时被忽视的问题:模型变大,不等于更听话。论文开篇就戳破了一个普遍的误解——大模型会生成不真实、有毒、或者「正确但没用」的输出,换句话说,它并没有和用户的意图对齐(not aligned)。
InstructGPT 给出了一个可复现的对齐配方:用人类的示范和偏好作为信号,一步步把模型「掰」到用户想要的方向上。更震撼的是它的实验结论——一个 1.3B 参数的小模型,经过这套方法训练后,在人类评估中居然比 175B 的原始 GPT-3 更受青睐,参数少了 100 倍。这个结果直接说明:对齐的质量,很多时候比模型的规模更重要。
今天 RLHF 已经成为大模型对齐的标配,ChatGPT、Claude、以及几乎所有对话模型的「礼貌、有用、无害」,都源于这篇论文确立的范式。要理解这个领域,绕不开它。
还有一层「方法史」的意义:InstructGPT 第一次把「人类反馈」从「一个模糊的想法」变成了「一套可复现、可量化的三步工程管线」,并公开了每一步的数据规模和训练细节。后来的 RLHF、RLAIF、DPO 等等,要么是它的直接改进,要么是为了解决它暴露的问题。它是对齐研究绕不开的「坐标系原点」。
三、背景:更大的模型为什么「不对齐」
论文的出发点,是语言模型预训练目标和「用户真正想要什么」之间的错位。预训练模型学的是「预测下一个 token」,它擅长的是补全文本,而不是「完成用户指令」。这种错位带来三类典型问题:
- 不真实(untruthful):模型会一本正经地编造事实;
- 有毒(toxic):生成带偏见、攻击性或有害的内容;
- 不有用(not helpful):回答「正确但答非所问」,不贴合用户意图。
传统的解法是「继续加大模型、加更多数据」,但论文指出这并不能从根本上解决问题——大只是让模型更流畅地说错话,而不是更对齐。要解决「对齐」,必须引入新的信号来源:人类的反馈。
这里值得把「对齐」这个概念再精确一点。论文说的「对齐」,指的是让模型的行为「符合用户的意图」——用户想要一个「有用、真实、无害」的助手,模型就应该朝着这个方向优化。而预训练的目标函数(预测下一个 token)里根本没有「用户意图」这个东西,所以再大的模型、再多的数据,只要目标函数不变,就不会自动变得「听话」。这个洞见,是理解「为什么需要 RLHF 这一步」的关键。
四、核心方法:三步走的人类反馈对齐
InstructGPT 的训练管线分成清晰的三步,这是整篇论文的方法论骨架。
第一步:监督微调(SFT)
首先收集一批人工标注者写的 prompt,以及一批通过 OpenAI API 提交的真实用户 prompt。对每个 prompt,标注者手写一个「理想回答」作为示范。用这些「prompt + 人类示范回答」的数据对 GPT-3 做监督微调,得到一个初步学会「听指令」的模型。这个模型叫 SFT 模型,是整个对齐流程的起点。论文报告这批 SFT 数据大约有 1.3 万条左右,规模并不大——这本身就是个重要信号:对齐不需要海量数据,关键是「信号要对」。
第二步:训练奖励模型(RM)
接下来收集偏好排序数据:让第一步的 SFT 模型对同一个 prompt 生成多个候选回答,标注者给这些回答排序(哪个更好、哪个更差)。用这些排序数据训练一个奖励模型(Reward Model,RM)——它学会预测「人类会偏好哪个回答」,输出一个标量分数来代表回答的「好坏」。论文报告这批偏好对比数据大约有 3.3 万条。这个奖励模型,就是后续强化学习的「打分裁判」。
为什么需要训练一个 RM,而不是直接让人实时打分?因为强化学习需要模型每生成一次就被打一次分,如果每次都要人实时判断,根本不可行。训练一个「能模仿人类偏好的打分器」,相当于把「人类偏好」固化进了一个可以无限次快速调用的模型里。这是 RLHF 能跑起来的工程前提。
第三步:用 PPO 做强化学习(RLHF)
最后,用近端策略优化(PPO)对 SFT 模型做强化学习:模型不断生成回答,奖励模型给这些回答打分,模型根据分数更新参数,目标是最大化奖励。论文里还加入了一个关键的 KL 惩罚项——约束强化学习后的模型不要偏离原始 SFT 模型太远,防止它「为了高分而走火入魔」。这一步产出的最终模型,就是 InstructGPT。论文报告这一步用的 RL 提示数据大约有 3.1 万条。
KL 惩罚这个细节非常关键,值得展开。如果只最大化 RM 给的分数,模型会学会「钻 RM 的空子」——生成一些 RM 会给高分、但人类其实不喜欢的回答(这就是所谓的「奖励黑客」reward hacking)。KL 惩罚相当于给模型套了个「缰绳」:你可以在 SFT 模型附近优化,但不能跑太远,从而保证「优化后的模型」和「人类示范过的好行为」不会差太离谱。这种「奖励 + 约束」的双目标设计,是 RLHF 稳定性的核心。
值得注意的细节是:论文把这三个阶段描述为「不断用人类信号做微调」的递进关系——SFT 用「示范」、RM 用「排序」、PPO 用「打分」,一步步把「人类意图」注入模型。三种信号的「信息量」其实是递减的(示范最具体、排序次之、打分最稀疏),但「可扩展性」是递增的(示范最难量产、打分最容易自动化)。这个「信息量」与「可扩展性」的权衡,是理解整个对齐技术演进的一把钥匙。
五、实验结果:关键数据逐字保留
论文最著名的结论,在摘要里写得清清楚楚:
「In human evaluations on our prompt distribution, outputs from the 1.3B parameter InstructGPT model are preferred to outputs from the 175B GPT-3, despite having 100x fewer parameters.」
翻译过来:在人类评估中,1.3B 参数的 InstructGPT 的输出,比 175B 的 GPT-3 更受偏好——尽管前者参数少了 100 倍。这是整篇论文最有力的一个数字,直接证明了「对齐」能带来超越「规模」的收益。
摘要还给出了两个关键结论:
「Moreover, InstructGPT models show improvements in truthfulness and reductions in toxic output generation while having minimal performance regressions on public NLP datasets.」
也就是:InstructGPT 在「真实性」上有所提升、「有毒输出」明显减少,同时在对公共 NLP 数据集的性能上几乎没有任何退化(minimal regressions)。这很重要——它说明对齐不是「牺牲能力换安全」,而是「安全性和能力可以兼得」。
论文里的量化对比还包括:
- 有用性(helpfulness):标注者认为 InstructGPT 的输出明显更贴合意图、更有帮助,在评估中一致偏好 InstructGPT;
- 真实性:在 TruthfulQA 等评测上,InstructGPT 的「编造事实」率显著下降;
- 毒性:在 RealToxicityPrompts 上,生成有毒内容的概率大幅降低,尤其是在收到「诱导有毒内容」的 prompt 时,InstructGPT 明显更克制;
- 「公共数据集退化极小」:即便在 RLHF 之后,模型在传统 NLP 榜单上的分数几乎没有掉,这说明对齐并没有「抹掉」模型的通用能力。
论文还坦诚地补充了一句:「Even though InstructGPT still makes simple mistakes…」——即便 InstructGPT 仍然会犯一些简单错误,但实验结果已经表明,「用人类反馈做微调」是对齐用户意图的一条有希望的方向。这种不夸大、留余地的表述,反而让结论更可信。
六、局限与不足:论文自己承认的问题
InstructGPT 也远非完美,论文和后续研究都指出了这些局限:
- 仍然会犯错:模型依然会生成不真实或有毒的内容,只是「更少」而非「没有」,对齐没有根除问题;
- 依赖人类标注的质量和偏见:标注者的偏好本身就是「有偏」的,模型学到的对齐会继承这种偏差;
- 奖励模型可能被钻空子(reward hacking):模型可能学会「讨好裁判」而非真正变好,这是 RLHF 的固有风险;
- 标注成本高:三步管线每一步都需要大量人工标注,规模化是挑战;
- 对齐目标单一:论文主要对齐「有用、真实、无害」这几项,但真实世界的价值观冲突远比这复杂。
这些局限,正是后来 Constitutional AI、DPO、RLAIF 等方法试图解决的方向。再往下挖一层:InstructGPT 对齐的是「标注者的偏好」,而标注者是一群特定背景的人,他们的偏好未必代表「全体用户」甚至「全人类」的价值观。这个「谁来定义对齐」的问题,是 RLHF 乃至整个对齐领域最深刻的争议之一,InstructGPT 只是把它第一次摆到了台面上。
七、横向对比:InstructGPT 在对齐路线里的位置
把 InstructGPT 放进「对齐」这条时间线,它的坐标很清晰。
在它之前,对齐更多停留在「安全过滤」「提示词工程」这类外围手段,没有一套端到端的、可复现的方法论。InstructGPT 是第一个把「RLHF 三步管线」完整落地并公开验证的工作,是这条路线的事实起点。
在它之后,对齐研究沿着几条分支演进:
- ChatGPT(2022 年末):把 InstructGPT 的方法大规模产品化,让 RLHF 真正走向大众;
- Constitutional AI(Anthropic):用「宪法原则」替代部分人工标注,让模型自我纠错,降低对人工反馈的依赖;
- DPO(Direct Preference Optimization,2023):直接优化偏好,跳过显式的奖励模型和 PPO,让对齐更简单稳定;
- RLAIF:用 AI 反馈替代人类反馈,进一步降低标注成本。
但无论后来者怎么改,它们共享同一个思想源头:用「偏好信号」而非「答案本身」来教模型什么是对的——这个范式,是 InstructGPT 确立的。
八、从 InstructGPT 到 ChatGPT:一次工业化的放大
很多人把 InstructGPT 和 ChatGPT 混为一谈,其实它们的关系是「论文原型」和「工业化产品」。这个关系值得单独说清。
InstructGPT 是一篇「验证方法」的论文:它用 1.3B/6B/175B 三个规模、几万条标注数据,证明了「SFT → RM → PPO」这套管线能让模型对齐人类意图。而 ChatGPT 是把这套方法放大到产品级:更大的模型、更海量的数据、更工程化的 RLHF 流水线,再套上一个对话界面,就成了 2022 年末引爆全球的那个产品。
理解这个关系的好处是:你能分清「哪些是方法本身的贡献、哪些是产品化的放大」。RLHF 三步管线、KL 惩罚、「对齐收益可超规模」这些核心洞见,都来自 InstructGPT 这篇论文;而「用户规模、产品形态、数据飞轮」这些,则是 ChatGPT 在工程和商业层面的贡献。读懂了 InstructGPT,你才算真正读懂了 ChatGPT「像个人」这件事的技术原点。
八点五、RLHF 的数学本质:奖励、KL 与 PPO
要真正理解 RLHF 为什么这样设计,得看它背后的数学。第三步的强化学习,本质上是在优化一个「带约束的奖励目标」,拆开看有三个关键组件:
奖励最大化。模型的目标是让生成的内容「在奖励模型眼里分数更高」。奖励模型 RM 已经学会了「预测人类偏好」,所以「最大化 RM 分数」≈「生成人类更喜欢的内容」。这是整个 RLHF 的驱动力。
KL 散度惩罚。光最大化奖励会出问题——模型可能「跑偏」,生成一些 RM 给高分、但人类并不真的喜欢的东西(奖励黑客)。所以在奖励项后面,论文减掉了一个「当前模型与 SFT 模型的 KL 散度」惩罚项,权重用超参数 β 控制。这个惩罚的意思是:你可以优化,但别偏离「人类示范过的、安全的」SFT 行为太远。β 越大,模型越「保守」、越贴近 SFT;β 越小,模型越「激进」地追高分、也越容易翻车。
PPO 的稳定更新。用 PPO 这个算法来做优化,核心是「近端约束」——每次更新时,限制新策略和旧策略的差异不能太大(通过 clip 截断概率比),避免「一步迈太大」导致训练崩溃。这个「小步走、别翻车」的设计,是大规模 RL 训练的工程基石。
把这三件套合起来,RLHF 的目标可以概括成一句话:在「贴近安全基线」的约束下,稳步地「讨好奖励模型」。理解了这句话,你就理解了为什么 RLHF 既有效、又需要小心翼翼地调参——它本质上是在「有用性」和「安全性/稳定性」之间走钢丝。
八点六、标注数据:RLHF 最「贵」也最「微妙」的一环
RLHF 的三步,每一步都依赖人类标注,而「标注」恰恰是这套方法最贵、也最微妙的部分。理解标注的细节,能帮你判断「我到底能不能复现 RLHF」。
数据规模并不大,但「质量」要求极高。论文报告的三批数据——SFT 示范约 1.3 万条、RM 偏好对比约 3.3 万条、RL 提示约 3.1 万条——相比预训练动辄数万亿 token,规模其实很小。这说明对齐拼的不是「数据量」,而是「每一条数据的信号质量」:一条高质量的「人类示范」或「偏好排序」,其信息量远超一堆同质的原始文本。
标注者本身是有偏的。论文的标注由一批经过筛选和培训的标注者完成,但「标注者的偏好」并不等于「全体用户的偏好」——他们可能更专业、更谨慎,也可能有特定的文化背景和价值观。模型学到的「对齐」,本质上是「对齐了这批标注者的口味」。这是 RLHF 一个被反复讨论的局限:它对齐的是「人」,而「人」是多样的、有偏的。
质量控制和一致性是隐形成本。为了让不同标注者的打分「可比较」,需要制定详细的标注规范、做交叉验证、定期校准。这些「看不见的工程」,其实占了 RLHF 成本的大头。这也是为什么后来 Constitutional AI、RLAIF、DPO 等方法拼命想「减少对人工标注的依赖」——不是人工标注没用,而是「高质量、大规模、可持续」的人工标注太难了。
八点七、RLHF 之后:对齐方法的演进全景
InstructGPT 之后,对齐研究没有停在原地,而是沿着「怎么更省、更稳、更可控」的方向快速演进。理清这条后续脉络,你就能看懂今天对齐技术的全貌。
- RLAIF / Constitutional AI:用「AI 反馈」替代「人类反馈」,用「书面原则」替代「逐条标注」,解决 RLHF 标注太贵的问题。这是 Anthropic 训练 Claude 无害性的核心技术。
- DPO(Direct Preference Optimization):直接拿「偏好对」优化策略,跳过显式的奖励模型和 PPO 强化学习,让对齐从「RLHF 三步」简化成「一步」,训练更稳定、更省资源。这是目前社区最流行的 RLHF 替代之一。
- KTO、IPO、SimPO 等:在 DPO 的基础上继续改进,解决「偏好对难收集」「DPO 对数据敏感」等问题,让对齐进一步「去 RL 化」。
- 拒绝采样(Rejection Sampling)与 Best-of-N:不训练、只采样——生成多个候选、挑最好的那个,简单粗暴但对齐效果好,常被用来做「低成本对齐」。
这些方法的共同点,是都在回答 InstructGPT 留下的两个问题:「标注成本能不能降下来?」「强化学习能不能省掉?」。理解了这个脉络,你就明白:RLHF 不是对齐的终点,而是「用偏好信号对齐模型」这条大路的第一站。后续所有方法,无论是 DPO 的「去 RL」、还是 RLAIF 的「去人工」,都共享 InstructGPT 确立的那个核心范式——用「偏好」而非「标准答案」来定义「什么是好的」。
九、总结:这篇论文留给我们三个启示
第一,对齐的收益可以超过规模。1.3B 打赢 175B 这个结果,是「方向比体量重要」最有力的注脚。如果你手里的模型「不听话」,先想对齐,而不是急着上更大的模型。
第二,RLHF 的三步是「信号精度」的递进。SFT 用示范、RM 用排序、PPO 用打分,本质是逐步提高「人类意图」的信号质量。理解这个递进,能帮你判断什么时候该用哪种对齐手段。
第三,对齐和安全是「可兼得」的,但不能「根除」问题。InstructGPT 证明了安全性提升可以不牺牲能力,但它也诚实地承认模型仍会犯错。对齐是持续的过程,不是一次性的终点。
参考来源
- InstructGPT 论文(arXiv:2203.02155):arxiv.org/abs/2203.02155
- OpenAI 官方博客:Aligning language models to follow instructions
- DPO 论文(arXiv:2305.18290):arxiv.org/abs/2305.18290


