不靠人工标注也能教会 AI 懂偏好,聊聊 100 万条 UltraFeedback

不靠人工标注也能教会 AI 懂偏好,聊聊 100 万条 UltraFeedback

数据集速览

数据集名称UltraFeedback
发布机构清华大学(THUNLP,作者 Ganqu Cui、Lifan Yuan、Ning Ding 等)
发布时间2023 年 10 月(论文,ICML 2024 camera ready)
数据规模超过 100 万条 GPT-4 反馈,覆盖 25 万组用户-助手对话
语言英文为主
许可证开源(GitHub:github.com/thunlp/UltraFeedback)
一句话定位用 GPT-4 自动生成、规模化且多样化的 AI 偏好反馈数据集

它要解决的痛点

RLHF(基于人类反馈的强化学习)是让大模型对齐人类偏好的关键技术,但它的瓶颈一直卡在数据上:高质量的人类偏好标注既慢又贵,而且受限于标注者的能力和精力,现有偏好数据集的规模小、话题也窄。这反过来又阻碍了开源社区的对齐研究。UltraFeedback 的核心问题意识很直接:能不能绕过昂贵的人工标注,用 AI 来自动生成高质量的偏好反馈,从而把规模做上去?

团队给出的判断是,反馈数据要真正起作用,关键在两点——规模和多样性。规模决定了反馈学习的信号量,多样性决定了模型能覆盖多少种真实交互场景。基于这个判断,他们设计了一套流水线来同时放大这两点。

数据是怎么构建的

UltraFeedback 的构建分两步走。第一步是”扩源”:先从多个渠道收集、扩充指令和回复,让数据的数量和广度都能覆盖更丰富的用户-助手交互。第二步是”降偏”:精心应用一系列技术手段来缓解标注偏差,让 AI 反馈更可靠。

在打分环节,UltraFeedback 用 GPT-4 对每一条回复从多个维度进行评估,而不是简单给一个”好/坏”的对错标签。具体来说,每条对话会得到多个候选回复,GPT-4 针对帮助性、遵循指令、诚实性等多个方面分别打分,再综合出最终偏好。最终,数据集里沉淀了超过 100 万条 GPT-4 反馈,覆盖 25 万组对话,规模远超此前以人工标注为主的偏好数据集。

为什么偏好数据是 RLHF 的「燃料」

要理解 UltraFeedback 的价值,得先看清它所在的技术链条。让大模型对齐人类偏好的主流路径是 RLHF,它通常分三步:先用指令数据做监督微调(SFT),让模型学会按指令办事;再训练一个奖励模型,用来给模型输出打分;最后用强化学习(如 PPO)根据奖励信号优化模型。而奖励模型的训练,恰恰依赖大量「哪个回答更好」的偏好对数据——这正是传统上最贵、最难规模化的一环,因为每一条偏好都需要真人去仔细比较、判断。

后来出现的 DPO(直接偏好优化)简化了流程:它不再单独训练奖励模型,而是直接从偏好对(一个被选中的回答 + 一个被拒绝的回答)里学习,训练更稳定、实现更简单。但无论走 RLHF 还是 DPO,偏好数据都是硬需求。UltraFeedback 的出现,本质上是把这条链路上最稀缺的「燃料」,用 AI 规模化地生产了出来,让开源社区第一次有机会以极低成本拿到海量偏好信号。

多维打分:一条回复怎么被评价

UltraFeedback 的另一个设计亮点是它的打分粒度。它不是简单地让 GPT-4 给两个回答判个「谁更好」,而是对每条回复从多个维度分别打分——比如是否忠实地遵循了指令、内容是否诚实准确、是否真正解决了用户的问题等。这种细粒度评价,让每条反馈携带的信息比单纯的二元偏好标签丰富得多。

下游使用者可以根据需要,把这些多维度分数灵活地转化成各种形式:比如取总分最高的回复作为「选中」、总分最低的作为「拒绝」,构造 DPO 所需的成对数据;或者直接拿分数去训练奖励模型。这种「一份数据、多种用法」的灵活性,也是它迅速被社区接纳的重要原因。相比之下,早期的人工偏好数据往往只标注了简单的二选一结果,信息密度低得多。

它为什么重要

UltraFeedback 的意义在于验证了一件事:规模化的 AI 反馈,足以支撑起一个强大的开源对齐模型。团队基于 UltraFeedback,用 best-of-n 采样和强化学习对齐了一个 LLaMA 系模型,在对话基准上取得了出色的表现。更广为人知的例子是 Zephyr——Hugging Face 团队用 UltraFeedback 训练偏好模型、再用 DPO 对齐,做出了一个 7B 级别却能逼近 70B 专有模型水平的开源模型。这几乎成了”小模型靠高质量偏好数据逆袭”的教科书案例。

从那以后,UltraFeedback 成了开源社区做 DPO、偏好对齐时的默认起点之一,大量衍生数据集和复现工作都建立在它之上。可以说,它把「高质量偏好数据」这件原本昂贵的事,变成了一件可以规模化复制的事。

数据如何流转到下游

UltraFeedback 是一份「原料型」数据集,它本身不直接给出最终答案,而是提供海量的评价信号,供下游按需加工。最常见的用法有三种。第一种是训练奖励模型:把 UltraFeedback 里的反馈作为训练数据,让一个模型学会给任意回复打分,再把这个奖励模型接到 RLHF 流水线里。第二种是构造 DPO 偏好对:从多个候选回复里挑出得分最高和最低的,组成「选定/拒绝」对,直接喂给 DPO 训练。第三种是 best-of-n 采样:在推理时让模型生成多个回复,用奖励模型(或评分)挑出最优的一个。

这三种用法各有取舍:奖励模型训练最通用但链条长,DPO 简单稳定但对偏好对质量敏感,best-of-n 推理时成本高但实现最简单。Zephyr 之所以出名,正是因为它把这套「先训偏好模型、再做 DPO」的组合拳打得很漂亮,为后来者提供了一个可复制的模板。理解了这个流转关系,也就理解了为什么 UltraFeedback 会被反复引用——它是开源对齐工具链里绕不开的一块积木。

下载与使用

UltraFeedback 的数据和模型都发布在 GitHub 仓库 thunlp/UltraFeedback 上,同时也能在 Hugging Face Hub 上找到多个处理版本。常见用法是把它作为偏好对数据,直接用于训练奖励模型(reward model),或者经过处理转成 DPO 所需的”选定/拒绝”成对格式。社区里也有一些已经二值化、清理过的版本,方便直接拿去跑 DPO 训练。

横向对比同类偏好数据

在偏好数据这条线上,Anthropic 的 HH-RLHF 是早期代表,约 16 万条、纯人工标注、聚焦有用性和无害性两条轴;OpenAI 早期的摘要偏好数据则更小、更聚焦单一任务。UltraFeedback 与它们最大的不同在于数据来源——它不依赖人工逐条标注,而是用 GPT-4 规模化生成,从而在规模和多样性上拉开了数量级的差距。当然,这也带来了一个绕不开的问题:用 AI 给 AI 打分,反馈的质量上限受制于打分模型本身的能力。

局限与注意事项

UltraFeedback 的局限主要有几点。第一,反馈由 GPT-4 生成,本质上是一种”AI 偏好”,可能与真实人类偏好存在偏差——这是所有 AI 反馈数据的共性问题。第二,打分维度虽然做了多角度设计,但仍是单一模型视角,存在系统性偏好风险。第三,数据以英文为主,中文场景需要另行处理或搭配中文偏好数据。最后,使用前建议留意数据的版本和是否经过清洗,不同下游任务(奖励模型训练 vs DPO)对数据格式的要求不同,往往需要二次加工。总的来说,它适合作为对齐研究的起点和基线,但落地到具体产品前仍需结合场景补充人工校准。

参考来源

论文《UltraFeedback: Boosting Language Models with Scaled AI Feedback》(arXiv:2310.01377,ICML 2024);GitHub 仓库 thunlp/UltraFeedback。

主要菜单