
在多模态数据集的历史上,DataComp 是一个「思路特别」的存在。大多数数据集的发布逻辑是「我们做出了一个数据集,给你们用」;而 DataComp 的逻辑是「我们把训练代码固定了,你们来比谁选的训练数据更好」。它把「数据设计」这件事,从「事后报告」变成了「可竞赛、可量化、可复现」的科研对象——而且它用一个 128 亿图文对的候选池,证明了「数据筛选」这件事本身,就足以带来超越「更大模型」的性能提升。
数据集速览卡
| 项目 | 内容 |
|---|---|
| 数据集名称 | DataComp(含 CommonPool 候选池) |
| 发布机构 | 多机构联合(华盛顿大学、苹果、LAION、微软等 34 位作者) |
| 发布时间 | 2023-2024 年(NeurIPS 2023) |
| 规模 | 候选池 12.8 亿(1.28B)图文对;DataComp-1B 子集 14 亿(1.4B) |
| 许可证 | CommonPool 基于 Common Crawl 条款;代码与基准开放 |
| 用途定位 | 多模态预训练数据的筛选基准与竞赛 |
背景:数据设计不该是「事后诸葛亮」
DataComp 的出发点,是一个在机器学习生态里长期被忽视的不对称。
CLIP、Stable Diffusion、GPT-4 这些里程碑式的突破,背后都离不开大规模的多模态数据。但奇怪的是,这些「数据」几乎没有得到和「模型架构」「训练算法」同等的科研关注——模型架构有海量的论文和消融研究,而数据集往往只是论文里一笔带过的「我们爬了 XX 对图文」。DataComp 的论文开篇就点破了这个不对称:多模态数据集的设计,理应和模型架构一样,成为可研究、可竞赛的对象。
于是 DataComp 做了一个关键的机制创新:把训练代码固定,把「数据」变成唯一的变量。参与者不需要设计新模型、不需要调训练超参数——那些都固定好了。他们唯一要做的,是「设计一个更好的过滤算法,从候选池里选出更好的训练数据」。这个机制,把「数据筛选」从一个「模糊的工程问题」变成了一个「边界清晰、可量化、可比较」的科学问题。
数据构成与规模
DataComp 的数据构成,围绕一个叫 CommonPool 的候选池展开。
CommonPool 是从 Common Crawl(公共互联网爬取)里收集的 12.8 亿(1.28B)个「图像-文本」对。这个候选池是「未经筛选」的原始数据——里面既有高质量的图文对,也有大量噪声(图文不匹配、低质图像、无意义文本等)。参与者的任务,就是从这个「大杂烩」里,用过滤算法选出「好」的子集。
DataComp 提供了四个计算规模,跨越四个数量级,让不同资源的参与者都能参与:
| 规模 | 候选池大小 | 训练时看到的样本数 |
|---|---|---|
| small | 1280 万(12.8M) | 1280 万 |
| medium | 1.28 亿(128M) | 1.28 亿 |
| large | 12.8 亿(1.28B) | 12.8 亿 |
| xlarge | 128 亿(12.8B) | 128 亿 |
这个「多尺度」设计有两个妙处:一是让资源有限的研究者也能参与(small 规模很小);二是让「规模定律」(scaling laws)的研究成为可能——你可以观察「随着数据规模增大,不同过滤算法的优劣如何变化」。
除了核心的 filtering 赛道,DataComp 还提供了一条 BYOD(Bring Your Own Data)赛道——允许参与者使用外部数据(包括但不限于 CommonPool 里的样本)。这条赛道,是为了让「寻找新的数据来源」也成为竞争的一部分。
清洗与构建方法
DataComp 的「清洗」逻辑,和传统数据集完全相反——它不提供一个「清洗好的数据集」,而是提供一个「脏的候选池」,让参与者自己设计「清洗算法」。
但 DataComp 自己的 baseline 实验,展示了一条「简单却有效」的过滤路径,这也是它最有价值的技术贡献之一。团队用「简单的过滤算法」从 12.8 亿候选池里筛选,得到了一个 14 亿(1.4B)图文对的子集,命名为 DataComp-1B。这个子集训练出的 CLIP ViT-L/14,从零开始训练,在 ImageNet 上达到了 79.2% 的零样本准确率。
这个 79.2% 有多厉害?对比一下就清楚了:它比 OpenAI 的 CLIP ViT-L/14(用同样的训练流程和算力)高了 3.7 个百分点;比一个「更大的」、用 LAION-2B 训练的 ViT-g/14 高了 0.7 个百分点——而后者需要 9 倍的训练算力。换句话说,DataComp-1B 用「更少的数据 + 更小的模型」,打赢了「更多数据 + 更大模型」的组合。这个结论,直接证明了「数据筛选」的价值,甚至比「堆更多数据」更大。
这些成果揭示的核心洞察是:多模态模型的能力上限,很大程度上在「数据筛选」这一步就已经被决定了。精心筛选的 14 亿图文对,胜过粗放堆砌的几十亿图文对。
下载与使用
DataComp 的代码在 github.com/mlfoundations/datacomp,CommonPool 的下载命令是:
python download_upstream.py --scale $scale --data_dir $data_dir
其中 $scale 是 small/medium/large/xlarge 四个规模之一。数据以 shards(tar 文件)的形式存储,配合 webdataset 使用。下载完成后,数据在 $data_dir/shards 目录下。
训练和评估的命令也很标准化:用 torchrun train.py --scale $scale ... 训练,用 evaluate.py 在 38 个下游测试集上评估。这种「训练代码固定」的设计,保证了所有参与者的结果是可复现、可比较的。
许可证与商用注意
DataComp 的 CommonPool 候选池,基于 Common Crawl 的数据,因此遵循 Common Crawl 的使用条款(允许研究和商业使用,但要求遵守来源网站的服务条款)。DataComp 的代码和基准本身是开放的。
和所有从公开网页爬取的多模态数据一样,CommonPool 里可能存在版权、隐私、以及图文不匹配或有害内容的风险。由于候选池是「未过滤」的原始数据,使用者如果直接用它训练,需要自行做必要的过滤和合规审查——这也恰恰是 DataComp 这个竞赛的「题眼」:好的过滤算法,本身就是对「内容合规」的一种处理。
横向对比同类数据集
把 DataComp 和几个同赛道的多模态数据集对比,能更清楚它的独特之处。
和 LAION-5B(2022)比,LAION-5B 是一个「已经构建好的」58.5 亿图文对数据集,规模巨大但「筛选质量」参差;DataComp 提供的不是「一个数据集」,而是「一个候选池 + 一套竞赛机制」,让「筛选」本身成为研究对象。和 COCO(2014)比,COCO 是「人工精标注」的 33 万图数据集,质量极高但规模极小,适合监督学习;DataComp 是「大规模弱标注」路线,适合对比学习预训练。和 DataComp-1B(它自己的子集)比,DataComp-1B 是「筛选后的产物」,它证明的价值恰恰是「筛选」这件事——这也是 DataComp 和所有其他数据集的根本区别。
一个可以提炼的规律是:多模态数据正在从「拼规模」转向「拼筛选」。DataComp 是这场转向的标志性事件——它用「固定训练代码、竞赛数据设计」的机制,把「怎么选数据」从幕后推到了台前。
局限与争议
DataComp 的局限,主要来自它「候选池」的天然属性。
第一是候选池本身的噪声。CommonPool 是「未过滤」的原始数据,里面图文不匹配、低质、甚至有害的内容是常态。这既是竞赛的「题面」,也是使用者的「风险」——如果你不设计好过滤算法,直接用候选池训练,效果会很差。
第二是「38 个下游测试集」的评估口径。DataComp 用 38 个下游测试集来评估筛选出的数据的好坏,但这 38 个测试集本身也有偏向(偏向英文、偏向常见物体),可能不完全代表「通用多模态能力」。
第三是「数据筛选」的收益有上限。DataComp 证明了「筛选」的价值,但筛选不是万能的——当候选池本身的信息量有限时,再好的筛选算法也造不出「不存在的」高质量数据。这又回到了「候选池的来源和规模」这个根本约束。
DataComp 为什么「思路特别」:把「数据」变成「科研对象」
DataComp 的价值,很大程度上不在「它提供了什么数据」,而在「它改变了人们对『数据』这件事的认知」。这个认知转变,值得单独展开。
在传统的数据集研究里,「数据」是「产出物」——团队爬一批数据、清一批数据、然后「发布」一个数据集,论文里报告「我们用了 XX 对图文」。数据的「好坏」,是「事后」才知道的——你训一个模型,看效果好不好,才知道数据行不行。这带来两个问题:一是「数据设计」无法被「单独研究」(因为它总是和模型、训练算法混在一起);二是「数据筛选」无法被「公平比较」(因为大家都在不同的训练设置下报告结果)。
DataComp 的机制创新,精准地解决了这两个问题。它通过「固定训练代码、固定超参数、只让数据可变」,把「数据」从「产出物」变成了「唯一的自变量」。这样一来:数据设计的优劣,第一次可以被「隔离」出来研究;不同团队的「筛选算法」,第一次可以在「完全公平」的条件下比较。这相当于给「数据研究」建立了一个「受控实验」的框架——而这,恰恰是「数据科学」从「工程手艺」走向「可复现科学」的关键一步。
这个思路的影响,已经超出了 DataComp 本身。它开创了一个「数据集竞赛」的范式:后来的一些「数据设计」竞赛和基准,都在沿用「固定其他、只比数据」的思路。DataComp 的论文标题也点得精准——《In search of the next generation of multimodal datasets》(寻找下一代多模态数据集)——它把「寻找更好的数据」这件事,从一句口号变成了一场有规则、有裁判、可复现的科学竞赛。
一个更深的启示是:「数据」这个在 AI 里长期被当成「原材料」、被忽视的环节,其实是一个有大量优化空间、值得认真研究的一等公民。DataComp 用 79.2% vs 75.5% 的对比(同样训练流程下,好数据比差数据高 3.7 个百分点),证明了「数据的价值」甚至可能超过「堆更多算力」。这个结论,正在被越来越多的团队接受——「数据工程」正在成为一个独立的、受重视的方向。
「好数据胜过大数据」:DataComp 最反直觉的结论
DataComp 最值得被记住的,是它那个「反直觉、却极其重要」的实验结论:精心筛选的「小」数据,可以打赢粗放堆砌的「大」数据。
具体来说,DataComp 团队用「简单的过滤算法」,从 12.8 亿的候选池里筛出 14 亿(1.4B)图文对(DataComp-1B),用它训练的 CLIP ViT-L/14,零样本 ImageNet 准确率达到了 79.2%。这个数字的「反直觉」之处在于对比:
- 它比 OpenAI 的 CLIP ViT-L/14(用同样的训练流程、同样的算力)高了 3.7 个百分点。
- 它比一个「更大的」ViT-g/14(用 LAION-2B 这个更大的数据集训练)高了 0.7 个百分点——而那个更大的模型,需要 9 倍的训练算力。
这两个对比,指向同一个结论:「数据质量」的杠杆,可能比「数据数量」和「模型规模」的杠杆更大。用 14 亿「精选」图文对,打赢了几十亿「粗选」图文对;用「更小」的模型,打赢了「更大」的模型。这在当时是相当有冲击力的——因为它动摇了「多模态就是堆数据、堆算力」的惯性认知。
这个结论的产业含义是深远的。它意味着:对于资源有限的团队,「认真做数据筛选」是一条「性价比极高」的优化路径——你可能买不起更大的 GPU 集群、爬不起更多的数据,但你可以通过「把现有的数据筛得更干净」,获得「相当于堆 9 倍算力」的提升。数据筛选,是「穷团队」的「免费午餐」。
当然,也要客观地看:DataComp 证明的是「筛选的价值」,而不是「筛选万能」。它的结论成立有一个前提——候选池本身(12.8 亿 Common Crawl 图文对)里「有」足够多的好数据,筛选才能「筛」出价值。如果候选池本身「没货」,再好的筛选算法也无能为力。这是一个重要的边界。
一个实操视角:DataComp 的「竞赛」怎么参与,能学到什么
DataComp 不仅是「一个数据集」,更是一个「可以参与的比赛」。对想练手「数据筛选」的人来说,它提供了一个绝佳的「练兵场」。
参与的流程很清晰:先下载某个规模的 CommonPool(比如 small 规模,1280 万对,门槛很低);然后设计你的「过滤算法」——可以是基于规则的(如图文相似度阈值、图像质量分数、文本质量分数),也可以是基于模型的(用一个预训练的 CLIP 打分器筛选);然后用 DataComp 固定的训练代码跑训练,在 38 个下游测试集上评估;最后提交你的数据集和分数。
这个「练兵」过程的价值,不在于「拿名次」,而在于它逼你去「认真思考数据筛选」这件事——你会直观地体会到:哪些过滤规则有效、哪些无效、图文匹配度怎么测、噪声怎么去。这些「手感」,是任何论文都教不会的。
DataComp 还提供了 BYOD(Bring Your Own Data)赛道,允许参与者引入外部数据。这条赛道,实际上是在鼓励「寻找新的数据来源」——比如用某个特定领域的数据、或某种新的采集方式,来补足 Common Crawl 的不足。这反映了 DataComp 团队的一个判断:「数据来源的多样性」本身,也是一个值得竞争的维度。
「筛选」这件事,为什么越来越重要
把 DataComp 放在多模态数据的演进大势里看,能看到一个正在发生的、清晰的方向转变:从「拼规模」到「拼筛选」。
在 DataComp 之前(以及它之后的一段时间),多模态数据的主流叙事是「越大越好」——LAION-5B 用 58.5 亿图文对,把「规模」推到了极致,很多人默认「数据越多、模型越强」。但 DataComp 用一个干净的实验,戳破了这个叙事的「简单化」:规模不是万能的,筛选才是。「更大的数据」如果「更脏」,可能还不如「更小的数据」如果「更干净」。
这个转向,其实和一个更宏观的行业趋势同频——「数据质量」正在成为比「数据数量」更稀缺的资源。当「爬数据」的成本越来越低(Common Crawl 就在那儿,谁都能爬),「筛数据」的能力就成了新的分水岭。DataComp 是把这个趋势「显性化」的里程碑:它用一个可复现的竞赛,证明了「筛选能力」是一种可量化、可竞争、可积累的核心竞争力。
这也解释了为什么 DataComp 的影响力能持续:它不只是「发布了一个数据集」,而是「建立了一个评估『数据设计能力』的标准框架」。在这个框架下,「谁更会选数据」成了一个可以持续被测量、被比较、被改进的指标。这对整个多模态(乃至整个 AI)领域的数据实践,都是一个持久的、结构性的影响。
参考来源
- Gadre et al.《DataComp: In search of the next generation of multimodal datasets》(arXiv:2304.14108,NeurIPS 2023)
- DataComp 官网:www.datacomp.ai
- GitHub:mlfoundations/datacomp

