58.5 亿个图文对从哪来?LAION-5B 如何把整个网页装进数据集

58.5 亿个图文对从哪来?LAION-5B 如何把整个网页装进数据集

数据集速览

数据集名称LAION-5B
发布机构LAION(大规模人工智能开放网络)
发布时间2022 年 3 月(NeurIPS 2022 论文)
数据规模约 58.5 亿(5.85B)个 CLIP 过滤图文对
语言英文 23 亿 + 100 多种其他语言 22 亿 + 无语言 12 亿
许可证元数据 CC-BY 4.0;图片各自保留原始版权
一句话定位开源多模态领域规模最大的图文对数据集,文生图模型的关键原料

它是谁、为什么重要

LAION 是一个非营利的开放 AI 网络,目标是把大规模多模态数据集”民主化”。在 LAION-5B 之前,高质量的大规模图文对数据集(如 CLIP 训练所用的 4 亿图文对)大多是闭源的,普通研究者拿不到。LAION-5B 的出现,让任何团队都能以极低的门槛拿到一个规模空前、且带完整元数据的图文对数据集。

它的影响力最直观地体现在 Stable Diffusion 上——这个引爆了 AI 绘画浪潮的模型,正是基于 LAION-5B 的一个子集训练的。可以说,LAION-5B 是过去几年生成式图像领域爆发的一块重要基石。

数据规模与构成

LAION-5B 总共包含约 58.5 亿个图文对,是其前身 LAION-400M(4 亿对)的 14 倍。它由三个子集组成:英语子集 Laion2B-en 约 23 亿对;多语言子集 Laion2B-multi 约 22 亿对,覆盖 100 多种语言;以及无法判定语言的 Laion1B-nolang 约 12 亿对。在多语言子集里,俄语、法语、德语、西班牙语占比较高,中文也有约 1.43 亿对。

从存储角度看,图像嵌入约 9TB,kNN 索引约 800GB,元数据(URL 和文本描述)约 800GB。数据集每条记录包含图片 URL、文本描述、宽高、语言、图文相似度分数、水印概率和不安全内容概率等字段。

三步流水线:从网页到图文对

LAION-5B 的构建是一条清晰的三步流水线。第一步是分布式处理 Common Crawl:解析其 WAT 文件,提取所有带 alt-text 属性的 img 标签,再用 cld3 做语言检测,把样本分成英语、其他语言、无语言三类,存入数据库。第二步是分布式下载图片:用异步请求抓取图片,单节点只需 1 到 2 个 vCPU、0.5 到 1GB 内存即可参与。第三步是 GPU 后处理:用 CLIP ViT-B/32(英文)和 mCLIP(多语言)计算图文嵌入的余弦相似度,作为”图文是否匹配”的过滤依据。

过滤规则也相当具体:alt-text 少于 5 个字符的丢弃,图片小于 5KB 的丢弃,分辨率过大的丢弃(防止恶意资源),基于 URL 做布隆过滤器去重。最关键的是相似度阈值——英文子集 0.28、多语言子集 0.26,低于阈值的样本被筛掉。最终,从 500 多亿候选样本中筛掉了约 90%,只保留不到 60 亿个高匹配度的图文对。

CLIP 相似度:凭什么判断图文匹配

LAION-5B 流水线里最核心的一环,是用 CLIP 模型的相似度分数来过滤图文对。这里值得展开讲清楚背后的原理。CLIP 是 OpenAI 提出的一个双塔模型,它通过对比学习,把图像和文本分别编码到同一个向量空间里——匹配的图文对,它们的向量会靠得很近;不匹配的,则相距很远。于是,「图片和描述是否相关」这个问题,就被转化成了「两个向量在空间里的余弦相似度有多高」。

网页上的图片 alt-text 往往质量参差,很多描述和图片内容毫无关系。LAION 的做法是:给每一对「图片 + alt-text」计算 CLIP 相似度,只有分数高于阈值的才保留——英文子集阈值 0.28、多语言子集 0.26。这个阈值并不高,是因为要在大规模召回和准确率之间取得平衡:阈值太高会筛掉太多样本,太低又会混入大量噪声。理解了这一点,也就理解了为什么 LAION-5B 的图文匹配质量并不完美——它追求的是「量」,而把「质」的优化留给了下游。

它对文生图意味着什么

LAION-5B 最深远的影响,发生在文生图(text-to-image)领域。Stable Diffusion 之所以能以开源姿态横空出世,很大程度上是因为它有了 LAION 这样大规模、开放、可获取的图文对数据作为训练原料。在此之前,训练一个文生图模型所需要的海量图文对,要么是闭源巨头的私有资产,要么需要自己从零爬取清洗,门槛极高。

LAION-5B 把这道门槛几乎拆平了:任何团队都能拿到数十亿规模的图文对,再按自己的需要筛选子集、二次清洗。后来的图像生成、图像编辑、视觉问答等一系列多模态模型的繁荣,都和这种「数据民主化」密不可分。可以说,LAION-5B 的价值早已超越了数据集本身,它重塑了多模态研究的基础设施。

安全标注与开放态度

LAION 在发布时就明确这是一份”未经人工策展”的数据集,可能包含令人不适的内容,并明确表示不推荐直接用它做工业级产品。为此,团队额外提供了基于 CLIP 的 NSFW(不安全内容)分类器标签和水印检测标签,方便使用者按需过滤。官方给出的 NSFW 分类器准确率约 0.96,各子集不安全内容占比在 3% 上下,水印占比在 5% 到 6% 左右。

这份”先开放、再标注风险”的姿态,让 LAION-5B 在推动研究的同时,也埋下了后续争议的伏笔。

下载与使用

LAION-5B 的元数据和标签可在 Hugging Face 上下载(如 laion/laion2B-en-safety 等安全标签子集),图片本身需要根据提供的 URL 自行抓取,官方推荐的下载工具是 img2dataset。单个节点下载 1 亿张图片大约需要 20 小时,分布式模式下用 10 个节点一周内可下完全部样本。LAION 还提供了 kNN 搜索界面和 clip-retrieval 检索工具,方便按文本搜图。

横向对比同类图文数据集

在多模态图文对的坐标系里,LAION-5B 的上一代是 LAION-400M(4 亿对),再往前是闭源的 CLIP 数据。与它们相比,LAION-5B 的优势是规模大一截、完全开放且带质量/安全标注。但它也有明显的代价:因为是网页抓取、自动过滤,图文匹配质量参差、内容未经人工策展。后来的高质量数据集(如 ShareGPT4V)正是针对”质量”这一短板,用 GPT-4V 重新生成高质量描述来补课。此外还有 DataComp 这类走”竞赛框架”路线、强调共同构建和可复现性的项目,代表了多模态数据构建的另一个方向。

争议、版权与注意事项

LAION-5B 绕不开的一个话题是争议。2023 年,有研究指出数据集中包含了非法内容(儿童性虐待材料),引发强烈反响,LAION 随后采取了撤下相关数据、发布更新等应对措施。这暴露了”大规模网页抓取 + 自动过滤”路线的根本风险:任何自动过滤器都难以 100% 拦截非法内容,而一旦数据流入下游模型,责任链条就变得复杂。

版权是另一个核心问题。LAION-5B 的元数据虽然用 CC-BY 4.0 开放,但图片本身的版权仍归原权利人所有,训练出的模型能否商用、是否侵权,至今仍是全球范围内的法律争议焦点。事实上,文生图模型的版权诉讼在过去几年频繁见诸报端,LAION 这类大规模抓取数据集往往处在争议的中心。使用这份数据时,务必清楚意识到:你拿到的是一份”指向图片的索引 + 描述”,而不是图片本身的授权;训练模型的版权合规责任,最终要由使用方自行评估和承担。

参考来源

LAION-5B 官方发布博客(laion.ai/blog/laion-5b/);论文《LAION-5B: An open large-scale dataset for training next generation image-text models》(arXiv:2210.08402,NeurIPS 2022)。

主要菜单