Llama 4 把上下文拉到 1000 万 token,开源模型第一次这么卷

开源大模型的竞争,在 2025 年春天又被狠狠推了一把。Meta 在 4 月初发布 Llama 4 系列,一口气拿出 Scout 和 Maverick 两款可下载的模型,并预告了仍在训练中的教师模型 Behemoth。这是 Llama 家族第一次用上混合专家架构,也是它第一次把多模态能力直接做进预训练阶段,而不是事后拼接。最让人印象深刻的,是 Scout 把上下文窗口拉到了 1000 万 token——在它之前,主流的”长上下文”还停留在 12.8 万到 100 万 token 的量级。

Llama 4 把上下文拉到 1000 万 token,开源模型第一次这么卷

先认识三款模型:Scout、Maverick、Behemoth

Llama 4 不是单一模型,而是一组”模型族群”。Meta 官方博客用了 “herd”(族群)这个词来形容它。三款模型的定位差异很大:

  • Llama 4 Scout:170 亿活跃参数,16 个专家,总参数 1090 亿。它的招牌是 1000 万 token 的超长上下文,在官方口径下是”业界最长的上下文长度”。更关键的是它足够小,用 Int4 量化后可以塞进单张 NVIDIA H100 GPU,这对个人和小团队做本地部署意义重大。
  • Llama 4 Maverick:同样是 170 亿活跃参数,但专家数量增加到 128 个,总参数飙升到 4000 亿。它是这一批里的”性能担当”,上下文 100 万 token,实验版聊天模型在 LMArena 上的 ELO 评分达到 1417,Meta 称它在推理和编码上接近 DeepSeek v3,却只用不到一半的活跃参数。
  • Llama 4 Behemoth:2880 亿活跃参数、16 个专家的教师模型,是这次发布的”幕后功臣”,但仍在训练中,只放出了预览。它的角色是当老师——用来蒸馏出 Scout 和 Maverick,官方称它在 MATH-500、GPQA Diamond 等 STEM 基准上超过了 GPT-4.5、Claude Sonnet 3.7 和 Gemini 2.0 Pro。

一句话概括:Scout 追求”长上下文 + 能塞进一张卡”,Maverick 追求”同等活跃参数下的最强性能”,Behemoth 则是用来拔高整个族群上限的教师。

为什么这次不一样:两个”首次”

Llama 4 之所以值得单独聊,是因为它身上有两个 Llama 家族此前没有的东西。

第一是混合专家架构(MoE)。此前的 Llama 2、Llama 3 都是传统的稠密模型——每次推理,模型里的所有参数都会被激活参与计算。而 MoE 模型把网络里的一部分层拆成了多个并行的”专家”,每个 token 只路由给其中的一小部分专家处理。这就是为什么会出现”活跃参数”和”总参数”两个数字:总参数是模型完整的大小,活跃参数是每次前向传播真正参与计算的参数规模。用更少的活跃参数去逼近更大模型的能力,是 MoE 能同时做到”能力强”和”跑得快、成本低”的核心原因。

第二是原生多模态。过去很多”多模态”大模型,是把一个训练好的文本模型和一个视觉编码器拼接起来,让两者协同工作。Llama 4 的做法不同——它用了所谓的 early fusion(早期融合),在预训练阶段就让模型同时吃进海量的无标注文本和视觉 token,把多模态理解直接”长”进模型的底层能力里,而不是事后加装一个视觉模块。官方强调,这带来的是”从分离的、冻结的多模态权重迈出的一步质变”。

讲透 MoE:混合专家到底怎么省计算

理解 MoE,可以先把它想象成一个公司。一个传统稠密模型像是一个”全员工都参与每一项任务”的组织——处理任何一句话,几万亿参数全部出动。MoE 模型则像是一个有分工的组织:它有一批”专家”(Expert),以及一个”路由”(Router)。每个 token 进来,路由器判断它更适合哪个专家,然后只调用其中少数几个专家来处理,其余专家保持空闲。

这就是活跃参数和总参数的区别由来。以 Maverick 为例,总参数 4000 亿,但每次推理只激活 170 亿——相当于你用一张能跑 170 亿参数的卡,享受了接近 4000 亿参数模型的智力。这对推理成本的影响是决定性的:显存里要装下整个模型,但每次计算的浮点运算量只对应活跃参数那部分,吞吐更高、延迟更低。

MoE 也有代价。第一是显存占用:总参数摆在那里,模型文件本身不会因为”活跃参数少”而变小,Scout 总参数 1090 亿、Maverick 4000 亿,这决定了对显存和内存的硬要求。第二是训练和推理的工程复杂度更高,路由策略、专家负载均衡都是需要仔细处理的问题。但总体而言,MoE 已经成为 2025 年之后前沿大模型的主流选择之一。

1000 万 token 的上下文意味着什么

上下文窗口(context window)决定了一个模型一次性”能看多长”。token 是模型处理文本的基本单位,中文里一个汉字大约对应一到两个 token。过去主流旗舰模型的上下文多在 12.8 万 token(约一本书的量级),后来 Llama 3.1 等把 12.8 万做成了标配,Gemini 系列一度把 100 万 token 带入公众视野。

Scout 的 1000 万 token 把这个数字又往前推了一个数量级。这个长度意味着什么?一整部《三体》三部曲加起来大约也就几百万 token,一个大型 GitHub 代码仓库、一摞研究论文、一份超长的企业合同,理论上都可以一次性塞进上下文,让模型通读之后再回答。官方在配套课程里给的例子,正是”在一堆大文本文件、整本书、研究论文和 GitHub 仓库里跨文件提问”。

需要提醒的是,超长上下文并不等于”模型一定记得住每一个细节”。上下文越长,”大海捞针”式的检索越困难,模型在长文本中段的注意力也可能衰减。1000 万 token 是一个能力上限,实际效果还取决于模型在长程理解上的训练质量。这也是为什么 Meta 单独把 Scout 的长上下文作为卖点,并在 MTOB 等长上下文基准上给出跑分。

跑分与横向对比:数据到底如何

Meta 在官方博客里给出了一组对比数据,把 Llama 4 Maverick 和 Gemini 2.0 Flash、DeepSeek v3.1、GPT-4o 放在一起比。为了准确,下面把官方报告的数字原样列出来(0-shot、temperature=0,无投票、无并行测试时计算):

基准(类别)Llama 4 MaverickGemini 2.0 FlashDeepSeek v3.1GPT-4o
MMMU(图像推理)73.471.769.1
MathVista(图像推理)73.773.163.8
ChartQA(图像理解)90.088.385.7
DocVQA test(图像理解)94.492.8
LiveCodeBench(编码)43.434.532.3
MMLU Pro(推理与知识)80.577.6
GPQA Diamond(推理与知识)69.860.153.6
多语言 MMLU84.681.5

从这张表能看出 Meta 的意图:Llama 4 Maverick 在图像理解、编码、推理等维度全面对标甚至超越 Gemini 2.0 Flash 和 GPT-4o,同时价格远低于 GPT-4o。官方给出的 Maverick 调用成本是每 100 万 token 输入输出混合(3:1)约 0.19 到 0.49 美元,而 GPT-4o 是 4.38 美元,差距超过一个数量级。

当然,官方跑分本身是 Meta 自己发布的,横向对比的另一方也标注了”取可复现的最高自报结果”。看这类数据时要留个心眼:不同机构的评测口径、版本、采样方式都可能不同,跑分只代表某一套基准下的相对表现。

开源权重:这到底是不是”开源”

很多人习惯把 Llama 称为”开源模型”,严格来说这个说法并不完全准确。Llama 开放的是权重(open weights)——你可以下载模型权重文件,自由地跑推理、微调、蒸馏,甚至商用(在许可证允许范围内)。但 Meta 并没有公开训练数据、训练代码和完整的训练配方,所以它和”完全开源”(open source)的定义还有距离。

Llama 的许可证也经历过演变。早期版本有严格的商用限制,后来逐步放宽。对开发者和企业来说,需要逐字阅读对应版本的许可证条款,确认商用、分发、衍生模型的条件。与之形成对比的是真正意义上的开源,比如某些社区项目会把数据、代码、权重全部公开。区分”开放权重”和”开源”这两个概念,能帮你更准确地评估一个模型的可定制性和合规风险。

什么场景适合用 Llama 4

结合三款模型的特点,可以大致这样判断:

  • 需要超长文档、大代码库、长文本分析:Scout 的 1000 万 token 上下文是首选,且单张 H100(Int4)就能跑,适合预算有限的团队。
  • 需要多模态理解 + 高性价比推理:Maverick 在图像理解、编码、推理上表现均衡,性价比突出,适合做需要看图、看图说话、图文结合问答的产品。
  • 想微调、蒸馏自己的模型:开放权重让定制成为可能,这也是开源生态相对闭源 API 的核心优势——数据不出域,权重自己掌控。

反过来,如果只是想要一个”开箱即用、最快上手”的聊天助手,直接调 Meta 官方的 Llama API,或者用它部署在合作伙伴平台(如 Together.ai)上的版本,可能比自己在本地搭推理服务更省事。

Llama 家族:一段开源模型的演进史

要理解 Llama 4 的分量,最好把它放回 Llama 家族的完整时间线里看。

Llama 1(2023 年 2 月):Meta 首次发布 Llama,当时参数规模从 70 亿到 650 亿不等。它最大的意义是”开源权重”——在那个闭源模型一统天下的年代,Llama 让研究者第一次能拿到一个像样的基座模型自己跑。这一举动直接点燃了后来的开源模型浪潮,Alpaca、Vicuna 等衍生模型都是基于它。

Llama 2(2023 年 7 月):参数拉到 70 亿到 700 亿,最大的变化是放宽了商用许可——企业可以商用,这让它迅速成为开源模型的行业标准。

Llama 3 / 3.1(2024 年):Llama 3 把 8B、70B 做成了当时同级的标杆;Llama 3.1 则推出了 405B 的旗舰,并把上下文拉到了 128K。这一年,开源模型和闭源模型的差距被大幅缩小。

Llama 4(2025 年 4 月):首次引入 MoE 架构和原生多模态,Scout 把上下文推到 1000 万 token。这是 Llama 从”追赶”转向”引领”的一次明显信号。

从这条线能看出两个趋势:一是开源模型的权重越来越大、能力越来越强;二是 Llama 家族持续扮演着”开源生态基础设施”的角色,无数下游模型和应用都建立在它之上。

MoE 的权衡:它凭什么又强又省,代价是什么

前面讲了 MoE”活跃参数少、总参数多”的结构,这里把它的利弊讲得更完整。

收益:在同样的推理算力下,MoE 模型可以拥有远超稠密模型的总参数量,从而获得更强的能力。用 Meta 的话说,Maverick 用 170 亿活跃参数,就逼近了 DeepSeek v3 的推理和编码水平。此外,因为每次只激活少数专家,MoE 的推理成本比同等总参数的稠密模型低得多。

代价:第一是显存——总参数 4000 亿意味着模型文件本身很大,部署时所有专家都要常驻显存,省的是”计算”而不是”存储”。第二是路由——每个 token 该发给哪个专家,需要路由机制来决策,路由不当会导致专家负载不均,某些专家过载、某些闲置。第三是训练和工程复杂度更高,MoE 的分布式训练、推理调度都比稠密模型难。

所以 MoE 不是”免费午餐”,它是在”计算成本”和”存储成本/工程复杂度”之间做的一次重新分配。理解了这层权衡,你就不会简单地认为”MoE 一定比稠密好”——它更适合那些”要强能力、但预算有限、愿意承担工程复杂度”的场景。

原生多模态和”拼接多模态”差在哪

多模态大模型有两条技术路线,理解它们的区别,能帮你判断一个”多模态”模型到底有几成真功夫。

拼接式(如早期的很多 VLM):先有一个训练好的文本大模型,再训练一个视觉编码器(如 CLIP 的视觉部分),把图像编码成向量后”塞”给文本模型。文本模型的权重往往是冻结的,多模态理解更像是”外挂”上去的。好处是省算力,坏处是图像和文本的理解容易”两张皮”,深层的图文融合不够。

原生式(如 Llama 4 的 early fusion):在预训练阶段就让模型同时吃文本和视觉 token,把多模态能力直接训练进模型底层。这样图像理解不是”外挂”,而是和语言理解融为一体的能力。Meta 特别强调,Llama 4 是”第一个开源的、原生多模态的、用 MoE 架构的模型”,并称早期融合是”从分离的冻结权重迈出的一步质变”。

原生多模态的优势在”图像接地”(image grounding)上体现得很明显——模型能把回答锚定到图像的具体区域,比如指出”图里左上角的那个物体”。这种深度的图文对齐,拼接式方案很难做到。

开源协议:Llama 的许可一直在变

使用 Llama 前,许可证是绕不开的一环,因为它一直在变。

Llama 1 的许可证严格限制商用。Llama 2 引入了 Llama 2 Community License,允许商用,但月活超 7 亿的公司需要额外申请许可。Llama 3 延续并微调了社区许可。这些许可证都明确开放”权重”,允许下载、微调、蒸馏、部署,但对”训练数据、训练代码”并不开放。

这引出了一个重要的概念区分:开放权重(open weights)不等于开源(open source)。开放权重意味着你能拿到模型文件自己跑、自己改,但你看不到数据、代码和训练配方。真正意义上的开源,要求数据、代码、权重全部公开。很多商业模型的”开源”,其实都是”开放权重”。

对企业来说,许可证的细节——商用条件、分发义务、衍生模型要求——需要逐字阅读,必要时应咨询法务。因为一旦商用规模做大,许可条款的差异可能带来实打实的合规成本。

怎么上手:Llama 的生态与入口

想用上 Llama 4,入口其实不少。最直接的是 llama.com 官网,可以直接下载 Scout 和 Maverick 的权重,也可以通过 Meta 官方的 Llama API 调用;Hugging Face 上也同步上架,方便用 transformers 生态加载。除此之外,Meta 还推出了 Llama Stack,一套围绕 Llama 模型构建应用的工具集,包括提示词优化工具、合成数据工具包等,帮助开发者更快地从”拿到模型”走到”做出应用”。

对大多数想快速验证的人来说,最省事的方式是调 API 或用云平台托管;对要深度定制、数据要本地化的团队,则下载权重自己部署。两条路各有取舍,取决于你对”上手速度”和”掌控程度”的优先级。

写在最后:开源生态的新变量

Llama 4 的意义,不只是多了一个模型。它把 MoE 架构、原生多模态、1000 万 token 上下文这几样原本属于闭源旗舰的能力,一次性带进了可下载、可商用、可定制的开放权重世界。对开发者和企业来说,这意味着一件重要的事:以前只有闭源 API 能提供的能力,现在可以自己部署、自己掌控、自己微调。

当然,开源模型的能力追赶是个动态过程。今天 Scout 和 Maverick 是标杆,明天就可能被新的开源模型超越。真正值得关注的,不是某一款模型跑分的高低,而是整个开放权重生态正在把”最先进的能力”变成”人人可得的基建”这件事本身。

主要菜单