一口气开源六个模型:K2 Horizon 把「开放权重」这个词重新定义了

一口气开源六个模型:K2 Horizon 把「开放权重」这个词重新定义了

2026 年 9 月 3 日,AI 圈迎来了一次在「开源」这件事上颇具分量的发布。阿布扎比的基础模型研究院 IFM(Institute of Foundation Models)正式推出 K2 Horizon——一个包含六个基础模型的「全开源舰队」,参数规模从 0.9B 一路覆盖到 375B。和市面上大多数「开源」模型只公开权重不同,K2 Horizon 把权重、代码、训练数据、方法论全部打包公开,并采用 Apache 2.0 协议。IFM 的创始人 Eric Xing 用一句话点明了这次发布想立的标准:

开源远远不止开放权重。科学之所以能运转,是因为别人能看到数据、跟随方法、复现结果、并在此基础上改进。

速览卡:这次发布的关键信息

项目内容
发布方Institute of Foundation Models(IFM,基础模型研究院)
背景由阿布扎比的 MBZUAI 于 2025 年 5 月发起,在硅谷、巴黎、阿布扎比三地设有办公室
发布时间2026 年 9 月 3 日
核心产品K2 Horizon 六模型全开源舰队(0.9B / 3.7B / 7B / 32B / 36B-A4B / 375B-A23B)
关键点权重 + 代码 + 训练数据 + 方法论全公开;Apache 2.0 协议;即日可下载

六个模型:从手表到企业级的完整阵容

K2 Horizon 这次没有选择「发布一个旗舰」,而是「一次性发布整个舰队」。六个模型共享核心架构、词表、训练方法论、接口和部署工具链,只是在规模上拉开梯度,让开发者可以「在小模型上做原型、无缝放大到旗舰」,而且整个过程中不需要改动部署流程。这是一个很务实的设计——它试图覆盖从边缘设备到企业数据中心的完整需求光谱。

具体阵容如下:

  • 0.9B:同尺寸下数学、推理、工具调用最强的模型之一,小到可以跑在手表上,面向极受限制的穿戴设备。
  • 3.7B:对开发者和研究者很「友好」的微调尺寸,推理能力号称 4B 以下最强,能追平甚至超过许多更大的模型。
  • 7B:10B 以下性能标杆,具备较强的软件工程和深度研究能力,小到可以跑在手机上。
  • 32B:面向本地托管的稠密模型,为笔记本和本地服务器上的重度使用而设计。
  • 36B(4B 激活):采用全新的 MoVA(Mixture of Value Attention)架构,只激活 4B 参数却能超过许多更大的模型,让本地托管更具成本效益。
  • 375B(23B 激活):舰队旗舰,对标最强开源模型做推理和 Agent 任务,面向企业级部署。

在性能声明上,IFM 声称 K2 Horizon 在推理、数学、代码和 Agent 任务上,每个尺寸档位都做到了「顶尖」,其中 0.9B、3.7B 和 7B 三个模型在各自规模上「创造了新的 state of the art」。不过需要客观指出的是,这份新闻稿没有附带具体的基准分数,这些性能声明仍有待社区实测验证。

两项技术创新:3 倍加速与零额外计算量的推理

抛开「全开源」这个最大的标签,K2 Horizon 还带来了两项具体的技术创新。

第一项是「diffusion distillation」(扩散蒸馏)。这是一种能并行生成 token 块的技术——传统的自回归模型是一个 token 一个 token 地生成,而 K2 Horizon 通过扩散蒸馏让模型一次性并行生成一组 token,官方称在不牺牲响应质量的前提下,把模型速度提升了大约 3 倍。这是一个值得关注的方向,因为「生成速度」正在成为大模型落地时最实际的瓶颈之一——尤其对端侧和本地部署场景,3 倍的速度差可能就是「可用」和「不可用」的差别。

第二项是「mixture of value attention」(MoVA,价值注意力混合)。这是一种在「不增加计算量」的前提下提升推理能力的注意力架构。从 36B(4B 激活)这个型号的定位就能看出它的价值:只激活 4B 参数,却能超过许多更大的模型。这延续了 MoE(混合专家)一类「稀疏激活」的思路——用更少的实际计算,换取更强的能力,本质是在做「算力效率」的文章。

背景:为什么「全开源」值得单独说

要理解这次发布为什么在社区里引起了「开源标准被重新定义」的讨论,得先看清过去几年的「开源」现状。

过去几年,「开放权重」(open weights)成了行业的主流叙事——很多厂商会发布模型权重,有的附带部分代码,但训练数据、训练配方(recipe)、中间检查点(checkpoint)这些「真正的秘密」,绝大多数情况下是不公开的。这就造成了一个微妙的现象:你拿到了一个「开源」模型,却无法真正复现它、审计它、或者从它的训练过程中学到东西。正如 Inside AI 的报道所指出的,这限制了独立的验证和复现。

K2 Horizon 走了一条相反的路。它公开的不只是权重,还包括训练数据、代码、方法论,甚至中间检查点——这些「快照」让研究者得以研究模型在训练过程中是如何演化的。这种完整度,对安全研究、审计、可复现性研究都有直接价值。Eric Xing 把这次发布定位成「一个参照点」(reference point):

我们这次发布的目标,是建立一个「真正开放」的模型发布可以是什么样子的参照点。开放性和有竞争力的性能,并不是互相排斥的。

这句话的背后,是对 OpenAI、Anthropic 这类「既不公开模型、也不披露训练细节」的闭源路线的直接回应,也是对「只公开权重」的中式开源路线的一次超越。硅谷实验室负责人 Hector Liu 的补充也很直白:

与其发布单个模型,我们一次性发布了整个舰队——从一个小到能跑在手表上的模型,到为推理而生的旗舰。每一个模型都附带权重、代码、训练数据和背后的方法论。开发者可以在最小模型上做原型,放大到旗舰,并在整个过程中验证我们的每一个声明。

行业内的讨论与不同声音

K2 Horizon 的发布,在社区里激起的反应大体分两派。

支持方把它视为「开源运动的一次升级」。过去「开源 vs 闭源」的争论,很多时候卡在「公开权重到底算不算开源」这个语义问题上。K2 Horizon 用行动给出了一个更高标准的示范:真正的开放,应该是「数据可见、方法可循、结果可复现、可以在此基础上改进」。对重视透明度、可审计性的研究者和监管者来说,这是一个受欢迎的信号。

但理性的质疑同样存在,而且集中在两个点上。第一,性能声明缺乏第三方验证。新闻稿没有给出具体基准分数,Inside AI 也明确表示「无法独立验证性能声明」,K2 Horizon 的实际水平如何,要等社区真的把它跑起来、跑各种榜单之后才知道。第二,完全开放带来的风险。训练数据可能包含受版权保护的内容或个人信息,公开代码和检查点也可能被滥用;而 IFM 目前还没有详细说明它的数据过滤和安全评估细节。这是「完全透明」这条路的固有代价,也是 K2 Horizon 需要后续补上的功课。

还有一个更宏观的观察角度:这次发布是阿联酋(UAE)在全球 AI 版图上「抢位」的一部分。阿布扎比近年来在算力、人才、研究基础设施上投入巨大,而「全开源」正是吸引重视透明度的研究者的一张牌。IFM 的模型组合里,除了 K2 系列,还有面向阿拉伯语的 Jais 模型、以及面向具身推理的 PAN 世界模型——可见它不只是想做「又一个开源 LLM」,而是在铺一个更完整的基座模型矩阵。

横向扩展:端侧模型、稀疏激活与「开源」的边界

K2 Horizon 的发布,其实踩在了当下几个并行趋势的交汇点上。

一是「端侧模型」的兴起。就在 K2 Horizon 发布的前一天(9 月 1 日),科大讯飞旗下的词元星火刚刚开源了星火 X2.5-4B 和 1.7B 两款端侧模型,主打「原生支持最长 100 万 token 上下文」。这两件事放在一起看,信号很清晰:小尺寸、能跑在手机/手表/边缘设备上的模型,正在成为新的竞争焦点。K2 Horizon 里那个「小到能跑在手表上」的 0.9B,就是这条赛道上的一员。端侧模型竞争的关键,已经从「能不能跑」升级到「跑起来能干什么」——长上下文、工具调用、Agent 能力,都在被塞进越来越小的模型里。

二是「稀疏激活 / 计算效率」。K2 Horizon 的 MoVA 架构(36B 只激活 4B)和 diffusion distillation(3 倍加速),都属于「用更少算力做更多事」这个大方向。这和 MoE 架构的流行一脉相承——当模型规模越来越大、推理成本越来越高时,「怎么高效地调用算力」就成了比「堆更多参数」更实际的问题。这对本地部署、端侧部署尤其重要。

三是「开源」这个词的边界正在被重新划定。从「开放权重」到「开放权重 + 代码」再到「权重 + 代码 + 数据 + 方法 + 检查点」,行业的开放度在层层递进。K2 Horizon 把标准推到了目前最激进的位置,这会形成一个参照系:以后厂商再说「我们开源了」,社区就有了一个「全开源」的标杆可以去对照。这对整个生态的透明度,是一个正向的推动。

两项技术创新,讲透一点

K2 Horizon 的两项技术创新值得单独展开,因为它们都不是「营销黑话」,而是两个有明确技术脉络的方向。

Diffusion distillation:把「逐个生成」变成「并行生成」。要理解这个技术,先得理解自回归模型的一个根本局限——它是「串行」的:生成第 2 个 token,必须等第 1 个 token 出来;生成第 1000 个 token,必须等前面 999 个都出来。这就是为什么 LLM 生成长文本会慢。而「扩散模型」(diffusion model)在图像生成里已经证明了另一种范式:一次性、并行地生成整块内容。K2 Horizon 的 diffusion distillation,本质是把「扩散模型并行生成」的思路,用「蒸馏」的方式嫁接到大语言模型上——让模型一次性并行生成一组 token 块,而不是一个接一个。官方称这让速度提升了约 3 倍,且不牺牲响应质量。这对端侧和本地部署的意义尤其大,因为那些场景里,「生成速度」往往就是「能不能用」的分界线。

MoVA(Mixture of Value Attention):花更少算力,做更强推理。这个方向的背景是 MoE(Mixture of Experts,混合专家)的流行。MoE 的核心思想是「稀疏激活」——一个模型有很多参数,但每次推理只激活其中一小部分,从而用更少的实际计算量,获得接近甚至超过稠密模型的能力。K2 Horizon 的 MoVA 是这条思路在「注意力机制」上的延伸:36B 参数的模型,每次只激活 4B,却能超过许多更大的模型。它解决的是一个很实际的问题——大模型的推理成本太高,而「怎么高效地调用算力」正在成为比「堆更多参数」更关键的竞争点。对想在本地跑大模型的开发者来说,「4B 激活却有大模型能力」是极具吸引力的。

这两项技术放在一起,其实指向同一个战略:IFM 不只是想「发模型」,而是想证明「开放 + 高效」是可能的——你可以同时做到「完全透明」和「有竞争力的性能 + 可接受的成本」。这也呼应了 Eric Xing 那句话:「开放性和有竞争力的性能,并不互相排斥。」

「开放权重」这层窗户纸,被捅破了

K2 Horizon 最大的行业意义,可能不在技术,而在它重新定义了「开源」这个词。

过去几年,AI 行业的「开源」叙事其实一直有点暧昧。绝大多数「开源模型」,严格来说只开放了「权重」(weights)——你能下载模型、能跑、能微调,但你不知道它是用什么数据、什么配方、什么成本训练出来的。于是出现了一个奇怪的现象:你手里有一个「开源」模型,却既不能复现它,也不能审计它,更不能从它的训练过程里学到任何东西。有人把这种现象戏称为「开放权重,封闭一切」。

K2 Horizon 捅破的,正是这层窗户纸。它公开的不只是权重,而是「完整的一套」:训练数据、代码、训练方法论,甚至中间检查点(checkpoint)。「中间检查点」这个细节尤其值得注意——它让你能看到模型在训练过程中是「怎么一步步演化」的,这对研究训练动力学、安全审计、可复现性研究,都是不可多得的材料。

这背后的价值主张,Eric Xing 说得很直白:「科学之所以能运转,是因为别人能看到数据、跟随方法、复现结果、并在此基础上改进。」换句话说,IFM 不是在「开源一个模型」,而是在「实践一种科学」。它把一个在学术圈天经地义的规范——可复现性——搬到了工业界的模型发布上。

这件事会产生一个「参照系效应」:从今往后,任何厂商再声称「我们开源了」,社区就有了一个「全开源」的标杆可以去对照。是只开了权重,还是连数据、方法、检查点都开了?差距一目了然。这对于整个生态的透明度,是一个实打实的正向推动——它逼着「伪开源」去解释清楚,自己到底省了什么、为什么省。

和同期发布放在一起看:一个更清晰的趋势

K2 Horizon 不是孤立事件。把它和同期的几条新闻放在一起,一个更大的趋势会浮现出来。

就在 K2 Horizon 发布的前一天(9 月 1 日),科大讯飞旗下的词元星火开源了星火 X2.5-4B 和 1.7B 两款端侧模型,主打「原生支持最长 100 万 token 上下文」,而且基于全国产算力平台完成全流程训练,兼容英伟达、华为、海光、后摩等多种硬件,支持 vLLM、SGLang、llama.cpp、Ollama、LM Studio 等主流工具链。这两件事合起来,信号非常清晰:「小尺寸、可端侧部署、且开放」的模型,正在成为新的竞争焦点。

这背后的逻辑也很朴素。当云端旗舰模型的能力逐渐逼近天花板、而推理成本居高不下时,行业的目光自然会转向「让模型跑在离用户最近的地方」——手机、手表、边缘设备。端侧模型竞争的关键,也已经从「能不能跑」升级到「跑起来能干什么」:长上下文、工具调用、Agent 能力,正在被不断塞进越来越小的模型里。K2 Horizon 那个「小到能跑在手表上」的 0.9B,和星火 X2.5 的端侧百万上下文,其实是同一条赛道上的两个选手。

另一个值得注意的对照,是「开放」正在成为地缘竞争的一张牌。阿布扎比通过 IFM 做「全开源」、吸引重视透明度的研究者;中国厂商用「开源 + 国产算力适配」来推进自主可控;而 OpenAI、Anthropic 则继续走闭源路线。三条路线并行的局面,本质上是在用不同的「开放度」,争夺同一批开发者和研究者的注意力。

总结与启示

K2 Horizon 这次发布,最值得记住的不是某个具体的模型有多强,而是它把「开源」这件事的标准,往前实实在在地推了一步。

对开发者,它是可立即上手的资源:六个尺寸梯度、Apache 2.0 协议、Hugging Face / vLLM / SGLang 即刻可用,还有 Compass、Cerebras、AWS、Nebius 等推理伙伴提供的 API。对研究者,它的价值在于「可复现」——中间检查点和完整训练配方,是研究模型行为和训练动力学的一手材料。对整个行业,它的价值在于「立标」——当「全开源」成为一个公开的参照点时,那些只开放权重的「开源」,就不得不解释清楚自己到底省了什么。

当然,理性地说,K2 Horizon 的实际成色还有待验证:性能声明缺基准背书、全开源的滥用风险尚未回应,都是它绕不开的坎。但它至少证明了一件事:在闭源和「伪开源」之间,还有第三条路可以走,而且已经有人走出来了。

参考来源

  • PR Newswire《Institute of Foundation Models Launches the Industry’s Largest Fully Open-Source Fleet of AI Models》(官方新闻稿,2026-09-03)
  • Inside AI News《Abu Dhabi AI Institute Releases Six Fully Open-Source Models with Training Data and Code》
  • 中国日报《端侧首个支持百万上下文模型开源 让小模型干大活》(星火 X2.5 端侧模型,作横向参照)
主要菜单