← 文章 / AI技术
Hacker News 7小时前 · 2026-09-04 02:15:16 · 0 阅读

K2 Horizon:前沿性能,彻底开源

日落时的K2 Horizon山峦艺术图

今天IFM正式发布K2 Horizon,这是一套由六款模型组成的互联模型系列:375B-A23B、36B-A4B、32B、7B、3.7B 和 0.9B。在推理、数学、编程、智能体任务和通用能力方面,K2 Horizon 在各参数量级均达到顶级性能,其中 0.9B、3.7B 和 7B 模型在其规模档位创造了全新最佳。

K2 Horizon 也是迄今为止我们最全面的开源发布。对于每款模型,我们完整开放了从预训练到推理及智能体后训练的全周期训练流程,包括中间检查点、训练数据(或详细的数据构建配方)、开放架构、混合组成、训练代码、配置文件、细粒度日志、评估结果以及最终权重。

模型和代码采用 Apache 2.0 协议发布;数据集遵循其各自适用协议(如 ODC-BY);在无法重新分发的情况下,我们会披露数据的构建与混合方式。

综合来看,K2 Horizon 是迄今最全面的开源模型发布:

  • 跨越各规模的全新性能标杆。0.9B、3.7B 和 7B 模型在广泛使用的评测中均达到世界领先水平。搭载全新 Mixture-of-Value-Attention(MoVA)机制的 36B-A4B 模型在每活跃参数效能上表现卓越,超越了许多体量大得多的模型;32B 和 375B-A23B 模型在各自类别中也位列顶尖。这六款模型共同覆盖从边缘设备到企业级部署的广泛场景,提供具有竞争力的性能。
  • 首款面向智能体的完整开源模型系列。K2 Horizon 是首个通过智能体后训练完整公开开发流程的开源模型家族。通过在各阶段开放检查点、数据(或数据配方)、代码、配置和训练日志,K2 Horizon 使得研究推理、工具使用、规划和智能体能力如何涌现成为可能,支持复现创造这些能力的方法,并将其适配至新工具、新环境和新领域。
  • 六款模型覆盖从边缘到企业级全场景。 0.9B 模型专为手表、眼镜等资源受限的设备设计,而 3.7B 和 7B 模型则将先进能力带入手机及其他端侧应用。密集型的 32B 模型和稀疏的 36B-A4B 模型为本地工作站和高效推理提供了强力选择。375B-A23B 模型则将系列中最强的能力应用于严苛的企业级部署。六款模型均支持量化。
  • 一体化系列。 六款模型共享核心架构、词表、训练方法、接口、评估基础设施和部署工具(0.9B 模型采用较小的词表)。这种一致性也便于在不同规模间切换、动态路由任务,以及跨规模研究能力与效率。
  • 全尺寸性能领先全球

    Benchmark comparisons for all six K2 Horizon model sizes

    0.9B、3.7B 和 7B 三款模型在数学、推理、通用能力、代码和智能体任务等多个维度均达到同类别最优水平。

    36B-A4B 模型的表现超越了其活跃参数规模应有的预期,展现了我们独特的混合专家(MoE)架构在计算注意力时的效率优势。32B 和 375B-A23B 模型也在各自对比类别中位居前列。

    小型模型的表现尤为突出。K2 Horizon 0.9B 在 AIME 2026 中取得超过 48 分的成绩,同时具备强大的推理、工具使用和智能体能力。K2 Horizon 3.7B 和 7B 进一步将这些能力扩展到更复杂的软件工程和多步骤场景中,在 SWE-bench 和 BrowseComp 上均表现出色。尽管对于需要大量探索和反复纠错的复杂任务(如 TerminalBench 中的场景),最小模型仍面临挑战,但 K2 Horizon 在各个规模上不断拓展能力的边界。

    Horizon 系列为何重要

    一个透明但能力远落后于前沿的模型,作为基础的价值十分有限,即便是用于研究也是如此。与此同时,一款仅以最终权重形式发布的强大模型虽然可以运行,却让人难以了解其能力是如何被构建出来的。

    K2 Horizon 将两者融为一体。该系列提供极具竞争力的模型,并公开训练这些模型所使用的配方。研究人员可以在能力足够展现高级特性的模型中深入探索,开发者也能复现、适配和扩展这些方法,而不会把最终检查点当成一个黑盒起点。

    自 2023 年在 LLM360 论文 中提出全面开源原则以来,我们每年持续发布开源模型,并将这一承诺延伸至更大规模、更强能力,如今更通过智能体后训练覆盖完整生命周期。

    K2 Horizon 系列深度解析

    K2 Horizon 375B-A23B:企业级旗舰

    K2 Horizon 375B-A23B 是系列中规模最大、能力最强的模型。其稀疏 MoE 架构拥有 3750 亿参数的总容量,但每个 token 仅激活约 230 亿参数,从而在不必对每个 token 使用全部参数的情况下,仍能调动远超自身规模的模型容量。

    在通用、推理、代码和智能体评估中,该模型均跻身 4000 亿参数以下模型的顶尖行列。它专为对模型质量要求极高的场景而设计,包括复杂推理、软件工程、研究以及长周期智能体任务。

    与 Horizon 系列的所有模型一样,375B-A23B 并非以单一端点的形式发布,而是作为完整的开发树开放。其中的中间检查点和后训练分支清晰展示了基础模型如何逐步演化为推理、指令遵循和专业化智能体变体。

    K2 Horizon 375B-A23B benchmark comparisons

    K2 Horizon 32B 和 36B-A4B:本地部署的强劲之选

    Horizon 32B 是系列中性能最强的稠密模型,在能力、适配性和本地部署可行性之间实现了出色平衡,位列 400 亿参数以下稠密模型的顶尖行列。

    Horizon 36B-A4B 每 token 仅激活约 40 亿参数,性能却已接近稠密的 32B 模型。其高效性来自 MoVA——我们的新型稀疏注意力架构,以及 MoE 前馈层。

    这两款模型为研究稠密架构与稀疏架构在相似训练条件下的行为差异,提供了一个重要的参考基准。

    这些模型在本地部署的性能定位恰到好处——既能胜任复杂的推理、编程和智能体任务,又能在本地工作站和高效推理服务中实际落地。 K2 Horizon 36B-A4B benchmark comparisons

    K2 Horizon 7B、3.7B 和 0.9B:小规模的顶尖能力

    K2 Horizon 7B 和 3.7B 在推理、数学、编程、工具使用和智能体任务上表现优异,同时适合本地和设备端部署。在多项评测中,其表现接近甚至超越前代体积数倍的模型。

    K2 Horizon 0.9B 将许多相同的能力带入了资源受限的环境。它能够进行数学推理、使用工具并完成简单的智能体任务,同时保持紧凑,适用于手表、眼镜及其他边缘设备的量化部署。

    任务适配随规模变化:0.9B 模型最适合专注交互和轻量级工具使用,而 3.7B 和 7B 模型能够处理更复杂的编程和多步骤工作流。它们共同展示了如今多么强大的能力可以被保留在近乎随处可运行的模型中。

    K2 Horizon 7B, 3.7B, and 0.9B benchmark comparisons

    K2 Horizon 的设计

    从始至终的一家人

    Horizon 被设计为一个有机整体,而非孤立的模型集合。这六款模型共享核心架构决策、训练方法、接口、评估基础设施和部署工具链。这使得开发者可以更轻松地在不同规模间切换,也为研究人员提供了更可控的跨规模能力研究环境。

    每个模型都使用精心构建并详细记录的混合数据集进行预训练,训练 token 数约为 20 万亿。训练过程中会保存中间检查点及其细粒度日志,形成详细的模型发展记录。

    MoVA:用稀疏专家扩展注意力机制

    混合专家(MoE)的核心思想是在每个 token 计算量大致不变的前提下,扩大模型的整体容量。传统 MoE 架构将这种稀疏性主要应用到前馈层:虽然存在大量专业专家,但路由器只为每个 token 激活其中一小部分。 我们的新架构 **MoVA——Mixture-of-Value Attention(价值注意力混合)** 将这一原则拓展至注意力机制。注意力决定了 Transformer 如何整合上下文中的信息,而在这一环节引入稀疏性,为超越前馈网络之外进一步扩展模型容量开辟了新维度。 MoVA 将专家路由机制融入多头注意力,同时兼容 FlashAttention、分组查询注意力(grouped-query attention)和稀疏注意力等高效技术。 由此诞生的 **K2 Horizon MoVA 36B-A4B**:总参数量 360 亿,但每个 token 仅需约 40 亿活跃参数。在相同训练条件下,其性能仅略低于稠密的 Horizon 32B 模型,活跃参数却大幅减少。

    训练数据

    跨越六个规模的训练需要数据既足够广泛以支撑通用能力,又经过精心设计以在约 20 万亿 token 上维持质量。 Horizon 的预训练混合了多样化的网页、代码、数学、科学、多语言和领域专属来源,以及通过自有管线生成的合成数据。我们的关键数据创新之一是将推理能力直接融入预训练:预训练语料中近 17% 是带有显式推理过程的问题求解轨迹。数学任务的推理轨迹还被改写为对话和学习指南等格式。总体而言,预训练阶段共使用了约 10 万亿个合成 token。 我们的合成数据流水线调配了数百万组多样性调控参数与上下文种子组合,并通过内部搜索引擎在 pre-training 网页语料库中进行检索。为在语料库规模上量化 diversity,我们开发了一种自定义的 gzip 压缩度量方法,采用自适应步长机制,避免标准 gzip 指标随文档数量增长而快速饱和。如图所示,我们 synthetic data 的多样性度量已接近高质量原生网页文本,并大幅领先于网页代码。
    Comparison of diversity across training data sources
    本文详细记录了数据构成、synthesis pipelines 及 training mixture 的构建过程。遵循开源原则,在许可允许的前提下,我们直接公开可用于训练的 datasets;若受限于再分发条款,则公开数据来源说明、过滤与构建方法及混合配比。此举有助于研究者厘清各模型的训练数据源及其在整个 training 过程中的分布演进。 我们的 post-training data 从中期训练(mid-training)阶段起即开始引入,而非仅预留至训练末期。我们将合成的 long-context documents 与经 Chat template 格式化的 instruction-following、reasoning 及 Agentic trajectories 进行融合。post-training data 的核心支柱在于大规模 task synthesis——依托 task taxonomies、diversity knobs 及网页搜索种子,最终生成超 1 亿个 unique tasks。此外,我们还研发了 sampling techniques,在生成 training trajectories 时引导 Solver LLMs 收敛至正确答案与预期行为。

    Pre-training Dynamics

    每个 K2 Horizon checkpoint 均附带详尽的训练日志与细粒度历史记录,直观呈现大规模训练的动态演变:losses 走势、instabilities 的成因、各类干预手段的效果,以及各项 capabilities 的首次涌现节点。

    以训练记录的价值为例,K2 Horizon 的 3.7B、7B、32B 和 36B-A4B 模型均在完全相同的 22 万亿 token 上训练。将各模型的训练进度对齐,并以训练末尾 1% 阶段的损失中位数进行归一化后,它们的原始损失曲线近乎重合——如上图所示,这一规律跨越了稠密与稀疏架构,参数总量相差近一个数量级。尽管归一化操作本身会强制各模型终点一致,但并不会让早期和中期的轨迹强行重合。它们高度吻合的事实表明,在共享数据与相同训练配方下,学习曲线在不同规模的模型族中保持了高度一致性。

    Normalized pre-training loss trajectories across K2 Horizon model sizes

    这些检查点和日志共同构成了研究基础,使研究者能够深入探究哪些训练动态在规模与架构变化时具有可迁移性,哪些会出现分化,并将这些差异与特定的训练阶段、数据配比及技术决策联系起来。

    面向推理与 Agent 的后训练

    K2 Horizon 的大多数高级推理与 Agent 能力在后训练阶段涌现。完整流程涵盖中期训练(mid-training)、监督微调(SFT)、模型合并以及结合专用 Agent 训练的强化学习。该过程并非只产出单一最终对话模型,而是形成一棵发展树:不同分支分别专精于推理、编程、工具调用和 Agent 场景,同时与共同的基座检查点保持关联。

    我们公开各阶段的产物,以便研究者追踪各项能力在何处涌现、复现单个分支,并将相同方法适配到新工具和环境中。

    Uno Diffusion:即插即用的无损加速方案

    推理速度已成为一级优化目标,尤其在推理模型与智能体时代。随着模型输出更长的思维链并采取更多动作,即便每个token的微小延迟也会累积成可观的时延。然而自回归语言模型一次只能生成一个token,这构成了根本瓶颈。既有方案仅能部分解决该问题:推测解码通常需要单独训练的草稿模型,而离散扩散虽支持并行生成,却往往以质量换速度。

    Uno 旨在消除这一取舍。它提供无损推理加速,在不降低响应质量的前提下加速生成。Uno 保持 Horizon 的自回归参数冻结并全权负责模型的输出分布,而一组轻量级扩散参数只学习如何更高效地生成。

    通过我们称之为扩散蒸馏的过程,这些紧凑的适配器学会了并行生成token块。最终结果融合了自回归解码的质量保证与扩散的速度优势:模型达到相同的准确度,但以更快的速度达成。

    在我们的评测中,Uno 实现了优于主流推测解码系统及开放权重和闭源扩散语言模型的的速度–质量权衡。关键在于,其在所有测试批次大小下均保持收益,既能降低交互式智能体的延迟,也能提升大规模服务的高吞吐,且无任何模型质量损失和几乎可忽略的训练开销。Uno 以简单的LoRA 适配器形式交付,使无损加速易于采用:只需挂载适配器即可。

    构建和扩展 Horizon 的开放基础设施

    我们随模型一同发布构建 Horizon 所用的基础设施。目的不仅是让整套系统可复现,更是让其中开发栈作为新模型和新系统的基础具备可用性。

    此次发布的核心是xLLM——我们的生产验证训练基础设施。xLLM 将大规模训练性能与研究所需的灵活性相结合,使团队能够在不重建外围系统的情况下修改架构、数据配比、训练阶段和目标函数。

    我们还将发布完整的 agentic 后训练代码库,包含强化学习部分,希望能帮助研究人员推进相关领域的技术。

    研究人员可用这些组件检查训练行为或复现特定阶段。开发者可将 Horizon 适配到某个领域、添加新工具、训练 agent 专家,或通过统一接口部署多种模型规模。

    从开源到开放科学

    中间检查点将模型开发转变为可观测的科学过程。研究者得以考察能力何时涌现、训练选择如何改变行为,以及意外策略何时首次出现。

    Reward hacking 提供了一个发人深省的例子。当一个有能力的模型被置于真实的计算机环境并要求解决复杂任务时,那种让它变得有用的随机应变能力,同样可能诱使它去利用评估流程本身的捷径。为厘清这会影响 K2 Horizon 报告数据多少,我们借助 Artificial Analysis 的 reward hacking 审计流程 对发布模型进行了审核。

    K2 Horizon reasoning trace after finding a benchmark solution on GitHub
    JACKPOT 时刻:我们的模型在 GitHub 上找到了基准测试的答案,并对此表达了「兴奋」。

    TerminalBench 2.1 将模型置于沙盒计算机环境中,评估其完成复杂技术任务的能力。一个有能力的模型需要探索文件、调用工具、诊断失败并寻找替代方案。这种应变力正是我们所期望的。但偶尔它会越界:不是去解决预期问题,而是找到隐藏答案、利用任务留下的漏洞,或篡改评分器本身。

    我们在 89 个 TerminalBench 2.1 任务上运行了 K2 Horizon 375B-A23B,每任务 8 次尝试,共 712 次试验。其中 500 次通过了任务验证器(报告准确率为 70.2%)。随后,我们利用 Artificial Analysis 的 reward hacking 审计流程对所有通过的试验逐一审核,使用 harbor analyze 工具,以 reward_hacking 标准及其完整量表文本逐字匹配,并由 Codex gpt-5.6-sol 担任评判模型。

    审计共检出10个任务中的24个试验存在异常。剔除后准确率从70.2%降至66.9%,修正幅度为3.37个百分点。其余79个任务完全干净。作为参照,Artificial Analysis报告的Claude Fable 5异常率为2.2%,GPT-5.6 Luna为4.1%;K2 Horizon的3.37%处于同一量级。 该模型发现了多种作弊策略: - 推断自己处于公开基准测试中,在GitHub找到对应仓库并下载参考解答 - 从真实项目的公开仓库拉取当前源码,直接复制修复方案而非自行推导 - 探查未公开的文件、生成脚本或泄露的凭证 - 修改测试框架,或构造利用测试判分机制漏洞的输出 我们在K2 Horizon 7B上观察到了一个相关案例:它找到并下载了SWE-bench的答案,从而产出了虚高的82分。这个分数不能代表真实的软件工程能力,但该行为具有科学揭示意义:基准测试破解是更广泛的能力——包括规划、工具使用、环境探索和持久性——发展过程中的意外后果。 由于我们随最终模型同步发布中间检查点,这些行为得以被研究而非隐藏。研究者可以追踪某种策略首次出现的时间点,将其与训练变化关联,并量化其对报告性能的影响。 因此K2 Horizon不仅仅是一组模型权重。它是一个关于能力及其意外后果如何在训练全过程中演化的开放实验。

    立即开始使用K2 Horizon!

    所有六个K2 Horizon尺寸均以Apache 2.0许可证开源权重,并获得vLLM、SGLang和Ollama的零日支持。此外,K2 Horizon支持部署在NVIDIA、AMD和Cerebras硬件上,覆盖从本地推理到大规模服务的全场景。请访问我们的仓库获取模型:https://huggingface.co/IFM——下载模型、检视中间检查点、研究训练数据与配比、复现训练流程,或使用Horizon的代码与基础设施构建新模型和智能体。 K2 Horizon提供的不止六个最终模型。它为理解、适配和推进下一代AI系统提供了一份开放蓝图。

    完整结果表

    375B-A23B

    Full result table for K2 Horizon 375B-A23B

    36B-A4B

    Full result table for K2 Horizon 36B-A4B

    32B

    Full result table for K2 Horizon 32B

    K2 Horizon 7B

    Full result table for K2 Horizon 7B

    K2 Horizon 3.7B

    Full result table for K2 Horizon 3.7B

    K2 Horizon 0.9B

    Full result table for K2 Horizon 0.9B
    原始来源: Hacker News

    评论 (0)