← 文章 / AI技术
Hacker News 5小时前 · 2026-10-04 06:29:29 · 11 阅读

Kolibri:Aleph Alpha 发布的主权开放权重模型

Green gradient with the white Kolibri hummingbird logo and wordmark in the centre, framed by thin stepped outlines on the left and right

在德国统一日,我们发布了新模型:Kolibri。

Kolibri 是一个英德双语 Mixture-of-Experts Transformer,总参数量 78B,激活参数量 3B。它支持最长 1M token 的上下文长度。您可以在 Hugging Face 下载该模型的全部权重,并依据 Apache 2.0 许可协议使用。

Kolibri 是我们持续迭代模型训练工作的成果。我们首先搭建了模型训练流水线,并通过构建 Kolibri Origin 验证了该流水线——这是一款总参数量 30B、激活参数量 3B 的模型,其上下文窗口仅为 65k token。Kolibri 运行在同一套流水线上:从数据摄入与整理,到消融实验、预训练、后训练,直至最终评估。这使得我们能够运行数百个消融实验,并实现稳定的预训练,即使硬件故障或数据连接中断,也无需人工介入。我们持续监控训练指标,并为自定义基准测试标准化了监控流程。在构建和迭代这条流水线上投入的时间是一项宝贵的投资。Kolibri 相较 Kolibri Origin 的巨大提升,以及两者发布间隔之短,都印证了这一点。

Kolibri 是一款专为受限领域的关键任务打造的专用语言模型,覆盖公共行政、工业及航空航天等领域。我们在德语、推理、数学、Agentic 行为以及客户在生产环境中所需的其他能力方面对 Kolibri 进行了专门优化。这种专项优化的目的是提升客户特定使用场景下的性能。通过专项优化,客户可以在其 AI 运营中实现情境化性能,并监控其经济效益,从而确保 ROI 可衡量且随时间增长。

单靠专业化并不足够,主权同样关键。对我们而言,主权包含两个维度:模型的构建方式,以及向客户交付的方式。我们提供完整的供应链完整性,对从数据摄取、预训练、后训练到最终评估的每一个决策都进行溯源,确保全流程透明。客户拥有部署自由和知识产权安全,合规性也因此成为模型的固有属性。

完整细节请参阅我们的技术报告。

Kolibri 的价值交付

我们针对众多行业的特定领域语言、监管要求和程序现实,优化了 Kolibri 的跨领域性能。其小巧高效的规模让客户能够灵活地在本地高效运行,而无需将内部数据发送至第三方推理服务。本节的重点介绍了模型的各项能力,随后我们将在我们如何快速构建 Kolibri 章节中详述这些内容。

面向企业和政府的基础能力

在 Kolibri 中,我们优化了模型能力与部署成本之间的权衡,总参数为 78B,其中 3B 为激活参数。在英语和德语场景下,Kolibri 在质量与服务成本之间位于帕累托前沿。帕累托前沿是一个经济学概念,指两个目标之间可达到的最佳组合,即改善其中一个目标必须牺牲另一个目标。与对比的模型相比,没有任何模型能在相同的服务成本下提供更高的质量,或在更低的成本下提供相同的质量。

平均基准测试得分 [%]

英语

德语

  • Kolibri
  • Kolibri Origin
  • 其他后训练模型
  • 帕累托前沿
后训练模型在英语(左)和德语(右)上的性能与吞吐量对比。图中指标为各基准测试的无权重平均得分,横轴为每块 GPU 每秒解码的文本量。越靠上、越靠右表现越好。

在数学、编程、事实依据和长上下文任务上,Kolibri 的表现可以媲美活跃参数量最高达其四倍的模型,比如 Nemotron 3 Super。

  • Kolibri
  • Kolibri Origin
  • Qwen3.6-35B-A3B
  • Nemotron 3 Super 120B-A12B
  • Mistral Small 4 119B-A6B
查看具体数据
基准测试KolibriKolibri OriginQwen3.6-35B-A3BNemotron 3 Super 120B-A12BMistral Small 4 119B-A6B
AIME 202596.981.984.691.779.8
AIME 2025(德语)87.573.582.985.672.3
AIME 202696.081.591.090.483.1
AIME 2026(德语)90.075.284.487.578.5
GPQA (diamond)84.368.183.478.074.7
GPQA (diamond,德语)81.358.580.676.672.9
AA-Omniscience 指数-32.8-64.0-15.3-36.5-24.0
BrowseComp29.44.426.929.1–
τ³-bench banking38.15.710.615.55.7
τ²-bench retail69.958.571.667.562.9
τ²-bench airline76.758.770.772.740.0
τ²-bench telecom94.767.599.168.141.5
BFCL v4 总分61.436.467.261.058.0
LiveCodeBench v685.959.282.582.071.2
HumanEval+92.776.892.894.792.8
LongBench Pro64.5–70.862.956.4
AA-LCR68.3–69.767.052.3
Kolibri 的基础能力。Kolibri 是一款均衡的通用型模型,在数学、代码、长上下文、智能体能力及知识领域均具备竞争力的表现。基准测试分数采用统一的 0–100 分制,分数越高越好。

面向实际应用的场景化表现

公共基准测试无法覆盖特定行业的特殊需求,因此我们为客户关注的垂直领域——如德国公共部门、航空航天、制造业及汽车行业——开发了内部评估套件。每个套件都模拟了这些行业所需的技能、工作流及边缘案例,配合合成的训练环境,使我们在不接触客户数据的情况下,就能针对这些评估指标优化 Kolibri。详见场景化表现章节。

内部客户代理基准测试得分
  • 汽车零部件供应商 0.72 → 0.99
  • 半导体 0.35 → 0.80
  • 德国公共部门 0.54 → 0.75
  • 工业驱动技术 0.31 → 0.60
  • 航空航天 0.14 → 0.59
  • 单个检查点,单次评估
  • 当日均值
  • Kolibri 初始版
  • Kolibri
Kolibri 在内部客户代理基准测试中,经过多轮后训练后的场景化表现。散点代表单次训练检查点的评估结果,线条代表每日评估的平均值。在全部五个垂直领域,性能均呈上升趋势,分数越高越好。

基于您的文档提供有据可依的回答。我们在训练 Kolibri 时引入了拒答数据及 Merlin-Arthur 协议。因此,当上下文中没有答案时,模型会被训练得回答“我不知道”。客户高度重视并主动请求此功能,所以我们持续追踪并验证拒答的准确率。更多细节请参见溯源章节。

原生德英双语模型。 我们开发了德/英双语 tokenizer,并在模型训练全程注重纳入原生德语数据,使得预训练 token 中 21.3% 为德语。由于翻译文本往往带有源语言的文化印记,我们谨慎使用翻译数据(占比仅为 6%)。最终得到的是一个在设计上即为双语的模型,而非一个“读过些德语”的英语模型。更多详情见德语预训练数据和专用 tokenizer章节。

通过设计实现控制与合规:捍卫客户的主权

我们在构建 Kolibri 时,从底层架构就着眼于欧盟《人工智能法》(EU AI Act)、通用人工智能行为准则 以及 GDPR,并将版权法作为研发可信技术的重点。

我们对模型权重和训练数据筛选过程保持高度透明,让开发决策可见。通过其推理轨迹,模型得出结论的过程变得可解释。借助我们的Merlin-Arthur 协议,模型建立了可信度:当上下文不足以支持回答时,Kolibri 会拒绝作答。

我们的团队在德国构建了这款模型,训练所用的基础设施位于德国和芬兰,全程遵循欧洲和德国法律,不受任何外国控制。从数据筛选、预训练与后训练,到 Model Factory 中的优化,整条流水线都由我们自己掌控,这正是模型主权的基础。这种控制权也延伸到我们的客户手中——Kolibri 体积小巧,客户可以自由选择部署方式,还能调节推理强度,在成本、延迟与回答质量之间灵活权衡。

我们如何高速打造 Kolibri

我们的 Model Factory:两款模型,相隔三个月

Model Factory 是我们提升迭代速度的答案,目标是尽可能缩短从“发现模型哪里做错了”到“训练出做得更好的模型”所需的时间。我们把训练流水线实现为代码,让团队积累的经验沉淀成一份带版本管理的训练配方,而不是散落在各处的脚本和笔记。下面是 Kolibri Origin 到 Kolibri 之间的历程。

流水线的工作始于 1 月。经过 5 个月和数百次消融实验,Kolibri Origin 于 6 月 11 日在目标规模上完成预训练,Kolibibri 则于 9 月 11 日完成。在这三个月里,参数量从 30B 增至 78B,上下文窗口从 65k tokens 扩展到最高 1M,训练 token 数从 7.5T 增至 20T。为了得到这 20T 训练数据,流水线共处理了超过 200T 的原始数据 token,经过过滤、去重和精选,最终才成为实际用于训练的数据集。我们还改进了 attention 设计,专家数量增至三倍,提高了稀疏度,更换了路由算法,优化了后训练数据,环境任务数量翻了一倍多,并教会模型在四种不同的推理强度下工作。两款模型每个 token 激活的参数量相近,但得益于效率团队的出色工作,Kolibibri 每个 token 的训练速度比 Kolibri Origin 更快。

Kolibri Origin Kolibri
完成预训练2026 年 6 月 11 日2026 年 9 月 11 日
发布 未公开发布2026年10月3日
推理模式是(仅限一种模式)是(无、低、中、高)
总参数规模306亿781亿
每 token 激活参数32.7亿34.6亿
预训练 token 量7.51万亿20万亿
层数50 层(2 层稠密 + 48 层 MoE,1 个共享专家)50 层(全 MoE,1 个共享专家)
预训练上下文长度8,192(8k)16,384(16k)
最大训练长度65,536(64k)262,144(256k)
分词器词表96,000128,000
模型维度2,0482,560
注意力头数(查询 / 键值)32 / 448 / 4
专家数(总 / 激活)128 / 8384 / 6
专家隐层维度768512
注意力模式全注意力,所有层滑动窗口(512)+ 每 5 层全注意力
知识截止英文:2024年9月1日,德文:2025年8月1日英文/德文:2026年6月18日

支撑这一切的是我们的训练流水线:将研究级的模型开发转化为全自动化的生产级基础设施,用于设计和训练大语言模型。流水线代码库已向所有人开放共享。每次提交的代码变更都会触发一次小型端到端模型运行——训练与评估,从而在数分钟内确认是否有功能被破坏。每次运行都是 GitHub Actions 工作流,复现一次只需 checkout 对应的 commit。该流水线既用于主训练,也用于为架构设计与数据配比决策服务的大规模消融实验。

训练检查点大约每小时保存一次,流水线会自动在英文和德文知识、数学、代码、指令遵循、工具使用、长上下文、安全性、幻觉拒答及信息溯源等维度上评估这些检查点。我们每天都在见证能力的涌现,而无需等到训练结束才知晓模型表现。整个训练过程的稳定性超出预期。在 Kolibri 长达 21 天的预训练阶段,我们遭遇了 38 次非计划中断,平均每万 GPU 小时约发生一次,均由硬件故障或连接超时引起。流水线自动处理了这些中断,无需人工介入。集群自动在另一组节点上重启训练任务,并从最多回退 250 步的检查点恢复训练。

掌握整条流水线并让检查点对所有人开放,意味着任何团队都能端到端地负责某项能力,而非仅仅负责装配线上的一个环节。一个团队将训练和评估 Kolibri 的信息溯源能力作为整体工作独立承担,并无缝集成到整体模型中。

然而,这一过程并非一帆风顺。我们曾遭遇挫折。在完成几万亿 token 的 Kolibri Origin 预训练后,我们中止并从头重启,因为发现一个数据洗牌 bug 逃过了测试。我们还进行了消融实验,做出决策,随后却因配置中的 bug 或错误而不得不重新运行部分实验。结合自身经验,我们持续跟踪最先进架构、最佳实践及 LLM 领域的最新研究进展。这些积累的经验推动了流程改进和流水线护栏的优化。

对比 Kolibri Origin 和 Kolibri 的差异,性能提升显著,但这属于容易实现的方向:更多参数、更多数据、成熟的架构族,且仍处于小规模阶段。随着我们考虑扩大规模,面对基础层面的挑战我们也感到欣慰。但我们今年构建的最持久资产并非流水线,而是一支经过验证的团队,具备以高速从原始数据出发构建、后训练并交付 LLM 的能力。

架构与预训练

Kolibri 总参数量为 78B,是 Kolibri Origin 的 2.5 倍,活跃参数约 3B。实验中,我们把模型从 32B 扩大到 123B,性能持续提升,但更大的规模也带来了更高的训练和推理成本。成本决定了最终选择:123B 在两张 H100 上只能同时处理 3 个 256k token 长上下文请求,而 78B 能处理 18 个并发请求,解码速度还快 28%。我们选用了 384 个小型专家而非少量大专家,因为后者在我们的测试中表现更好。注意力机制同样贯彻了效率优先:50 层中只有 10 层处理完整上下文,其余 40 层使用紧凑的 512 token 聚焦窗口,这样无论上下文多长,这些层的解码计算量和内存占用都有上限。效率提升既有利于部署训练好的模型,也有利于后训练 RL——后者依赖海量的推理。

Kolibri 在 768 块 B200 GPU 上分三个阶段训练:先是 21 天、16k 序列长度的 20T token 预训练,接着是 64k 序列长度的 3.44T token 中期训练,最后是 256k 序列长度的 200B token 长上下文适配,总计近 24T token,约为 Kolibri Origin 的三倍。预训练数据中德语占比超过五分之一,约 4.3T token,英语约 62%,代码约 14%。与预训练不同,中期训练的数据池筛选更严格,以精选数据集为主,侧重推理、问题求解、代码和 agent 相关数据。长上下文训练方面,我们没有只用长文档训练——那样往往会损害之前学到的能力——而是把长文档与上一阶段的高质量中期训练数据交错混合。此外,我们从长上下文数据中剔除了合成的长文档,以免在 RULER 这类基准上产生虚高的成绩。

与处理 Kolibri Origin 时一样,我们采用 Muon 进行优化。我们将训练稳定性作为重点,结果两个模型都经历了稳健的训练过程,未出现任何损失尖峰。在 Kolibri 中,针对训练期间的专家路由,我们引入了精确的分位数平衡。分位数平衡最早由 Kimi K3 提出,当时由于精确计算被认为通信成本过高,因此通过直方图来估算全局分位数;我们证明了可以在与批次大小无关的固定成本下精确计算分位数,且这种精确性能够同时改善负载均衡和模型质量。

大规模后训练

后训练分为两个阶段;第一阶段是监督微调,用于培养模型的核心推理能力和聊天交互方式,随后进行大规模强化学习,使模型学会处理多样化的长周期任务。我们为这两个阶段都构建了流水线,从而能够对模型行为实施细粒度控制。

在监督微调中,我们生成了共计 1740 亿个令牌的合成数据,经过质量筛选后,与许可宽松并经过过滤的开源数据集版本相结合,最终得到 2680 亿个令牌的高质量混合训练集。在强化学习方面,我们基于一组包含逾 120 万个精选任务的广泛环境进行训练,涵盖代码与数学推理、智能体任务、指令遵循、问答、工具调用等多样领域。我们对内部训练代码库进行了高性能优化,并采用异步训练方法:即使用当前模型并行生成训练数据,同时利用已生成的数据训练模型。

在这两个阶段中,我们教导模型在不同努力等级(无、低、中、高)下进行推理。这意味着用户可以控制模型为解决当前任务应投入多少计算资源。这使得我们的客户能够在成本、推理速度和最终答案质量之间进行权衡。

德文预训练数据

我们在小型代理模型上的实验发现,使用约 20% 的德语数据训练能获得最佳效果。这意味着,若要在 20T token 的训练量下实现该比例,我们需要找到 4T 的德语 token。现有的开放德语数据集虽然有用,但远远不够:经过去重和过滤后,我们只剩下 390B 德语 token,远未达到目标。正如我们在《Sauerkraut, Not Burgers》一文中论证的那样,德语能力必须来自高质量的德语文本;过度依赖机器翻译会因细微的翻译错误和缺乏地道的德语文化语境而导致糟糕的结果。我们通过三种方式弥补了 token 缺口。

第一种方式是自行从 Common Crawl 中筛选德语数据。我们构建了一条专门针对德语数据的处理流水线。德语不同于英语,德语数据也不能像英语数据那样进行过滤:我们必须针对德语重新调整过滤参数。语言数据流水线中一种常见的过滤器是删除长词过多的文档,但德语的行政文书通常超出了英语的平均词长界限,因此标准设置会悄无声息地剔除政府公文所使用的那种语体。重新调参后,我们的德语流水线产出了 1.3T 唯一的德语网络原生 token。

第二种方式是对已有的德语文档进行改写。LLM 将一篇原生德语文档改写为百科词条、问答对话或段落等形式,同时保留其内容。这能让模型以多种表层形式学习相同的事实,从而倍增稀缺数据中蕴含的信息量。这与翻译不同:源语言是德语,因此主题和文化亲近感保持德语特性:比如是“总理”(chancellor),而非“总统”(president)。它并没有增加太多新知识,而是为语料库中已有的知识提供了新的表述方式。改写为我们提供了约 1T 唯一的 token,使其成为模型中德语来源的最大单一贡献者。

第三项任务是翻译,只用于 Kolibri Origin。只要模型、提示词和分块策略都选得合适,英译德是可以行的,但它有两个问题。一是输出仍可能带翻译腔——把习语直译出来,比如 "Drive safe!" 会译成 "Fahre sicher!",而不是地道的 "Komm gut an!"。更重要的是,文化背景是翻译不过来的。从英语语料翻译过来的语料,会继承英语互联网在地域、人群和机构上的分布,所以用它训练出来的模型,说的是德语,描述的却是一个美式世界。

最终,德语以 2.4T 唯一 token 的规模进入 Kolibri,其中 80% 由我们整理或生成,20% 来自开放数据集,模型在预训练中有 21.3% 的 token 是德语——通过上采样,在 20T 的总训练量中约合 4.3T。每个德语 token 平均被看了 1.8 次,远低于四轮的上限,超过这个上限重复训练就不再有收益。模型读到的德语约 85% 是网页文本,要么是原生采集,要么是从原生文本改写而来。其余是人工整理的文档——议会记录、法律文本和其他公共领域数据——再加上那一小部分翻译语料。

专用于英德双语的特殊 tokenizer

我们构建了一个英德双语 tokenizer,并在每个模型的预训练数据上训练和特化。由于数据中德语占比达 21%,它对德语的压缩效果优于其他 SOTA 模型,从而让推理更高效(token 更少),既降低成本又缩短响应时间。我们还提出了一种新的 tokenizer 训练方法 UniBPE,它比现有方法更尊重语言的形态结构——尤其是德语的复合词结构——同时不牺牲英语的 token 效率。

德语网页 (FineWeb-2)

  • Kolibri 词表 128,000 4.90
  • Kolibri Origin 词表 96,000 4.69
  • 普通 BPE 128k 128,000 词表 4.89
  • GPT-5 200,019 词表 4.35
  • DeepSeek V4 129,280 词表 3.72
  • Kimi K3 163,586 词表 3.28
  • GLM 5.3 154,856 词表 3.93
  • Qwen3-Next 151,669 词表 3.59
  • Qwen3.5-3.8 248,077 词表 4.17
  • Gemini 262,144 词表 4.13
  • EuroLLM 128,000 词表 4.08
  • Tekken (Mistral, Nemotron, Apertus) 131,072 词表 4.03

英文网页 (FineWeb)

  • Kolibri 128,000 词表 4.58
  • Kolibri Origin 96,000 词表 4.50
  • 普通 BPE 128k 128,000 词表 4.59
  • GPT-5 200,019 词表 4.67
  • DeepSeek V4 129,280 词表 4.59
  • Kimi K3 163,586 词表 4.62
  • GLM 5.3 154,856 词表 4.61
  • Qwen3-Next 151,669 词表 4.52
  • Qwen3.5-3.8 248,077 词表 4.47
  • Gemini 262,144 词表 4.49
  • EuroLLM 128,000 词表 4.16
  • Tekken (Mistral, Nemotron, Apertus) 131,072 词表 4.45
分词器压缩率(以每个 token 的平均字节数衡量),测试文本为德语和英语网络语料。在本次对比中,Kolibri 在德语压缩率上表现最佳。纯 BPE 128k 指在相同数据上、使用与 Kolibri 相同配置训练的常规 BPE 分词器,用以隔离训练方法本身的影响。每个 token 包含的文本越多,执行任务所需的 token 数就越少——数值越高越好。

训练分词器的两大主流方法是 BPE 和 Unigram。我们将二者结合,保留 BPE 的自底向上合并方式,同时采用 Unigram 的训练目标来决定向词表中添加哪些合并项。在 128k 词表规模、基于英德数据集训练的条件下,该方法显著提升了分词效果。

Bundessozialgerichtes 联邦社会法院(第二格)

  • Kolibri Bundes sozial gericht es
  • GPT-5 Bund ess oz ial gericht es
  • Qwen3.8 Bund ess oz ial gericht es
  • Gemini Bund ess oz ial gericht es
  • Mistral Medium 3.5 · Nemotron 3 Nano Bund ess oz ial gericht es

silkworm(蚕)

  • Kolibri silk worm
  • GPT-5 sil kw orm
  • Qwen3.8 sil kw orm
  • Gemini sil kw orm
  • Mistral Medium 3.5 · Nemotron 3 Nano sil kw orm

日志数据

  • Kolibri Protokoll daten
  • GPT-5 Pro tok ol ld aten
  • Qwen3.8 Protokol ld aten
  • Gemini Protok ol ld aten
  • Mistral Medium 3.5 · Nemotron 3 Nano Pro tok ol ld aten

协处理器

  • Kolibri co processors
  • GPT-5 cop rocess ors
  • Qwen3.8 cop rocess ors
  • Gemini cop rocess ors
  • Mistral Medium 3.5 · Nemotron 3 Nano cop rocess ors
不同分词器如何处理同一词汇。Kolibri 分词器遵循语言的形态结构,英语和德语词汇被切分为有意义的单元,而竞争对手的切分则跨越词素边界。数值越低越好:每个单词产生更少、更干净的切分,意味着 token 数量更少。

接地性:减少幻觉

常见的 LLM 训练和评估机制在奖励“猜测”:猜中正确答案有一定概率,而拒答则没有。因此,模型学会用仅有的信息作答,即使输入信息不足以支持回答。要求模型提供引用往往事与愿违,原因相同:模型可以凭空捏造看似合理的来源,来为没有依据的答案背书。

对于受监管的客户,一个知道何时该拒答的模型,是区分“试点”和“正式部署”的关键。我们将“我不知道”视为一项重要的模型能力,并(1)开发并追踪专门的接地性和反幻觉指标,(2)使用并开发专门的训练流程来提升这种拒答能力。

在训练中,我们会使用正确答案为“我不知道”的训练样本。虽然针对拒答能力的微调正在业内逐渐兴起,但高质量的负样本依然稀缺——尤其是在客户所在的垂直领域,那里本身就数据匮乏。为此,我们还采用了自主研发的 Merlin-Arthur 流程(详见我们的博客文章)进行训练。该流程通过在每个训练步骤中自动挖掘模型的弱点来解决数据稀缺问题,并从现有文档中生成合成的负样本。这种训练本质上是一个三方博弈:Arthur 是我们要训练并交付的模型;Merlin 基于已有文档上下文生成新的上下文,让 Arthur 更有可能答对;Morgana 则从文档中剔除关键证据来构造新数据点,诱使 Arthur 产生幻觉。Arthur 并不知道自己面对的是谁,因此他的最优策略就是仔细阅读问题和上下文——既要在 Merlin 提供的上下文中给出正确答案,又要识别出 Morgana 删改后的上下文必须拒答,此时任何猜测,哪怕碰巧猜对,都算错误。

在衡量幻觉拒答能力时,我们既使用成熟的基准测试,也使用基于客户实际场景构建的自有代理指标。我们还开发了自有的“M/A grounding score”(M/A 溯源得分),它由 Merlin-Arthur 训练流程自然产生,代表答案中可证明来自文档部分的下限。

Kolibri 比 Kolibri Origin 的幻觉问题少得多:在 AA-Omniscience 测试中,面对 44% 的题目它选择拒绝回答而非给出错误答案(Kolibri Origin 仅 15%);在 RGB 基准测试中,Kolibri 更频繁地保持克制(86% vs 74%),编造虚假信息的情况也明显更少(87% vs 76%)。在我们自研的 M/A 接地评分 中,该指标用于认证而非估算回答内容源自文档的比例,Kolibri 得分为 0.23,而 Kolibri Origin 及部分其他模型的得分均为 0。

  • Kolibri
  • Kolibri Origin
  • Qwen3.6-35B-A3B
  • Qwen3-Next 80B-A3B
  • Nemotron 3 Super 120B-A12B
  • Mistral Small 4 119B-A6B
Show the numbers
BenchmarkKolibriKolibri OriginQwen3.6-35B-A3BQwen3-Next 80B-A3BNemotron 3 Super 120B-A12BMistral Small 4 119B-A6B
AA-Omniscience Non-Hallucination Rate44.014.856.712.313.934.7
RGB: holds back85.673.979.681.374.682.3
RGB: invents nothing87.375.684.383.986.087.0
FRAMES71.265.774.768.974.971.9
M/A grounding score0.230.000.120.000.000.06

场景化性能表现

大多数公开基准测试无法反映垂直行业的特定需求。为了衡量场景化性能——即模型处理特定行业独特工作流和领域知识的能力——我们需要关注那些对客户至关重要的专业化领域,例如德国公共部门、法律、硬件、消费电子以及汽车行业。

为此,我们首先构建了领域专属的评测套件,以模拟关键行业所需的技能、工具调用、工作流及边界情况,从而捕捉模型在特定上下文中的实际表现。随后,我们生成了涵盖这些核心技能的高质量专业合成数据,以此搭建训练环境。为了增强模型在这些任务上的鲁棒性,我们还对具体细节(如工具、配置、测试框架)进行了随机化处理。

这套流程共同构成了一个迭代引擎,使我们能够不断打磨模型的 Agentic RAG 能力与领域逻辑,并在上下文评测中持续优化性能,且全程无需使用客户数据进行训练。

这些评测套件作为流水线的一部分自动运行:每当新的检查点生成时,系统会立即对其进行评分。Kolibri 在众多开源权重模型中表现优异。在 Agentic RAG 基准测试 Honeypot 上,Kolibri 超越了所有对比模型,包括参数量大得多的 Nemotron 3 Super 和 Mistral Small 4。在清理后的 Agentic RAG 基准测试 MuSiQue 上,除表现最佳的 Nemotron 3 Super 外,Kolibri 位列第二,且远远领先于其他模型。在五项客户应用测试中,Kolibri 在四项中取得领先或持平于最佳模型的成绩。这些结果表明,我们具备处理多种数据及框架配置的能力,适应不同的使用场景,而对比模型对这类细节较为敏感。

这些衡量上下文性能的评测之所以存在,是因为客户向我们反馈了其应用的不足之处。每一项评测都源自我们从这些沟通中获得的洞察:哪些文档至关重要、模型应配备哪些工具、哪些问题具有挑战性、当前部署的系统在哪些环节让用户感到困扰。这种双向交流非常具体:当客户展示一个失败案例时,我们会将其转化为基准测试,用于衡量未来的每一个检查点。这样,我们既能持续优化目标性能,又无需在客户数据上进行训练,避免了过拟合风险。

  • Kolibri
  • Kolibri Origin
  • Qwen3-Next 80B-A3B
  • Qwen3.6-35B-A3B
  • Nemotron 3 Super 120B-A12B
  • Mistral Small 4 119B-A6B
查看具体数据
基准测试KolibriKolibri OriginQwen3-Next 80B-A3BQwen3.6-35B-A3BNemotron 3 Super 120B-A12BMistral Small 4 119B-A6B
MuSiQue(清洗后)77.342.750.561.279.166.8
Honeypot80.825.313.574.368.868.1
半导体80.435.341.279.469.662.7
德国公共部门75.054.029.572.078.050.0
航空航天58.914.148.159.054.947.0
汽车供应商99.072.484.292.691.087.1
工业传动技术60.031.432.759.537.356.8

基准测试

所有基准测试均使用我们自研的评测框架运行,并在适用情况下让各模型使用最高的推理力度。

原始来源: Hacker News

评论 (0)