← 文章 / AI技术
Hacker News 45分钟前 · 2026-09-03 13:52:46 · 2 阅读

Quasar 438B:欧洲最强AI大模型

Quasar 438B 是我们的旗舰推理模型,专为企业级智能体和代码生成而构建。这是 Multiverse Computing 发布的第一个大模型,支持英西双语,在 Artificial Analysis Intelligence Index 综合评分达 43 分,成为该领域欧洲模型的最高分。 Intelligence Index v4.1.1 综合了九项评测:GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience 与 AA-LCR。Quasar 以 43 分领先于 Mistral Medium 3.5(30 分)、NVIDIA Nemotron 3 Ultra(38 分)和 Inkling(42 分),而该榜单由 Claude Opus 5(63 分)领跑。 Quasar 不仅聪明,而且快速。连同推理时间在内,生成 500 个 token 仅需 15.3 秒。对比列表中仅有三个模型速度更快,且只有一个——Gemini 3.7 Flash——在综合评分上超过 Quasar。在得分高于 Quasar 的模型中,仅有两个能在 25 秒内完成响应,其余则需要 38 至 156 秒不等。 Multiverse Computing 一直致力于让 AI 更高效、更易部署。Quasar 将这一理念带入了 4000 亿参数以上的大模型阵营:这是一款针对多步任务的推理模型,支持规划、工具调用、代码执行与大上下文,同时摆脱了此类规模模型通常伴随的高延迟。 该模型已通过 CompactifAI API 上线,团队无需搭建基础设施即可进行测试。 **得分最高的欧洲模型** 图 1. Artificial Analysis Intelligence Index v4.1.1,九项评测的综合得分,越高越好。 Quasar 综合得分为 43,领先于 Mistral Medium 3.5 达 13 分,领先于参数量多出 1120 亿的 Nemotron 3 Ultra 达 5 分。 **前沿级别的速度** 图 2. 端到端响应时间:输出 500 个 token 所需秒数(含推理时间),越低越好。 Quasar 用 15.3 秒完成 500 token 的响应。对比中另外三个更快的模型分别是 Nemotron 3.5 Lightning(9.4 秒,得分 24)、Gemini 3.5 Flash-Lite(10.8 秒,得分 37)和 Gemini 3.7 Flash(11.5 秒,得分 56)。只有最后一个同时更快、更强。 反过来读数据则差距更大:Quasar 得 43 分耗时 15.3 秒,Mistral Medium 3.5 得 30 分耗时 18.8 秒,Nemotron 3 Ultra 得 36 分耗时 25.7 秒,Inkling 得 42 分需要 48.3 秒——超过 Quasar 438B 的两倍还多。 在与 Mistral Medium 3.5 的对决中,Quasar 在两个维度上都领先:得分更高(43 比 30),响应更快(15.3 秒比 18.8 秒)。 **长上下文推理** *图 3. AA-LCR 得分,越高越好。* Quasar 在 AA-LCR 上取得 75.0 分,该测试考察从长篇文档中提取、关联和推理信息的能力。这与 Grok 4.6(高配版)的 75.0 分持平,距 Claude Opus 5 的 75.7 分仅差一点,也接近 Qwen3.8 2.4T A95B 的 75.3 分。它领先 Nemotron 3 Ultra 4.0 分,领先 Mistral Medium 3.5 9.7 分。 长上下文处理能力是企业研究、文档分析和 agentic 工作流的基础,而 Quasar 正是在这一领域最接近前沿团队。 **Agentic 编码与终端工作** *图 4. Terminal-Bench v2.1 得分,越高越好。* Quasar 在 Terminal-Bench v2.1 上取得 69.3 分,该基准在真实终端环境中检验 agent 的工作能力。它领先 Mistral Medium 3.5 18.7 分,领先 Nemotron 3 Ultra 15.4 分,但落后由 Claude Opus 5(89.1 分)领衔的前沿团队。这是 Quasar 最具提升空间的评估项,也是下一阶段工作的重点。 **四项结果一览**

表1. Quasar 438B在四张Artificial Analysis图表上的表现。来源:Artificial Analysis。

专为企业级代理与编码而构建

Quasar面向部署软件开发代理、技术助手、研究系统和工作流自动化的企业打造。Terminal-Bench和长上下文测试结果表明,该模型能有效支持需要维持上下文、协调操作并处理多步骤任务的代理场景。其响应速度足以支撑交互式产品内的实时循环,而非仅用于批量作业。

支持英语和西班牙语,使Quasar成为欧洲及国际企业的实用基石——无需将部署局限于单一语言即可获得推理能力。团队可在工程、运营和知识工作等多种场景中部署,只要准确性、上下文理解和可靠的任务完成度能决定最终产出。

Quasar将带来更多更新,敬请期待。

立即上手

CompactifAI API。 注册并开始发送请求:dashboard.compactif.ai

Artificial Analysis。 查看基准测试数据

联系我们。 也可通过 business@multiversecomputing.com 联系我们的团队。

原始来源: Hacker News

评论 (0)