← 文章 / AI技术
InfoQ 2小时前 · 2026-08-22 03:14:27 · 1 阅读

神秘“Ox Alpha”突袭 OpenRouter,性能超过 Fable 5?全网盲猜智谱 or 小米

电影圈的“牛来”刚刚火遍全网,大模型圈也来了一头身份不明的“牛”。

今天上午,OpenRouter 没有举行发布会,也没有公布技术报告,只用一个忍者表情放出了一款代号为“Ox Alpha”的神秘模型。“Ox”在英文中正有“牛”的意思,于是,一场属于 AI 行业的“牛来”也开始了。

OpenRouter 对这款神秘模型的介绍很短,基本就一句话概括了:这是一款面向高效编程、长时间 Agent 任务和真实生产环境的前沿模型,拥有 100 万 Token 上下文窗口,同时支持文本、图像和视频输入。

除此之外,模型参数、训练数据、架构、基准成绩以及开发团队全部处于保密状态。

神秘模型 Ox Alpha 引发热议

目前能够确定的是,Ox Alpha 并不是 OpenRouter 自己开发的模型。OpenRouter 只负责将用户请求路由给背后的第三方供应商,而后者选择在预览期间保持匿名。

这让 Ox Alpha 在上线几小时后迅速变成一场大型“猜模型”游戏。

从 Google Gemini、小米 MiMo V3 到腾讯混元新模型,不同猜测陆续出现。

更重要的是,在人们试图识别它到底是谁之前,OpenRouter 表示它目前是免费的。

根据 OpenRouter 公布的信息,Ox Alpha 的完整模型标识为:

stealth/ox-alpha

它是一款以推理和编程为主要方向的模型,重点面向三类任务:长周期软件工程、复杂推理,同时结合文本与视觉信息的 Agent 工作流。

据介绍,Ox Alpha 拥有超 100 万 Token 上下文窗口,最大输出长度达到 13 万 Token。

这意味着,它理论上可以一次读取规模较大的代码仓库、长时间积累的 Agent 执行记录,或者由文本、图片和视频共同组成的复杂任务。

模型支持文本、图片和视频输入,但输出形式仍然只有文本。

值得一提的是,在 Ox Alpha 介绍页面的 FAQ 部分,有一个问题是问 Ox Alpha 是否支持工具调用和结构化输出?

显示的回答是:它能够支持工具调用、tool_choice以及 JSON 格式的结构化输出,不过暂不支持严格的 JSON Schema 约束。

这些特征说明,Ox Alpha 并不只是面向聊天或单次代码补全,还可能是为了 Coding Agent 准备的执行模型。

长时间 Agent 任务对模型的要求,与普通编程问答并不相同。

它不仅要生成一段正确代码,还需要持续读取文件、调用工具、跟踪修改状态、运行测试,并在失败后重新规划。如果上下文稍长就忘记目标,或者连续调用几次工具后开始偏离任务,即便模型在代码基准上得分很高,也很难真正进入生产环境。

OpenRouter 因此没有把 Ox Alpha 描述为单纯的“代码模型”,而是反复强调“sustained agentic work”,即能够持续进行的 Agent 工作。

截至目前,OpenRouter 页面显示,Ox Alpha 的中位首 Token 延迟约为 1.95 秒,输出速度约为每秒 49 Token,最近三天的可用率接近 100%。

不过模型刚刚上线,这些数据的采样周期和调用规模都非常有限,后续很可能继续变化。

更值得注意的是,OpenRouter 没有公布任何 SWE-bench、Terminal-Bench 或其他编程与 Agent 基准成绩。

换句话说,OpenRouter 使用了“frontier model” 这一定位,但目前还没有公开证据证明 Ox Alpha 在性能上已经进入 GPT、Claude 或 Gemini 旗舰模型所在的第一梯队。

它究竟是新的旗舰模型,还是针对速度、成本和 Agent 任务优化的中型模型,根据已知信息,还暂时无法判断。

不过,这款模型目前虽然还不知道出自谁手,但最大的好处是,它现在免费呀!

Ox Alpha 目前在 OpenRouter 上的输入和输出价格均为零。

对于一款拥有 100 万 Token 上下文、支持视频输入和工具调用的模型而言,完全免费的 API 并不常见。

作为对比,同样拥有百万级上下文的 Gemini 3.7 Flash,在 OpenRouter 上的价格为每百万 Token 输入 0.375 美元、输出 1.875 美元;GPT-5.6 Sol Pro 则为每百万 Token 输入 2.5 美元、输出 15 美元。

不过,Ox Alpha 的免费并不是永久定价。

OpenCode 随后宣布,Ox Alpha 将在其平台上免费开放一周,提供较宽松的速率限制和接近无限的使用额度。

OpenCode 发文称他们为这次测试准备了每天 100T Token(Trillion,表示万亿)的容量,其联合创始人 Dax 在 X 上向开发者喊话:“快来猜猜是啥模型吧!”

有一说一,100 万亿 Token 确实是一个很有诚意的公开测试邀请了。

这意味着,隐藏在 Ox Alpha 背后的模型厂商可能不只是想收集几百条聊天反馈,而是希望观察模型在真实 Agent Harness、代码仓库和长周期任务中的表现:它会在哪些工具调用中失败,面对多长上下文开始遗忘,连续修改几十个文件后是否仍能维持目标,以及开发者最终是否愿意继续使用。

测试效果如何?

模型放出后,在国外技术社区引发了一波集中测试。

在 X 平台,有用户测试过后,表示用起来很不错。

还有用户拿出了最难的 AI 测试题——鹈鹕骑自行车 SVG 任务。

该用户对 Ox Alpha 的不同推理档位进行了 15 次对照测试:在相同提示词、相同温度下,分别以 low、high 和 max 三档推理强度各生成 5 次。

从结果看,模型基本都理解了任务,能够稳定画出鹈鹕、自行车、车轮和骑行动作,说明其代码生成与空间关系表达具备一定稳定性。

但仔细观察仍能发现,部分样本中鹈鹕的腿没有踩在踏板上,车架结构不完整,翅膀、身体与车把之间也偶尔出现不合理连接。

更值得注意的是,推理强度提高后,质量提升并没有与计算开销保持同步。

low 档通常只需约 13 至 21 秒,推理字段几乎为空或只有十几个字符。

high 档耗时仍维持在 19 至 23 秒左右,画面细节和结构一致性有所改善。

最后到了 max 档,模型的推理字段骤增至约 1.7 万至 6.2 万个字符,单次生成耗时也拉长至 124 至 355 秒,Token 消耗最高超过 2.6 万。

最终图像确实增加了云朵、太阳、头盔、速度线和更复杂的车轮结构,但核心构图并没有出现同等幅度的提升,个别样本甚至仍存在脚与踏板错位、车架比例失衡等问题。

这组测试其实很能说明问题:一是它能够比较稳定地完成需要生成可视化代码的任务;二是其最高推理档位存在明显的“过度思考”倾向——模型花费数十倍的推理字符和十几倍的时间,换来的主要是装饰细节,而不是结构准确性的根本改善。

另一部分用户更关注它是否适合 Agent 任务。

有人表示,Ox Alpha 能够在经过两次需求澄清后,完成自己预期的功能;也有人尚未开始测试,就已经因为免费额度和百万上下文把它接入 OpenCode。

还有用户把注意力放在“100 万亿 Token”上,认为这更像一场公开压力测试,而不是常规产品发布。

社区中目前比较一致的态度是:免费、上下文足够长,可以尝试;但在身份、稳定性和真实能力得到确认之前,不适合仅凭“frontier”标签替代成熟的生产模型。

这种谨慎并非多余。OpenRouter 此前已经上线过多款 Alpha 匿名模型。社区往往会在发布初期把它们猜成下一代 GPT、Gemini 或 Grok,但模型身份揭晓后的实际定位,未必与最初的想象一致。

免费开放还带来了另一个现实作用:为模型进行极大规模的真人压力测试。

相比模型厂商自己设计的 Benchmark,开发者会把模型接入 OpenCode、Claude Code 类 Harness,放进真实项目,要求它修复依赖冲突、阅读混乱代码、操作终端、浏览网页,甚至连续工作几个小时。这些失败案例对准备正式发布的模型厂商可能比排行榜分数更有价值。

免费并不是没有代价,只是测试费用由模型公司承担,开发者则贡献真实任务和反馈。

此外,在 x 上,有用户对该模型与其他模型进行了更详细的对比测试,该用户让 Ox Alpha 在 10 个具体的任务中跑一遍。

从结果看出,Ox Alpha 最终通过 8 个、失败 2 个,因此是 80%。

其他模型每个任务测试了 4 次,有的模型在 4 次任务中全部成功,有的任务某个模型成功 2 次;

还有的全部失败了。

最后一行是这 10 项任务的平均通过率:

  • Fable 5:65%

  • GLM-5.3:62%

  • GPT-5.6 Sol:52%

  • Grok-4.6:62%

  • Ox Alpha:80%

从表面结果看,Ox Alpha 在这 10 项任务里排名第一,比第二名 Fable 5 高 15 个百分点。

综合结果来看,Ox Alpha 表现出了接近甚至超过前沿模型的潜力,但样本太少,测试口径也不完全一致,也不能直接判断它已经击败 GPT、GLM 或 Fable。

在这条测评贴下面,一些用户看到结果后评论,“感觉把 Fable 5 都干掉了”。

因此有人猜测,这是智谱的能力水平。

关于模型归属的猜测

匿名模型上线后,社区最关心的问题不是怎么用,而是“它到底是谁”。目前主要出现了四类猜测。

第一种猜测:小米 MiMo V3

在 Reddit、x 等平台上,MiMo V3 是目前出现频率较高的答案。

这种猜测主要建立在三条线索上。

第一,时间点接近。8 月 18 日,小米集团 CFO 林世伟在财报电话会上透露,新一代 MiMo 模型正在训练,有望很快发布。但小米并未公布具体型号,因此“MiMo 3.0”只是网友暂时使用的称呼,并非官方名称。

第二,小米此前有过在 OpenRouter 匿名测试模型的先例。

今年 3 月,代号 Hunter Alpha 的神秘模型在 OpenRouter 免费上线,一度被外界猜测为 DeepSeek V4,随后小米确认,它实际上是 MiMo-V2-Pro 的早期内部测试版本。

Hunter Alpha 同样拥有 100 万 Token 上下文,且面向 Agent 任务,上线后很快突破 1 万亿 Token 调用量。

第三,两者的产品定位存在重合。Ox Alpha 被描述为面向高效编程、持续 Agent 任务和生产环境;目前的 MiMo 系列同样把代码、工具调用和长周期 Agent 执行作为重点方向。

Ox Alpha 的 100 万 Token 上下文,也与 MiMo-V2.5 和 MiMo-V2.5-Pro 的百万级上下文接近。

所以在 Reddit 上,有一位用户猜测,这款模型就是 MiMo V3,后面有用户继续提问,他的猜测理由是什么。

有另一位用户回答了这个问题,他写道:“Mimo 确实经常以 100 万亿 Token 为单位进行预算。例如,Mimo 100 万亿 Token 计划。

更有一名用户直接判断:“这很可能就是 MiMo V3,趁它还开放的时候用吧。”

这类猜测目前主要来自发布时间、免费测试策略和模型定位,并没有确凿技术证据。

第二种猜测:腾讯混元 HY 4

另一部分网友认为,Ox Alpha 可能来自腾讯混元。

一篇 Reddit 帖子直接将模型指向“HY 4”,理由是能够支撑如此大规模免费调用的厂商并不多,腾讯在算力和推理基础设施上具备相应条件,同时也可能需要在正式发布前收集真实 Agent 任务数据。

下面有用户附和说,由于最近在和 Hy 3 合作,这就说得通了。

跟上面一样,这些都只是网友们的猜测。目前没有 OpenRouter、腾讯或第三方评测机构给出能够把 Ox Alpha 和混元模型联系起来的证据。

第三种猜测:Google Gemini 系模型

Ox Alpha 拥有 100 万 Token 上下文,并原生支持图片和视频输入,这两个特征很容易让人联想到 Gemini。

有 x 用户发帖猜测,这是披着神秘外衣的 Gemini 模型。

有用户向模型询问身份后发现,Ox Alpha 自称 Gemini,于是把截图发到 X 上。

但让模型“自报家门”并不是可靠的鉴别方法。模型可能从训练数据、系统提示或上下文中生成一个看起来合理的答案,也可能在不同询问方式下给出完全不同的身份。

尤其对于 Stealth Model 而言,提供方通常会主动隐藏模型信息,模型回答“我是 Gemini”“我是 Claude”或者“我是某个 OpenAI 模型”,都不能作为归属证据。

如果仅从百万上下文和视频输入判断,Gemini 确实是候选之一,但同样的能力正在越来越多的新模型上出现。它更像是一条缩小范围的线索,而不是答案。

第四种猜测:智谱 GLM-5.3

除此之外,还有网友怀疑它是智谱尚未发布的新模型。

有用户通过分析结果得出猜测,认为这是 GLM-5.3 的变体,在 25 个不同的提示中,原生 token 数量和 GLM-5.3 完全匹配,ox 也接受图像输入。

还有用户表示,它在 50/50 的对抗字符串测试中与 GLM-5.3 的分词器匹配度最高,而 Gemini、DeepSeek 和 Kimi 的匹配度仅为 18-22%,同时 OXAlpha 还拥有其罕见的 API 指纹。

在国内知乎平台,有用户猜测,这种风格很智谱,他们之前出过一个名为 Pony Alpha 的模型,现在又出了 Ox 模型,正好对上了。

Stealth Model 正在成为一种新的发布机制

除了上述种种猜测外,还有网友表示,这几乎形成了一个有些荒诞的局面:几乎每一家正在准备新模型的公司,都可以被套进 Ox Alpha 的身份猜测中。

过去,模型发布通常由厂商主导:先公布名称和技术报告,再展示基准成绩,最后向开发者开放 API。用户知道自己正在测试谁,但也很容易受到品牌和宣传信息影响。

Stealth Model 反过来操作。

模型先匿名进入平台,开发者在不知道品牌、参数和排行榜的情况下直接使用。提供方可以获得更接近真实环境的评价,也可以避免一次不成熟的预览影响正式品牌。如果模型表现出色,最终揭晓身份还能再制造一轮传播;如果效果不理想,则可以低调结束测试。

对 OpenRouter 而言,这种机制也强化了它在模型产业链中的位置。

OpenRouter 不再只是汇总不同模型 API 的“路由中间层”,还可以成为模型公司的公开试验场:统一接口、真实开发者、大量 Agent 流量和相对完整的使用数据,为尚未正式发布的模型提供灰度环境。

Ox Alpha 的匿名身份暂时遮住了模型公司的名字,却把行业正在变化的发布逻辑暴露了出来:下一代模型可能不再先开发布会,而是先悄悄进入开发者的终端,工作一周,消耗数万亿 Token,再带着真实反馈正式亮相。

至于忍者面具后面究竟是小米、腾讯、Google,还是一家尚未进入公众视野的模型公司,目前没有任何一种猜测获得证实。

等面具揭开的那一天,人们也许才会知道,它究竟是一款真正的前沿模型,还是一次包装得很成功的匿名灰度。

参考链接:

https://openrouter.ai/stealth/ox-alpha

https://x.com/himustafatokmak/status/2090601134767439976/photo/1

https://x.com/search?q=opencode%20Dax&src=typed_query

https://www.reddit.com/r/opencode/comments/1vtxp6t/identity_of_the_ox_alpha_model_hy4/

https://www.reddit.com/r/opencode/comments/1vtw0aq/guess_what_another_one_free_model_ox_alpha_in/

原始来源: InfoQ

评论 (0)