← 文章 / 行业与公司动态
The Decoder 4小时前 · 2026-09-22 01:53:04 · 2 阅读

xAI 低价发布 Grok 4.7,但基准测试显示与 Claude 和 GPT-6 差距明显

Elon Musk 旗下的 xAI 推出了 Grok 4.7,这是该公司迄今在代码生成和知识工作方面能力最强的模型。公司称,该模型基于更大的基座模型构建,采用了更长的强化学习训练,并专为验证自身输出而设计。定价方面,输入每百万 token 收费 2 美元,输出每百万 token 收费 6 美元。这一价格更接近中国模型,而非西方前沿模型,且这种定价策略似乎有其合理性。在综合了十项基准测试的独立评测平台 Artificial Analysis Intelligence Index(v4.3.2)中,Grok 4.7 得分 46,处于中等水平。Claude Fable 5.1 和 GPT-6 以每款 53 分的优势领跑。

Grok 4.7(黑色)综合得分为 46,显著落后于得分 53 的 Claude Fable 5.1 和 GPT-6。其两个最高的推理级别表现相近。| 图片来源:Artificial Analysis

在 agentic coding(代理式编码)领域,差距进一步扩大。在 Terminal-Bench 4.0 测试中,Grok 4.7 得分仅为 26%,而 GPT-6 Astra 得分 60%,Claude Fable 5.1 得分 55%。即便价格更低的 DeepSeek V4.1 Flash 也以 27% 的微弱优势领先于它。该模型可通过 Grok APICursorGrok Build 访问。

Grok 4.7 在 Terminal-Bench 4.0 的 agentic coding 测试中得分 26%,远落后于 GPT-6 Astra(60%)和 Claude Fable 5.1(55%)。| 图片来源:Artificial Analysis
原始来源: The Decoder

评论 (0)