← 文章 / AI技术
Simon Willison 6小时前 · 2026-10-06 01:31:15 · 9 阅读

Qwen3.8 27B 模型英文单词加法运算基准测试

研究 Qwen3.8 27B 以文字形式进行加法运算 — 一项基准测试验证了本地 `Qwen3.8-27B-Q4_K_M.gguf` 模型是否能在禁用推理模式的情况下,仅用英文单词表达正整数加法的确切结果。测试包含 5,070 个禁用推理案例,并搭配一组 169 个中等推理案例进行对比。在禁用推理时,模型数值准确率为 23.57%;尽管格式合规率高达 96.17%,准确率仍从一位至三位操作数的 97.04% 骤降至十位至十三位操作数的 6.44%。

Colin Frasier 在 Bluesky 上发帖分享了他两年前使用 GPT-4o 进行的一项实验,旨在观察模型随着数字位数增加,在“计算总和但用文字返回答案”任务中的表现。以下是他分享的相应结果图表:

加法提示词准确度的热力图,颜色从深绿(高)经黄色过渡到深红(低)。标题:"{a} + {b} 等于多少?请仅用文字写出答案,不要包含其他文本或信息,只需文字答案。"副标题:每种数字组合随机选取 30 对数字(n = 30 * 13 * 13 = 5070)。X 轴:a 的位数,1 到 13。Y 轴:b 的位数,1 到 13。图例:准确率,1.00,0.75,0.50,0.25,0.00。按行列出 a = 1 到 13 的数值。b = 13: 100%, 77%, 27%, 20%, 0%, 0%, 0%, 0%, 0%, 0%, 0%, 0%, 0%。b = 12: 97%, 80%, 80%, 40%, 23%, 20%, 7%, 13%, 20%, 27%, 67%, 63%, 3%。b = 11: 97%, 97%, 53%, 17%, 0%, 0%, 0%, 0%, 0%, 0%, 0%, 37%, 0%。b = 10: 100%, 90%, 47%, 20%, 7%, 0%, 0%, 0%, 3%, 0%, 0%, 7%, 0%。b = 9: 97%, 93%, 80%, 77%, 53%, 67%, 47%, 87%, 97%, 3%, 0%, 13%, 0%。b = 8: 93%, 87%, 53%, 43%, 7%, 0%, 0%, 13%, 87%, 0%, 0%, 0%, 0%。b = 7: 93%, 93%, 47%, 10%, 13%, 20%, 23%, 0%, 70%, 0%, 0%, 0%, 0%。b = 6: 100%, 100%, 100%, 83%, 97%, 97%, 23%, 0%, 53%, 3%, 0%, 10%, 0%。b = 5: 100%, 100%, 80%, 70%, 73%, 100%, 13%, 13%, 70%, 0%, 20%, 30%, 0%。b = 4: 100%, 100%, 93%, 100%, 60%, 97%, 20%, 50%, 67%, 53%, 40%, 40%, 40%。b = 3: 100%, 100%, 97%, 90%, 83%, 100%, 63%, 50%, 63%, 53%, 60%, 60%, 30%。b = 2: 100%, 100%, 90%, 97%, 93%, 100%, 93%, 83%, 90%, 83%, 87%, 87%, 83%。b = 1: 100%, 100%, 100%, 97%, 100%, 97%, 97%, 97%, 100%, 100%, 100%, 97%, 100%.

我确信 GPT-4o 没有作弊使用计算器,特别是考虑到它在许多计算中出现了错误。但这次经历启发了我在本地硬件(DGX Spark)上重新运行该实验,以在完全受控的环境中探索这一效应。

我将他的图像粘贴到 Codex Remote 会话(GPT-6 Astra)中,让它使用 Qwen3.8-27B-Q4_K_M.gguf 运行相同的实验。以下是每个组合运行 30 次且禁用推理时的结果:

热力图布局与之前的图表相同,使用橙色(低)到白色再到蓝色(高)的色标,显示总体准确率大幅降低。标题:文字加法 — Qwen3.8 27B Q4_K_M。副标题:禁用推理 · 每个有序数字长度单元格固定 30 对(n = 5,070)。总体数字准确率:1,195 / 5,070 (23.57%)。X 轴:a 的数字位数,1 到 13。Y 轴:b 的数字位数,1 到 13。图例:准确率,100%,75%,50%,25%,0%。按行列出 a = 1 到 13 的数值。b = 13:17%、13%、0%、0%、0%、0%、0%、0%、0%、0%、0%、0%、0%。b = 12:53%、20%、0%、0%、0%、0%、0%、0%、0%、0%、0%、0%、0%。b = 11:47%、10%、0%、0%、0%、0%、0%、0%、0%、0%、0%、0%、0%。b = 10:70%、27%、3%、0%、0%、0%、0%、0%、0%、13%、0%、0%、0%。b = 9:77%、47%、3%、0%、0%、0%、0%、3%、7%、0%、0%、0%、0%。b = 8:53%、20%、0%、0%、0%、0%、7%、13%、0%、0%、0%、0%、0%。b = 7:53%、23%、17%、10%、3%、3%、13%、3%、0%、0%、0%、0%、0%。b = 6:60%、60%、33%、10%、53%、47%、7%、3%、0%、0%、0%、0%、0%。b = 5:73%、67%、87%、80%、53%、40%、0%、0%、3%、0%、0%、0%、0%。b = 4:83%、93%、90%、93%、53%、13%、0%、0%、0%、0%、0%、0%、0%。b = 3:100%、93%、90%、80%、67%、37%、17%、0%、0%、3%、0%、0%、0%。b = 2:100%、100%、93%、90%、77%、77%、43%、50%、63%、43%、40%、13%、23%。b = 1:97%、100%、100%、100%、80%、67%、77%、80%、80%、60%、43%、30%、37%。脚注:色盲友好的橙蓝色标;百分比提供冗余的非颜色编码。

随后我再次运行实验,这次启用了推理。每对数据的耗时大幅增加,因此我没有像之前那样每个方块运行 30 个样本,而是只运行了一次——这使得热力图在视觉上吸引力较低,因为每个方块只能是 100% 或 0%:

热力图,布局与之前的图表相同,几乎全为蓝色。标题:用文字做加法 — Qwen3.8 27B — 中等推理试点。副标题:每个有序位数单元格 1 组固定数字对 · 由易到难(n = 169)。X 轴:a 的位数,1 到 13。Y 轴:b 的位数,1 到 13。图例:准确率,1.00、0.75、0.50、0.25、0.00。除两个显示 0% 的橙色单元格外,所有单元格均为 100%:a = 2 且 b = 8,以及 a = 12 且 b = 9。

169 次尝试中有 167 次得到了正确答案。由于这些都是单次运行,我确信再跑一次结果会有所不同。

这份报告版本包含了一些大型计算的推理轨迹,其中有这样的内容:

Wait, let me redo this more carefully.

4,299,366,105,622
6,088,794,067,970

Let me align them:
4 2 9 9 3 6 6 1 0 5 6 2 2
6 0 8 8 7 9 4 0 6 7 9 7 0

Adding from right to left:
Position 1 (units): 2 + 0 = 2
Position 2 (tens): 2 + 7 = 9
Position 3 (hundreds): 6 + 9 = 15, write 5, carry 1
原始来源: Simon Willison

评论 (0)