The Decoder 5小时前 · 2026-08-30 20:14:11 · 2 阅读
AI Agent 缺乏时间感知能力,无法准确预估任务耗时
Nano Banana Pro 受 THE DECODER 提示
一项新研究发现,流行的编程助手无法预测任务耗时,也无法可靠地报告它们已经工作了多久。这对耗时较长的任务来说是个问题。
当 AI 助手处理任务时,往往意识不到时间的流逝。这是两位独立 AI 研究人员在 MATS 研究项目中得出的结论。他们测试了 Anthropic 的 Claude Code 和 OpenAI 的 Codex 这两款广泛使用的编程助手的时间感知能力。
在执行每个编程任务前,代理必须预估所需时间。随后它们完成任务,并回顾报告实际耗时。测试素材来自名为 ProgramBench 的 200 个任务集,以及研究人员自建的 18 个基准测试套件。
在测试中,代理总是严重高估所需时间。在 ProgramBench 上,无论任务难度如何,两个模型大多猜测需要约 90 分钟。在第二轮测试中,Claude 的平均误差是实际时间的 3 倍,Codex 则是 6 到 10 倍。估算偏差在短任务上最为严重,只有在数小时的范围内,部分预测才接近现实。

同一 AI 在不同配置下表现截然不同
结果取决于模型运行的软件环境。Claude Code 会一直工作直到认为任务完成,中位时长约为 90 分钟;而 Codex 则会在大约 30 分钟后停止,几乎与任务无关。研究显示,同一语言模型在 Claude Code 中的平均步数是 Codex 的 2.5 倍。因此,运行时间既取决于模型,也严重依赖被称为“框架”的周边软件。 这些代理在评估自身工作质量方面同样极不可靠。较旧的模型 Opus 4.8 和 GPT-5.5 平均会高估 20 分,甚至在任务失败时也给自己打高分。在其中一个案例中,两者都认为自己的工作完成了约 70%,而实际得分仅为 7% 和 14.5%。
原始来源: The Decoder