← 文章 / AI技术
The Decoder 5小时前 · 2026-08-30 20:14:11 · 2 阅读

AI Agent 缺乏时间感知能力,无法准确预估任务耗时

Image description Nano Banana Pro 受 THE DECODER 提示

一项新研究发现,流行的编程助手无法预测任务耗时,也无法可靠地报告它们已经工作了多久。这对耗时较长的任务来说是个问题。

当 AI 助手处理任务时,往往意识不到时间的流逝。这是两位独立 AI 研究人员在 MATS 研究项目中得出的结论。他们测试了 Anthropic 的 Claude Code 和 OpenAI 的 Codex 这两款广泛使用的编程助手的时间感知能力。

在执行每个编程任务前,代理必须预估所需时间。随后它们完成任务,并回顾报告实际耗时。测试素材来自名为 ProgramBench 的 200 个任务集,以及研究人员自建的 18 个基准测试套件。

在测试中,代理总是严重高估所需时间。在 ProgramBench 上,无论任务难度如何,两个模型大多猜测需要约 90 分钟。在第二轮测试中,Claude 的平均误差是实际时间的 3 倍,Codex 则是 6 到 10 倍。估算偏差在短任务上最为严重,只有在数小时的范围内,部分预测才接近现实。

编程代理严重误判任务耗时。图上位于深色对角线上方的点代表高估:Fable 5 的平均运行时间约为实际值的 3 倍,GPT-5.6 Sol 约为 7 倍。短任务上的差距尤为明显。来源:Ofengenden/Andriushchenko,LessWrong

同一 AI 在不同配置下表现截然不同

结果取决于模型运行的软件环境。Claude Code 会一直工作直到认为任务完成,中位时长约为 90 分钟;而 Codex 则会在大约 30 分钟后停止,几乎与任务无关。研究显示,同一语言模型在 Claude Code 中的平均步数是 Codex 的 2.5 倍。因此,运行时间既取决于模型,也严重依赖被称为“框架”的周边软件。 这些代理在评估自身工作质量方面同样极不可靠。较旧的模型 Opus 4.8 和 GPT-5.5 平均会高估 20 分,甚至在任务失败时也给自己打高分。在其中一个案例中,两者都认为自己的工作完成了约 70%,而实际得分仅为 7% 和 14.5%。
Claude 和 Codex 对自身工作的评价过于慷慨。平均而言,这两个系统在测试中的实际得分都比自我评分高出约 20 个百分点。虚线表示准确的自我评估。来源:Ofengenden/Andriushchenko, LessWrong
研究人员表示,这种自我评估能力至关重要。为了让代理在数小时的长时间任务中可靠地工作,它必须遵循诸如“迭代此任务两小时”的指令。一个无法准确判断时间的代理很难控制。接下来,作者希望测试代理是否能遵守固定的工作时长。当代理获得一个显示已用时间的工具时,它们几乎每次都能做到准确无误。
原始来源: The Decoder

评论 (0)