← 文章 / AI技术
Interconnects 2小时前 · 2026-10-10 12:23:13 · 8 阅读

我期待快速进步,但并非通往通用超级智能

听到业界的顶级研究者说几年内 AI 会在他们的工作上超越自己,我常常感到意外,而我一直说不清自己为什么会怀疑这一点。现在我想明白了:他们看到的是模型在基础设施和工程能力上的巨大加速。我完全认同,几年内模型会成为超越人类的分布式 GPU 工程师。这会让实验和调整模型公式变得容易得多,但不会让模型的本质发生巨变。

从某种意义上说,Ilya 宣称 AI 已进入研究时代为时尚早。有了编程 agent,如今做研究确实容易多了。这种便利来自一种更灵活、更有吸引力的全新工作方式,也标志着一个时代的开端:在软件领域,好想法可能远比好的执行更有价值。

Subscribe

我们在这条路上才刚起步。而且,AI 在“研究”与“工程”之间的重心转移,也不是这个领域第一次经历。深度学习兴起之前,AI 更多是一项研究工作。如今,评价顶尖研究者的标准,公认是他们把想法在复杂基础设施中实现和规模化的能力。我们即将迎来几年的巨大加速,瓶颈将再次越来越少地落在工程上。有人把这称为 RSI(递归自我改进),但更务实的说法是“并行化、AI 辅助的语言建模”。你不需要相信奇点起飞的叙事,也能看到基础设施的改进即将到来,以及这将如何改变 AI 工作的性质。

这篇文章旨在概述为什么会出现这种工程加速,并谈谈它无法解决的问题。即便在数学和编程之外,我们得不到具有经济价值的超人类能力,这也将大大促进技术向经济领域的扩散。这些近期进展大多来自用现有工具扩展推理时算力,而不是模型研究能力出现了质的飞跃。

Share

AI 训练与推理技术栈中的许多环节都极具可验证性。训练指标如单 GPU 每秒处理的 token 数,直观反映训练速度;推理指标则包括单 prompt 生成的 token 数、单 token 的 FLOPs,或干脆就是单次回答的成本。这些指标都具备很高的优化空间,特别是因为其中涉及成熟的子问题和架构权衡。预计几年内,AI Agent 将助力端到端地优化这一流程,使推理能力逼近 GPU 等加速器在底层算力上的理论极限。过去几年,企业在推理效率上取得的提升已相当显著,例如在特定价格点发布模型后,服务成本可再降低 10% 至 30%。这套技术栈的优势将持续复利,我预计未来几年模型智能的有效成本将呈近指数级下降(速度甚至可能快于近期趋势)。

捕获效率提升这颗“低垂的果实”只需几年时间。长期来看,加速器与模型的协同设计将在更长的时间尺度上运作,能在柔性 GPU 平台基础上带来额外数个数量级的效率增益。在效率快速提升期间,GPU 的灵活性至关重要,因为架构的探索空间似乎很重要,是自动化研究的关键杠杆。我认为预训练研究——至少涵盖服务当前模型类别的架构和数据选择——在 2-3 年内实现自动化是合理的预判。

这一切都将成为 Agentic 模型触发 Jevons 悖论的巨大引擎。我预计需求只会增长,因为行业当前的瓶颈主要在于探索更好的 Agent 定向与交付方式。Meta 的 Muse Agent 是这一趋势的早期信号,未来我们应能看到更多面向不同受众和特定场景的类 Muse 体验。其价值在于理解 Agent 的运行机制,而非单纯追求性能前沿。

在生物学、化学等更广泛的科学领域中,类似的阶段将是一个由模型发现大量跨子领域成果的时期。AI 模型在检索文献和连接稀疏网络方面远超人类,而这些网络目前由很少互动的科学家小群体负责管理。这其中存在一条微妙的界限:是宣告科学发现新时代的到来(例如治愈大多数癌症),还是仅仅加速了科学既有的发展轨迹。

另一个工业级的低垂果实是提升强化学习(RL)环境的整体质量。你不需要找太远的例子,就能看到另一家收入突破 1 亿美元甚至 10 亿美元的 RL 数据公司。这样的公司比我预期的要多得多。这个领域的平均输出质量极低,无数研究人员都承认他们购买的数据坦白说是垃圾。但与此同时,头部实验室也明确表示,购买这些数据有着清晰的投资回报。

许多 RL 环境糟糕的质量显然是可以修复的。

原始来源: Interconnects

评论 (0)