← 文章 / AI技术
Interconnects 3小时前 · 2026-09-29 22:27:05 · 2 阅读

探讨RSI、中美差距与AI发展轨迹:与Epoch AI的JS Denain对话

本期嘉宾是 Epoch AI 的 Jean-Stanislas(JS)Denain,他领导该机构的 Insights 团队,也是我平时探讨 AI 现状与发展趋势时最常交流的对象之一。此前,我们在线上或私下就我近期多篇文章进行过多次后续讨论。鉴于此,我希望在公开播客中深入探讨其中的细微差别。

本期播客的一个核心观点是,JS 和我都对 AI 的确切走向感到高度不确定,但我们尽力基于当下的观察,坦诚地陈述了各自的看法。

章节/主题包括:

  • 00:00 关于 RSI 的预测

  • 18:15 机器人技术在 AI 加速中的角色

  • 24:20 中国模型落后多少?

  • 27:39 蒸馏技术能否解释这一差距?

  • 40:58 中国职位招聘信息揭示了哪些实验室动向?

  • 48:13 开放模型和封闭模型,哪个更安全?

  • 58:10 Epoch AI 的运作模式

  • 1:00:55 前沿后训练(post-training)方法论是什么样的

祝收听愉快!

JS 更多内容:Epoch AI 主页及文章、X、LinkedIn

分享

请在 Apple Podcasts、Spotify 或您常用的播客平台收听 Interconnects。其他 Interconnects 访谈请点此访问。

文字实录

00:00:00 Nathan Lambert: 今天和我一起的是 JS Denain,他是 Epoch AI 的资深研究员,负责洞察团队。在我认识的人里,他是给我的文章提供最佳反馈的人之一,无论是关于美中 AI 能力差距的文章,还是现在这篇关于 RSI 的。我很想借此机会和他深入聊聊,了解他对这些问题的思考方式。我觉得他的观点很有价值、也相当克制,而且他 probably 比大多数人更倾向于所谓 AI 进展加速的情景。那我们就直接进入正题:当 OpenAI 和 Anthropic 频频宣称 RSI 即将到来时,你觉得他们实际看到的指标是什么?

00:00:47 JS Denain: 是的。他们确实发布了一些测量数据,对吧?OpenAI 和 Anthropic 都发过博客文章,我是说 Anthropic 至少发了两篇,探讨 AI 对加速 AI 进度的影响。我觉得至少是他们公开的那些内容,我不认为这提供了确凿证据,证明即将出现自我维持的加速 AI 能力,或者 AI 研究人员工作的完全自动化。但我觉得我们看到的一些趋势,我认为是 OpenAI 博客中最引人注目的是 AI 系统在模型部署中的使用率不断上升,比如我们观察到的 Codex 支出大幅增加。确切如何解读这一点尚不明确,因为可能存在测量偏差——他们只关注了 Codex,但研究人员此前可能大量使用 ChatGPT。不过总的来说,例如那个图表显示研究人员的 Codex 支出每月增长 2 倍,这在我看来确实表明他们从中获得了巨大价值。我不认为这是六个月内就会发生软件智能爆炸的强有力证据。

00:01:57 Nathan Lambert: 你认为这是否意味着同样的事?也就是说,他们内部掌握的信息与我们所掌握的相比如何?这当然是假设性的,我们没有这些内部信息。因为感觉很多人看到实验室发布的更新时,比看到我们掌握的信息时更感到恐惧。我非常认真地思考:他们看到了什么,使得风险加速的评论变多了,这其中有多少是实质性的证据,又有多少是随时间演变的文化现象?我更关注的是证据。

00:02:29 JS Denain: 是的。这里有两点。首先,我觉得我目前并不认为 OpenAI 或 Anthropic 内部掌握了某些我们接触不到的、足以让人极度恐慌的特定信息。我也觉得,目前公开的关于 AI 进度的证据,加上基于先验逻辑对这一关键动态重要性的论证,已经足以让我们重视 AI 加速自身研发这一趋势,以及去追踪这一现象。至于反馈回路何时真正启动,其紧迫性尚不明确。基本上,关于内部人员所能接触到的信息,我可以举例说明他们可能在关注哪些指标。虽然公众能获取 AI 系统的能力数据,但内部团队有自己的 KPI。也许他们在预训练团队看到计算量乘数飙升,或其他正在追踪的指标出现异常波动。将这些数据结合各团队不同产出如何综合作用的直觉,可以预测最终 AI 系统实际性能的趋势。这可能是一个早期预警信号。但不清楚我们最近看到的讨论是否表明这些指标真的出现了失控状况。

00:04:09 Nathan Lambert: 你如何看待 RSI 与存在性风险之间的联系?我推测你也会同意,AI 确实带来非常现实的风险。我好奇的是,这些我认为尚属非常早期的测量指标,如何改变对风险范围的认知。我认为,如果六个月前询问大众,他们不会像现在这样如此迅速地认同 x-risk(存在性风险)。现在有更多理性人士再次讨论 x-risk,这一点让我颇感意外。

00:04:43 JS Denain: 好的,我的看法大致是……就我个人而言,我对这个问题非常不确定,但我确实基本认同一点——我知道 Evan Hubinger 说过,在某种时间框架内生存性风险至少有 10%。我觉得在十年的时间尺度上,这个估计似乎相当合理。我对这件事感到极其不确定,但确实非常担忧。那么,我为什么担忧,分歧出在哪里,我又怎么把这和 RSI 的早期判断联系起来?我的观点是,我算是个“能力决定一切”理论派。有人可能不同意,但我真的认为,人与人之间分歧的主成分就是:AI 系统的能力会变得多强、多快?当然我也承认,经济增长的大小还受技术扩散等其他因素影响。你也可以认为能力会疯狂增长,但 AI 系统是对齐的、良性的,所以没什么大风险。不过具体来看,当我观察人们之间的主要分歧时,那些对最极端情景持强烈怀疑态度的人,大多数只是预期能力不会像我说的那么强——或者,那些认为——

00:06:18 Nathan Lambert: 几年后“能力最大化主义者”会是什么样子?因为我大概是怀疑派那一边的,不过你先继续说。

00:06:28 JS Denain: 我认为这看起来很像AI 2027 的场景,对吗?在我看来,背后的机制是 AI 正在自动化 AI 研究流程,这是值得重视的原因。但在对现实世界的影响方面,我觉得这类似于机器人在大规模进展上取得的突破,或者说是一场巨大的工业爆发:AI 系统管理着工厂,从而形成一种能够自我维持的经济体,并以远超预期的速度推动重大科学进步。具体来说,我预计分歧会出现在以下几点:假设你拥有在“书本知识”层面极其智能的 AI 系统,同时它们还经过训练,能够更充分地利用并利用这些能力,且懂得以高效的方式管理项目等任务。那么,在取得极快的 R&D 进展或对人类形成强大控制力方面,现实中的瓶颈究竟有多大?

00:07:26 Nathan Lambert: 对。能深入讨论其中几点吗?你听过 Dwarkesh 与 Charlie、Beren 和 John 的播客访谈吗?

00:07:32 JS Denain: 听过。是的。

00:07:33 Nathan Lambert: 是的,因为他们在节目结尾有一个环节,讨论了不同能力水平及达成这些水平所需的时间线。我觉得我大部分都同意……我非常赞同他们对时间分布的看法,直到某个点之后,我对后续的时间线感到惊讶。其中一点是关于 AI 研究员实现 10 倍生产力提升。我认为 Beren 和 John 预估的时间比我要快。我的观点是,我同意从产生想法到开展实验以验证想法的周期,很快就会缩短 10 倍。但我未必同意“AI 研究员的整体生产力净提升 10 倍”这一说法。我将这种“整体生产力”定义为该领域完整理解进度的速度。对领域的“理解”与仅仅继续扩大模型规模是不同的维度。我认为这是我在此 AI 研究领域核心困惑之一。所以,我只是很好奇你是如何看待这类问题的,以及你如何将 AI 研究中的 10 倍改进拆解为不同的子类别。

00:08:37 JS Denain: 对。这里可能存在一个量级差,真正关键的问题在于整体 AI 研究的进度快了多少?或者 Anthropic 的整体产出快了多少?Anthropic 作为一家公司正在产出某些成果,它在一年内完成的工作,过去可能需要十年。这与个别研究人员的生产力有很大不同,我认为……如果当前 AI 研究人员所做的大部分工作就是你刚才描述的那种循环,那么基于他们目前执行的任务,中位研究人员的生产力提升十倍是有可能的。但首先,这并不意味着所有研究人员的生产力都提升了十倍。即便真如此,由于存在其他瓶颈,这种提升未必能转化为 Anthropic 整体生产力提升十倍。所有研究人员生产力提升十倍,但受算力或其他因素制约,公司整体的进展速度可能依然没有那么快。

00:09:38 Nathan Lambert: 我有个类比:初级博士生的生产力可能会提升十倍,但从导师的角度看,他们的研究日程并不会因此加快十倍。这种贡献在多大程度上影响了 Anthropic 的进步,是另一个难题。这让我联想到了对 AI 能力的理解,正如聆听Noam 的播客时所得到的启发。我写这篇文章时一直在思考:随着海量推理算力上线——我认为 Dwarkesh 很好地强调了这一点——很难区分 AI 研究的巨大加速究竟是因为研究效率本身提高了,还是因为我们拥有了远超以往的算力,从而能更有效地将资源投入相关问题。我认为,这些效应将同时发生。

00:10:27 JS Denain: 好,这个问题的确值得讨论。你看 OpenAI 那篇关于 AI 加速研发的博客文章,里面确实指出研究人员的 Codex 用量出现了大幅激增。有意思的是,公司其他部门的 Codex 用量其实在春季猛涨之后,到夏季就趋于平稳了。但研究人员、数据团队和工程师这边,用量一直在涨,有时甚至还在加速。他们指出这一点之后,又去分析增长出现在哪些地方、哪些任务的使用量在上升。结果很多都是工程类任务,故障排查类任务也明显增加。但他们明确表示,对于很多高层战略决策,无论是根据他们的观察还是对会话数据的分析,都没有发现 AI 在优化算力分配或研究方向选择上带来多大提升。在我看来,这和 PI 的情况很相似。所以这里有一个问题:假设 AI 对研究的战略决策部分提升不大,但其他环节突飞猛进,整体研究到底能快多少?另一个问题是,这种战略决策到底有多难?能不能靠更长时程的 RL 直接搞定?或者也许可以押注在其他同样需要这类决策的领域上能实现不错的迁移,最终把这种提升也吃到。

00:11:59 Nathan Lambert: 我的直觉是,科学的面貌将发生根本性的巨变,很难用数字来量化。我们正在从 AI 前时代向 AI 后时代进行快速过渡,迈向一种全新的科研方法论。我认为各大学术会议已准备好迎接变革,并在未来几年内艰难地摸索出路。我希望它们能集体找到一种可扩展的方式,将 AI 监督引入同行评审等环节。鉴于当前大量低质量论文的泛滥,这种筛选机制至关重要。对此我也无从得知。在能力层面,我认为 AI 的进步显然会转化为新的能力。这主要涉及两方面。其一是预训练扩展定律:我们的损失值与算力的指数级增长成正比。其二在研究层面:我们正在调整这条曲线,以获得更优的截距,甚至可能获得更优的斜率。另一方面是 RL 环境。我认为我们正在构建的 RL 环境与高价值的工作具有可比性。因此,我预计 AI 模型在处理范围明确的知识型工作方面会变得极其出色。但我不确定我们是否有一套好流程来生成难度高一个数量级的环境,这类环境更接近于治愈癌症或解决未解的数学难题。数学就是一个我们可以讨论的案例。但这更像是在扩展原始智能方面存在不确定性,而非效率问题。因此,我对扩展效率持非常乐观的态度。

00:13:29 JS Denain: 是的。我同意,在某种程度上,推理效率确实很像一项攀峰(hill-climbing)任务,其范围界定得非常清晰。确实,目前这一领域的进展已经非常快,但我预见这种趋势会加速得更快。看起来这确实属于……我的意思是,实际上 OpenAI 已经提供了证据,对吧?通过构建更优秀的内核(kernels)等方式来降低服务成本。如果你对这方面还不熟悉,他们通常不会给出太多细节,但这实际上已经在发生了。实际上,我对你们的情况也颇感兴趣。这里定义 Anthropic 整体加速的一种方式是:观察某一时点 Anthropic 最佳质量点对应的 ECI 趋势。你可以查看当前的 趋势线,并思考未来一年内,我们是否会看到 5 倍的加速?也就是说,斜率是否会比 2025 年大 5 倍?我认为很可能看到显著提升,因为这确实是一个可清晰解读的关键指标——虽然并非字面意义上的 KPI,但在兼顾安全考量等因素的前提下,它确实是公司追求的目标。我很好奇你是认为这种可能性极低,还是认为虽然可能出现,但如果真发生了,多半是因为 ECI 作为一个指标被古德哈特定律(Goodhart's Law)效应所扭曲,从而对实际能力的影响并不大。

00:15:03 Nathan Lambert: 如果我们真的达到那个程度我不会惊讶,但我认为情况会是:我们正在爬坡,坡度可能会突然变陡,但等我们把这个方向能爬的都爬完了,增速又会回落。所以我觉得,凡是能被量化的东西,都会因为“可测量”而被快速拉动提升,之后就进入“怎么测量”的困境。我接触过一些在做这方面尝试的人……现在构建 evals 的成本非常高,我确实认为评估会围绕这几个维度展开:写代码有多好多高效、做 ML 研究有多好多高效、做知识工作有多好多高效。但我不确定该怎么做……构建这些 evals 看起来可行但很难。而“如何在基础化学领域取得突破”这种事,真的非常非常难测量。我本来想拿前沿数学举例,但我觉得数学是 AI 能力分布中“参差不齐”(jaggedness)最极端的一个例外。尤其是数学中的开放问题,简直是最适合 AI 快速进步的目标,因为它是可证伪的。如果我们能在某个开放性强得多的领域看到类似的表现,我会大幅更新我的判断。或者如果某家实验室站出来说:“用 Claude,我们在 AI 架构上实现了巨大的变革”——就像著名的 Jonathan Frankle 和 Sasha Rush 的赌局那样——Transformer 不再是我们所沿袭的路线。我觉得以上任何一件事如果真的是 AI 驱动的,都会让我大幅更新认知。但数学上的进展,虽然速度让我意外,还不至于让我震撼。

00:16:49 JS Denain: 这挺有意思。我完全认同这种普遍感受。我认为 METR 的研究人员在评估 autoresearch 风格的 nanoGPT 结果与人类表现时,确实观察到了一种现象。我想 Tom Cunningham 将其称为“摘苹果模型”:AI 在初始阶段效率极高,但随后并没有发掘出多少新想法。你在优化器研究中也能看到这一点。关于可验证性,我想补充一点。常见的趋势是,有些任务看似不可验证,你可能在构建对应环境时会遇到困难。但实际上,它是某个更大且本身可验证任务的子集,只是时间跨度更长。举例来说,许多企业内部的难以验证的任务,从某种意义上说,其营收、估值等指标其实相当清晰明了。这是其中一点。另一点是,要预期各项能力会出现明显的参差不齐(jaggedness)。但我认为一个大问题是,在这个疯狂的世界里,能否引发一场巨大的、自我维持的工业级爆发?

00:18:05 Nathan Lambert: 是的。我们能不能聊聊机器人技术和工业?我具备实体机器人背景,我认为机器人领域的趋势将更接近自动驾驶汽车,而非大语言模型(LLMs)。我认为许多奇点论的论据都建立在“机器人技术比自动驾驶汽车的推广更接近 LLM”这一假设上。那你为什么不同意呢?或者说,支持大规模工业化及机器人扩张可行的论据是什么?我对这一可行性持高度怀疑态度,尤其是关于时间线。我认为这需要几十年的时间,而非两到五年内需要担忧的事情。我可能没有充分公允地考虑过这一点,但我依然对此表示强烈怀疑。

00:19:01 JS Denain: 明确来说,两到五年确实是个比较粗糙的估计。我在机器人领域了解得不太深。你的主要顾虑是可靠性吗?可靠性是否难以攻克,就像之前提到的,它涉及大量的长尾场景?还是说更多是现实层面的问题,比如需要应对更多监管?

00:19:21 Nathan Lambert: 我觉得关键在于造东西本身就很难。咱们这样吧,我带你们梳理一下。举个例子,我知道像亚马逊这样的公司,在建造新工厂时会优先考虑机器人化,这对他们来说效率更高。那么这就需要建立机器人工厂。就美国而言,你得先在美国高效地建一个造机器人的工厂,然后过渡到或者新建一个由这些机器人建造出来的工厂。我认为美国的重工业化进程面临许多障碍,这也是它迟迟未能发生的原因。中国的情况可能更有希望,但我仍未被视觉和行动模型方面的 AI 进展所说服,它们迭代的速度不够快。我在多模态领域和同行的讨论也表明,现有技术相比文本语言模型还比较原始、不够成熟,亟需更基础的创新。而代码加 RL 这种模式非常契合这种可预测的梯度提升过程。所以——

00:20:35 JS Denain: 我觉得这里有两个问题。一是机器人能力的进步速度没有 LLM 那么快;二是即使机器人能力很强,建厂也需要时间。对第二点我持怀疑态度。我的想法是,如果机器人能力足够强,这个市场空间是巨大的。看看美国的数据中心建设,速度就非常快。如果机器人真能完全替代蓝领工人,我觉着经济激励会非常强。我认为美国很多领域没出现大规模扩张,原因其实在于需求不足,比如电力就是这样。所以在这一点上,我想引用 Tyler Cowen 的那句话:不要低估供给的弹性。但在能力问题上,我不那么确定。尤其是,我还有些困惑,也没认真研究过:LLM 和基础模型到底能为机器人能力直接带来多少提升?另一个不确定的点是,我不清楚极其精细、极其灵巧的操作能力是否是引发大规模工业爆发的关键。所以,机器人技术最难啃的长尾部分,是否真的是大规模工业爆发最大的瓶颈,我也不确定。总的来说,机器人不是我的专长领域。我很感兴趣的是,有多少末日场景最终是通过机器人获取的硬实力实现的。我另一部分不确定性来自于:我认为造成巨大硬实力积累、进而构成灾难性甚至灭绝性风险所需的最低门槛,可能是像拿到核密码这类东西?我对这个问题没有特别成熟的看法,想做更多威胁建模。不过有一点是明确的:能力的发展趋势本身就存在争议,那么造成灭绝级危害、或者足以永久改变人类走向的灾难所需的最低能力到底是什么,这也是问题的一部分。

00:22:46 Nathan Lambert:是的。我关于机器人领域的最后一个观点是——

00:22:47 JS Denain:我觉得这类问题需要更多深入的思考,不过你说得对。

00:22:50 Nathan Lambert:我关于机器人的最后一个观点是,我认为机器人在约束性强、重复性高的环境中会表现非常好,比如制造业机器人。但我认为,要等到机器人能在街头与人类共存漫步,还需要很长时间。如果我想深入研究这个话题,我希望看到针对那些建设多个不同数据中心的人的研究和讨论,了解他们的工作到底有多少是重复性的(比如从卡车上卸货、放到指定地点),又有多少需要人类的灵活性和解决问题的创造力。我目前没有很好的信号来判断当前工作的重复程度,以及人类灵巧性和创造力在其中扮演的角色。

00:23:34 JS Denain:是的。不过目前,环境主要是围绕人类设计的,人类在这些方面相当灵活,还有其他约束。你可以想象,也可以设计出机器人优先的工厂。我认为你刚才提到了 Amazon,对吧?他们现在确实在这样做。所以,你还可以……是的,我认为这就是“锯齿状”进步能带来的影响。即便机器人可能在灵巧性或灵活性上无法完全匹敌人类,某些行业的物理世界仍然可能出现巨大的加速。总的来说,是的。我认为追踪机器人能力非常重要。我们在 Epoch 写过相关文章,但我们并不宣称在机器人领域有专长。

00:24:21 Nathan Lambert:是的,我同意。我觉得我们可以转向另一个能力话题:你认为顶级中国实验室落后于 OpenAI 和 Anthropic 多少?你可以定义如何衡量这个差距,无论是公开模型还是内部模型。我认为同时考虑这两者其实很有趣。比如,你会如何描述这个差距?你可以选择……这是少数我会逼你给出具体数字的问题之一。

00:24:47 JS Denain:是的。我觉得大概是六到八个月,或者类似的幅度。

00:24:53 Nathan Lambert: 是指从公开到公开?

00:24:56 JS Denain: 对。比如,从发布日期到发布日期。我手头没有精确的数据来衡量从内部部署到公开发布到底需要多久。抱歉,如果你把模型构建的时间也算进去,延迟时间可能会稍长一些,因为我预计 OpenAI 和 Anthropic 的延迟会比中国实验室大。不过我不太确定,光是看看 ECI,那里有几种不同的评估方法,而且这些方法之间也存在一定的噪声。这些方法都还算合理,我的直觉是,差距大概在六到八个月左右。

00:25:28 Nathan Lambert: 我会说像 Kimi K3 和 GLM 5.2 的差距更接近两到三或四个月。所以你觉得这些是测量上的异常还是过拟合?我经常和 Florian 讨论这个话题。Florian 经常帮我做 Interconnects,他总是在这方面死缠烂打地逼问我。我觉得我直觉上得出的结论更接近你的观点。我认为那两个模型,特别是 Artificial Analysis 给出的结果,差距非常小。我记得当时 Kimi 在 Artificial Analysis 指数上的差距甚至可能不到两个月。我抛出这个观点,但我也一直在反复权衡这件事。

00:26:12 JS Denain: 我记不清 Artificial Analysis Index 最新的细节了。我的感觉是,由于筛选标准之类的原因,它可能低估了差距,但我不想对此太有把握,因为他们的方法论也在不断更新。不过我认为即使是 ECI,也有一些案例显示差距其实更接近四个月。所以说不好,四到八个月对我来说是合理的区间。如果只有两个月,我会觉得“不行,这有点像是过拟合出来的结果”。我们内部也研究过过拟合能在多大程度上解释这个差距,比如做同样的 ECI 滞后分析,但只用私有基准测试,或者只计入模型发布之后才公开的基准结果,这类情况下不存在数据污染的风险。总体来看,这个影响在统计上基本不显著,挺有意思的。如果只依赖模型卡片里的结果而不是 ECI 收录的结果,可能确实会出现一些污染或过拟合的影响。但我仍然认为,类似 ECI 这样的指标可能低估了差距,因为我觉得 OpenAI 和 Anthropic 应该还有一些不太会体现在基准测试上的能力,而它们在这些方面做了更多优化,也在服务更广泛的用户群。总之,这就是我给出的整体数字。

00:27:39 Nathan Lambert: 如果我们有效地禁止蒸馏——甚至不只是禁止,而是蒸馏实际上被彻底叫停——你觉得六到十二个月后差距会是多少?我的前提是没有 RSI 疯狂起飞。如果 RSI 真的失控加速,头部实验室会拉开更大的差距。

00:28:01 JS Denain: 是的。按照当前趋势,我实际上已经更新了自己的看法,认为蒸馏确实是个非常重要的因素。我们可以聊聊各个不同因素的影响。那么,如果我现在说差距是六个月,那六个月后大概不会真的变成十二个月,对吧?所以我的猜测是,大概在八到九个月左右。也就是说,从六个月扩大到可能九个月。

00:28:31 Nathan Lambert: 你为什么更新了对蒸馏(distillation)有效性的看法?

00:28:35 JS Denain: 对,我想主要有两个原因。一个比较肤浅的理由是,我不太清楚,但似乎越来越多人都在这么说。

00:28:45 Nathan Lambert: 确实如此,这让我感到意外。

00:28:47 JS Denain: 是的。Stolen Thoughts 那篇论文也确实提到,获取相关内容其实相对容易。嗯,算是些闲谈。另一个重要原因是,我们可以聊聊这点,考虑到关于滞后(lag)的其他解释,它们不像我最初想到的那样具有说服力。我确实认为 Claude 路由器(routers) 这件事也相当关键。起初想到蒸馏时,我没考虑到这一层。但我觉得 Claude 路由器能提供符合实际使用场景的用例和提示词分布,这非常有用。

00:29:26 Nathan Lambert: 但现阶段这些公司已经有自己的使用数据了。我们也有基准测试(benchmarks),所以基准测试的分布我们已经有了。因此我不一定认为蒸馏能带来多少帮助……我认为路由器可能非常有帮助,但我对那个提示词分布的观点感到困惑,因为一旦你有了基准测试分布,你只需要构造或寻找类似的示例就行了。

00:29:50 JS Denain: 是的,我同意。我认为 Claude 的路由机制(routers)能生成大量有用的训练数据,这通常会提升模型能力,这是我提出的一个解释。我也认为,提供合适的 prompt 分布对提升实际应用能力很有帮助。当然,如果单纯讨论 ECI 滞后(lag)之类的问题,确实可以直接采用 benchmark 的 prompt 分布,但我觉得这并不足以解释得清楚。嗯……比如,很多人说 mid-training 非常重要,在那次对话中,Beren 提到 mid-training 实际上能让模型完成 80% 的目标。这类说法都表明 RL 非常有用,但并没有承担大量的探索工作。因此,这也证明了在语言轨迹上进行 SFT(监督微调)确实非常有效。

00:30:48 Nathan Lambert: 是的。我想梳理一下——

00:30:50 JS Denain: 我觉得他在一篇关于此的文章里提到,这是一个良好的初始化。不过我现在意识到,这个初始化的重要性其实非常非常关键。没错。

00:30:59 Nathan Lambert: 是的,因为我还是倾向于认为,把 RL 做好、做得更快从而能放大规模,才是各家提升能力的主要路径。不过最近我听到了更多关于另一种模式的讨论——大概是中训练 SFT 和 RL 之间反复循环,然后 RL 的巅峰表现反哺到中训练,而不是跑一次超大规模的 RL。我以前没想过这种可能。RL 训练大概也就一周左右,我觉得规模并不夸张,尤其是智谱或 Kimi 这种。所以我能理解这个说法,但我的反应是“我也不太确定”。我原本的想法是,模型现在已经很有用了,靠蒸馏来支撑中训练,规模得大到难以想象。而且反例是,Kimi 和 GLM 也很强——如果差距真的那么小,那蒸馏带来的帮助怎么可能那么大?这就是我为什么仍然持保留态度,但在等待更多证据。我手边还有我写的这篇博客文章。如果你想多聊蒸馏,可以在我们转下一个话题前补充一下观点。

00:32:21 JS Denain: 我其实挺想聊聊其他可能的解释。现在有个普遍现象:中国实验室的资本少得多,尤其是算力少得多,而且这个差距非常大。但不管是四个月还是八个月,能力上的落后时间远短于资本上的差距。这就需要某种解释。

00:32:48 Nathan Lambert: 对。那大家觉得,从 RL 训练完成到公开发布 API 和评测分数,中国实验室在发布速度上还有明显优势吗?过去我觉得他们发布快得多,但现在各家实验室也都在更快地放出中间版本,所以我不确定这还能解释多少。但一年前的话,我会把更多权重放在这一点上:中国模型几天内就能放出,美国实验室可能要拖几个月,这会人为地把差距压缩得很厉害。

00:33:26 JS Denain: 为什么发布速度能把差距压缩那么多?

00:33:28 Nathan Lambert: 从能力发展的轨迹来看,OpenAI 和 Anthropic 处于较高位置,它们目前暂停了训练,而中国的实验室则处于较低位置。但在模型正式发布之前,其表现似乎停滞不前。

00:33:44 JS Denain: 没错,我认为这取决于你用来计算滞后时间的方法。我的直觉是,当我提到四个月到八个月时,这个不确定性区间很大程度上来源于测量方式:是向前看还是向后看?你如何处理不确定性?是取阶梯状曲线还是插值?我认为这些因素仍包含在不确定性范围内。所以我的猜测是,即使考虑到这些,仍有大量影响需要解释。还有其他潜在的解释,比如计算资源的延迟很大,但劳动或数据方面的延迟较小,而这些是重要因素。即使计算资源落后两年,如果在数据上只落后六个月,而在研究人员数量上领先或差距不大,那可能有助于追赶。这甚至算不上溢出效应,而是一个原因。还有蒸馏(distillation)。人们提出的其他解释包括想法泄露,我怀疑这不是一个大因素。人们可以通过使用模型来推断其训练内容或优化方向。这些不完全像蒸馏,但使用 Claude 作为奖励模型或用其清洗数据等,可能会产生一些溢出效应。

00:35:23 Nathan Lambert:让我想想。我在尝试量化一些因素。我认为中国实验室在财务层面更看重基准测试。其中一些是上市公司,展示接近前沿模型的基准结果对它们帮助很大。所以我确实认为它们更看重这一点。我不知道这是否会带来一两月的领先优势。我不清楚你会得到什么回报,比如一两个月。我认为中国实验室在组织人才进行繁琐的 hill-climbing 数据处理方面可能更有优势。我认为这不会带来巨大影响,只是它们拥有大量人才,并且在文化上通过……我认为这很可能就是更艰苦的磨练。它们可能在效率上比美国实验室磨练得更有效,这就……我不知道怎么说。我不太愿意把这个归因于此,因为我觉得差距其实很小,但我认为确实存在这种可能性。但这只是非常微弱的……这不是巨大的领先原因。我更倾向于将其归因于计算量差异,而非蒸馏。不过也许蒸馏与计算量差异密切相关,因为这是一种将资金转化为极高质量数据的方式,而这原本需要消耗大量算力。

00:36:35 JS Denain:是的。还有另一个理论,我研究过但不确定其影响有多大,就是美国存在这样一个数据市场。也许发生的事情是,找到最佳的 RL 环境或评测其实需要大量算力。因此,数据提供商和 AI 实验室之间可能存在某种协作,共同测试并找出哪些 RL 环境真正有效。然后,一旦该数据提供商完成这一迭代过程——这隐含了前沿实验室大量的 R&D 算力投入——他们就会构建大量类似的 RL 环境,因为他们已经吸取了经验教训。随后,他们虽然会有所延迟,但仍会将这些环境出售给其他方,包括中国。

00:37:21 Nathan Lambert:我从其他人那里也听过这种说法。

00:37:22 JS Denain:所以,这里存在一种隐形的 R&D 算力投入,而他人因此得以节省。我不确定这究竟有多重要。

00:37:29 Nathan Lambert: 这种说法我听过好几次了,包括从一些中国人那里听来的……这是种类似“多跳传播”的传闻,大概意思是:只要等一段时间,就能以十分之一的价格买到 Anthropic 当初买的那批 RL 环境。我觉得这确实能大幅提升资金使用效率。但我一向认为人的因素对模型进步非常关键,比如竞争氛围——OpenAI 和 Anthropic 之间目前的竞争感,本质上就是一种“概念验证”:证明了某条路走得通,事情就会容易得多。我确实认为 OpenAI、Anthropic 这类公司更可能在开放式方向上创新,比如 Navier-Stokes、多智能体超大规模训练,而中国实验室则相对少一些。我跟不少中国实验室的人聊过,我觉得他们不会反驳这一点,但大概也不会公开承认——毕竟跟着追赶要容易太多了。

00:38:27 JS Denain: 是的。所以这更接近所谓的“四分钟一英里”效应——你证明了某件事是可行的,别人就有了信念沿着这条路走下去,不用浪费大量资源去探索其他各种方向。你说的就是这个意思吧。

00:38:43 Nathan Lambert: 对,我觉得这个——

00:38:44 JS Denain: 我想找找这方面的例子……具体有哪些例子呢?比如说,推理模型就不属于这种情况吧?DeepSeek Math 之类的可比 o1 早出来了。所以我还是挺好奇的……我同意这个说法听起来挺有道理的,但我不太确定能不能举出哪些重大创新是前沿实验室——

00:39:04 Nathan Lambert: 我觉得问题更多出在组织架构上。实验室里的研发算力往往被混为一谈,但现实是,训练下一代模型所需的算力,与两三代以后的模型相比,其实是完全不同的两回事。我认为中国实验室在投入时考虑的是更短的周期。而且,如果架构出现重大创新,消息在美国生态圈内很快就会被传开,我假设中国实验室也会搞明白。我不认为 Anthropic、OpenAI、Meta 和 Google 能很好地守住架构创新的秘密。我认为这些创新很快就会通过人员流动泄露出去。

00:39:50 JS Denain: 我懂了。所以你认为这其实有重大影响。换句话说,我觉得你的意思是,仅靠其他解释因素就足以解释很大一部分差距,因此并不需要靠模型蒸馏来解释主要差距。

00:40:03 Nathan Lambert: 没错。我认为如果不考虑蒸馏,目前的差距也大致会是这样。另外,在构建这些模型时,有很多唾手可得的提升空间。我不认为蒸馏能填补多少这类容易获得的收益,这点非常不明确。比如,一旦确立推理轨迹的风格……这虽未得到证明,但我认为在中阶段训练和 SFT 过程中,你的推理轨迹需要具备相当独特的风格,才能让策略层层叠加,并为模型定义明确的推理策略。Kimi 和 GLM 做到了这一点,我认为它们可以在此基础上进行调整。问题在于,如果 Anthropic 和 OpenAI 的迭代速度远快于此,这种复合效应随时间推移会产生多大影响,这点可能变得更关键。我不清楚。听起来我们还没得出什么结论。我很喜欢那篇分析中国 AI 招聘岗位的文章,我觉得这是窥探中国 AI 行业内幕的非常巧妙的方式。所以我不确定你对此还有什么特别的有趣发现。从外部理解这个行业的发展真的非常困难。

00:41:22 JS Denain: 是的。这项工作是 Cheryl Wu 和我做的。我认为,作为一种证据来源,它更像能让你获取一些有趣的小道消息或冷知识。我认为它并不太像 Epoch 那种能得出清晰、可长期追踪的趋势线。我认为某些招聘趋势分析对此很有帮助,但就中国的情况而言,它更多是呈现这种状态:“哦,你看到他们正在这个地区招聘数据中心相关的岗位,这似乎表明,至少其中一些实验室正在自建数据中心,而不是像租用 Alibaba 的算力那样。”于是,你会得到几个这类不错的信息点。我认为你也能稍微更了解不同公司的产品策略是什么,以及它们的追求目标是什么。所以,我认为就这方面而言,它相当有意思。这篇文章现在已经是六月发布的,事情变化很快,情况可能已经改变了。但总之,我认为关于公司策略,以及它们如何——

00:42:31 Nathan Lambert: 你能多说说公司的策略吗?因为我认为有很多东西被投射到,比如说…… 中国不同公司的策略上。这就好比,DeepSeek 的策略是什么?我认为 MiniMax 是比较清晰的一个,然后是 Zhipu。Zhipu 有一些本地部署(on-premises deployment)的东西,但从宏观层面看,我认为 Zhipu 更接近 OpenAI 和 Anthropic。你同意这个看法吗,还是你认为其中有些公司的定义更清晰,或有着更有趣的不同之处?

00:43:03 JS Denain: 是的。嗯,有一点就是,我认为我们有一张关于 B2B 销售岗位招聘数量的图表。举个例子,看起来 Z.ai(即 Zhipu)的这类岗位确实比 MiniMax 或 Moonshot 要多得多。我认为,它们在希望多大程度上拓展国际业务的策略上也有所不同。我认为 MiniMax 在这方面投入相当可观,比我们找到的 Z.ai 要多。我认为还有几件事是这样的。例如,对于 DeepSeek,我们没有看到那么多。

00:43:40 Nathan Lambert: 既然做了这个分析,你认为你能把你的分类体系交给一个 AI 模型,让它每三个月重新做一次吗?你认为这现在是 Epoch 几乎可以自动化的事情吗?

00:43:53 JS Denain: 我们确实有一些关于招聘信息的后续项目。不过具体到这类事情,我觉得总结出来的要点往往比较随意,更多是依赖“手里有一堆数据,看看哪些真的有意思”。而且很多时候,LLM 判断的“最有趣的五件事”并不怎么样。举个例子……我自己用 vibe coding 写了个很粗糙的招聘信息追踪工具,看起来 OpenAI、Anthropic 这类公司的招聘质量确实更高一些。Epoch 之后可能也会有相关内容。AI 在这方面很有用的一个场景是:把职位大致分类,比如这基本是研究岗还是工程岗?(研究工程岗可能不好分,但研究岗和 GTM 岗还是能分的。)各公司的团队结构并不统一,但你可以用 AI 自动持续追踪,建立一套一致的分类体系。这样就能看出趋势,比如“这家前沿 AI 实验室招聘激增,但主要招的是销售”或“主要是硬件基础设施”。我觉得这挺有意思的,而且可以自动化。

00:45:14 Nathan Lambert: 是的。如果你再做这类研究,我很想看看你能不能发现数据市场扩张的迹象,也就是那些职责就是“买数据”的岗位。我听很多人说中国的数据市场正在爆发,我也打听过——不管是认识的一些实验室的人,还是密切关注中国产业动态的人——得到的回答都是“确实,但我联系不上任何人,搞不清这具体表现为什么、他们的预算有多大”。要知道 Anthropic 的数据预算可是出了名的十亿美元级别。我觉得这个话题很快就会变得非常重要,比如算力出口管制相关的讨论。我估计年底前会有文章深入报道这个领域,但在我看来,要拿到这种报道所需的信息几乎是不可能的。

00:46:05 JS Denain: 是的。我觉得数据这块非常粗糙。对 Epoch 来说,数据一直是个棘手的问题。它显然是一个极其重要的因素,但更难量化或商品化,而且高度保密。所以,我觉得其中很多信息都是道听途说,很难判断可信度多高。我个人的感觉是,那篇文章其实对此有些提及。确实,中国公司在整体上的自研(in-housing)更多,我认为这一点也适用于数据。顺带一提,实习岗位的招聘也很多。如果你去看这些公司的招聘页面,通常会看到两个专门的标签页,一个是暑期实习或实习,另一个是常规招聘。我觉得他们在招聘初级人员方面力度很大,其中一部分可能就是用于数据处理。不过,前沿 AI 公司确实在数据领域的自研上有所增加。我不确定现在是否仍如此,但 xAI 似乎是唯一明确这样做的公司,这一点其实挺好的,因为如果你去他们的招聘页面,会有一个“人类数据”类别,可以直接看到他们在招哪些数据岗位。所以在数据方面,我们也该在招聘启事上做点文章,尤其是 xAI。我之前用 Mercor 和其他几家公司的数据做过类似分析。但我觉得同样有趣的往往是那些“哇,这是什么脑洞大开的岗位”。比如 xAI 在招“梗图专家”之类的,这些都更偏临时性的有趣尝试,而非明确的大趋势,至少从目前我看到的情况是这样。

00:47:35 Nathan Lambert: 是的。遗憾的是,我觉得这种情况不会改变。实验室的各个团队似乎都与数据公司有人脉联系,所有操作都是私下进行的,无法追踪……我想,即便是算力追踪也比较困难,但现在数据中心作为一种实体表现,多少是可以追踪的。而 NVIDIA 是上市公司,这就是现状。如果数据公司也是上市公司,我们或许能更容易地拆解出一些信息。

00:48:13 JS Denain: 同意。

00:48:13 Nathan Lambert:好的,我们再来聊一个很应景的话题。你如何看待前沿模型的安全保障措施?要知道,就在过去 24 小时里,我们知道有三个人利用公开的 Claude 模型黑客攻击了 OpenAI并获取了内部访问权限,这在我看来简直疯狂。你看到这个新闻了吗?身处一个如此漏洞百出的世界,我真的深感惊讶。与此同时,我们又正在更严肃地讨论 RSI(递归自我改进)相关事宜。

00:48:46 JS Denain:是的。我简单看过这起事故。我想我不太确定这究竟应该多大程度上被视为模型安全保障的问题,还是公司安全质量的问题,或者两者兼有。我觉得这是个很大的问题,对吧?模型安全保障究竟有多好?这看起来相当重要,尤其是当大家在谈论开放模型时——显然开放模型的安全保障更弱,因为人们可以拥有的“支持”(affordances)要多得多,但开放模型本身的性能也较弱。所以单就滥用影响而言,似乎存在这样一个对比:一个是稍加保障的超强模型,另一个是完全无保障的较弱模型。我感觉从一开始就不太清楚哪者会产生更大的影响。是的,我不确定。我觉得这是个有趣的问题。我觉得我也感觉到人们对这点看法不一。有些人强烈认为,至少持续地利用前沿模型做真正坏事是很困难的。但我认为,像这次事件,或者《Stolen Thoughts》那篇论文,都有明显的例子。尽管公司有强烈的动机去阻止这些情况,但看起来安全保障还是不足以防止它们发生。

00:50:06 Nathan Lambert:是的,关于《Stolen Thoughts》——

00:50:07 JS Denain:我对此有点困惑。

00:50:09 Nathan Lambert: 关于 Stolen Thoughts 这篇论文,我把它归为服务层面的问题,就是有人通过越狱 API 的方式,比较可靠地把推理轨迹提取出来。我觉得中国的实验室几乎肯定已经在这么干了。这或许能更清楚地展示蒸馏到底产生了多大影响。不过既然已经有了这么显眼的一个例子,我猜他们应该还有其他拿到这些 token 的渠道。再就是模型本身的安全防护,比如分类器、提示词过滤之类的东西。我预计这些模型会一直存在一定程度的泄漏。很难想象别的结果:如果你手里有一个对齐程度较低的模型,让它去完成“帮我绕过某个对齐模型的安全防护”这类任务,我猜对于强大的网络安全模型来说,想出针对另一个模型的某种越狱手段是在能力范围之内的。现在模型泄漏得这么厉害,似乎很难永久压制住这些问题——尽管官方号称发布了更高的误报率和更严格的通用防护。结果就是用户不高兴,模型老是被降级,做生物研究的人账号还动不动被封。整件事简直就是一团乱麻。我倾向于认为,这大概就是之前那场 Fable 恐慌事件的某种成因:Anthropic 觉得“Mythos 是个威力巨大的武器”,然后有人告诉政府“这东西其实很容易绕过”,于是他们就慌了。但我的看法是,蒸馏的故事一直围绕着“蒸馏让他们得以规模化、继承危险能力”这一点。而我认为,只要你在运营 API,你就必须假设在当前和可预见的未来,模型的能力都是可以被提取出来的,哪怕它做了一点安全防护。

00:52:14 JS Denain: 嗯。我想说的是,我不确定他们如何权衡不同的威胁模型,但他们似乎确实有动力去防止模型蒸馏。不过,很难判断反事实是什么,对吧?我们确实看到有人在做这些坏事,这些模型也有大量使用。但在大多数情况下,其实真的很难做到,要么是那些人碰巧解决了问题,要么是某些随机波动让他们得逞了。所以我不太清楚该如何基于这些证据更新我的判断。但确实,至少在某些案例中,人们还是设法绕过了限制。也许还有一个区别在于:你需要花多长时间来做这件事?这里有两个层面:一个是嵌入模型权重中的对齐(alignment),另一个是你当时能做的同步监控。同步监控的效果肯定远不如异步分析,后者可以投入大量算力来解析轨迹、分析群体行为轨迹等。但这需要更长的时间,如果某人需要快速发起攻击,那么实时检测就太困难了。但如果某人想进行一场长期的行动,也许会更难绕过。我不清楚这些行动需要多久,也不知道那些身份验证(KYC)措施有多有效。不过这在其他滥用场景中也很重要,比如那些并非涉及能力泄露,而是其他类型的滥用情况。

00:53:38 Nathan Lambert: 我想让问题更具体一点:你认为开放模型带来的风险中,有多大比例是因为人们可以自行部署开放模型,从而绕过了额外的监督和分类器?相比之下,我认为是之前讨论较多的另一种方式——通过微调移除安全措施——其实很少有人会对 Kimi K3 进行这种微调。但如果那些在推理时能拦截 99% 用户的分类器能够覆盖大部分风险,我认为这种情况反而更可能发生。这需要一个过程才能达到这种状态:你得假设人们能够绕过模型的安全防护,并假设有大量用户在使用。

原始来源: Interconnects

评论 (0)