← 文章 / AI技术
Hacker News 5小时前 · 2026-09-22 16:05:38 · 1 阅读

前沿 AI 跑在你自己的硬件上

在我的一个课程上,我提出了一个既害怕问又必须得到答案的问题:“谁担心毕业找不到工作?”教室里大约 150 人中有 80% 举起了手。这意味着大约 120 名学生用一个动作表明,他们不相信未来有他们的一席之地。

另一个故事是通过邮件传到的。有些博士生等不及毕业,因为他们想加入前沿实验室,并认为学术研究毫无意义。他们正数着日子,期待离开这一天。

我认为这两个观点都是错误的,而且错误的原因相同。它们假设研究的未来属于拥有最多 GPU 的人。我恰恰认为事实相反。学术界很可能即将迎来文艺复兴,未来十年最令人兴奋的工作将在大学实验室发生——不是因为他们资源有限,而是正因如此。

本周我们将论证这一观点,且是以代码而非文字的形式呈现。

这篇文章包含六个部分:为什么像我们这样的实验室现在发布的是生态系统而非单篇论文;这个开源周具体包含什么;我反复遇到的悲观论调错在哪里;应该放下什么、又该坚守什么;放下束缚后研究会变成什么样;以及为什么文艺复兴发生在学术界。

目录 隐藏 研究的单位不再是论文 开源周 为什么悲观论调是错的 放下你的工作方式,而非你的本质 未来的研究长什么样,该如何为之训练? 文艺复兴在学术界 相关 相关文章

研究的单位不再是论文

过去一年的时间里发生了一些变化,而我们大多数人还没有更新自己的习惯以适应这种变化。

翻译如下:

有了智能体,研究项目变得轻而易举,速度也大大加快。过去需要花一年时间进行工程开发和实验的工作,现在几周甚至几天就能搞定。有一点我是过了好久才意识到的:当每个单独的项目都变得容易时,零散的工作就不再算好的研究了。这边发一篇论文,那边发一篇论文,每篇都自给自足,还得让读者自己去拼凑碎片——这是来自一个“每个碎片都很昂贵”的世界里的格式。

困难并没有消失,它只是转移了。发表一篇论文不再难,难的是构建一个连贯的生态系统。

研究的单位是生态系统。

开源周(Open Source Week)正是为此而生。我和学生起步时,就打算构建那些相互叠加而非仅仅并存的组件,让每个部分都让下一个部分更有用。我和我的实验室相信,我们要利用学术自由,把最好的 AI 工具免费带给每个人。这是大学独有的优势。具体来说,这意味着构建开放系统,降低本地运行模型的成本,增强本地模型的能力,构建能复现前沿水平的深度与自主研究本地系统,以及探索构建领域特定强化学习环境的新方法。

这一切都处于三个领域的交叉点:推理服务框架、智能体框架及其工作流,以及将这两者结合成的自主研究系统。而且这一切必须易用,因为只有资深研究人员才能跑起来的开源,不算真正的开源。可及性有两面——你需要的资源和你需要的专业知识——其中只有资源受硬件限制。几块 GPU 或一台 MacBook 可能就足够了。专业知识门槛是个设计问题,解决办法是抽象掉用户不需要关心的所有技术细节。我们的大部分精力都花在这里,这在智能体框架上体现得最明显。

开源周

在开源周开始之前,我不想把底全亮出来,所以现在能告诉你们的只有这些。

如果问我现在一个小型实验室能做什么,我们会展示三样东西:前沿的自主研究、我所知的最高效的测试时扩展(test-time scaling),以及比 Claude Code 或 Codex 实现的高效得多的自动压缩(auto-compaction)。

先从框架说起,因为它让其他一切都变得可用。

你大概听说过 agent 会话能连续运行几小时、几天甚至几周。对大多数人来说,尤其是从没用过 agent 的人,这简直是个谜。你把我们的 harness 指向一个代码仓库——比如一个带 CUDA kernel 的推理框架——让它去优化这些 kernel。然后你就可以走了。它会持续改进,哪怕进展缓慢、工作枯燥也不停下来,一直干到你回来为止。整个过程没有任何反馈,所以遇到不清楚或拿不准的地方,agent 只能自己想办法解决。

我们在推理框架的 Mac 和 Metal 实现上就是这么做的。一条命令就放开了 agent,让它随便折腾 kernel。结果回来的是一个 Qwen 3.6 35B-A3B 模型的量化推理,速度达到每秒 450 tokens,在每权重 1.5 bit 下依然输出高质量。要知道,半精度模型每个权重需要 16 bit;而 1.5 bit 意味着同样的模型只占原来十分之一的内存,而且速度快到感觉上就是一个本地进程,而不是在调用远程服务。

这就引出了本文标题的主题:当原本遥不可及的模型能跑在你自己的硬件上时,会发生什么?

Qwen 3.8(270 亿参数)一直是热门的本地模型。而我们的框架可以让你在单张 24 GB 显存的 GPU 上——也就是普通台式机里的那种显卡——跑它更大的兄弟 Qwen 3.8 Flash Next(1250 亿参数)。如果你有 AMD Strix、NVIDIA DGX Spark,或者一台 128 GB 内存的 MacBook,你甚至可以跑 DeepSeek V4.1——一个 5500 亿参数的模型。上下文长度也不用你操心:压缩和上下文处理都是自动的,长上下文下推理速度依然很快。

接下来才是我最兴奋的部分。

我们把这几块拼在一起,进一步推进了自主研究,过程中还开发了一种全新的信息检索技术,精度之高前所未见。这个系统击败了前沿实验室的 deep research 系统,自主研究的效果也优于 Sakana AI 的系统和 Google 的 ScientistOne。而且它完全在本地运行,完全不联网。

用起来很简单。让我给你讲讲我做的那个实验。

我让智能体在生物信息学领域找一个值得投入的问题,因为我对此了解不多,所以定下了几条具体标准:进度必须快,评估成本要低,得能在我们现有硬件上跑,而且题目得新——最近四周内得有人发过相关论文,这样才不会被领域内已有的成熟结论限制住。智能体给出了三个候选,我们挑了第一个。大约两小时后,它已经在启发式方法上确立了新的下界,开发并测试了文献中最好的启发式方法,推进了接近于用 AI 模型训练的昂贵方法,还指出了大家评测该问题时共用的数据来源里存在缺陷。我们没有在整个问题上刷新最先进水平。但结果依然显著:在我实验室一台机器上工作两小时,产出了四项成果,其中一项直指该领域赖以运转的评估数据本身。

这套系统不是我们为了写博客而摆出来展示的玩具。我的学生天天在用。在放进这个框架之前,它是挂在一个 Slack 机器人上的,稳定性堪忧,时不时掉线。当时我没有设置邮件提醒,但有第二个信号:学生隔三差五跑来问我,“Tim,那个 Slack 机器人好像坏了,不工作了,能帮忙看看吗?”在协作场景里,我开完会后用它做后续处理:从会议录音里生成研究问题,拿讨论过的点子对照文献评估,把有前景的方向和没前途的分开。然后生成一份 Google Docs 文档发给学生。我这么做过了两次。学生觉得有用,但流程里得我手动复制粘贴两处内容,太麻烦,就停了。接下来两场会议我没再用它,结果学生反而带着期待来问我能不能再用起来——因为他们发现这东西整理研究方向时特别好用。

对我而言,一个研究工具唯一可信的评测标准就是这个:你停了之后,别人还会来要。

最后一块是我们用得最多、聊得最少的部分:对话结束后,怎么让智能体接着干?

我们的答案是一种名为 CliffCompaction 的自动压缩技术。我们在实验室里已经使用它数月之久,以我个人的经验来说,我已经离不开它了。它比 Claude Code 或 Codex 中的自动压缩功能要强大得多。使用它的会话可以处理数百万的 token,我的一些会话甚至超过了一亿。它还能将整体成本降低约百分之五十。我们的一个合作伙伴将其部署到公司内部,测量结果显示其总 AI 预算减少了百分之四十五——几乎一半的 AI 支出直接省去,而无需牺牲任何性能。在 KernelBench 上,它达到了最先进水平,大幅超越了比我们复杂得多的方法,包括类似 AlphaEvolve 的方法和分层记忆系统。我们将发布一个增强版本。我们已经在下一版本的自动压缩技术中实现了部分功能,效果更佳。

它同时改善了成本/能力权衡的两个方面:会话运行时间更长,账单更低。换句话说,代理不再遗忘之前做了什么,你也不必为这种遗忘付费。

更长的会话,更低的开销。

这便引出了列表中关于测试时扩展(test-time scaling)的部分,因为这与上述技巧息息相关。自动压缩将成本降低约百分之五十,你可以重新投资这部分节省:在相同预算下,不再只进行一次 rollout,而是购买多次。我们发现了一种首个实用方法,能在相同成本下将多次 rollout 转化为显著提升。虽然这对日常工程工作尚不实用,但迈向实用级别的门槛并不高。结合通常未充分利用的本地部署,我们认为这将通向一个未来,任何人都可以在任何单一问题上运行多个并行代理。

为何悲观是错的

那么,150 名学生中的 120 名为何感到恐惧?

有三件事同时发生,但只有一件真正与 AI 相关。第一是一种信念,认为 AI 将夺走每个人的工作。第二是对 AI 如何改变工作的理解不足。第三是感染效应:自我挫败的思想在人与人之间传播,一个听过十遍同一句悲观论调的房间里,会滋生出第十一个传播者。

让我们从 AI 对工作的影响开始,因为这是我们可以实际推理的部分。

先从大家普遍认为会最先受冲击的职业说起。此前的预测是软件工程师会最先失业,但近期的趋势恰恰相反:对软件工程师的需求比以往任何时候都高。一个善用 agent 的工程师能开发新产品、维护现有系统,并以远高于从前的效率进行扩展——公司花在这位工程师身上的每一分钱都换来了更多价值。工作的要求变了:需要过硬的 agent 使用能力,而且往往需要比以往更深的专精——原来的“软件工程师”岗位已经不存在了。而这二者如今都触手可及:agent 技能靠时间积累就能掌握,过去需要多年打磨的深度专精,借助 agent 也能快速获得。

我们生活在一个渐进式改进的经济里。新一代手机并不比上一代好多少;改进是真实的,但很小,而且一年比一年难以察觉。许多服务也是如此。今天用 Lyft 或 Uber 打车,和过去的体验没有本质区别,将来大概也不会有,因为已经没什么可改的了。同一件事你只能“稍微好一点”那么多次,总有一天人们不愿再为下一个版本买单。

进步有两种形态,而且表现截然不同。不妨称之为改进/能力:改进让你已有的东西变得稍好一些,能力则给你一件你从未拥有过的东西。一个只产出前者的经济是有天花板的,无论其中的人多么努力。所以,看看当技术带来后者时会发生什么。

自动驾驶汽车就是最明显的例子,有趣的是它们的到来会极不均匀。在欧洲、亚洲这类路况复杂的地方,自动驾驶还很遥远。但在路网规整、交通有序的环境——比如美国的大部分地区——它会更早实现,并将在未来二十年带来巨大改变。机器人技术大概也走在类似的道路上:家用机器人会像洗衣机那样把人从劳动中解放出来,而解放劳动的意义不在于劳动本身,而在于你因此能过上的生活。

同样的逻辑也适用于你口袋里的设备。下一代手机未必更快,因为芯片的性能提升已经逼近极限。它可能会是一部完全不同的设备。

有人跟我提的一个典型情况是,说 AI 让产品变糟了。这个观点值得认真一听。如今已经是个老生常谈了:硬塞进去的 AI 毁掉了宿主产品的体验,微软产品里的 AI 功能更是几乎人人嫌弃。我觉得这种反应没错,但这其实是针对整合方式的评价,而非技术本身。设计得当的 AI 体验会改变你的交互方式、工作方式,甚至日常生活的结构。这样的版本是存在的,在那些做得好的产品上,你能真切地感受到差异。ChatGPT 就是最好的例子。

在美国,普通大众对 ChatGPT 的采用速度其实挺慢的。但不可否认,一旦人们跟上节奏,它对生活的影响是巨大的——不是小打小闹,而是结构性的改变。我们生产和消费知识的方式将被永久改写。

这种变化会带来动荡和复杂性,我不想假装它不存在。但动荡不是故事的终点。对新体验和新产品的需求拉动营收,营收驱动招聘,而招聘正是人们口中所谓「工作保障」的核心。悲观的解读只盯着动荡,却忽略了其后发生的一切。

放下的是工作方式,不是你是谁

即将到来的未来是剧烈转变,对很多人来说会是冲击、失望和幻灭。但事情本不必如此。

你现在能做的最有用的事,就是放手。放下过去做事的方法,放下被灌输的顺序——先学基础,再学更通用的方法,最后解决问题。也要放下「你的价值在于你已经学会的东西」这个念头,因为你正在使用的那些工具,就在你用的时候被重写了。

放下旧习惯并不等于失去自我,这两者的区别恰恰是核心所在。身份是必须坚守的东西:你做什么可以变通,但你是谁不能改变。我们做事是为了投入生活、享受生命;当生活发生变化,比如换工作、组建家庭或经历其他变迁,我们度过日子的方式也会随之调整。但人们会保持与自己本性的亲近——并非因为停滞不前,而是因为他们喜欢这样的自己。这就是他们的本质。我们都有缺陷,都爱着某些人,并将某些事物视为对自己或他人重要。技术并不会触动这些核心。一旦你确定了自己的本质,其他一切都变得可以商量。而能够商量其他一切,正是让我们能快速适应未来任何变化的能力。

那么,在实际中,“放下”是什么样的?

如果你是学者,你需要放下的是对论文的执念。不是不写论文,也不是不在乎论文——论文依然是我们沟通的媒介。必须放弃的是将论文视为成就单位、被量化和比较对象这种观念。如果生态系统是研究的基本单位,那么构建一个能让他人在此基础上继续创造的东西,其分量必须超过下一个微小的增量。

如果你是学生,你需要放下“先获取技能和基础知识,再解决问题”的想法。这个顺序要颠倒过来。在学徒制模式下——而这本应是博士培养的最佳状态——你不会为了日后解题而去读教科书。你是先附上具体问题,在过程中学习、建立理解和直觉,将注意力集中在困难的部分,而非那些现在可以直接查询到的部分。

困难问题将比以往任何时候都更加常见。不是因为世界变得更难,而是因为所有不困难的事情都会被自动化取代。真正重要的技能,是博士研究所传授、而几乎其他任何东西都不教的东西:坚持面对一个无法轻易解决的问题。

这才是值得投入的精炼技能集。

未来的研究将是什么样?你该如何为此训练?

如果智能体(agents)极大地改变了研究,那么从这里开始,研究将呈现什么模样?我们该如何训练学生去进行这样的研究?

这个问题我已经思考了大约一年,目前还没有一个清晰的答案,但答案似乎正在浮现。开始担任教职后,需要承担的责任比读博时做研究多得多,留给深入钻研某项技能再传授给学生的空间也变小了。但我决定牺牲一些东西来挤出这段时间——亲自使用 agent 做研究、摸索用 agent 做研究应该是什么样子、搞清楚到底是什么让它真正高效。这笔交换我一直在做。

大约一年下来,一些适合博士生的工作方式逐渐成型。比如:学生应该把生态系统当作工作单元;学生应该并行推进多个项目;学生应该先动手解决问题,边做边理解。

我正在 CMU 设计一个下周开讲的为期四周的短期课程,以及下学期的完整课程,目标是把全部内容放到 YouTube 上,让任何人都能学到这些 agent 技能。

掌握了合适的 agent 技能,未来并不灰暗,反而令人兴奋。会有一个过渡期,我不会假装这个过程很轻松,但一旦熬过去,可能性将是无穷的。当然,这种兴奋感并非都能经得起考验:刚上手 agent 的头几周,几乎什么都不靠谱。真正有价值的东西会稍后到来,等你对 agent 究竟能产出什么有了清醒的认识之后。从那一刻起,兴奋感才站得住脚,并转化为研究上的快速进展。

Open Source Week 展现的正是这种进展。

文艺复兴在学术界

那么,你应该在哪里做这样的研究?

我的答案是:在大学实验室,而且比你想象的要快。

原因就是我开头说的那点。Agent 让你能找到并研究那些不需要太多资源、却可能产生巨大影响的问题。这个领域——低成本切入却价值巨大——非常广阔,而且完全无人竞争,因为手里有资源的人都在别处厮杀:拼规模、拼需要成千上万张 GPU 的问题、拼只有最大实验室才敢尝试的方向。小实验室拥有的,是创造力、时间,以及研究前沿实验室无法涉足的问题的自由。事实证明,这是一种与所有人都在追逐的优势完全不同的优势。

开源周正是我们用实际行动诠释这一信念的尝试——我认为我们做得相当出色!和学生们一起打磨这些项目,过程充满乐趣。我们的实验室规模很小,只有几张 GPU。开源周因我仍在完善草稿而推迟一天,但从明天起,我们将一次性发布两个开源项目和四篇论文。关键在于它们作为一个整体打包亮相,互为补充,使彼此的价值倍增。

这并非预谋,而是自然促成的。我和学生目标一致:投身开源,构建真正有用的东西。不一定要是商业产品,虽然其中有些可算作研究成果,但更多是此前不存在的知识与技术。我原打算四周前就发布,学生们的课题一个多月前便已完成,但他们耐心等候,直到一切就绪,让所有内容作为一个完整生态而非零散公告呈现出来。统筹整合的难度远超预期——协调六项发布与做科研是两种截然不同的技能,后者我从未刻意练习过。但我相信这一切值得。

若此路走通,研究将达到前所未有的普惠程度,并印证一个当下学生亟需听懂的真理:只要几个人、几张 GPU,就能造出能与前沿比肩的系统。文艺复兴无需任何人许可。你尽管放手去做。

所以下次再问一百五十名学生里谁害怕找不到工作时,我期待举起来的手会少一些。机会摆在那里,学术界的未来一片光明,我对接下来的数年满怀期待。


原始来源: Hacker News

评论 (0)