← 文章 / AI技术
Interconnects 5小时前 · 2026-08-28 17:53:56 · 1 阅读

我写了一本 AI 教材:AI 还要多久才能做得更好?

人们对 AI 写作有不少批评,但大多针对的是像这篇博客一样,更具创意、更有个人风格的文章。这些批评——包括我自己写过的那篇——通常认为,好的文章应当有鲜明的个人风格和独到的观点,能够传达深层次的人类情感,也应当让读者从遣词造句中窥见作者的思考过程。随着 LLM 逐渐从对话助手转向更成熟的工具,我反而觉得,我们想让模型写出鼓舞人心的文章这一目标,正在倒退。

另一类则是非虚构写作。生成填充内容和宣传文案,曾是 LLM 真正实用的能力之一(Sam Altman 最近在一次播客中也多次谈到 GPT-3 早期的商业应用)。过去看来,这方面的缺陷主要源于模型整体智能不足,或训练存在其他问题;随着技术快速进步,所有非虚构和解释性文本最终都会被模型彻底超越。但过去几年里,我一直把这些模型当作写作助手使用。它们确实进步了一些,不过,我们有必要认真想想,究竟是什么在限制它们。

如果模型在长篇非虚构写作上的能力长期停滞,那些指望模型在不久的将来自主解决重大开放性科学问题的人,应该对此感到警惕。如今的模型连本领域一些最成熟的科学知识,都难以组织起来并以有说服力的方式呈现。这似乎是模型在能够独立解决广泛、开放式问题之前,理应先掌握的一项基础能力。在这一步实现之前,LLM 在科学领域的进展恐怕更像是解决一些容易摘取的成果、连接不同领域中相距较远的知识,而不是产生某种革命性的洞见。

对于一个对 AI 发展十分乐观的人来说,这或许是个颇具争议的看法——尤其是 Anthropic 恰好在当天发布了一篇博客文章,介绍 Claude 在著名的Riemann Hypothesis(黎曼猜想)上取得了一些进展。科学问题的覆盖面极其广泛,而我认为,当前 AI 模型掌握的知识远没有许多人想象的那么全面。

组织知识本质上是一种压缩。这种压缩是形成洞见的必要条件。如今的 LLM 在长篇非虚构写作中反而会增加熵,我看不出这种产出如何能够无限叠加、不断自我构建。它们仍然需要人类充当某种引导者。

不过,我依然非常看好这样一种可能:把数学等狭窄科学领域中取得的巨大进展,迁移为稳定而广泛的整体进步。LLM 是科学家迄今使用过的最强大助手。首先,我需要解释:当我观察模型如何处理写作中这类扎根于事实、处于较低层次的知识问题时,为什么会意识到它们的泛化能力出人意料地不足。

补充一点背景:我刚刚写完一本关于 post-training 的教材,书名是 Reinforcement Learning from Human Feedback(可在 ManningAmazon 购买)。写作过程中,我以多种方式借助了 LLM:包括协助处理公式的 LaTeX 排版、进行大量文字校订,以及用 TikZ(LaTeX)或 Python 等编程语言制作示意图

分享

为什么模型的写作质量停滞不前?

我原本以为,模型在非虚构写作上的进步应该远远更大。回想 2024 年的情况,我甚至差点觉得,2026 年出版一本非虚构作品会让自己显得很可笑。如今,写作能力最受认可的一些模型其实已经相当老了,比如 OpenAI 的GPT 4.5和 Moonshot 的Kimi K2。在这些模型发布前后,它们在编程、数学等其他任务上的能力却从“还行”一路提升到了超越人类。更接近、但仍不完全相同的例子,是模型在搜索和研究任务上从完全无能进步到基本够用。大多数其他能力都在飞速提升,但写好文章似乎与它们不在同一条发展轨道上。我不认为写作只是被忽视了,更可能是因为它本身很难,而且缺乏能够针对性改进这一能力的优质训练数据。

当然,要提升 AI 模型的写作能力,还有一些显而易见的突破口——比如 Claude Code 这样的专用 harness、更好的 prompts,以及能让模型在输出上投入更多 inference tokens 的训练环境。但我不认为这些手段会让能力实现成倍提升。写好文章是一项极其困难的任务!很遗憾,我们还没有为这项伟大的智力活动找到有效的 inference-time scaling 方法。无论如何,写作似乎与模型擅长的事情有着本质区别。1

如今的模型在长篇技术写作方面似乎真的糟糕透顶。让它们写对一句话并不难,但如果要求它们完成整章内容,结果往往会充斥令人困惑的措辞,结构组织混乱,整体感觉也不太对。它们经常在不需要卖弄的时候故作聪明,结果反而犯下各种莫名其妙的概念错误。随着模型变得更大,它们在不久的将来会大幅减少这类小错误——更大的模型能够掌握更多世界知识——但我不认为它们运用这些知识的能力会因此发生质变。

例如,GPT 系列长期以来在查找错别字和细微问题方面都表现得非常出色。我把自己那本书接近定稿的 PDF 交给 GPT 5.5 Pro,它找出了这份长达 200 到 300 页的手稿中一些隐蔽而出人意料的小错别字。

另一方面,Claude 模型更适合充当编辑。它们的品位好得多,往往能更准确地理解任务背后的思维模式,也更能提出有意思的建议,帮你突破各种写作瓶颈。

我上面举的例子其实都有一个共同点:模型擅长检查每个内容单元——通常是一句话、一个公式或一张图——也擅长针对你卡住的某个具体部分提出修改。有了这些能力,它们却不太擅长回头审视各个组成部分,再把它们连贯地串起来;尤其是在不断叠加大量修改时,错误似乎会以某种无法避免的方式不断累积。过去我们在数学和代码中也会遇到类似问题,但回过头看,RLVR 确实是减少这类错误的神奇解决方案。

Interconnects AI 是一份由读者支持的出版物,欢迎考虑订阅。

订阅

作为作者,如何从现有模型中获得价值

我愿意坦白,我的书里有几句技术解释来自 AI 模型——当然不到 1%——之所以保留下来,是因为我真的很喜欢它们。作为真正了解这一主题的专家,如果我认为这句话正是读者需要的内容,我就允许自己把一些 AI 生成的文字写进书里,因为这并不算作弊。尤其是在编辑阶段,我会非常仔细地审阅内容,同时还要担心手头这么多事情会不会让这本书永远无法完成,因此这成了一条极其有价值的推进路径。

比如,我的编辑在 LaTeX 文件中插入了一系列问题,每条问题都使用类似 \editor{} 的特定分隔符。我会让 Claude Code 逐条定位这些评论,打印前后的上下文,并判断这是简单的拼写错误,还是需要更细致处理的问题。然后我会自己写出回复——也就是要插入的文字——或者先让 Claude 提供建议,再进行修改。从思考方式上说,这是一种非常专注的编辑过程,也是一种有趣的改进书稿的方法。有时,Claude 建议中的某些措辞最终就被我写进了书里。

这确实是一条容易越走越远的路。我第一次采纳 AI 的建议时,已经在进行第二轮完整的全文审阅。那时从情感上说,这个项目已经完成了,但实际上还有不少工作要做。完成这本教材后,我越发珍惜自己在 Interconnects 写作时那条明确而简单的规则:文章内容绝不使用 AI 的输出。完全按照自己的方式写作更有趣——保持鲜明的个人风格,而写作本身也承载着极大的价值。但编写一本标准参考书,通常并不是以有趣著称的活动。我现在能理解,为什么人们会把 AI 工具当成拐杖:当大多数写作只是为了填充篇幅,而不是为了实现某个目标时,确实很容易依赖它。而我愿意大量写作,是为了学习、感受和表达。

在科研工作中,我也在处理类似的取舍。AI 模型很适合完成论文中那些重复性的部分,比如起草自己早已熟知的相关工作或背景介绍。但如果把它们用于摘要、引言、实验或结论,就未免可惜了。论文的故事和灵魂,正是在这些部分中传达出来的;你也正是通过它们,真正理解自己的研究究竟在做什么。

我相信,借助 AI 模型来创作和检查非虚构写作,我最终创造的净价值要高得多。它们能让公式编写变得轻而易举,也可以帮助重构代码仓库、在不同语言之间移植代码,以及完成许多其他工作。起初这一切非常有趣,只是随着出版流程不断拉长、眼看着整个领域继续向前发展,我也逐渐感到疲惫。

这次经历之所以离不开 AI,一个很典型的例子是:我必须同时维护这本书的 Markdown 和 LaTeX 版本,而且它们分别位于两个地方——读者会对网页版提出反馈,而 Manning 的编辑团队则在审阅一个分叉副本。没有 AI agents,在这两个版本之间同步内容,耗时很可能会增加到原来的五倍(而这项工作本身已经花了几十个小时)。

在思考 agents 时,我还偶然意识到一件与这个故事密切相关的事:使用 agents 并不会加快你的理解速度。未来真正有价值的,恰恰是这种理解所形成的直觉、品味和本能。如果用 AI 来完成非虚构写作,你的这些能力就会少一些成长空间。更糟的是,如果你本来就不是专家,也很难发现 AI 输出中的问题。

对我来说,当时有一种强烈的紧迫感,恨不得把脑中的知识尽快倾泻到纸面上。因此,有些时候,使用 AI 模型确实是值得的。写这本书的一个重要动机,就是为 rejection samplingcharacter training 等重要的 post-training 方法提供一份单一参考资料,因为网上关于这些内容的资料实在太少。

这本教材在很大程度上是我对社区的回馈,所以只要能以某种形式完成它,我就觉得已经是很大的收获,也因此认为这样做没什么问题。我当然相信,如果投入更多人工,我能学到更多,成品也能得到一定程度的改进。但真正促使我这样做的,是一种担忧:等到这本书正式出版时,它可能已经过时了。一方面,我担心 AI 模型的能力发展太快;另一方面,这个领域本身也在迅速演进。

结果证明,这种担忧大错特错?我对最终成果非常满意。相比 2024 年开始写作时,我现在反而更有信心相信它能长期发挥作用,因为这些模型在非虚构写作方面远没有达到外界的宣传预期。

分享

技术写作的未来

这些模型是不可思议的工具,能帮助你以不同形式表达知识。它们非常适合生成创意性填充内容或背景材料——比如先起草一份幻灯片,其真正价值在于为教师授课提供讨论线索——让知识从一种媒介转换成另一种媒介。

写非虚构作品或参考教材时,前期有一个微妙的阶段,和写这样一篇观点鲜明的博客文章有些相似。在梳理早期结构、呈现核心框架的过程中,新的知识会被创造出来。这一环节需要洞察力,而 LLM 在取代人类完成这项工作方面还差得很远。

上面这一段以及前文的核心意思是:如果世界各地有更多专家借助 AI 模型,哪怕只用它来完成书中很小一部分内容,我都会感到高兴,因为这样能让更多知识与世人分享。问题在于,如今 AI 模型只能帮你节省 10% 到 20% 的工作量,我也不认为这个比例会在短期内提升到一半以上。

此外还有社会压力:人们期待 LLM 成为最优秀、最个性化的教育者,于是觉得再写书或制作教育内容毫无意义。我认为,这类看法正在逐渐过时,因为高质量教育内容一直都极度匮乏,尤其是顶尖水准的内容。AI 擅长把现有内容加工成适合学生的形式,却不擅长从零开始创作这些内容。

与此同时,我觉得我们正陷在一个令人沮丧的局部低谷里:AI 模型总体上会减少人们平均投入在非虚构写作上的精力,却也可能帮助人类实现出色的表达。最终,愿意动笔并坚持写完的人会变少。

因此,未来 2—5 年里,我仍然认为最好的教材会主要由人类精心打磨。再往后我就不确定了,但这已经比很多人的预测更久——毕竟,这些模型掌握了如此庞大的知识,而且从结构上就倾向于把知识源源不断地输出出来。

至于模型的能力,可以得出这样的结论:它们在两类场景下表现出色:1)任何真正可验证的领域;2)提供大量上下文、只要求进行小幅修改时——比如找 bug、解决一个非常具体的数学问题,或给出反馈。它们并不擅长以开放式的方式生成 prose。长篇写作肯定会早于创意写作受到冲击,但这也清楚表明:面对定义不充分的问题,模型无法表达其知识的全部范围。当我们试图让模型成为“数据中心里的天才”,去解决宏大的科学问题时,这似乎是一个相当根本的局限。


Jasmine Sun 曾写过一篇很棒的文章,讨论为什么 LLM 是优秀的编辑,却同样是糟糕的作家

1

这在一定程度上也取决于人们如何使用模型。如果你在 Claude Code 中(我相信在聊天应用里也一样)让 Claude Fable 5“写一首关于金鱼的精彩诗歌”,模型很快就会吐出答案。我问过模型它是如何做到的:在返回满意结果之前,是否有某种写给自己、再不断迭代修改的草稿区?它回答说没有。它只是在推理 token 中制订了一个最简计划,然后以自回归方式生成诗歌。也就是说,它完全没有利用推理时扩展,也没有把这当成一项困难任务来处理。

大多数人显然就是这样让模型写作的,结果平庸也就不足为奇了。想让模型发挥最佳水平,应该给出非常详尽的提示,让它在回答前充分思考和处理,并参考其他评审模型的意见后再输出文本。考虑到当前的模型确实已经具备一定能力,其实有一种简单的方法可以提升长篇内容的质量。

9614分享上一篇下一篇
原始来源: Interconnects

评论 (0)