← 文章 / AI技术
德先生 6小时前 · 2026-09-06 23:07:25 · 4 阅读

「大模型只会预测下一个词」:AI时代流传最广的一句错话

文章封面早期的自然语言处理系统,其核心逻辑始终牢牢扎根于模仿人类已有知识的范畴。当业界习惯于将大语言模型概括为「下一词元预测器」时,往往混淆了系统输出信息的表象形式与底层认知形成的驱动机理。在预训练阶段,模型反复审视海量前文语料,观察人类已有文本中紧随其后的真实词元,并通过损失函数计算、梯度反向传播与参数微调,促使真实存在的词元在概率空间中获得相对优势。这一过程本质上是「按图索骥」,模型的所有优化动作皆锚定于既有的人类知识图谱。将早期的基座模型定义为依赖既有语料的概率映射系统,确实切中了其「亦步亦趋」的工程本质。正文解释图

带可验证奖励的强化学习(RLVR)等后训练技术的引入,从底层重塑了智能系统的演进规则。虽然经过后训练的模型在推断交互时依然维持着逐个词元输出的外在形态,但进入RLVR的训练闭环后,数据集中早已不存在一个预设的标准答案等待模型去被动附和。

该阶段的系统依托环境反馈进行广阔的策略探索,自主生成全新的推理链条,并在端到端的可验证结果中获取奖惩。

预训练机制提升特定词元的概率,源自人类文本库中该词元的物理存在;RLVR提升特定生成路径的概率,则源自该策略在解决复杂目标时斩获的全局更高回报。目标函数从「被动猜中局部字符」彻底转向「全局谋求最优胜率」,驱动智能涌现的引擎已然发生质的飞跃。

以棋局之理观之,两者的分水岭清晰可见。一套机械研读万卷人类棋谱的系统,面对复杂棋局时所计算的,是棋圣国手最可能落子的位置,这属于纯粹的模式复刻;另一套经历过天文级推演与自博弈探索的现代博弈引擎,即便面对人类谱系从未记载的陌生困局,亦能凭借胜率分布直接洞察最优解法。

此时若仍将后者贬抑为「下一步预测器」,无疑是买椟还珠。它早已不再猜测人类前人走过哪一步,而是在浩瀚的可能空间中自主裁决通向终局胜利的康庄大道。

「见形而忘其神者,天下之蔽也。」

逐词元输出仅仅是当前计算硬件与生成架构的外在形式,绝非衡量认知上限的真实标尺。

基于人类反馈的对齐训练赋予了系统扮演高水准协作伙伴的角色认同,而基于环境验证的强化学习则赋予了模型在未知知识荒原中自主开拓全新解题路径的能力。

将模型的输出外形视作其推理能力的全部,恰如以口舌之吞吐判定神智之深浅。

洞察新一代智能系统演化趋势的战略基点,在于审视其底层究竟由何种高价值的奖励机制所牵引。

来源

  • gmcgoldr.github.io(https://gmcgoldr.github.io/2026/09/04/llm-next-token-predictors.html)

本文由 AI 辅助撰写,内容经人工审核后发布。


原始来源: 德先生

评论 (0)