从Token到答案:AI大模型的工作原理
AI大模型的
工作原理
从Token到答案



试想一下,当我们在百度中输入“深圳有哪些十一假期值得去的旅游景点”会发生什么呢?
在以往,我们会看到许多夹杂着广告的繁杂页面。我们往往需要逐步人工点选、筛查,才能找到想要的答案。
当我们问AI同样的问题时,它却能迅速给出结构化答案。它似乎更懂我们的心,我们只需关注其输出信息的可用程度,就能快速对答案进行“拍板”选用。这让我们节省了大量浏览、筛选、整理的工作量。
AI大模型(以下简称“AI”)是如何做到“精准回答”的呢?本文将用通俗易懂的语言,带大家简析AI背后的工作原理。


01.
AI=百科全书?
也许大家对AI的设想是一个陈列了无数百科全书的图书馆,其中包含从古至今的所有知识,预置好了各种问题和答案,AI不过是根据我们的问题在知识库中找到标准答案。
但问题在于,我们无法穷举所有问题和标准答案,构建一个庞大到能涵盖所有知识的知识库。
实际上,AI是一个由海量神经网络参数构成的预测系统。AI并不像数据库那样按条目存储知识,而是把知识以参数的形式分布式地分散在整个神经网络中,与其说AI保存了所有知识,不如说它学习了海量文本中的语言规律和知识关联,把这些规律压缩进数以百亿甚至万亿计的参数中。

02.
AI=预测系统

要回答AI的工作原理,离不开它的SOP,可以将AI的SOP概括为6个步骤:提问->切分Token->Embedding->Transformer->输出Token->生成答案。
1) 提问->切分Token
切分Token的目的是将我们的问题转化成AI可以理解的数据。
当我们向AI提出问题:“深圳有哪些十一假期值得去的旅游景点?”大模型会将问题拆解成多个独立的Token。例如:
拆成5个Token:“深圳、有哪些、十一假期、值得去的、旅游景点”;
或者拆成8个Token:“深圳、有哪些、十一、假期、值得、去的、旅游、景点” ;
甚至,该问题可以拆成17个Token:“深、圳、有、哪、些、十、一、假、期、值、得、去、的、旅、游、景、点”。

Token的拆分规则没有统一标准,主要取决于AI的训练样本和计算成本,一般会根据词频、压缩效率、训练效率等维度决定Token。如果训练样本中,“深”和“圳”两个字单独出现的频率远不及“深圳”,说明“深圳”两个字组合在一起更适合作为一个Token。
单个Token拆的太细会导致语义被拆碎、上下文变长、计算成本增加;反过来单个Token太长又会导致泛化能力下降、词表过大、模型的通用能力变弱。
因此,AI普遍采用“中庸”的方案,采用介于单个字符和完整词之间的"子词(Subword)"作为Token,达到切分Token后既保留语义信息,又兼顾计算效率的最佳效果。例如,旅游景点,一般会被切分为“旅游”和“景点”这2个Token,但不会被切分为“旅、游、景、点”这4个Token。

2) Embedding
可以将 Embedding 理解为“查坐标”的过程。每个 Token 在词表中都有一个唯一编号,而 Embedding 表中存放着每个 Token 对应的坐标(即向量)。当用户输入问题后,AI会根据 Token到 Embedding 表中查找对应的向量,将文本转换成计算机擅长处理的数学问题,从而开始后续的向量计算。
Embedding 表本质上是一个巨大的矩阵,它属于AI参数的一部分。在预训练过程中,模型通过海量文本不断进行预测和纠错,逐渐学习出这些向量的取值。经过训练后,语义相近的 Token 往往会在向量空间中分布得更接近。这样一来,AI就可以通过计算向量之间的距离和关系,判断不同Token之间的语义关联程度。

为了方便理解,假设 Embedding 表是一个三维空间,每个 Token 都对应一个坐标。例如:
广州 → [0.85, 0.72, 0.91]
深圳 → [0.90, 0.68, 0.95]
世界之窗 → [0.93, 0.70, 0.89]
公众号 → [-0.80, 0.95, -0.72]
因为“深圳”和“世界之窗”经常一起出现,因此坐标接近;“广州”和“深圳”同属于中国的一线城市,一起出现的频率也比较高,坐标也相对靠近;而“公众号”属于完全不同的概念,因此它的坐标与前三者距离较远。

实际AI并不是三维空间,通常是几千维甚至上万维的高维空间,但原理是相同的:语义越相近,向量距离通常越近;语义越不相关,向量距离通常越远。
另外,Embedding除了“查坐标”之外,AI还会记录Token在句子中的位置顺序。例如"我喜欢你"和"你喜欢我"的Token相同,但Token的位置顺序不同,所表达的语义完全不同。

3) Transformer->输出Token->生成答案
简单来说,当问题经过Embedding转换成向量后,这些向量会进入Transformer网络,AI会对所有输入Token之间的关系进行分析和计算,最终得到一个概率分布,预测下一个Token最有可能是什么。
例如,当输入:“深圳有哪些十一假期值得去的旅游景点?”
Transformer计算后得到的结果可能类似于:
1. 世界之窗 35%
2. 欢乐谷 20%
3. 锦绣中华 15%
4. 广州 2%
因此,AI优先选择“世界之窗”作为输出Token。

随后,“世界之窗”会被加入上下文,形成新的输入:
“深圳有哪些十一假期值得去的旅游景点?
“世界之窗”
Transformer再进行下一轮计算,预测出下一个最可能出现的Token:“是”,然后“是”被加入上下文继续预测:
“深圳有哪些十一假期值得去的旅游景点?
“世界之窗是”
如此循环,不断生成新的Token,直到最终形成完整答案。

Transformer之所以能够一直预测并生成与用户所提问题相关的内容,核心原因之一在于Attention(注意力机制)的存在。Attention会动态判断AI当前应该重点关注哪些Token。例如在“深圳有哪些十一假期值得去的旅游景点”这个问题中,模型会重点关注“深圳”和“旅游景点”等关键信息,因此生成“世界之窗”“欢乐谷”等景点名称的概率会明显高于“广州”等与当前问题含义不匹配的内容。


03.
小结与思考

从外部看,AI像一个无所不知的知识库;但从内部看,它其实是一个由海量参数驱动的概率预测系统。换句话说,AI并不是在数据库中查找标准答案,而是在已有上下文的基础上实时生成最合理的答案。
虽然AI能准确回答问题,但还不能等价证明它能理解问题,它是将文字、图片等信息逐步转换成向量和概率计算问题,通过一次又一次的运算来预测下一个跟上下文关联性更强的Token,动态生成最终结果,这与人脑仍有区别。

当前及未来一段时间内,AI大概率仍会停留在“历史知识”的框架内,其价值更多在于替代当代人大量重复性的基础脑力劳动,还不具备“智慧”。AI的推理能力更像是大量算力堆砌后的“智能涌现”,与人类基于现实世界经验进行推理和创造知识的能力仍存在明显差异。
可以预见,AI在未来会像当下的智能手机一样,在每个人的日常生活和工作中形影不离,也不可或缺。如果回望历史,会发现决定每个时代生产力高低的根本因素往往并不在于工具,而是创造和使用工具的人自身。如何善用AI,既是当下每个人正面对的问题,也是我们拥抱未来、释放潜能的关键一步。
