← 文章 / AI技术
天未的博客 5小时前 · 2026-10-02 16:38:14 · 2 阅读

《AI工程-大模型应用开发实战》- 2 理解基础模型

多语言模型

多项研究表明,通用模型在英语任务上的表现远优于其他语言。既然 LLM 通常擅长翻译,我们是否可以将所有非英语语言的查询翻译成英语,获取回答后再翻译回原语言呢?许多人确实采用了这种方法,但它并不理想。

  • 首先,这种方法要求模型能够充分理解代表性不足的语言,才能进行准确的翻译。
  • 其次,翻译过程可能导致信息丢失。例如,越南语中有专门的代词来表示两个说话者的关系,但在翻译成英文时,这些代词通常会变成 I 和 you, 导致关系信息的丢失。
  • 此外,模型在处理非英语语言时可能出现意想不到的性能问题。例如,ChatGPT 在中文语境下比英文语境下更容易生成虚假信息。
  • 除了质量问题,模型在处理非英语语言时往往速度更慢且成本更高。模型的推理延迟和成本与输入/输出中的 token 数成正比。

为了解决这一问题,许多模型专门对非英语语言进行了训练。

模型规模

预训练模型需要巨大的计算资源。

  • 假设拥有 256 块 H100 GPU,且能以最大性能使用它们,并且训练过程中不出任何差错,那么训练 GPT-3-175B 所需的时间为 236天,约 7.8个月。
  • 以 70% 的利用率计算,在每块 H100 每小时 2美元的成本下,训练 GPT-3-175B 的成本将超过 400 万美元。

模型的规模还能增加多少个数量级? 是否会存在一个零界点,超过这个点后,无论模型规模如何增加,性能都将趋于平稳?虽然这些问题很难回答,但目前已经可以看到两个明显的规模瓶颈:训练数据和电力。

  • 基础模型的使用的数据量如此巨大,以至于人们开始担忧未来几年内互联网数据可能会被用尽。
  • 此外,互联网正迅速被 AI 模型生成的数据所填充。
  • 在 ChatGPT 问世后,许多公司修改了数据使用条款,以防止其他公司抓取其数据用于训练模型。
  • 另一个瓶颈虽然不太明显,却更加紧迫,那就是电力。截至本书撰写时,据估计,数据中心消耗了全球 1%~2%的电力,到2030年,这一比例可能上升到 4% ~ 20%。

后训练

每个模型的后训练过程虽不尽相同,但一般而言,后训练包括以下两个步骤。

  • 监督微调(supervised finetuning,SFT):在高质量的指令数据上对预训练模型进行微调,使其针对对话而非文本进行优化。
  • 偏好微调(preference finetuning):进一步微调模型,使其输出符合人类偏好的响应。偏好微调通常使用强化学习(reinforcement learning,RL)完成。

采样

温度:在根据概率分布采样下一个 token 时,存在一个问题:模型生成的内容可能缺乏创造性。为了重新分配可能值的概率,你可以使用温度进行采样。直观地说,较高的温度会降低常见 token 的概率,从而提高稀有 token 的概率。

top-k: top-k是一种采样策略,旨在降低计算负担,同时不过多牺牲模型响应的多样性。在模型计算出 logit 后,我们则选取排名前 k 的 logit,并仅对这些 top-k 的 logit 执行 softmax 操作。k 的取值通常在 50-500之间——这远小于模型的词表大小。

top-p:top-p 也称为核采样(nucleus sampling),允许动态地选择要采样的值。在 top-p 采样中,模型按照概率从高到低的顺序依次累加最可能的下一个值的概率,直到累计概率达到 p 为止。语言模型中常用的 top-p 采样值通常在 0.9 和 0.95 之间。

推理时计算:提高模型响应质量的一种简单方法是推理时计算(test time compute),即并非每个查询只生成一个响应,而是生成多个响应,以增加获得高质量结果的机会。OpenAI 还训练了验证器,以帮助模型选择数学问题的最佳解答。事实上,使用验证器带来的性能提升大约相当于将模型规模扩大至 30 倍。

原始来源: 天未的博客

评论 (0)