← 文章 / 科技资讯
搜狗微信-AI 2小时前 · 2026-08-26 18:56:34 · 1 阅读

如何“手搓”一个审计专用AI大模型——让审计人员也能看懂AI大模型(二)

第二部分认识“你的AI同事”— 基础概念大起底

  从“婴儿”到“通才”:

  预训练(吞下互联网的“海量知识”)

大模型制造的第一步,是利用海量的互联网数据做预训练。这一步能让大模型掌握人类世界的各种知识和语言规律,打造出一个基座模型。过程听起来很简单:让大模型爬遍互联网,把包括我们在内的所有人创作的、饱含人类智慧的知识精华作为数据集,认真学习,并通过一种叫反向传播的方法,让大模型自己调整参数。

听到这里我估计你可能有点懵了,这是什么意思呢?让我用通俗一点的方式解释一下。当你把一串Token输入模型时,模型里会通过计算,输出一个结果,这叫作前向传播。但这个结果往往不尽人意——假如训练目标是让大模型输出“枣树”,结果它输出的是“苹果树”。这时就需要把错误的回答跟目标答案对比,看看差了多少,这一步叫作计算损失。通过计算损失,模型就能反向找出在整个传播过程中,到底是哪些步骤出了问题,然后调整它们对应的参数。如此循环往复,逐步调整,直到输出结果逼近目标,这就是反向传播。

由于在预训练时,大模型要学习的内容太多,数据量很大,靠人力梳理根本干不过来。所以目前预训练主要都用“自监督学习”——就是人类躺平了,让大模型自己去看数据、计算损失、调整参数,自己调教自己。预训练是大模型最耗时、最费力的阶段,往往需要几个月甚至几年,要买天量的显卡,所以才让黄仁勋成了AI的最大赢家,因此预训练一般都是由各大模型的厂家完成的。

预训练完成后,你就能得到一个基座模型。你可以把它理解为一个互联网模拟器,或者一个学会了人类世界知识的通用大脑。无论你输入什么,它都能续出合适的Token。不过,基座模型一般不能直接使用。为了把它从通用大脑,变成一个有特定功能的“打工人”,还需要给它做后训练。


  从“通才”到“专才”:

  后训练(注入“审计灵魂”)

你可能听说过微调,它就是在后训练阶段完成的。目前最常用的方法是“监督微调”。所谓的监督,就是要给AI提供带标注的数据集,让它模仿标注数据的风格来生成内容。比方说,要把它做成你最常用的“对话助手”,那就要给基座模型提供对话数据集。听起来又是一项大工程,但此时所需要的数据集大小和训练时长,要远远小于预训练阶段。比如某开源对话数据集,一共包含16万条出头的对话信息,中文对话数据只有不到5000条,但已经足够把基座模型变成一个合格的对话助手了。

所以,如果你想要建设一个审计专用的大模型,最困难的可能就是准备这样合格的数据集。像审计计划、审计工作方案、审计报告、审计底稿等等材料,都需要转换为可供大模型学习的语料数据集。也就是说,监督微调的这些语料数据集都需要真人编写,或者是真人借助AI来编写。所以监督微调时,需要用到很多真人作为“数据标注员”。这也算是AI给可能会被AI取代工作的审计人员提供了一些工作机会——甚至你现在可以在招聘网站上找到很多“数据标注员”的工作岗位。也许哪天你因为AI而下岗了,也会去应聘一下。

总之,不管你是想把AI打造成审计对话助手,抑或是打造成数据分析专家,都要在微调时给它们喂相应的数据。在完成监督微调之后,你就得到了一个基本可用的大模型了。但如果到此为止的话,大模型也不过就是一个只会四处搬运、鹦鹉学舌的复读机罢了。如果要给大模型注入灵魂,那就要进入到后训练中最重要的一步:强化学习。


  注入“灵魂”

  实现超越:强化学习

通过强化学习,大模型输出的答案会更加符合人类偏好,甚至展现出超越人类的“智力”。强化学习的具体方法很多,其中一些思路既简单又巧妙。拿DeepSeek的GRPO方案来举例:首先提出一个问题,让AI生成几十个不同的解决方案,并给出答案。这些答案有对有错,其中答错的方案直接扔掉,答对的那些解决方案大概率更合理。于是可以把它们再喂给AI,让它模仿这些方案,继续生成解决思路和答案。然后再根据答案对错,继续筛选解决思路,再回头喂给AI。这样反复训练,就能提高AI输出正确答案的能力,甚至偶尔能涌现出一些在人工数据集之外、连人类自己都未曾设想过的解决方案,达成了一种超越人类的效果。

但这种方式也不是万能的。遇到一个问题没有标注清晰的答案时——比如写文章、写诗——大模型怎么知道哪个答案更好呢?这时候又得用到数据标注员了。在强化学习中,数据标注员的任务是给AI生成的答案按自己的判断排序,把好的排在前面,差的排在后面。当然,数据标注员无法给无穷无尽的回答排序,所以还要根据他们的排序偏好,训练出一个奖励模型来给AI打分。然后把AI生成的答案交给奖励模型,这样就能让大模型根据奖励模型的反馈,不断地训练自己了。这种方式就叫作基于人工反馈的强化学习,简称RLHF。

从监督学习的数据集编写,到RLHF中给答案排序,都需要数据员的参与。所以从某种角度来说,一个大模型的“个性”,能反映出它背后的人类标注员们的偏好。以后如果有了审计专用模型,也许它给你提供的答案背后就有我的喜好在里面。

总而言之,目前后训练中的强化学习,是各家技术团队发力比拼的重要方向。大模型中很多让人惊叹的功能都和它有关。比如DeepSeek R1发布后,大家都震惊于它能展示详尽的CoT,也就是思维链。而根据官方说法,CoT的出现是因为团队在后训练中的监督微调阶段,特意喂了60万条推理数据,然后又通过刚才说的那套GRPO强化学习流程,引导大模型自己筛选有效思路,最终实现了强大的推理能力。


  蒸馏

  你能用上的“平替”

就这样,经过预训练、后训练,包括强化学习,一个完整的大模型终于可以做出来了。那你说不如我们就手搓一个大模型吧?开个玩笑,其实不光没办法手搓,甚至你连安装一个大模型都很难。因为想要运行全量参数的大模型,需要的算力硬件不是简单家用电脑就能部署的。所以大多数时候,你可能使用的都是所谓的“蒸馏模型”。

你可以简单把它理解为高仿版。比如这个模型的本质是使用阿里千问32B这个参数较小的模型,去学习DeepSeek R1 671B满血版的输出结果,据此调整参数,做出一个“高仿”的DeepSeek R1,所以叫蒸馏。一个更容易理解的方式是:拿一个原版的LV背包,把它逐项拆解开,从用料、走线、五金件等等,这些就是原模型的输出结果。然后,按照这些输出结果再交给一个新的模型,让它按照这些分解的材料再生成一套类似的材料,再组装起来。这样,这个新的模型就学会了仿制LV背包了。

经过这一整套流程,你大概理解了,一个大模型从无到有,经历了预训练的海量学习、后训练的针对性微调,再到强化学习注入“灵魂”,最后通过蒸馏技术变得触手可及。下一部分,我们就来聊聊审计人员具体如何用好这个大模型。

往期回顾双先风采 | 秉持审计为民初心 笃行精准监督使命>审计关注 | 如何“手搓”一个审计专用AI大模型——让审计人员也能看懂AI大模型(一)>


撰稿:电子数据审计处 鄂瑞枫

编辑:张砚昕

审核:燕伟龙

图片
原始来源: 搜狗微信-AI

评论 (0)