AI落地场景:为什么说本体是大模型落地企业的"数据底座"?
去年年底,我做了一个"经营助手";模型是现成的大模型,算力也买了,IT部门两周就搭出一个能对话的界面。
演示那天,分管副总兴致勃勃地问了一句特别朴素的话:"这个客户最近有没有风险?"
模型答得那叫一个流畅——洋洋洒洒三百字,从行业趋势讲到宏观政策,唯独没有一句是这个客户真正的情况。全场安静了两秒,副总扭头问我:"它是不是在胡说?"
我说:不是它笨,是我们喂给它的东西,它压根读不懂。这就是很多企业上AI的真实写照——垃圾进,垃圾出。数据散在各系统、口径不一、脏乱差,模型再好,喂进去是这堆东西,出来还是垃圾,只不过它把垃圾讲得更流畅了。
一、真障碍不是算力,是数据
上一篇我们聊了"护栏"——本体怎么给大模型划定合法知识边界,让它别乱说。这一篇往下一层:护栏解决"别乱说",可要是压根没有干净、能用的数据喂给它,护栏也是空的。这篇讲底座——你到底有没有一份能喂给AI的数据。
一提AI落地,很多人第一反应是买卡、上算力、比谁的模型参数大。但我这些年看下来,真正卡住企业的从来不是算力。算力花钱就能买,模型开源的一大把。真正的障碍是数据——散、乱、差。
• 散:客户在CRM里,订单在ERP里,回款在财务系统里,投诉在售后工单里,质量记录在MES里。一个客户的事,散在五六个系统,谁也串不起谁。
• 乱:同一个客户,销售系统写"三花制冷",开票系统写"三花制冷设备有限公司",Excel台账里又是个简称。大模型不知道这仨是一家。
• 差:必填项空着、编码是老编码、金额单位一会儿元一会儿万元。人看着都费劲,何况机器。
这样的数据,直接丢给大模型,它只能靠猜。猜对了是运气,猜错了就是你看到的"胡说八道"。
二、本体这层"数据底座"到底是什么
说人话:本体就是把散在各系统里的表和文档,重新整理成一张带语义、带关系的对象网,让大模型能"看懂"并顺着调用。
这个系列我一直打的那个比方还成立:对象是点,关系是线,动作是能动手的手。数据库里存的是"表、字段、行、列"这些技术视角的东西;本体把它翻译成业务视角——"客户""订单""物料""设备""应收账款""质量投诉",还标清楚了谁跟谁有关系:客户下了订单、订单发了货、货对应了应收、这批货有过投诉。
大模型面对这样一张网,就不用自己瞎猜"这两张表怎么连"了——关系已经明明白白画在那儿。这一层,就是喂给AI的语义层,也就是数据底座。
三、喂原始表,还是喂语义层?看一个例子
还是那句"这个客户最近有没有风险"。两种喂法,天差地别。
喂原始表/文档:你得指望大模型自己去join十几张表——客户主档、订单表、发货表、应收账款、回款记录、质量投诉、售后工单,可能还要接外部征信。它得先猜对哪张表的哪个字段是"客户",还得处理"三花制冷"和"三花制冷设备有限公司"到底是不是一家。表一多、口径一乱,它join错、join漏,最后要么答非所问,要么干脆编一个。
喂本体语义层:大模型不用碰那些表。它只需要抓住"客户"这个对象,顺着关系往下走——客户 → 订单 → 应收账款 → 逾期天数 → 质量投诉 → 售后工单。一路点下去,逾期多少、投诉几次、最近有没有异常,全都挂在这个对象身上,它照着念就行,不用猜、不用拼。
一句话区别:喂原始数据,是让大模型自己在一屋子乱账里翻;喂本体语义层,是你先把账理成一条线,递到它手上。
四、三个最常见的坑
坑一|以为把文档一股脑塞进上下文就行了:很多企业上来就建个向量库,把制度、报表、聊天记录全丢进去,觉得这就叫"喂数据"了。可文档是给人看的,塞进去模型还得自己从字里行间猜关系、猜口径。正确做法:先把关键业务对象和关系结构化出来,文档只作为对象的补充说明。
坑二|先买模型搭算力,数据底座没人管:顺序反了。正确的顺序是:盘清业务问题 → 建对象底座 → 接大模型 → 持续治理。反过来做成"上模型 → 发现没数据 → 临时补 → 补不动 → 项目黄了"的,我见得太多了。
坑三|底座建完就撒手:数据天天在变,订单在增、回款在动、投诉在来。底座不持续更新,就是一张过期地图,模型照着它只会带错路。底座是要养的,不是一次性交付的。
五、可套用的五步法
Step 1|盘清AI要回答的高频业务问题:别一上来就想接全部数据。先列一张问题清单——"客户有没有风险""这个料缺不缺""哪台设备快坏了"。问题定了,要建哪些对象才有边界。
Step 2|用本体把相关数据组织成对象与关系:只围绕上面的问题,把客户、订单、物料、设备这些对象立起来,把它们之间的关系连成网。不求全,先求这几条线通。
Step 3|建语义层,作为大模型的取数接口:让大模型走对象接口取数,而不是直接怼到数据库表上。它问"客户",语义层负责翻译成底下那十几张表的正确查询。
Step 4|做检索增强与工具调用:检索增强(RAG)让它按对象捞到相关事实,工具调用(Function Call)让它不只是回答、还能触发动作——查库存、拉工单、发提醒。
Step 5|持续用治理保证底座数据质量:垃圾进垃圾出,底座脏了模型照样胡说。把主数据、编码标准、质量监控这套治理机制接到底座上,让它长期干净。
六、这跟数据治理是什么关系
说到这儿你大概明白了:本体这层底座,本质就是数据治理的成果换了个用法。
以前我们做主数据、统一编码、清洗BOM,是为了报表准、对账齐——那是"给人看的档案"。现在同一套治理成果,往大模型上一接,立刻变成"给AI用的语义层"。一物一码,模型才不会把两个客户当一个;口径统一,模型才不会把万元当元。治理不是白干的,它是AI的地基。反过来,AI落地也头一回给治理找了个业务愿意买单的硬理由——底座不干净,几百万的大模型就是个摆设。
金句:大模型落地的门槛,不在你买了多少算力,在你有没有一份它看得懂的数据。本体,就是把企业数据翻译成"AI看得懂的样子"的那一层。
七、给你的行动清单
1. 挑一个高频问题走一遍:选"这个客户有没有风险"这类业务天天问的问题,手动把它要用到的数据在几个系统里找一遍,数数到底要翻几张表、几个口径。这一遍走完,你就知道大模型为什么答不好了。
2. 画一张对象关系草图:拿张白纸,把这个问题涉及的对象(客户、订单、应收、投诉)画成圈,把它们的关系连成线。这张草图,就是你AI底座的第一版蓝图。
3. 查一个核心对象的数据质量:就去查"客户"这个对象——在几个系统里名字写法有几种、必填项空了多少。这一查,你对自家底座干不干净就有数了。
这一篇我们聊了本体作为大模型落地的"数据底座"——把散乱数据理成一张AI看得懂的对象网。有了干净的底座,AI就不只是"会答话",下一篇聊聊它怎么"会干活"——「Palantir AIP + 本体:Agent不是聊天机器人,是"会干活的数字员工"」,我们接着聊。