← 文章 / AI技术
崔博科技探索 16小时前 · 2026-09-28 15:30:45 · 4 阅读

一个不聊天的AI大模型,可能彻底改变AI行业

过去两年,我们用 AI 基本是一个套路:打开对话框,问一个问题,等它回一大段话,再从里面找出自己要的那一段。之前我在文章里面介绍过,现有 AI 的最大问题是“幻觉”。说出的话里,有很多不确定甚至不准确的内容。写写文章可以,但是如果要想要嵌入到企业的核心工作流程中,这其中的不确定性,是致命的障碍,使得很多企业、很多人,不敢用 AI,更不要说做一些关键性的决策。最近海外科技圈被一个叫 Jev 的大模型刷屏了。它有个很奇怪的特点:不说话。不写文章,不陪你聊天,也不跟你客气。你问它一件事,它只回一个判断,再附上一句“我有几成把握”。Jev 的创始人 Diogo Almeida 以前是 OpenAI 的研究员,参与过让 ChatGPT 学会听懂人话、好好聊天的那批关键研究。当年教 AI 说话的人,现在出来做了一个不说话的 AI。按照 Diogo 在访谈中的说法:

我认为业内目前过度关注速度和成本,却严重忽略了可靠性。坚如磐石的可靠性不仅能带来卓越的用户体验,更是让企业放手托付业务的核心前提。

Jev 创始人Diogo Almeida
我挺好奇这里面的原理,就花时间做了一个小网页,把 Jev 的能力做成几个按钮,直接用真实的句子去试。下面是我试出来的真实结果。大家如果感兴趣,也可以点击“阅读全文”,自己试试看,可以直接修改里面的示例问题为你自己的问题。

先打个比方:顾问和分诊护士

普通的大模型像一位口才很好的顾问。你问他“这个客户急不急”,他会从客户心理讲到服务体系,最后才告诉你“总体来说,比较急”。Jev 更像医院急诊台的分诊护士。病人一进门,她看一眼,贴个标签:红色,马上处理;黄色,排队等;绿色,去普通门诊。她不写病历,也不跟你讨论病情,但整个急诊科能不能转起来,全靠她这几秒钟的判断。医院离不开会写病历的医生,也同样离不开这个贴标签的护士。只是过去两年,整个 AI 行业都在培养医生,没人培养护士。

例子一:这个客户急不急?

我在网页上输入了一句很常见的客户留言:

“我明天一早就要出差,可发票到现在还没开出来,麻烦尽快处理一下!”

然后只问了 Jev 一个问题:客户是否表达了时间上的紧迫感?它的回答:98%,几乎一定是。没有长篇分析,也没有“综上所述”,就一个数字。这个数字可以直接交给系统:超过九成的,自动排到最前面;五成左右的,交给人再看一眼。这是 Jev 的第一种本领,回答“是不是”。投诉还是咨询,真话还是可能有诈,是不是差评,都可以这样问。

例子二:他到底想让我干什么?

第二个例子稍微绕一点:

“帮我把上个月的营收数据做成饼图,然后发给财务部的王经理。”

我给了 Jev 四个选项:生成图表、发送消息、查询数据、创建待办,问它:用户最主要想做的是哪一件?它选了生成图表,把握是99%,只用了0.62 秒。注意,这句话里其实有两个动作:先做饼图,再发给王经理。Jev 没有被“发给”两个字带偏,它看出来核心任务是做图,发送只是顺手的事。这正是一个熟练的前台每天在做的判断:电话一接起来,就知道该转给哪个部门。这是 Jev 的第二种本领,从几个选项里挑一个。

例子三:这个故障有多严重?

第三个例子是一条故障反馈:

“登录页面一直转圈,我换了三个浏览器都不行,整个团队的早会都被卡住了。”

我给了它三档:几乎没影响、有影响但能凑合、完全卡死没法工作。Jev 的判断是:完全卡死,把握 99%。它读出了两个关键信息。一是“换了三个浏览器都不行”,说明用户已经自己想过办法了;二是“整个团队的早会”,说明受影响的不是一个人。一个有经验的运维工程师看到这句话,也会立刻把它标成最高级。这是 Jev 的第三种本领,打分定级:有多严重,有多满意,语气有多冲。

例子四:一眼看出三件事

前面三种本领单独用已经挺好用了。真正让我觉得“这东西不一样”的,是把它们合起来。我输入了一句火药味很重的话:

“我已经连续三天无法导出报表,明天董事会就要用这份数据,你们到底什么时候能修好?!”

然后同时问了 Jev 三个问题:急不急?情绪怎么样?属于哪类问题?它一次全部答完:紧急,98%;情绪,明显愤怒,100%;问题类型是【填入你截图中的分类结果】。三个问题加起来总共 1.73 秒。这就像那位分诊护士,病人一进门,她同时判断了三件事:
  • 伤得重不重
  • 情绪稳不稳
  • 该挂哪个科
人做这些判断是一瞬间的事,所以我们从来不觉得这是本事。可是一家大公司每天要处理几万条这样的消息,没有人能盯得过来。

Jev 给整个 AI 行业带来什么变化?

第一,AI 要的不是更会说话,而是更“敢拍板”。Jev 的创始人在访谈里问过一个很扎心的问题:AI 都聪明到能去挑战数学界最难的题目了,为什么企业里最简单的重复性工作,它还是替代不了?我自己的观察是:因为它话太多了。很多企业团队都在使用 AI 时遇到同一个难题:AI 在演示的时候表现很好,一放进真实业务就时灵时不灵。原因很简单,AI 回的是一段话,系统读不懂一段话,只能再安排人去看、去判断、去点按钮。一个流程里只要有一个环节必须靠人盯着,它就算不上真正的自动化。Jev 给系统的是一个明确的结论加一个把握度,就像给流水线装上了一个自动阀门,不需要人守在旁边。只要是程序员的朋友,都知道基于标准格式的数据,和基于语言的“提示词”,区别有多大。第二,“知道自己没把握”,比“什么都答得出来”更值钱。Jev 每次回答都会附上一个把握度。这一点看起来不起眼,其实最关键。打个比方,一个新员工每天处理一百张单子,做对九十五张。听起来不错,但如果他分不清自己错的是哪五张,你就只能一百张全部复查一遍,等于没帮上忙。反过来,如果他每张单子都告诉你“这张我有把握”“这张我拿不准”,你只要复查那几张拿不准的就行。TypeSafe公司在网站上就是这么讲的:一个任务能做对 95%,却说不出哪些是那 5%,这个任务就没法真正交给 AI。第三,便宜到“随便用”,用法才会爆发。Jev 这个名字来自 19 世纪的英国经济学家杰文斯(Jevons)。杰文斯发现一个反直觉的现象:蒸汽机越来越省煤以后,英国的煤炭用量不减反增。原因是烧煤便宜了,原来用不起蒸汽机的工厂也都用上了。(参见我以前的文章)AI 很可能也会走这条路。过去一次 AI 判断又贵又慢,只有重要的事才舍得用。一旦判断便宜到可以随手用、快到一眨眼就出结果,它就可以用在每一条评论、每一封邮件、每一张工单上。官方的报价里,“输出”这部分干脆不收费,理由是便宜到不值得计量。创始人在访谈里有一句话,我觉得是整件事最好的总结:

全世界每个人都来找它随便问几次,加起来的价值,也比不上一个程序员让它在后台不停地跑。

AI 未来最大的用户,可能不是人,而是软件。

冷静一点:Jev也有做不到的事

说了这么多好处,也要泼点冷水。它只会判断,不会写作。想让它写周报、写方案,它办不到,这些还是得交给 ChatGPT、Claude 这类会说话的模型。它算账也不行,数数、算日期这类事,官方配套文档里专门提醒过不要交给它。它还会严格按照你问的字面意思来答,问题问得含糊,答案也会跟着跑偏。我在演示网页底部也专门写了一段“事实边界”:98% 的意思是它有九成八的把握,不是它一定对。至于多少把握可以直接放行,要拿每家企业自己的业务数据慢慢试出来。另外我这边实测,一次判断从发出到拿到结果大约 0.6 到 1.8 秒,比官方宣传的速度慢一些。所以我不觉得它会取代大模型。更可能的情况是两者分工:大模型负责思考和表达,Jev 负责快速、大量地拍板。一个当医生,一个当分诊护士,医院两个都需要。TypeSafe 团队有一句口号,我很喜欢:专注生产力,不造神(Build Prod, Not God)。

写在最后

做完这个网页,我最大的感受是:过去两年,我们一直在教 AI 怎么像人一样说话,却很少去想,大多数工作根本不需要它说话,只需要它给个准话。如果你也在企业里推动 AI 落地,下次准备写一大段提示词、让 AI 帮你“全面分析一下”之前,可以先停一下,问问自己:

这件事,能不能拆成几个是非题?

很多时候,能拆开的那一步,就是自动化真正开始的地方。我是崔博,如果有企业AI落地的需求,欢迎留言联系。
原始来源: 崔博科技探索 微信临时链接,可能已过期

评论 (0)