开放模型回顾:Kimi K3、Qwen 3.8、蒸馏与开闭源差距
开放模型回顾:深入聊聊 Kimi K3、Qwen 3.8、习近平在 WAIC 的演讲、蒸馏、开源与闭源模型的差距,以及未来走向旨在与全世界分享后训练知识的内容已经完成,即将发布。现已开放预订:
Nathan 和 Florian 坐下来,一起讨论开放模型领域正在发生的一切。继上周 Kimi K3 发布后,行业仿佛全面提速——从中美地缘政治、开放模型与闭源模型的经济学,到 AI 前沿的安全问题,诸如此类。
章节:
00:00 欢迎与背景
04:38 体验和使用 Kimi K3
08:53 GLM 5.2 仍将发挥什么作用
12:47 中国模型为什么能做到这么好?
17:41 数据、环境,以及中国实验室巡览
19:47 中国模型厂商盘点:Qwen、DeepSeek、MiniMax……
24:08 美国开放模型生态
30:25 前沿模型与准前沿模型,以及从网络安全角度反对禁令的理由
34:58 蒸馏与 Ben Thompson 之争
44:12 预测与前沿模型分级
48:36 总结
你可以在 Apple Podcasts、Spotify,以及其他常用播客平台收听。想了解 Interconnects 的其他访谈,请点击这里。
想了解更多教育类后训练视频,可以查看我正在制作的课程。
文字稿
00:00:06 Nathan Lambert:好,欢迎回到《Interconnects》。我们来做一期季度开放模型盘点,主要是解释——或者说吐槽——为什么关于模型蒸馏的很多观点都站不住脚,同时梳理一下目前的发展状况。我记得 Kimi K3 是上周四发布的。接下来很快还会有更多模型,几乎是板上钉钉的事。比如上周末,习近平发表讲话,明确把开放和开源作为一项战略。他并没有详细说明现状或具体路线。
Qwen 也宣布,他们的下一个大模型将开放权重,这意味着方向会发生很大变化。可以聊的东西实在太多了。Flo,你之前似乎已经开始谈模型性能差距和蒸馏方面的各种说法了。不如就从这里开始。我这边也列了一些想聊的话题,之后可以逐个展开,再结合我写的那篇博客——里面的观点都非常细致。总之,我们有聊不完的内容。你先继续发挥。
00:01:17 Florian Brand:我觉得,每次模型发布,至少每次开放模型发布时,大家最关心的问题就是:它们落后闭源前沿模型多少,或者说落后了几个月。人们特别喜欢给这个差距下一个明确的数字,但这其实会把问题搅得更复杂。如今 benchmark 提供方越来越多,benchmark 的种类也越来越丰富。于是每个网站——我也不例外——都会挑自己喜欢的 benchmark,来证明当前模型或新发布的模型已经处于前沿;另一方则会拿出另一个 benchmark 反驳说,实际上它落后了一年之类的。很多争论似乎都取决于这个问题:开放模型究竟落后了几个月。
00:02:26 Nathan Lambert:没错。我的观点可能有点挑衅性:有些基准测试其实和大家实际在做的事情有相当不错的相关性,比如智能体式编程、智能体式计算机操作;但也有一些基准测试更能反映长尾场景,而这正是 Claude 和 GPT 的价值所在。问题在于,现在 Claude Code 和 Codex 的市场到底是什么?如果核心市场是软件工程,那么模型在这方面落后几个月,可能就是非常、非常严重的问题。话说回来,我猜这个模型应该还不错——当然,模型权重目前还没发布,据说要到7月27日才会发布,所以后续很多讨论都会建立在它确实按计划发布这一假设之上。
不过,大家完全可以对这个模型进行后训练,让它在许多用户真正关心的细分领域达到接近 Opus 和 GPT 的水平。我认为,这方面的进展非常令人兴奋。我们两个人观察后训练开源模型行业的角度不太一样,但可以肯定的是,业界正在大力推进针对特定高价值任务的模型微调。过去,这类工作主要围绕 Qwen 和 GLM 展开,而 GLM 5.2 更是显著加快了这一进程。我很好奇,谁会第一个发博客说“我们已经针对自己的任务完成了 Kimi K3 的微调”,因为我敢说,效果可能会有大幅提升。你用 Kimi K3 的次数比我多,不过我的直觉是,考虑到它的规模如此庞大,现阶段的后训练可能还比较粗糙,这通常意味着模型里仍然有不少性能可以挖掘。大概就是这样。
00:04:03 Florian Brand:没错。训练,尤其是后训练,会非常困难,因为光是加载模型权重,就需要一台配备 B300 的节点,规模大得离谱。所以,要真正把它弄到可以微调的状态,可能还需要一段时间,以及大量工程工作。不过,你刚才提到的是实际使用这个模型的人——你确实报名参加了它的编程项目,也亲自用过。所以,把这些背景交代清楚还是很有帮助的。
00:04:38 Nathan Lambert:对。我大概是在发布后的第二天注册的,选的是 200 美元的套餐,这是他们最大的一档,和其他服务类似;我记得他们还有 40 美元和 100 美元的套餐。最高档提供 100 万 token 的上下文,我觉得——至少用起来感觉如此——API 请求似乎也有一定优先级。因为网上很多人都说自己不断遇到 API 错误,但到目前为止,我用得还挺顺利。至于模型能力,除了前端开发确实很强之外,它在其他一些方面也相当亮眼,表现非常出色。
它甚至超出了我的预期。比如研究任务:我在 Interconnects 上已经积累了一年多的开放模型数据,也会让各家 frontier model 做一些我们以前没做过的有趣分析。毕竟我们通常都是自己分析并发布结果,所以我会直接告诉它们:来点新的,给我一个惊喜。结果很多模型,基本上所有模型,都会抓住我们已经做过的内容,重新跑一遍数据分析,然后再加上一些奇怪又偏门的部分。
但 Kimi K3 做得更有意思。我明确让它去抓取 Reddit,结果它找到了几个我完全没想到的 subreddit。它还发现,比如 Reddit 上的讨论通常会比下载量增长早一两个月出现;也就是说,大家已经开始关注 Qwen 了,过一两个月才会有更多人去下载 Qwen 模型。这类分析非常有突破性,也是 Kimi 相比其他 frontier model 让我感到意外的地方。
那换个简单的问题:在你日常做的核心工作中,大多数任务都能用它完成吗?你平时有一套分布各异的工作内容,其中大部分应该是用 Codex 完成的。我觉得你更像是 Codex 用户,而不是 Claude 用户。你认为在这个模型也能胜任的任务上,两者的交集大概有多大?
00:07:24 Florian Brand:呃,这确实取决于我给它多大的发挥空间。就 Kimi K3 目前的表现来说,我正在参与开发 Prime Intellect 的框架,最大的感受是,Kimi 生成的代码简洁得多,也更容易读懂;但有些地方 Codex 做得更好——如果按 56、55,尤其是 54 的水平来比较,我会说,Kimi K3 在这类任务上大概相当于 54~55 的水平。
不过,如果我先读一遍代码,觉得“这代码写得真不错”,再让 Codex 检查一遍,它还是会找出很多 Kimi 不擅长处理的边缘情况。但用来监督运行过程,或者执行一些实验,它其实已经非常实用。还有些比较特殊的任务,完全可以直接让它自己跑。唯一的缺点是——当然,这也和 API 用户太多、服务器位于中国有关——实际耗时明显高于 GPT。不过,如果我把它真正用到日常工作流里,整体速度确实会慢一些,但还不至于慢到让我觉得“算了,根本没法用”。
00:08:53 Nathan Lambert:那它和 GLM 5.2 相比怎么样?在我看来,GLM 5.2 的故事还在继续发展。比如我在旧金山转转时,经常有人说:“我确实在 agentic coding 或工作流的这一环节使用它。”你当时是不是也属于这类用户?你有没有用过 GLM?
00:09:20 Florian Brand:用过,现在也在用。我主要是因为我们有一个速度很快的内部 endpoint;在那之前,我也用过一个 API,速度大概是每秒 200~300 个 token。只要它能以足够好的水平快速完成大量任务,那当然就直接用这个模型了。相比之下,切到 Codex 后还得选择次一级的模型、调整合适的 reasoning effort,再打开快速模式——我直接用 GLM 就行,结果差不多,而且表现相当不错。就能力而言,它绝对有 Sonnet 的水平;对于很多清理类任务,或者单纯的苦力活,它都非常好用。我觉得,完全可以让 Kimi K3 担任主 agent,再让 GLM 负责 sub-agent 工作,这样能覆盖相当多的任务。
00:10:24 Nathan Lambert:Kimi 这次发布的模型规模确实很不一样。我觉得,这批开放权重模型要真正完成优化,并在各家推理服务商那里普及,还需要更长时间。比如 GLM 5.2 的速度就很快,但首先,我们现在还拿不到它的权重;其次,我不认为它的采用速度会像 500B、700B 的 MoE 模型那样快。这里面会遇到更多问题,毕竟这是一个完全不同的阶段。过去,中国模型通常在 RL 训练结束后,几小时到几天、最多一周内就会以开放权重形式发布,生态很快就知道该怎么接入和使用。
我认为,下一代开放权重模型需要大幅提升基础设施能力,这一点必须纳入考量。闭源实验室在发布模型前,都会在幕后提前完成这些工作。这样一来,原本的时间差就会被拉长:人们可能要再等一个月,才能真正对 Kimi 做后训练,并将它大规模用于自己的工作流。作为开放权重模型的支持者,我们经常会说,只有等闭源模型正式可用后,才会出现所谓的时间差。但现在,开放模型也出现了类似情况:Kimi 的 API 几乎完全瘫痪,需求太大,而供给远远不够。所以,模型并不会一发布就立刻扩散开来。我只是想说,这同样会影响模型性能进入实际应用的时间差。
00:11:54 Florian Brand:这确实如此。不过另一方面,过去几个月里,开放生态已经变得专业得多。比如在模型首次发布时,通常都会有合作伙伴提前拿到权重;现在 vLLM 的补丁也会提前几天、甚至几周准备好。这和一年前完全不同:当时基本就是模型权重一丢出来,模型开发者便说“好了,剩下的你们自己想办法”。所以我预计,模型在第一天就能实现较好的普遍可用性。随后,各家服务商之间的竞赛才会真正开始:大家会不断优化,争取更高的推理速度,因为这本身就是一种荣誉。
00:12:47 Nathan Lambert:嗯,好。我们可以从两个方向来讨论。为什么我们认为中国的模型能做到这么好?我之前写过相关内容:在我们的 Discord 里,Epoch 的 JSD 也参与过一场讨论。我觉得这场讨论很有价值。我在那篇文章里提到,自己越来越倾向于认为,中国实验室的资本效率更高,能够更有效地把资本转化为算力、数据和人才,从而提升模型表现。如果这确实是一种结构性优势——不管原因是什么——那原因可能在于,中国的人才经过了更适合解决这类问题的训练,而这些问题正是让 LLM 变得更好的关键。
也可能只是因为在中国,算力、人才以及其他一切成本都低得多。可能是因为补贴,也可能只是平均工资更低。但随着模型不断迭代,这一点会变得非常重要。假设下一代模型对 Anthropic 来说要花 100 亿美元,而 Kimi 只需要 40 亿美元,那差距可能会非常惊人。但我们还不清楚为什么会这样。比如,我认为 Kimi 的工程师 Big Eagle 曾回复过我关于这个问题的推文,大意是:这对他们有帮助,因为他们并不是要推动能力前沿,只是在努力追赶。这或许确实与思维方式有关,也就是说,中国实验室设定的目标范围不同,因此开发这些模型的成本要低得多。
不过,过去一年里,我们一直在问:中国模型会不会掉队?我原本以为,由于训练的资本密集度越来越高,闭源模型和开源模型之间的差距会扩大。但现在看起来,情况似乎正好相反。这确实很难解释清楚。你是否也同意,中国实验室的表现比我们预期的更能跟上——它们在持续追赶?你认为原因是什么?
00:14:43 Florian Brand:我回头看了看我们根据去年总结对今年做的预测。我们当时基本认为,差距会维持在几个月之内。现在看来,这个判断大体是对的。好在我们没有给出具体数字——究竟是 3 个月、6 个月还是 9 个月——所以这方面算是比较稳妥。不过,我们在中国和这些人交流时都有一个很强烈的感受:他们的研究团队往往有两三百人,成员全都二十多岁,一心只想把一个模型做到极致,似乎完全不做其他“支线任务”。
他们似乎不会去做任何偏离这一目标的事情。至于算力,这对我们来说确实很难判断,尤其是现在中国自产的芯片也陆续开始投入使用。我还认为,过去 6 到 9 个月里,芯片走私的规模大幅增加了,或者说,之前走私进来的芯片开始陆续上线。
00:15:58 Nathan Lambert:这里说的“走私”是广义上的概念,指一切规避出口限制的方式。如果芯片被运到马来西亚,然后在那里投入使用,我也会把这种情况归入其中。我认为过去 6 到 9 个月里,这种情况大幅增加了。这在一定程度上解释了现在的结果。我的意思是,他们现在拥有的算力,确实比训练上一代模型时多得多。
00:16:24 Florian Brand:对。举个背景例子,大概两周前,LongCat 发布了自己的模型。他们声称——而且我们知道这很可能是真的——整个模型完全使用中国芯片训练。他们没有公开具体使用了哪些芯片,但业内猜测可能是 Huawei 的 Ascend。随着国产芯片产能不断提升,这些芯片很可能主要用于训练;不过,它们尤其适合推理,而推理本身也是训练流程中非常重要的一环。
所以,他们在训练阶段可能会混用 Nvidia 和其他芯片;随着推理阶段占比越来越大,推理所需的算力也会不断增加,而这部分同样非常关键。我认为,他们的整体算力确实在提升。另一方面,他们目前并没有多少用户,不需要像 ChatGPT 那样服务 10 亿用户,也不需要像 Anthropic 那样支持数百乃至数千家企业,因为他们没有那么多付费客户。
00:17:41 Nathan Lambert:是的。我觉得即使是这些付费客户,至少在企业端,支持这类产品也会占用公司的时间,引发内部讨论。即便这不是研究工作,甚至不在你的职责范围内,也会改变公司上下的注意力。如果 SSI 能推出一个优秀的模型,那将最终证明,分心确实是个问题。不过这是题外话,我们可以先放一放。我觉得,数据和环境行业似乎也开始出现一些动静了。
你还记得具体有哪些吗?因为我们在中国时,他们对外部数据的利用程度之低,确实让人有些震惊。可就在我们 4 月份去过中国几个月后,也就是 7 月份,我们突然听说中国出现了一些新公司,而且它们想要购买数据之类的东西。这种变化发生得很快,时间线还挺有意思。
00:18:40 Florian Brand:至于他们当时具体告诉我们的情况,我觉得还是要留出一定的误差空间。
00:18:44 Nathan Lambert:对,毕竟时间间隔太短了,所以我也说不准。
00:18:49 Florian Brand:是的,也有可能确实如此。不过,这类变化很难准确判断。我只能说,购买外部数据似乎正变得越来越重要。如果他们直接购买同样的数据,哪怕价格更低一些——毕竟他们进入数据和环境领域的时间更晚——这也会帮助 open models 追赶 closed models。但它确实是一个影响因素,至于影响有多大,我们还不知道。公开信息中没有相关线索,我也怀疑未来很难从谁那里得到真正有价值的内幕。因此,这很可能是他们能够追赶或提升模型得分的原因之一。
00:19:47 Nathan Lambert:好,我们再盘点一下其他中国模型厂商。前面聊过 Kimi,也聊过智谱 / GLM。我觉得 GLM 很快还会推出一些非常强的新模型,可能会叫 GLM 5.5 之类的。Qwen 方面,我们之前提到过,他们最大的模型也快发布了。我要说的是,相比小模型的出色表现,Qwen 的大模型在绝对性能排名上往往没那么突出,这可能是因为他们的重点不同。我觉得这和云厂商的思路有关。仔细想想,它几乎有点像 Google。
Qwen 背靠 Alibaba,在这里拥有巨大的机会。通过这些小模型吸引开发者使用 Alibaba 和 Qwen,对他们的云业务来说是千载难逢的机会,而我认为他们确实取得了非常大的成功。但他们的大模型一直没有小模型那么出色。所以,我不认为这次的新模型会像 Kimi K3 或 GLM 5.2 那样带来突破。我预计它会成为新闻焦点,在中国被视为重磅开源模型——就像“又一个巨型模型”一样受到关注,但我不觉得它会像 DeepSeek 那样持续成为新闻话题。你可以接着说,随时补充。
00:21:01 Florian Brand:有件事挺有意思,不知道你关注得多不多:他们有一个可以调用的 endpoint,目前提供预览版本,而且每天都会更新。也就是说,他们的迭代速度非常快。我们在各种 Twitter 基准测试上都能看到进展,尤其是 SVG、three.js 以及各种视觉生成任务,模型在过去几天里提升了很多。所以,他们似乎已经建立起了一套快速反馈机制。其他公司也在这么做——比如 Cursor 就写过很多文章,介绍他们如何快速迭代。但他们看起来是在持续上传新的 checkpoint,并将其开放出来。
00:21:47 Nathan Lambert:嗯,我同意。我猜这可能是他们最终 RL 训练过程中的时间窗口控制:在 RL 训练接近结束时,模型还在一点点变好,于是他们就顺手把这些版本逐个打勾发布了。
00:22:03 Nathan Lambert:好。Qwen DeepSeek V4 据说会先发布预览版。我觉得,DeepSeek V4 值得关注的地方在于,他们的 Flash 模型其实更受欢迎。这个更小的模型对用户来说简直是台“劳模”,所以我认为它才是最值得关注的版本。我不觉得 V4 Pro 会带来什么颠覆性突破。如果小米很快发布新的 MiMo Pro,情况大概也类似。我不期待它的提升幅度特别大,但应该会是一款相当扎实的模型。只是现在还很难判断,毕竟他们还是相对较新的玩家。至于 MiniMax,我觉得他们走的是另一条路。我不认为 MiniMax 正在追逐 Kimi/GLM 那种以 AGI 为目标的“登月计划”式路线。
00:22:46 Florian Brand:哦,我倒不这么认为。
00:22:49 Nathan Lambert:你觉得 MiniMax 还在这条路上?
00:22:52 Florian Brand:对。我觉得他们确实感受到了这种压力,尤其是因为他们和 GLM 一样,都是上市公司。看看这几天的股价表现——这些股票跌得很惨——就能发现,这件事的影响非常大。有意思的是,他们接下来会采用什么许可证。因为他们已经多次调整许可证,限制越来越多。Xi 演讲之后,如果他们再次改变立场,那就更值得关注了。
看看 MiniMax 会不会重新采用完全开放的许可证,会很有意思。K3 最终采用什么许可证也值得关注:他们说过会开源,但我不认为他们已经承诺了具体会采用哪种许可证。
00:23:45 Nathan Lambert:对,这一点非常重要。我们拭目以待吧。Ling、Meituan、LongCat 的情况也有些类似:模型实力很强,可能在内部创造了很大价值,但还没有带来同样的开发者领域突破。这样算下来,大概有七到八家中国实验室,可能还漏掉了几家。我们也可以聊聊美国的实验室。先不说别的,Gemini 3.6 Flash 发布了。表现还行,算是小幅提升:速度更快,也没那么爱啰嗦,但其实影响不大。我们就不再继续分享这个了——这就是 Gemini 对我们来说得到的全部关注。
不过,我确实觉得有必要聊聊美国这边的生态。我认为,一些新玩家正在崛起。Thinking Machines 发布了他们的首个模型,我也和其中一些人交流过。他们非常愿意探索如何结合 Tinker 打造可微调模型。我认为这也是大多数开放模型开发者都值得重点投入的研究方向:如果能在这方面建立影响力,就会获得大规模采用。因为对真实任务而言,模型是否易于微调,比榜单上的分数是否“最好”重要得多。这个模型叫 Inkling,参数规模达 1 万亿,成绩还不错,但还没达到前沿水平。
他们似乎计划推出一个更小的版本,有点像 DeepSeek V4 的思路:总参数量约为原版的四分之一,但性能会非常好。如果 Inkling small 预览版能在几周内发布,我认为它会成为一款真正得到广泛使用的模型。它的规模很适合自动化任务和领域专用任务,可能不像 Kimi、GLM 5.2 那样定位于通用智能体,但这其实非常符合他们的业务方向。我还知道一些其他公司——可以说,美国这些规模较小的玩家整体表现不错。比如 Arcee 在今年早些时候发布了模型,目前仍在持续推进;Poolside 也开始发布模型了。
过去几个月里,Poolside 已经发布了几个模型,接下来似乎还会推出更多。Reflection 则一直处于“模型即将发布”的状态。如果他们真的致力于开源,现在最需要做的就是尽快发布模型、代码或其他成果,启动开发者生态的飞轮。只是,把模型真正做出来并发布并不容易。我和 Thinking Machines 的一些人聊过,他们也提到,这件事实际需要投入大量工作。Nvidia 也在稳步推进,我认为他们目前已经是一个稳定的参与者。他们持续发布模型,近期还会推出更多,同时也开放了大量数据。我一直在推动他们发布类似 Qwen 的小模型,比如 Gemma 那种规模的模型。
Gemma 也有一批像 Qwen 这样的竞品模型,而且非常受欢迎。Gemma 各个型号的规模和架构差异比较大,整体显得有些分散,但从采用情况来看,Gemma 确实已经能和 Qwen 抗衡了。不过我不确定它们是否同样适合研究,这可能还需要一段时间,甚至经过多轮迭代。现在很多语言模型研究都是围绕小型 Qwen 模型或基于 Qwen 的模型展开的,研究人员已经非常熟悉这套工具和流程。换用 Gemma 的话,可能需要一定适应期。所以我希望 Gemma 能继续推出新模型,在这个细分领域形成竞争力。不知道还有没有遗漏谁。
00:27:22 Florian Brand:没有,我觉得这两家都是头部玩家。现在参与者确实越来越多了。说到模型开发者,去年除了 Gemma 3 和 GPT-OSS,我们还有其他发布吗?
00:27:41 Nathan Lambert:GPT-OSS 2 的表现会很强,当然还有 Nemotron。哦,我差点忘了年初发布的 Llama 4——不想漏掉它。不过现在确实有越来越多的参与者加入进来,以惊人的速度持续推出模型。
00:27:59 Florian Brand:比如 Poolside 在过去两三个月里就发布了三四个模型。他们似乎已经找到了一套稳定产出模型的方法。开源阵营也出现了类似趋势。以 GLM 为例,他们现在每次迭代的发布间隔大约只有一两个月,而且新版本都在持续变强,这和闭源实验室的节奏非常接近:如今我们大约每六周就能看到一个新的 GPT 或 Claude。也就是说,为了持续发布越来越强的模型,开源生态似乎已经,或者至少看起来已经,建立起了一套足够成熟的流程。
00:28:59 Nathan Lambert:是的,我同意。这确实很有希望,但也挺有意思:美国生态刚开始发布一些模型,紧接着习近平发表讲话,又有这两个模型出现。想追上来实在太难了,因为要训练出真正有人用的模型,需要大量的机构经验。我觉得,现在发布模型的美国公司也开始意识到,这些并不只是刷榜、蒸馏出来的知识产权窃取模型。
这些模型本身确实很强,人们会拿它们和自家内部基准上的模型比较,然后发现,在可量化的指标上想超过它们并不容易。我从几位在美国做模型交易的人那里听到了类似看法:我认为,大家应该在模型规模、可微调性等方面继续创新,充分挖掘这个近在眼前的市场。但与此同时,每家公司面临的发布压力也非常大,都想推出一款能够被称为前沿模型的产品。我觉得,许多投资者都对这些公司抱有这样的期待,所以它们实际上都在尝试完成一件相当困难的事。接下来一年美中两国的格局会如何发展,值得关注。
00:30:25 Florian Brand:是的。总体来说,我和很多人都讨论过整个生态,这也是你一开始就提到的话题。我认为,模型能力正在越来越明显地分化:对于很多任务来说,模型已经足够好。比如在大量编程任务上,无论是开源还是闭源的当前前沿模型,基本都已经够用了。在这方面,继续提升的意义似乎越来越小。
但如果把目光投向最前沿——比如发现新的数学证明、寻找新的治疗方法、研发新药、创造全新的事物——这似乎完全是另一类问题,而且在相当长一段时间里,很可能仍由最前沿的模型主导。接下来的关键问题是:从可触达市场的规模来看,这究竟有多重要?行业又会在这方面投入多少精力?我的基本判断是,最前沿的能力正变得越来越封闭。网络安全领域的 Mythos、GPT……以及生物科技领域的相关模型,都说明这些模型不会对所有人开放;如果 Anthropic 正在组建或创建内部实验室来研发药物的报道属实,那么它们甚至可能不会向外部合作伙伴开放。
也就是说,真正处于最前沿的能力对所有人都不可用,而接近前沿的能力则正越来越商品化。这会带来很多影响,尤其是在网络安全领域。两三天前,Hugging Face 发布了一份报告:他们发现有一个 agent 试图入侵自己的系统。Hugging Face 原本想用 GPT 和 Claude 分析它,但因为安全护栏拦截了相关操作,最终没能做到。于是,他们只能改用能力较弱的 GLM,因为它没有针对这类防御性操作的安全护栏。也就是说,他们不得不使用更差的模型来保护自己、分析数据。这是一种非常糟糕的局面:最前沿的闭源模型无法使用,导致美国公司反而只能依赖能力较弱的模型。
00:33:10 Nathan Lambert:没错。我认为,这其实是“不采取任何行动”的最佳理由之一。问题在于,如果世界其他地方都能使用这些开放
