开源大模型,正在掀翻AI牌桌
开源大模型,正在掀翻AI牌桌
AI 每日观察 · 2026-08-27
8月中旬,一笔1.5亿美元的融资悄悄落定。拿到钱的是 HappyRobot——一家你可能从没听过、却在物流圈声名鹊起的美国公司。它做的不是炫酷的聊天机器人,而是替 DHL、Uber、Repsol 这类客户自动打电话、发邮件、处理运输异常。同一周,智谱完成20亿美元D轮、估值突破200亿美元;再早几天,DeepSeek V4 Pro 正式版上线,一个1.6万亿参数的开源模型,价格只有闭源前沿模型的四十六分之一。
三件事发生在同一周,看似各不相干,却指向同一个信号:大模型竞争的牌桌,正在被重新洗牌。过去两年,我们习惯了"谁的参数更大、榜单分数更高"的叙事。但2026年8月告诉我们,故事的主角换了——能真正把活干完的开源模型与智能体,正在把"能力稀缺"这个旧神话,一点点拆掉。
一、开源模型,已经摸到了闭源的天花板
过去业内有个心照不宣的默契:闭源模型(GPT、Claude、Gemini)在能力上稳稳压开源一头,开源只是"够用就好"的平替。但8月的数据,让这个判断越来越站不住。
8月3日,阿里巴巴开源 Qwen3.8-Max,总参数2.4万亿、激活950亿,是千问 Max 级别首次开放权重。它在 GPQA Diamond 拿到92.6分、PaperBench 93.0,Artificial Analysis 智能指数58分——这个水平,已逼近许多闭源旗舰。8月14日,阿里紧接着放出 Qwen3.8-27B,一个270亿参数的稠密模型,在 Agent 编程基准上逼近 Opus-4.6 级别,却能跑在普通消费级显卡上。据多家统计,中文社区开源模型的全球下载量已经稳居第一。
同一天,DeepSeek V4 Pro 正式版 API 上线:1M 上下文、384K 输出、Agent 能力大幅跃升,部分性能逼近甚至超越 Claude Fable 5;而它的定价只有 Claude Fable 5 的四十六分之一。智谱 GLM-5.3 也在8月14日发布,基于7440亿参数的同一底座,仅靠后训练就让 Terminal-Bench 从4.6飙到28.3、DeepSWE 从46.2到66.9。Meta 的 Muse Glimmer 30B 则用一张显卡就能跑起本地 Agent。xAI 的 Grok 4.6 凭后训练刷新把智能指数从56抬到61,定价却只有前沿模型的零头。
结论很清楚:当一个开源模型在特定维度追平闭源、价格却便宜几十倍时,"谁更强"就不再是用户真正的痛点。能力平权,正在发生。
二、智能体融资爆发:投资人开始为"干活"买单
如果说开源解决了"模型够不够强",那么8月的融资潮,则在回答"AI 到底能不能落地"。答案,比想象中更肯定。
8月前两周,企业级 AI 智能体公司拿下了创纪录的融资:HappyRobot 1.5亿美元C轮、估值12亿美元;Zenity 1.25亿美元C轮,专做智能体的权限与安全治理;Obsidian Security 8500万美元D轮,管理"非人类身份"的安全;传闻 Cognition(Devin 背后的公司)正谈判超过10亿美元、估值400亿美元以上的融资。仅前12天,披露的智能体融资就超过6.3亿美元——而8月原本是风投最淡的月份。
更关键的,是钱花在了什么地方。HappyRobot 的客户部署后,有的每月自动处理2.8万小时工作量,自主解决率超过70%,客服满意度9.4/10,部分客户产能提升10倍。Zenity 解决的则是另一道难题:当几百个 AI 同时替你操作系统,谁来管权限、做审计、防越权。CodeRabbit 则拿到1.43亿美元,专做"人类与 Agent 提交的代码变更"的优先级治理。这不是聊天的玩具,而是真正嵌入企业运营流程的"数字员工"。
投资人用脚投票的逻辑其实很朴素:他们不为 demo 买单,只为"可量化的产出"买单——自动了多少工时、提升了多少产能、省下了多少人力。当"能干活的 Agent"成为被追逐的标的,AI 才算真正越过从实验室到车间的那道坎。
三、价格战与技术平权:算力的边际价值正在坍缩
能力追上、价格跳水,直接后果是"模型能力"作为护城河的价值在塌方。
DeepSeek V4 Pro 引入了峰谷定价——高峰期(早9-12点、下午2-6点)价格翻倍,空闲时段直接腰斩,新规8月17日生效。Google 8月13日发布 Gemini 3.7 Flash,编程基准 DeepSWE 从49%跳到65.3%,AutomationBench 从17%跃升到30.4%,而价格直接减半;它在输出速度上以340 token/秒登顶186个模型的榜首。三天之内连发三个 Flash 版本,把"快且便宜"做成了主旋律。
当模型能力以指数级速度变便宜,"谁能训练出最大模型"就不再是核心壁垒。算力正在从"战略硬通货"——腾讯Q2资本开支同比增176%、高端算力被当溢价资产倒卖——变成按需取用的水电。成本曲线的下移,把创新的门槛从"谁有钱堆算力"挪到了"谁能用好算力"。
四、真正的护城河,转移到了场景
牌桌洗牌之后,赢家到底是谁?答案很朴素:离业务最近的人。
美团8月18日发布餐饮"食安大模型",接入食材溯源、后厨规范、顾客反馈等12类数据,在北上广深1000家门店实时识别违规操作、提前72小时预警,违规识别准确率98.7%,计划年内覆盖10万家。字节跳动豆包上线企业级 Agent 商店,首批1200个智能体覆盖销售、客服、法务、财务、HR 等全职能场景。开源框架 openJiuwen 甚至推出分布式"蜂群"智能体,与邮储银行联合落地金融生产环境。Perplexity 则推出 Portable Computer,把整套智能体跑在本地 DGX Spark 上,彻底摆脱云端依赖。
这些案例的共同点是:它们不比谁的模型更大,而是比谁的 AI 更懂一个具体场景、能替用户把事办成。模型可以买、可以换,但沉淀在场景里的数据、流程和行业 know-how,才是搬不走的护城河。连监管也在加速——欧盟 AI 法案于8月18日正式生效,首批100家高风险企业被列入监管名单,倒逼"能落地"必须"能合规"。
所以回到开头那笔融资。HappyRobot 的 CEO 说了一句耐人寻味的话:"让 Agent 干活,只是起点,不是终点。"当开源把能力摊平、智能体把流程打通、监管把边界划清,AI 竞争的下半场,比的不再是模型参数,而是谁能把技术真正变成生意里省下的那2.8万小时。
每日推书
《AI 3.0》——梅兰妮·米切尔 著。如果你以为"大模型已经无所不能",这本书会给你一剂冷静剂。作为复杂系统科学家,米切尔用清晰的逻辑拆解了深度学习的能力边界:AI 在模式识别上惊人,但在因果推理、常识迁移上依然笨拙。放在今天这篇文章的语境里,它的价值在于提醒我们——开源模型再强、智能体再能干活,AI 依然是"在特定框架内高效、在框架外失灵"的系统。真正要把 AI 用好的企业,既要敢于拥抱它的能力,也要清醒认识它的盲区。读懂边界,才配谈落地。