效果差10%,成本低100倍,速度快10000倍:为什么Simulation正在接管AI
按如今的 AI 标准来看,今天这个周五相当平静,正好可以退一步,想想事情究竟发展到了哪一步。如果你读过我们的 2025 年阅读清单,关注过我们对 Z.ai GLM 的报道,了解过 Poolside 的转向,一直在追踪我们的 AI for Science 主题,又收听了今天的 Simile 播客,那你不仅是 Latent Space 最忠实的读者之一,可能也已经形成了这样一套认知:

自 2022 年以来,每一年,构成机器智能生产流程的某个环节都会从人工制造转向模型生成。这个过程并非渐进式、也并不均衡——每次转变都有一个“零号病人”:某篇论文或某款产品,首次让合成版本在前沿实验室中承担起关键作用。从那一刻起,未来其实已经到来,只是还没有完成生产化。
如果换个角度看,我们过去称之为“synthetic data”“synthetic rubrics”“AI researcher”和“端到端 RL 环境”的东西,本质上都是越来越大胆的人类模拟——效果差 10%,但成本低 100 倍、速度快 10,000 倍。
阶段 1:奖励信号(2022 年)
最先被合成化的,出人意料地是评判者。InstructGPT 奠定了如今的经典做法:只收集一次人类偏好,训练一个奖励模型,让策略直接针对这个模型进行优化,而不再依赖人类。从策略的视角看,负责给予认可的本来就是一个 LLM。Constitutional AI 更进一步,让 AI 根据一组原则自我批评(RLAIF);随后,Lee 等人 证明,AI 反馈只需极低成本,就能达到与人类反馈相当的效果。等到 LLM-as-judge 成为默认的评测方法(MT-Bench、AlpacaEval)时,整套认可机制——奖励、批评和评估——都已经变成由模型评判模型。
阶段 2:训练数据(2023)
Microsoft 的 Phi 系列把观点直接写进了标题:Textbooks Are All You Need。一个用 LLM 合成的高质量教科书式数据训练的小模型,性能远超其参数规模所能预期;phi-1.5 进一步证明这并非偶然。Apple 的 WRAP 将这一思路推广开来:不只是生成数据,而是用 LLM 重写整个互联网,让预训练效率提升约 3 倍。此后,这条流水线开始工业化——NVIDIA 的 Nemotron-4 340B 将采用宽松许可的合成数据生成流程作为主要卖点;到 2025 年,推理轨迹语料(由强推理模型生成的思维链)已经成为预训练和中期训练的标准组成部分。原本被认为是不可替代的人类输入——语料库——如今很大一部分已经由模型撰写。
阶段 3:教师(2023)
ChatGPT API 开放几周后,Stanford 的 Alpaca 证明:只需花 600 美元,利用 GPT 生成的指令进行微调,就能复现前沿模型的大量行为。Vicuna 使用共享对话实现了类似效果;Orca 则引入了丰富的教师解释,而不只是简单答案。这项技术逐渐从模仿发展为一套完整的训练方法——on-policy generalized knowledge distillation 解决了训练与推理之间的不匹配问题。随着 DeepSeek-R1 在发布旗舰模型的同时推出一系列蒸馏模型,这一方法达到了影响力巅峰,也让“教师本身就是模型”成为此后小模型发布时的默认前提。
阶段 4:课程学习(2024)
前 3 个阶段让输入变成了合成数据;到了第 4 阶段,整个闭环开始形成,因为模型开始决定下一步要学什么。相关技术其实很早就已出现——Self-Instruct 让模型编写自己的指令集,STaR 让模型生成并迭代自己的推理轨迹,这两项工作都发表于 2022 年。真正的转折来自 Meta 的 Self-Rewarding Language Models 和 SPIN:它们表明,模型可以自行生成任务、评估输出,并突破人类偏好数据设定的上限。课程设计——历来最依赖经验、品味和人工判断的机器学习环节,如今也开始由模型自行完成。
阶段 5:研究员(2026)
辅助时代(先是 Copilot,后来是 SWE-agent)仍由人类决定要做哪些实验。到了发现时代,情况变了。DeepMind 的 AlphaEvolve 在 2025 年进化出了真正全新的算法;Sakana 的 AI Scientist(如今已发表在 Nature!)则勾勒出了完整的论文写作流程。真正的转折点出现在 Karpathy 于 2026 年 3 月推出的 autoresearch:一个刻意保持极简的迭代闭环——coding agent 修改真实的 LLM 训练配置,运行一个五分钟实验,只有当验证损失下降时才保留改动,然后彻夜重复。Karpathy 的一次长期运行累计进行了 700 个实验,最终保留了 20 项改进,把 GPT-2 的训练耗时从 2.02 小时降到 1.80 小时——他睡觉时,系统找到了真实且可迁移的代码改动。
阶段 6:环境(2026)
RL 的扩展瓶颈从模型转移到了环境:训练需要成千上万个可执行、可验证且足够贴近专业现实的任务世界,而人类无法手工快速构建这么多环境。我们最近在关于 z.ai / GLM-5.3 的文章中介绍过这一点:Z.ai 构建了端到端合成环境的流水线——研究型 agent 从真实工作中提取任务模式,将其转化为带有隐藏状态的长时程环境;裁判 agent 会尝试完成每项任务,以确认任务确实可解;验证器则在看不到参考答案的情况下自动生成,再通过 oracle、no-op 和未解决状态检查进行压力测试,直到二元奖励足够可靠,可以直接用于训练。正如 GLM-5.3 的发布说明所说,从环境、裁判到验证,整套系统自上而下都是合成的。同一周发布的 Ornith-1.5 也宣称实现了端到端自我改进——模型自己提出任务,并生成自己的 RL rollouts。如今,训练场、裁判和记分牌全都是模型。
阶段 7:人类作为研究对象(2025)
如果模型既能充当裁判、教师和环境,那么人类在闭环中剩下的角色就是受试者——偏好、行为和需求的来源。这正是 Simile 正在替代的那一层。相关研究脉络始于 Joon Sung Park 的 Generative Agents(Smallville,2023),随后发展到对 1,000 人进行生成式智能体模拟:研究者根据两小时的传记访谈构建数字孪生体,结果发现,它们对调查和行为的还原准确率达到 85%,与两周后人类受访者再次复现自身反应的准确率相当。
需要攻克的最大障碍是:前沿模型的训练目标是成为智能体模型,因此它们并不擅长模拟真实的人类。为此,Simile 进一步利用访谈、交易数据,以及来自 Open Science Framework 的注册随机对照试验(RCT)进行后训练,专门还原人类的偏见、不一致性和因果脉络,并公布了模拟质量的早期规模定律。在 Shopify 的 SimGym 用于模拟购物者行为轨迹,以及腾讯较为粗放的十亿人格方案等实践推动下,焦点小组、用户研究和 A/B 测试面板都正在变成推理任务。
第 8 阶段:物理世界(2026 年,进行中)
这张路线图的最后一行始终没能完全变红,而这正是关键所在。Poolside 的反向招聘信对此划分得非常清楚:世界上的问题分为两类,一类是智能受限型问题,可以通过扩展认知能力解决,并且很快会因开放权重模型而商品化;另一类是实验受限型问题——“再多的智能也无法替代真实世界的实验反馈。没有湿实验室,10 万个天才也治不好癌症。”Poolside 的判断是,AI 的持久价值最终会归于掌握实验闭环的人,也就是把 AI 打造成“世界上最有价值的科学发现引擎”。
生物领域也在从另一个方向采取同样的策略。CZ Biohub正将 Human Cell Atlas 成像为一个虚拟细胞——因为与体内实验相比,in silico 模拟的成本和速度大约都能提升 1000 倍——并进一步构建虚拟免疫系统。Chai、Xaira以及由 Lila 打造、形似数据中心的实验室,正在共同补齐AI for Science技术栈。现实世界是唯一无法被完全合成的部分——我们只能逐个细胞地将其压缩进模型。
AINews:工作日简报[AINews] Poolside 获 NVIDIA 120 亿美元反向收购式招揽:创始人以 10 亿美元留下,员工以 60 亿美元转入,Infraco 将新云规模扩展至 7GW
8 月 21 日![[AINews] Poolside gets $12B reverse-execuhire to NVIDIA; founders stay for $1B, employees go for $6B, Infraco scaling to 7GW neocloud](https://dbyun-product.oss-cn-chengdu.aliyuncs.com/crawl/a75a7d456f510d09d172098e1e1942e9.png)
不到一个月前,我们刚在播客中与 Eiso Kant 一起介绍过 Poolside 的 Model Factory(此前还报道过我们的 Paper Club):
阅读全文指数增长始于对角线
再读一遍这张表格,你会发现隐藏在第一种模式之下的另一种规律。每一次转折前,都有人提出同样的质疑——模型崩溃、幻觉叠加、垃圾进垃圾出——但每一次转折最终都发生了,而且恰好发生在验证机制让合成版本变得可信的那一刻:Phi 依靠严格筛选教材,LLM 评测依靠评审模型之间的一致性研究,RLVR 依靠单元测试和证明检查器,z.ai 的验证器依靠 oracle/no-op 检查,Simile 的数字孪生依靠预注册的 RCT,虚拟细胞则依靠湿实验室闭环。合成领域的前沿,并不是随着生成能力提升而推进的;真正推动它前进的,是验证能力。
这也揭示了它下一步的发展方向。网格左下角剩下的那块灰色三角区域——实体实验、具身世界的真实反馈——恰恰是验证速度最慢、成本最高的地方。模型先学会写作,再学会评判,接着学会实践,最后开始做实验。未来十年要回答的问题是:它们究竟需要接触多少现实,又有多少环节可以用模拟来替代。
准确度低 10%,成本低 100 倍,速度快 10000 倍……而且这三个维度都在快速改善。
再强调一遍:

2026 年 8 月 20 日至 21 日的 AI 新闻。我们查看了 12 个 subreddit、544 个 Twitter 账号,没有再查阅其他 Discord。AINews 网站支持搜索往期全部内容。提醒一下,AINews 现在已成为 Latent Space 的一个栏目。你可以选择订阅或取消订阅不同频率的邮件!
AI Twitter 综述
隐身模型、中国的前沿竞争压力,以及 DeepSeek 在多模态领域的推进
Ox Alpha 成了当天最神秘的模型:多位开发者称,它在编程和智能体任务上的表现异常强劲。综合各种猜测,它很可能属于 Zhipu/GLM 系列,或许是 GLM-5.3 Vision,也可能是某个 Flash 版本,而不是全新的超大规模基础模型。有报道称,Theo 表示它“横扫”了内部基准测试;随后,团队又根据它的审核结果合并了 8 个 PR。Kimmonismus 则称,在 10 项 DeepSWE 任务中,它的得分超过 80%,高于 Fable 的 65% 和 GPT-5.6 Sol 的 52%。随后,社区很快通过 Hermes Agent/OpenCode/OpenRouter 以及 Cline 推广开来。
社区最有说服力的技术判断是:“后训练 + 基础设施”胜过单纯堆规模:多位独立分析者认为,Ox Alpha 的速度特征和输出风格,更像是经过高效优化的 GLM 衍生模型,而不是参数量超过 1T 的庞然大物。比如,Tim Dettmers 认为,更快的输出速度和较弱的部分预填充能力,可能意味着模型实际激活的参数更少;scaling01 推测,它可能是由更大的教师模型蒸馏到 5.3 级别的模型;teortaxesTex 则多次将范围进一步缩小到 GLM-5.3/5.4 Vision。这一解读也符合一篇对 GLM-5.3 的详细分析:它沿用了与 GLM-5.2 相同的 743B 基础模型,性能提升主要来自扩大规模的后训练、更完善的沙盒,以及用于长程智能体任务精细信用分配的 SAO。ZhihuFrontier 的串文对此进行了总结。
DeepSeek 发布了当天最具实质性的产品:DeepSeek-V4-Flash-Vision-Exp 新增多模态支持,同时据称保留了 V4-Flash 的文本能力。DeepSeek 表示,其多模态智能体性能接近 Opus-4.8。此次更新还包括混合文本与图像 API 支持:图像按 Flash 价格计费,每张图像占用 117–384 个 token,以及全新的Files API,可复用已上传的文件。这似乎至少澄清了部分 Ox Alpha 的疑云:有观察者指出,这个神秘模型很可能在部分测试中其实是“盲测 VLM”。
更广泛的趋势:中国实验室正在性价比和多模态智能体两个方向压缩与前沿模型的差距。Kimmonismus 认为,传闻中的 GLM-5.3 Flash 级别模型 Ox Alpha 将迫使美国实验室采取应对措施;与此同时,SemiAnalysis 也直接提出了开放模型是否正在追赶的问题。
OpenAI、Codex 与定价/使用成本
OpenAI 将 GPT-5.6 Sol 的价格下调了 20% 以上,优惠期为三个月,适用于 API 和按额度计费的产品。相关消息由 @OpenAI 和 @OpenAIDevs 发布。此举还叠加了产品层面的促销,例如 Code 在 9 月 3 日前提供五折优惠,以及 Cognition 提到的 Devin 优惠:叠加各项折扣后,Sol 在 10 月 3 日前实际可享受 76% 的目录价折扣。这既像是对使用率和效率的调整,也是在回应中国厂商低价推理带来的竞争压力。
Codex 的使用量似乎正在爆发式增长:thsottiaux 称 Codex 已达到 2000 万活跃用户,并向所有 Codex 和 ChatGPT Work 用户赠送了一次“预存重置”,随后被 Theo 和 Kimmonismus 迅速扩散。还有用户反馈产品突破了原本的使用上限,例如 Theo 称,自己在剩余额度已经显示为 0% 后,一个持续运行的目标仍消耗了约 800 美元的 token。
OpenAI 加强了费用控制功能:团队现在可以按 API key 跟踪用量和支出,并为组织或项目设置每月硬性额度。随着 agent 工作负载变得更难预测、并发量不断增加,这些功能会越来越实用。
创业公司工具市场的风向重新转向 OpenAI:immad 认为,Anthropic 在创业公司中的份额可能已于第一季度见顶,Sol 和 Codex 正在“扭转局势”。与此同时,一些用户将 Sol 视为当前编码、数学和 agent 任务的综合最佳模型。例如,DimitrisPapail 称它是“几乎适用于所有任务的最强模型”。
Agents、Harness 与以环境为中心的训练转向
重心正从 prompt 转向环境:这里最值得关注的讨论,再次来自 对 GLM-5.3 沙盒扩展机制的解读:基础模型保持不变,但通过更丰富的可执行环境和 SAO 风格的反事实信用分配,模型在长时程任务上的表现得到提升。这与当天分享的其他研究方向一致:Google 的 EnvHarness / EnvRigger 通过插件层和基于策略诊断的环境重塑来改造静态环境,在留出测试集上的表现最高提升 9 分,同时执行步骤减少 9.8%。
基准测试正变得更垂直、更难:FACET 根据 Agent 技能生成可执行的终端任务,并验证了6,078 个任务;SWE-bench Science 新增 119 个科学软件任务,即使 Claude Code + Opus-5 的 pass@1 也不到 50%;CADBench 发现,在贴近真实的 Fusion 360 任务中,顶尖模型的通过率仅为 24.6%;AI4AI-Bench 则围绕 10 个研究代码库测试递归式自我改进,最佳模型的平均得分只有 0.288。
Agent 基础设施正加速产品化:GitHub 将协作式 Agent 工作流扩展到了 Slack 和 Teams。Slack 描述了一种类似 Devin 的工作流:Agent 自动接手任务、创建 PR,并在共享频道中邀请设计团队参与(示例)。Agent runtime 也在持续演进:nac v0.1.3 新增沙箱化 git worktree、会话管理和支持视觉理解的图片读取;Hermes Agent 开放了 Ox Alpha,并加入“Blank Slate mode”和自动技能清理功能;OpenHands 则将免费版默认模型切换为 Kimi K3。
RL 推理服务的正确性取得了重要系统性进展:vLLM 的 IsoExec 解决了浮点运算不可结合导致的 rollout 与训练 logprob 不一致问题,确保不同 TP/EP/SP 布局之间实现位级一致。在 8 张 H100 上使用 DAPO 运行 Qwen3.5-35B-A3B 时,据称 logprob 差异从 1.6e-2 降至 6.7e-7,额外开销为25.3%。
研究亮点:路由、循环利用与机器人技术
推理时架构的新思路:DeepMind 关于 Recirculation 的论文引发关注。该方法无需重新训练,只需在推理阶段将更深层生成的上下文激活反馈给前面的处理层。论文摘要称,实验中上下文理解错误率降低了 60%、困惑度下降 23%,GSM8K 得分提升 21%(讨论串)。
模型路由获得了更严谨的理论处理:Google DeepMind 的 Pandora’s Router 将路由建模为一个带有高昂评估成本的最优搜索问题,而不是假设路由评估可以免费进行。其核心结论是:在更少调用昂贵评估器的情况下,也能达到穷举式评估的效果;这一结论同样适用于配备专用 LLM、且推理时思考深度可变的场景。
机器人领域也有两项重要进展:据报道,NVIDIA AVO 已解决 ARC-AGI-3 公开的 25 个环境中的全部 183 个关卡。不过,François Chollet 提醒,这些只是公开演示和教程关卡,并非完整基准测试。另一边,Jim Fan 发布了 T-Rex:这是一套触觉响应型灵巧操作系统,配备异步视觉专家和触觉专家,并使用了目前规模最大的开源触觉数据集——50 小时、约 5,500 个 episode、22-DoF 硬件。
基础设施、算力与开源模型
开源模型获取和本地推理持续改善:Ollama 宣布 AT&T 加入开源模型阵营,并将 Kimi K3 加入 Pro/Max 订阅。Yuchen Jin 介绍了加州大学伯克利分校的 FreeToken:在单张 RTX PRO 6000 上运行 753B GLM-5.2,速度达到 14.9 tok/s;在配备 8GB RTX 4060 的笔记本上运行 Qwen3.6-35B,速度达到 39.3 tok/s。据称,在消费级 GPU 上,其吞吐量是 Ollama 的 2–4 倍。
算力仍是最硬的约束:多位运营者表示,推理算力正在变得更加紧张,而不是趋于宽松——参见 saranormous 关于优秀 AI 公司受算力限制、增长受阻的观点,以及 Andrew Carr 关于自建 GPU 集群后,实验需求仍超过可用算力的分享。因此,提升模型效率、优化调度,以及降低延迟、提高每美元可处理的 token 数,都具有重要的战略意义。
开源训练的透明度也在不断提升:Percy Liang 宣布 Marin 535B-A23B 已开始训练,计划在约 3 个月内,使用 11× GB200 NVL72 训练 18.75T tokens,整个训练过程也将像往常一样保持公开。
热门推文(按互动量排序)
DeepSeek 发布 V4-Flash-Vision-Exp——这是当天最明确的产品发布,也可能是多模态 Agent 领域最具实际影响力的变化。
OpenAI 将 GPT-5.6 Sol 的价格下调超过 20%——前沿模型市场的价格压力正在显著加大。
Codex 活跃用户达到 2000 万,并为用户提供可累积的重置次数——这是一个值得关注的产品增长信号。
NVIDIA AVO 在 ARC-AGI-3 公共环境中达到 100%,但Chollet 提醒,这一成绩的具体解读仍需谨慎——表现确实亮眼,但基准测试的含义同样重要。
David Sacks 分享 Harvey 如何以更低成本,利用开源 Kimi K3 达到法律领域的 SOTA 水平——这有力说明了:如果限制开源模型,受损最大的可能主要是美国应用层公司。
AI Reddit 综述
/r/LocalLlama + /r/localLLM 综述
1. Qwen3.8 27B 本地 Agent 评测
Qwen3.8-27b 是我见过本地模型中“自主性”最高的一个(活跃度:1334):发帖者称,Qwen3.8-27B 通过 Unsloth 在单张 RTX 3090 上本地运行,采用
Q4_K_S量化、q8KV cache 和150k上下文后,展现出了异常出色的自主代理能力:它可以结合 Playwright 和现有的 SSO/会话 Cookie 登录大学系统,查询课程安排;也能独立处理社交媒体视频,包括下载视频、提取帧、用 Whisper 转录,以及增强图像质量。配图是模型的运行截图,显示它使用 Outlook/OWA 的 Playwright 配置、Microsoft“保持登录”功能以及 Duo 浏览器信任 Cookie 访问学校系统。因此,这件事的技术意义不只是模型本身的能力,更在于本地 LLM 的工具调用和自主执行能力,以及对高风险凭据和会话信息的处理。评论者既感到惊艳,也保持谨慎:有人明确担心,如果给代理足够高的权限,它可能执行退学等破坏性操作;也有人认为,这说明先进的本地代理系统已经出现,只是目前还没有普及。有评论者询问了 Qwen3.8-27B 展现上述代理能力的具体实现细节,尤其是使用了哪种 agent harness——例如 Claude Code、Hermes 或其他框架——以及工具是如何通过 MCP servers、浏览器工具、Python、文件系统访问等方式提供给模型的。他们还询问了模型使用的推理后端,例如 llama.cpp,以及它如何自主下载视频、提取帧并安装 Whisper。
有人对所使用量化方案的可靠性提出了技术层面的担忧:一位评论者表示惊讶于“这个量化效果居然这么好”,但同时提到有报告称该量化版本会出现循环行为。这表明,模型表现出的自主性可能会受到量化级别和运行时行为的显著影响,尤其是在需要长时间、多步骤调用工具的任务中。
。
一条关注安全的讨论质疑了是否应该赋予本地 agent 广泛的系统访问权限。有评论者表示,他们不会信任 Sol 或 Fable 这类 agent,让其拥有不受限制的权限。问题不在于本地推理本身,而在于具备足够权限、能够自主执行现实世界重大操作(例如修改账户或工作流)的 agent。
Qwen3.8-27B 的知识能力 相比 3.6 大幅退步(热度:779):帖子称,在离线、无工具调用的事实回忆测试中,Qwen3.8-27B / Qwen3-8-27B 似乎不如 Qwen3.6-27B / Qwen3-6-27B:作者使用自己编写的“略冷门”知识与实用常识基准进行测试,发现模型在不同量化级别和采样设置下都出现了错误;这一结果也与 Artificial Analysis 的Omniscience 知识基准中较低的得分相符。这里所说的退步,具体指模型权重中存储的知识,以及在隔离网络环境推理时的幻觉和事实回忆能力,并非编码或工具使用能力;评论者指出,Qwen3.8 在工具调用、网页搜索/抓取工作流、编码和 agent 能力方面更强。评论者普遍认为,这是一种有意的取舍:新版 Qwen 3.x 可能更侧重编码和 agent 任务,而不是充当“迷你版 Google”的事实知识库, wit