← 文章 / AI技术
Latent Space 5小时前 · 2026-08-28 17:49:36 · 1 阅读

效果差10%,成本低100倍,速度快10000倍:为什么Simulation正在接管AI

按如今的 AI 标准来看,今天这个周五相当平静,正好可以退一步,想想事情究竟发展到了哪一步。如果你读过我们的 2025 年阅读清单,关注过我们对 Z.ai GLM 的报道,了解过 Poolside 的转向,一直在追踪我们的 AI for Science 主题,又收听了今天的 Simile 播客,那你不仅是 Latent Space 最忠实的读者之一,可能也已经形成了这样一套认知:

自 2022 年以来,每一年,构成机器智能生产流程的某个环节都会从人工制造转向模型生成。这个过程并非渐进式、也并不均衡——每次转变都有一个“零号病人”:某篇论文或某款产品,首次让合成版本在前沿实验室中承担起关键作用。从那一刻起,未来其实已经到来,只是还没有完成生产化。

如果换个角度看,我们过去称之为“synthetic data”“synthetic rubrics”“AI researcher”和“端到端 RL 环境”的东西,本质上都是越来越大胆的人类模拟——效果差 10%,但成本低 100 倍、速度快 10,000 倍。

阶段 1:奖励信号(2022 年)

最先被合成化的,出人意料地是评判者。InstructGPT 奠定了如今的经典做法:只收集一次人类偏好,训练一个奖励模型,让策略直接针对这个模型进行优化,而不再依赖人类。从策略的视角看,负责给予认可的本来就是一个 LLM。Constitutional AI 更进一步,让 AI 根据一组原则自我批评(RLAIF);随后,Lee 等人 证明,AI 反馈只需极低成本,就能达到与人类反馈相当的效果。等到 LLM-as-judge 成为默认的评测方法(MT-Bench、AlpacaEval)时,整套认可机制——奖励、批评和评估——都已经变成由模型评判模型。

阶段 2:训练数据(2023)

Microsoft 的 Phi 系列把观点直接写进了标题:Textbooks Are All You Need。一个用 LLM 合成的高质量教科书式数据训练的小模型,性能远超其参数规模所能预期;phi-1.5 进一步证明这并非偶然。Apple 的 WRAP 将这一思路推广开来:不只是生成数据,而是用 LLM 重写整个互联网,让预训练效率提升约 3 倍。此后,这条流水线开始工业化——NVIDIA 的 Nemotron-4 340B 将采用宽松许可的合成数据生成流程作为主要卖点;到 2025 年,推理轨迹语料(由强推理模型生成的思维链)已经成为预训练和中期训练的标准组成部分。原本被认为是不可替代的人类输入——语料库——如今很大一部分已经由模型撰写。

阶段 3:教师(2023)

ChatGPT API 开放几周后,Stanford 的 Alpaca 证明:只需花 600 美元,利用 GPT 生成的指令进行微调,就能复现前沿模型的大量行为。Vicuna 使用共享对话实现了类似效果;Orca 则引入了丰富的教师解释,而不只是简单答案。这项技术逐渐从模仿发展为一套完整的训练方法——on-policy generalized knowledge distillation 解决了训练与推理之间的不匹配问题。随着 DeepSeek-R1 在发布旗舰模型的同时推出一系列蒸馏模型,这一方法达到了影响力巅峰,也让“教师本身就是模型”成为此后小模型发布时的默认前提。

阶段 4:课程学习(2024)

前 3 个阶段让输入变成了合成数据;到了第 4 阶段,整个闭环开始形成,因为模型开始决定下一步要学什么。相关技术其实很早就已出现——Self-Instruct 让模型编写自己的指令集,STaR 让模型生成并迭代自己的推理轨迹,这两项工作都发表于 2022 年。真正的转折来自 Meta 的 Self-Rewarding Language ModelsSPIN:它们表明,模型可以自行生成任务、评估输出,并突破人类偏好数据设定的上限。课程设计——历来最依赖经验、品味和人工判断的机器学习环节,如今也开始由模型自行完成。

阶段 5:研究员(2026)

辅助时代(先是 Copilot,后来是 SWE-agent)仍由人类决定要做哪些实验。到了发现时代,情况变了。DeepMind 的 AlphaEvolve 在 2025 年进化出了真正全新的算法;Sakana 的 AI Scientist(如今已发表在 Nature!)则勾勒出了完整的论文写作流程。真正的转折点出现在 Karpathy 于 2026 年 3 月推出的 autoresearch:一个刻意保持极简的迭代闭环——coding agent 修改真实的 LLM 训练配置,运行一个五分钟实验,只有当验证损失下降时才保留改动,然后彻夜重复。Karpathy 的一次长期运行累计进行了 700 个实验,最终保留了 20 项改进,把 GPT-2 的训练耗时从 2.02 小时降到 1.80 小时——他睡觉时,系统找到了真实且可迁移的代码改动。

阶段 6:环境(2026)

RL 的扩展瓶颈从模型转移到了环境:训练需要成千上万个可执行、可验证且足够贴近专业现实的任务世界,而人类无法手工快速构建这么多环境。我们最近在关于 z.ai / GLM-5.3 的文章中介绍过这一点:Z.ai 构建了端到端合成环境的流水线——研究型 agent 从真实工作中提取任务模式,将其转化为带有隐藏状态的长时程环境;裁判 agent 会尝试完成每项任务,以确认任务确实可解;验证器则在看不到参考答案的情况下自动生成,再通过 oracle、no-op 和未解决状态检查进行压力测试,直到二元奖励足够可靠,可以直接用于训练。正如 GLM-5.3 的发布说明所说,从环境、裁判到验证,整套系统自上而下都是合成的。同一周发布的 Ornith-1.5 也宣称实现了端到端自我改进——模型自己提出任务,并生成自己的 RL rollouts。如今,训练场、裁判和记分牌全都是模型。

阶段 7:人类作为研究对象(2025)

如果模型既能充当裁判、教师和环境,那么人类在闭环中剩下的角色就是受试者——偏好、行为和需求的来源。这正是 Simile 正在替代的那一层。相关研究脉络始于 Joon Sung Park 的 Generative Agents(Smallville,2023),随后发展到对 1,000 人进行生成式智能体模拟:研究者根据两小时的传记访谈构建数字孪生体,结果发现,它们对调查和行为的还原准确率达到 85%,与两周后人类受访者再次复现自身反应的准确率相当。

需要攻克的最大障碍是:前沿模型的训练目标是成为智能体模型,因此它们并不擅长模拟真实的人类。为此,Simile 进一步利用访谈、交易数据,以及来自 Open Science Framework 的注册随机对照试验(RCT)进行后训练,专门还原人类的偏见、不一致性和因果脉络,并公布了模拟质量的早期规模定律。在 Shopify 的 SimGym 用于模拟购物者行为轨迹,以及腾讯较为粗放的十亿人格方案等实践推动下,焦点小组、用户研究和 A/B 测试面板都正在变成推理任务。

第 8 阶段:物理世界(2026 年,进行中)

这张路线图的最后一行始终没能完全变红,而这正是关键所在。Poolside 的反向招聘信对此划分得非常清楚:世界上的问题分为两类,一类是智能受限型问题,可以通过扩展认知能力解决,并且很快会因开放权重模型而商品化;另一类是实验受限型问题——“再多的智能也无法替代真实世界的实验反馈。没有湿实验室,10 万个天才也治不好癌症。”Poolside 的判断是,AI 的持久价值最终会归于掌握实验闭环的人,也就是把 AI 打造成“世界上最有价值的科学发现引擎”。

生物领域也在从另一个方向采取同样的策略。CZ Biohub正将 Human Cell Atlas 成像为一个虚拟细胞——因为与体内实验相比,in silico 模拟的成本和速度大约都能提升 1000 倍——并进一步构建虚拟免疫系统。ChaiXaira以及由 Lila 打造、形似数据中心的实验室,正在共同补齐AI for Science技术栈。现实世界是唯一无法被完全合成的部分——我们只能逐个细胞地将其压缩进模型。

AINews:工作日简报

[AINews] Poolside 获 NVIDIA 120 亿美元反向收购式招揽:创始人以 10 亿美元留下,员工以 60 亿美元转入,Infraco 将新云规模扩展至 7GW

8 月 21 日[AINews] Poolside gets $12B reverse-execuhire to NVIDIA; founders stay for $1B, employees go for $6B, Infraco scaling to 7GW neocloud

不到一个月前,我们刚在播客中与 Eiso Kant 一起介绍过 Poolside 的 Model Factory(此前还报道过我们的 Paper Club):

阅读全文

指数增长始于对角线

再读一遍这张表格,你会发现隐藏在第一种模式之下的另一种规律。每一次转折前,都有人提出同样的质疑——模型崩溃、幻觉叠加、垃圾进垃圾出——但每一次转折最终都发生了,而且恰好发生在验证机制让合成版本变得可信的那一刻:Phi 依靠严格筛选教材,LLM 评测依靠评审模型之间的一致性研究,RLVR 依靠单元测试和证明检查器,z.ai 的验证器依靠 oracle/no-op 检查,Simile 的数字孪生依靠预注册的 RCT,虚拟细胞则依靠湿实验室闭环。合成领域的前沿,并不是随着生成能力提升而推进的;真正推动它前进的,是验证能力。

这也揭示了它下一步的发展方向。网格左下角剩下的那块灰色三角区域——实体实验、具身世界的真实反馈——恰恰是验证速度最慢、成本最高的地方。模型先学会写作,再学会评判,接着学会实践,最后开始做实验。未来十年要回答的问题是:它们究竟需要接触多少现实,又有多少环节可以用模拟来替代。

准确度低 10%,成本低 100 倍,速度快 10000 倍……而且这三个维度都在快速改善。

再强调一遍:

2026 年 8 月 20 日至 21 日的 AI 新闻。我们查看了 12 个 subreddit、544 个 Twitter 账号,没有再查阅其他 Discord。AINews 网站支持搜索往期全部内容。提醒一下,AINews 现在已成为 Latent Space 的一个栏目。你可以选择订阅或取消订阅不同频率的邮件!


AI Twitter 综述

隐身模型、中国的前沿竞争压力,以及 DeepSeek 在多模态领域的推进

OpenAI、Codex 与定价/使用成本

Agents、Harness 与以环境为中心的训练转向

研究亮点:路由、循环利用与机器人技术

  • 推理时架构的新思路:DeepMind 关于 Recirculation 的论文引发关注。该方法无需重新训练,只需在推理阶段将更深层生成的上下文激活反馈给前面的处理层。论文摘要称,实验中上下文理解错误率降低了 60%、困惑度下降 23%,GSM8K 得分提升 21%讨论串)。

  • 模型路由获得了更严谨的理论处理:Google DeepMind 的 Pandora’s Router 将路由建模为一个带有高昂评估成本的最优搜索问题,而不是假设路由评估可以免费进行。其核心结论是:在更少调用昂贵评估器的情况下,也能达到穷举式评估的效果;这一结论同样适用于配备专用 LLM、且推理时思考深度可变的场景。

  • 机器人领域也有两项重要进展:据报道,NVIDIA AVO 已解决 ARC-AGI-3 公开的 25 个环境中的全部 183 个关卡。不过,François Chollet 提醒,这些只是公开演示和教程关卡,并非完整基准测试。另一边,Jim Fan 发布了 T-Rex:这是一套触觉响应型灵巧操作系统,配备异步视觉专家和触觉专家,并使用了目前规模最大的开源触觉数据集——50 小时、约 5,500 个 episode、22-DoF 硬件

基础设施、算力与开源模型

热门推文(按互动量排序)


AI Reddit 综述

/r/LocalLlama + /r/localLLM 综述

1. Qwen3.8 27B 本地 Agent 评测

  • Qwen3.8-27b 是我见过本地模型中“自主性”最高的一个(活跃度:1334):发帖者称,Qwen3.8-27B 通过 Unsloth 在单张 RTX 3090 上本地运行,采用 Q4_K_S 量化、q8 KV cache 和 150k 上下文后,展现出了异常出色的自主代理能力:它可以结合 Playwright 和现有的 SSO/会话 Cookie 登录大学系统,查询课程安排;也能独立处理社交媒体视频,包括下载视频、提取帧、用 Whisper 转录,以及增强图像质量。配图是模型的运行截图,显示它使用 Outlook/OWA 的 Playwright 配置、Microsoft“保持登录”功能以及 Duo 浏览器信任 Cookie 访问学校系统。因此,这件事的技术意义不只是模型本身的能力,更在于本地 LLM 的工具调用和自主执行能力,以及对高风险凭据和会话信息的处理。评论者既感到惊艳,也保持谨慎:有人明确担心,如果给代理足够高的权限,它可能执行退学等破坏性操作;也有人认为,这说明先进的本地代理系统已经出现,只是目前还没有普及。

    • 有评论者询问了 Qwen3.8-27B 展现上述代理能力的具体实现细节,尤其是使用了哪种 agent harness——例如 Claude CodeHermes 或其他框架——以及工具是如何通过 MCP servers、浏览器工具、Python、文件系统访问等方式提供给模型的。他们还询问了模型使用的推理后端,例如 llama.cpp,以及它如何自主下载视频、提取帧并安装 Whisper

    • 有人对所使用量化方案的可靠性提出了技术层面的担忧:一位评论者表示惊讶于“这个量化效果居然这么好”,但同时提到有报告称该量化版本会出现循环行为。这表明,模型表现出的自主性可能会受到量化级别和运行时行为的显著影响,尤其是在需要长时间、多步骤调用工具的任务中。

    • 一条关注安全的讨论质疑了是否应该赋予本地 agent 广泛的系统访问权限。有评论者表示,他们不会信任 SolFable 这类 agent,让其拥有不受限制的权限。问题不在于本地推理本身,而在于具备足够权限、能够自主执行现实世界重大操作(例如修改账户或工作流)的 agent。

  • Qwen3.8-27B 的知识能力 相比 3.6 大幅退步(热度:779):帖子称,在离线、无工具调用的事实回忆测试中,Qwen3.8-27B / Qwen3-8-27B 似乎不如 Qwen3.6-27B / Qwen3-6-27B:作者使用自己编写的“略冷门”知识与实用常识基准进行测试,发现模型在不同量化级别和采样设置下都出现了错误;这一结果也与 Artificial Analysis 的Omniscience 知识基准中较低的得分相符。这里所说的退步,具体指模型权重中存储的知识,以及在隔离网络环境推理时的幻觉和事实回忆能力,并非编码或工具使用能力;评论者指出,Qwen3.8 在工具调用、网页搜索/抓取工作流、编码和 agent 能力方面更强。评论者普遍认为,这是一种有意的取舍:新版 Qwen 3.x 可能更侧重编码和 agent 任务,而不是充当“迷你版 Google”的事实知识库, wit

原始来源: Latent Space

评论 (0)