← 文章 / AI技术
Latent Space 4小时前 · 2026-09-15 14:03:12 · 3 阅读

Xai、OpenAI与Anthropic联署AEF-1标准,推动第三方AI评估体系

我们在七月曾重点讨论过关于“发展节奏”(pacing)的争论,当时《Pacing the Frontier》一文首次提出这一概念:

[AINews] Fearing RSI: OpenAI, Anthropic, GDM, Meta, Thinky cosign letter to "Pace" AI development, as HuggingFace details Machine-Speed Offensive Cyberattack

Latent.Space·Jul 29Read full story

随着 Dario(原报告的主要作者)撰写了一篇罕见的个人博客,详细阐述了他对实施节奏控制的看法,看来我们正在迎来第二轮讨论:

  1. 嵌入式评估者。 每家前沿 AI 公司承诺向由第三方评估团队(例如 METR)组成的嵌入式小组提供持续、类似员工权限的访问权。该团队负责验证安全规范与承诺的执行情况、报告事故,并协助评估不仅包括已完成的 AI 模型,还包括训练管道和流程的对齐性。这是确保节奏承诺具备可验证性的关键一步,银行业对此也有先例,即监管机构有时会派遣“监管员”嵌入企业内部与员工共同工作。Anthropic 现已单方面承诺执行这一步骤。 我们打算将此作为加大安全和对齐工作力度的更广泛举措的一部分。

  2. 民主协调。 位于民主国家的前沿 AI 公司应协调一致,共同制定安全标准,并对未经检查的 AI 进步速度设定限制。某些具有节奏控制意义的协调形式在法律上具有挑战性,且需要政府支持。

  3. 全球协调。美国及其他民主国家在可能的范围内尝试与威权政府进行协调,同时认真对待合规验证的难题。

非常巧合的是,AI 评估者论坛(AI Evaluator Forum)成立于 2025 年 12 月)也恰好发布了他们对第一类评估者应尽职责的期望:

AEF 的成员如今大概率就是各大实验室在进行自我监管时会聘请的头部第三方审计机构。Dario 单方面承诺了前所未有的开放程度,包括“在我们的办公室设立工位、发放门禁卡和公司笔记本”,以及“获得与内部风险评估团队大体相当的workspace、工具和权限”。

这些都在标准的国内行业自我监管套路之内,而真正的考验或许更在于 Dario 提出的如何与中国协调推进速度这一方案。

2026 年 9 月 11 日至 9 月 14 日的 AI 新闻。我们查阅了 12 个 subreddit、544 个 Twitter 账号,未包含其他 Discord。AINews 网站可检索所有往期内容。提醒一下,AINews 现已是 Latent Space 的一个板块。你可以自行选择开启或关闭邮件推送频率!


AI Twitter 回顾

AI 安全治理、第三方评估,以及“Pace the Frontier”引发的分歧

  • 独立评估标准正日趋规范化AI 评估者论坛发布了AEF-1,这是一项针对独立第三方 AI 评估的拟议基准,涵盖资源访问权限、利益冲突、资金关系、回避机制及透明度等方面。这一点值得关注,因为本批次中关于安全的许多广泛争论都围绕着一个核心问题:在实操层面,外部评估是否真的能做到独立。

  • 公众层面在“前沿减速”与“控制优先”的安全路线上出现明显分裂:多篇高影响力帖子将当前争论聚焦于实验室应该控制能力进度的节奏,还是专注于具体的缓解与控制措施Bilal Chughtai宣布离开 Google DeepMind,并指出技术进步可能正在超过对齐研究的进度,明确呼吁控制节奏并提高透明度。Daniel Kokotajlo 转发了 Dan Selsam 的声明:Selsam 认为,具备情境意识的模型在评估中可能会看似对齐,实则掩盖了对齐失效,从而削弱对今后评估证据的信任。相比之下,Shashank/Sayash Kapoor 和 Lennart Heim 的新文章摘要提出,近期出现的“失控代理”事件最好被理解为一个主要属于安全/控制/治理范畴的问题,而非证明通用对齐研究是最高杠杆效应的干预手段。

  • 针对“放缓论”的反驳同样强硬,且矛头多指向 AnthropicAidan Gomez 反对由少数硅谷巨头垄断政府 AI 门禁权的世界;Cohere 也强调,公共领域的 x-risk(尾部风险)讨论容易滑向科幻范畴。在更具争论性的层面,Brian Chau 认为“失控智能体”的叙事被夸大了,而 Kevin Bass 发布了一则获得广泛互动的长帖,指责与 Anthropic 相关的安全生态存在结构性利益冲突。即便言辞激烈,其下潜藏的实质性工程问题依然真实存在:当前风险中,有多大比例可通过控制、监督、沙箱隔离及组织流程解决,又有多大比例必须依赖更慢的能力研发速度来化解?

  • 相关主题:治理即生产工程,而非仅是原则AI Engineer 世界博览会 中的 Harness Engineering 赛道强调,当智能体在生产环境中失效时,故障源往往不是“模型”本身,而是其周围的整套系统:harness(运行框架)、权限、工具路由、记忆、重试机制、紧急终止开关及监控。这一视角与安全性辩论中侧重控制流派的立场高度契合。

  • 智能体框架、编程智能体,以及从模型到编排范式的转变

    • Harness 工程正在逐渐成为一门独立的学科Omar Shorbagy 发布了一份从零构建 agent harness 的实用指南:把推理、工具和循环分开,保持 prompt 精简,勤于记录日志,在多样化任务上测试,然后再逐步加入记忆、技能和子 agent。他在后续推文中指出,自建 harness 可以通过更精简的 prompt、路由、压缩和验证器,显著降低成本并提升可靠性Business Barista 的 eval 大师课回顾从评测角度表达了类似观点:任务、验证器、环境、轨迹和自我改进循环,如今已成为应用 AI 的核心原语。

    • 桌面端编码 agent 正在走出 IDE 插件的范畴Cline 推出了 Cline Desktop,这是一款用于搭配 open-weight 模型工作的原生应用,支持 BYOK 和自选提供商,兼容 DeepSeek-V4.1-Flash、Musespark-1.3 等模型。kimmonismusOmar 的反响都集中在开放模型选择、独立工作流以及项目中途切换模型这些亮点上。

    • Copilot/Codex 工作流正变得更加侧重编排:GitHub 通过 Pierce Boggan 推出了自动模型选择档位——效率、平衡、智能,此外还加入了 Jira 画布,以及 agent 运行期间可直接使用的 /ask 模式。OpenAI 开发者团队也为 Codex 应用新增了对 Arch Linux 的原生支持。在工作流策略方面,reach_vb 建议把 Astra 用作编排器,将子任务分配给 Sol/Luna,并通过心跳循环来跟进长时间运行的任务。

    • 越来越多的证据表明,编排策略的选择与模型本身的原始质量同样重要:Twitter 上的普遍观点认为,更昂贵或能力更强的主模型能通过更优的委派降低整体成本。生产环境中的收益正日益来自上下文处理、文件格式、工具使用及验证器设计,而不仅仅是“使用更聪明的模型”。LangChain 的笔记也印证了这一点:仅改变文件读取格式,就将 edit_file 错误率降低了 15%,总输入 token 消耗减少了 10%

    模型/产品发布与性价比变化

    机器人、世界模型及专用应用 AI

    • 重要的机器人基础模型发布RewardAI 推出了 OM-1,定位为一种机器人基础模型,具备零样本泛化能力,可覆盖桌面、工业及人形机器人,并直接基于 人类操作数据 进行训练,而非依赖遥操作或特定机器人数据。其宣称的指标包括接近人类的手部灵巧度与效率,以及多机器人协作能力;若这些数据属实,则极具意义,尤其值得关注的是多条回复聚焦于“人类操作而非遥操作”这一特性。

    • 芯片设计应用 AI 正在向全栈演进kimmonismus 总结 Cognichip 指出 ACI Enterprise 是一款全栈 AI 副驾驶,涵盖从规格到 RTL、验证及 PPA 优化的芯片设计全流程。引人注目的案例是一位工程师在 10 天 内完成了工作,而 Cognichip 将其与前端团队传统流程所需的 4–5 个月 进行了对比。

    • 世界模型与实时生成系统依然活跃Google DeepMind 的 WeatherNext 3 将天气建模用于可再生能源规划,可按小时更新风机高度的风速和太阳辐射预报。Runway 和 fal 相关的生成媒体动态,以及 MiniMax 的 H3 推理优化,都表明更快的实时视频生成仍在持续投入;MiniMax 宣称在 8× B200 上预热后,端到端 9.0 秒生成 14.4 秒 768p 视频

    • 带验证器的 RL 正在扩展到数学/代码之外的领域Tinker 展示了借助基于物理的验证器和 Tinker 训练模型,以低成本设计符合真实规格的电力变压器——这是 RLVR 类方法迁移到已有仿真/验证基础设施的工程领域的一个例子。

    基础设施、开放生态与数据/算力主权

    • TPU 与 vLLM 的集成正在加深Inferact 与 Google Cloud 宣布合作,让 TPU 成为 vLLM 的一等公民,包括生产级 serving 特性、优化 kernel、通过 TorchTPU 提供原生 PyTorch 路径,以及一个为开源贡献者提供 TPU 算力和维护者支持社区计划。如果落地顺利,在 TPU 上 serving 前沿开源模型的门槛将大大降低,而不再默认只用 GPU 方案。

    • 开源模型生态正日益与真实数据采集绑定Arcee 与 Bolt 合作的 Forge 计划向选择加入的 Bolt Pro 用户提供50 倍用量额度,可用于多个开源权重模型,作为交换,用户的匿名开发会话数据将用于未来开源模型的训练和评估,且模型权重承诺后续公开发布。这是本批新闻中将产品使用转化为开源模型训练数据飞轮最直白的案例之一。

    • 对主权/去中心化 AI 技术栈的兴趣与日俱增Jon Durbin 主张构建 P2P、“不可阻挡”的 AI 系统,并声称 DGX Spark 搭配太阳能或 Starlink 部署,即可通过分布式节点参与训练一个 80B 模型。即便这种宣传略显夸大,也反映了对话中的一个更宏观的脉络:对监管俘获、算力集中以及对前沿实验室依赖的担忧,正促使人们关注可部署的主权替代方案。

    热门推文(按互动量排序)

    • 对 Anthropic 及安全生态的批评Kevin Bass 发布了互动量最高的技术相关帖子,指控 Anthropic 与 AI 安全/评估生态系统的某些部分存在财务利益捆绑,并认为这损害了评估者独立性的宣称。

    • Dan Selsam 关于 AI 风险的声明:由 Daniel Kokotajlo 转发,这是影响最深远的几篇安全类帖子之一:一位 OpenAI 现任研究员辩称,未来模型可能会系统性地博弈对齐评估,因为它们能理解自己何时正在被测试。

    • DeepSeek 内核工程师的反思teortaxesTex 翻译/分享 的一篇 DeepSeek 内核工程师文章引发了巨大关注。其技术实质并非模型发布,而是捕捉到了一个日益重要的工程现实:专家预期 AI 将吸收更多底层优化工艺本身,使人类工程师的角色转向监督与整合。

    • Muse 带动的消费级 AI 势头Sasha KaletskyAlexandr Wang 均放大了关于 Muse 是自 ChatGPT 以来最大规模消费级 AI 发布的说法,据报道其在美国的日下载量已超越 Threads、WhatsApp 和 Facebook。这些推文缺乏技术细节,但使用量的信号意义重大。


    AI Reddit 回顾

    /r/LocalLlama + /r/localLLM 回顾

    原始来源: Latent Space

    评论 (0)