← 文章 / 行业与公司动态
Latent Space 4小时前 · 2026-10-06 15:31:14 · 5 阅读

AI新闻周报:Reflection 发布 501B-A23B 美国本土开源模型 Beam

距离 Reflection 与我们一同发布 已经过去了一年多,当时他们立下了在编码领域的宏大目标(并暗示了其 RL 方法):

但他们“隐身”的时间比 Thinking Machines 更长。原本不明朗,因为更广泛的开放模型生态系统并没有为他们放慢脚步。嗯,我们做到了:

他们将自身与 Inkling、Nemotron 和 GLM 5.2 进行了对比,但 SOTA 的 GLM 5.3、Kimi K3、Qwen 3.8 Max 和 DeepSeek V4.1 Flash 通常更具优势。不过,既然该模型完全在美国从头训练,市场上一部分人一直在急切等待更多此类选择。更重要的是,Reflection 如今已宣布其作为一个功能性新实验室(neolab)的到来!

2026年10月3日至10月5日的 AI 新闻。我们检查了12个 subreddit、544 个 Twitter 账号以及更多的 Discord。通过 AINews 网站,你可以搜索所有过往刊期。提醒一下,AINews 现在是 Latent Space 的一部分。你可以 选择是否接收 邮件频率!


AI Twitter 回顾

Reflection 的 Beam 引领了一波开放权重模型的发布浪潮

  • Beam 发布:Reflection 发布了 Beam,这是一款专为编码、智能体及科学工作设计的纯文本 MoE 模型,总参数量 501B,激活参数 23B。该模型从头训练,其完整的 Apache 2.0 许可证权重预计将于本月开放(公告、Laskin)。

  • 训练规模:团队官方帖子称预训练使用 23.8T tokens,部分来自对数亿份 PDF 的 OCR 管线(数据负责人)。他们还提到在 1 万张 GB300 上稳定运行 RL/OPD,覆盖约 100 万个任务、超过 1 亿条 rollout(Damos)。

  • 宣称结果:Reflection 的总结显示 SWE-bench Verified 得分为 80.9,推理效率是 GLM 5.2 的 3–4 倍,且预训练与 RL 各训练了 4 周,约使用 10,500 张 GB300(总结)。技术报告和开源集成也在路上(Polozov)。

  • 背景信息:Axios 提前报道了这次发布。报道指出 Reflection 每月为 Colossus 算力支付 1.5 亿美元,另有与 Nebius 的 10 亿美元协议;同时多家未具名的美国实验室将在本月发布开放模型(Curran)。

  • 独立与批判性解读:Artificial Analysis 已获早期访问权限,预计 Beam 在其智能水平下是最 token 高效的开源模型之一(AA)。

    • MFU 与架构:Elie Bakouch 估算预训练 BF16 MFU 仅约 12%。他判断架构采用 3:1 的全局/滑动窗口注意力交错,并表示其 held-out 代码 perplexity 优于 DSv4(分析)。

    • 算力对比:Teortaxes 称 Beam 是 DeepSeek V3 的 iso-FLOP 复制品(帖子)。他推测 4 周内 RL 共启动约 13 亿个沙箱,峰值同时运行多达 17 万个(沙箱数据)。

    • 定位:观察者普遍认为 Beam 处于 GLM-5.2 水平(iScienceLuvr),在部分基准上低于 DSv4 Flash(点评)。Nathan Lambert 将它与 Nvidia 和 Thinking Machines 的模型归为一类——都是实力强劲的美国发布,但仍落后于中国同行(Lambert)。

  • 其他开源与专业模型:

    • Aleph Alpha Kolibri:总参数 78B / 激活 3.46B,Apache 2.0 协议,专为德语和英语打造。官方自报成绩为 AIME 2025 达 96.9%、GPQA Diamond 达 84.3%、SWE-Bench Verified 达 66.4%(汇总)。不过训练数据集未公开,agentic 评测也明显低于 Qwen(Jitsev)。

    • Reka Rho-1:一款 19B 全模态模型,可理解和生成文本、图像、视频及机器人动作,从零训练,仅用 320 张 H100 耗时约 3 个月(发布,算力)。

    • 决策模型:Command Code 的 Agr(31B)和 Agr-flash(360M)不生成文本,而是直接返回带各选项概率的类型化数值,用于工具调用和路由(Agr)。SemiAnalysis 指出 TypeSafe 的 Jev 采用同样的免解码方案,主要在路由场景中替代前沿模型(解读)。

    • 小型发布:Upstage 的 Solar Mini 4(35B / 激活 3B,512K 上下文)在 Nous Portal 上免费开放两周(Nous)。Eleven v4 Turbo 以 v4 一半的价格登顶 AA 的 Provider Voice TTS 竞技场(AA)。

  • OpenAI 与 Anthropic:订阅价值、速度与评测

    • SemiAnalysis 限制测试:SemiAnalysis 针对 Anthropic、OpenAI、Meta、SpaceXAI、MiniMax、Moonshot、Cursor、Cognition 等公司的订阅计划进行了测试。结果显示,Claude 的订阅提供的 API 等效价值是 OpenAI 计划的 5 倍以上(报告)。

      • 方法论:价值取决于每个模型和 token 类型的积分成本,而非列表中的 API 价格(推文串)。

      • 任务成本调整:考虑任务成本后,Claude 的优势缩小至 1.3–2.9 倍(scaling01)。

      • 未经验证的算力估算:有一位分析师声称,Anthropic 将 42% 的推理算力用于贡献约 10% 收入的订阅服务(图表)。

    • OpenAI 容量紧张:用户反映,新用户的 $200 订阅已暂停办理,且各档位的用量限制实际上减半。GPT-6.1 Sol 被定位为高效替代方案(分析)。Theo 描述了 7 月至 9 月期间编码模型偏好的逆转(帖子)。

      • OpenAI 回应:Codex 负责人 Tibo 承诺,在 28 天内每天都进行有意义的改进或完全重置(承诺)。

      • 首日提速:GPT-6 Astra 和 GPT-6.1 Sol 的默认速度提升约 50%,从 ~30 TPS 升至 ~50 TPS。该变更覆盖所有订阅入口及 OpenCode、Pi、Amp、Devin 等通过 Sign in with ChatGPT 接入的合作伙伴(首日更新,TPS 数据)。

      • 摩擦点:已累积的 Codex 重置额度在未时区调整的情况下过期(报告)。常开的 dots agent 仅限 $100+ 的 Pro 计划用户(批评)。

  • 企业需求(报道):The Information 报道称,微软将内部 Anthropic 支出的预测值削减了三分之一以上。报道还指出,Meta 的 Claude Code 用户数从约 6 万降至约 3 万,主要原因是 Meta 大力推广其自有工具(摘要)。

  • 排行榜:

    • Agent Arena:Anthropic 在 Code、Work 和 Chat 类别中均位居第一。Fable 5.1 领先 Code 和 Work 类别,而 GPT-6 Astra 在 Code 类别中排名第二(Arena)。

    • Design Arena:GPT-6 Astra 在 3D Design、Frontend、Full Stack 和 Image-to-HTML 类别中均排名第一(Design Arena)。

    • 幻觉测试:在 AA-Omniscience 测试中,Gemini 4 Argon 在未知问题的错误猜测率为 15%,而表现第二好的模型为 29%。GPT-6 Astra 准确率最高,达到 61%(数据)。

  • Agent 运行环境、RL 环境与开发者工具

    • 多环境 RL(Hugging Face):一款捕获代理支持 OpenAI Chat、OpenAI Responses、Anthropic 和 Gemini 格式。它将对调用转发给 vLLM,并记录精确的 token ID 和 logprobs 以供 TRL 使用,从而使 10 个未修改的运行环境转变为 RL 环境(Delangue,解析)。

      • 结果:相同权重的模型在 Mini-SWE-Agent 下得分为 62%,而在 Claude Code 下仅为 33%。在 4 个运行环境下训练 LFM2.5-2.6B 使首次尝试解决率从 42% 提升至 54%,并引入工具调用奖励可将调用次数减少 31%。在 3,189 次 rollout 上进行 SFT 后,性能稳定在 47.5%。

      • 局限性:该运行实验仅使用了一个任务族和一个种子。

      • 环境托管:RL 环境如今像数据集一样在 HF Hub 上托管和版本控制(博客)。

    • Pi Durable:Earendil 的运行环境围绕小型基于任务的工作流引擎构建,使长时运行、多人 Agent 可以在任意位置暂停和恢复(Pi)。

      • 设计:核心约 15K 行 TypeScript 代码,使用 SQLite/JSONL 存储,可运行在 Bun 或 Cloudflare Durable Objects 上。控制层与执行环境分离(评测)。

      • Effect.ts:作者解释说没采用 Effect,因为它不提供持久化能力(Zechner)。

    • Agent 记忆:Cognition 推出 Devin「Dreaming」,夜间自动修剪并链接记忆图谱,并将基于 git 和 markdown 的格式开源为 Agent Memory Repo(发布,格式)。

    • Cursor SDK:本次更新支持运行中途干预(mid-run steering)、可向主 agent 汇报的后台 subagent、可替换的 system prompt,以及在自定义工具上添加 MCP readOnlyHint 和 destructiveHint 注解(steering,注解)。

    • DeepSeek Harness:v0.2.1-alpha.1 中加入了一个实验性的 Claude Code Mods 兼容层,用来验证 DSH 的「一切皆插件」架构是否是 Claude Code 扩展点的超集(团队帖子)。

    • 路由与访问:

      • Cline:Pareto 26.10 Preview 跨模型路由并对答案评分,宣称在相同 DeepSWE 得分下单任务成本为 $0.24,而竞品为 $13.41(Cline)。此外,Cline 因滥用问题暂停了免费 DeepSeek-V4.1-Flash 促销(公告)。

      • ChatGPT:自定义 MCP 服务器不再需要开发者模式(帖子)。

    Agent 与训练研究

    • 验证优于采样:

      • NVIDIA 中途校验框架:该方法在生成候选 Shell 命令后先进行验证,确认无误后再执行。使用 GPT-5.6 Sol 作为验证器,从 8 个操作中择优,可将 TerminalBench-Lite 的 Pass@1 从 50% 提升至 68%;而使用较弱的验证器收效甚微(摘要)。

      • Google VeriHarness:该方法针对所有回滚(rollout)结果一致的观点提出质疑,并依据工作区证据解决分歧。在 Gemini 3.5 Flash 上带来 6.2 分提升,在 Opus 4.8 上提升 6.4 分,并公开了约 2.6 万个回滚数据(摘要)。

    • 上下文管理:

      • UT Austin 压缩研究:在约 3.5 万次运行中,仅使用三分之一 Token 的压缩策略比保留完整上下文慢 20%–80%。基于阈值触发优于基于步数触发,且最优策略因模型而异(摘要)。

      • PAIR:该方法通过从同一状态重放智能体,以隔离有害的压缩操作,随后重写压缩提示词,使性能接近无压缩水平(论文)。

      • CorpusMap:为文档集合预计算实体页面,可将回答质量提升 6.4–11.7 分,同时减少 34%–57% 的输入 Token(论文)。

    • 自我改进框架:

      • SelfSearch:使用 DeepSeek V4 Flash,该方法在 Terminal-Bench 2.1 上达到 82.0% 的声称分数,与 Codex 持平,搜索成本仅为 4.03 美元(论文)。

      • EverMind Raven:其进化后的研究框架在 BrowseComp 上达到 69.3%(论文)。

    • 优化与架构:

      • Dust:一种基于激活扰动“虚拟种群”的零阶方法,在 Transformer 预训练中接近甚至有时超越反向传播。其计算效率据称比 EGGROLL 高 1,000–10,000 倍(帖子)。

    • LOOM:循环 MoE 在 9–12 次循环下训练保持稳定,且 700M 模型在 5 次循环时 iso-FLOP 表现最佳(线索)。

    • ImageNet 策略梯度:Ian Osband 指出,在 ImageNet 上,精确策略梯度可达 4%(对比交叉熵 62%),他主张 RL-loss 的失败并非仅由探索问题导致(帖子)。

    • RL 动态:Base Labs 发现 RL 更新的低秩性低于先前的说法(rollout)。Datalab 报告称,单靠 RL 即可在温度 0 时消除工具调用循环,相比之下 SFT 的循环率高达 92%(分析)。

  • AI 科学应用:Vals AI 报道,90 多个 Opus 5.5 智能体在 3 天内运行了 DFT 模拟,并标出两个室温磁性半导体候选材料,其中一个早在 1999 年就被合成过。结果仅为预测,且有公开账本(线索、注意事项)。

  • 智能体支出:Epoch 估算 OpenAI 研究人员用于编码智能体的开销(按 API 价格计价)大致每月翻一番。中位数研究员至 8 月中旬已达约 600 美元/天(Epoch)。

  • 推理系统与硬件

    • OpenRouter 定价失真:Horace He 指出 GLM 5.3 在 inference.net 上的输入价为 0.08 美元/M,而输出价却高达 5.00 美元/M。他将其归因于 OpenRouter 的平方反比价格路由以及对输入价格的显著过度加权(线索、路由)。

    • llama.cpp:

      • Metal 上的投机解码:新内核使投机解码在 M3 Ultra 上比常规解码快至 3.4 倍(110 vs 32.1 tok/s)(qvac)。

      • v0.6.0:新增 Clef 文本与视觉支持、Qwen3.8-Flash-Next,以及全新的 llama_batch_ext API(Gerganov)。

    • Agentic 内核开发:Baseten 宣布用智能体在一周内基本自主完成了一个推理引擎的开发,解码速度比开源基线快 90%,TTFT 降低 57%(博客)。

    • 通信优化:NCCL 与 PyTorch 对称内存加速了中小规模集合通信(Bekman)。

    • 中国加速器:阿里平头哥的镇武 V900 配备 216 GB 显存、1200 GB/s 互联带宽,宣称性能达 M890 的 3 倍,预计 2027 年 Q1 上市(SemiAnalysis)。

    安全、政策与行业动态

    • OpenAI 文本水印:根据欧盟 AI Act,OpenAI 将为符合条件的 ChatGPT 和 Codex 文本添加隐形统计水印,并通过 API 向全球提供可选开关(公告)。

      • 局限性:改写或翻译即可去除水印,检测工具也仅对获批的研究人员开放(限制说明)。

      • 鲁棒性数据:有引用的测试显示,25% 的同义词替换会使检测率从约 92% 骤降至 17%(批评)。

    • 智能体事故与安全治理:

      • Bengio 评论:Bengio 在 FT 撰文指出,近期智能体被攻击事件并非单纯的沙箱问题(评论文章)。他还引用 Quinnipiac 的民调,其中 86% 的受访者支持独立的安全标准(民调)。

      • HF 事件:Neel Nanda 称 OpenAI 与 Hugging Face 的这次事件是迄今为止最引人注目的对齐失败案例(Nanda)。

      • 系统安全:Ryan Lowe 呼吁各实验室建立类似核安全的分层系统安全机制(Lowe)。

      • 关闭抗拒性:一篇 OpenAI 对齐研究帖记录了目前已知最真实的关闭抗拒行为前兆,一位研究人员对此进行了分析(链接)。

    • 政策声音:

      • 自主武器:前 OpenAI 研究员 Joshua Achiam 呼吁禁止某些类似于化学武器的自主武器(帖子)。他已加入 IFP 和 FAI 成为研究员(公告)。

      • 专家调查:LEAP 面板的 250 多位专家最支持建立由美、中成员组成的国际机构,赋予其发布前授权权力,并反对联邦层面的法规优先权(FRI)。

      • Altman 谈权衡:Sam Altman 告诉 Politico,为了技术的收益,“世界应该接受一些坏事发生”(Politico)。

    • 中国的算力获取:

      • 腾讯租约(据报道):据《金融时报》,腾讯在 Oracle 的东南亚数据中心租用了约 10 万颗高端芯片,为期五年,总价约 70 亿美元(摘要)。

      • 走私指控:美国检察官起诉一名加利福尼亚州经销商,指控其向中国走私价值超过 3 亿美元的 GPU 服务器(报道)。

    • 行业整合:

      • AMD 与 World Labs(据报道):AMD 据报道以 82 亿美元收购 World Labs(DL Weekly)。

      • NVIDIA 的中立性:SemiAnalysis 质疑 NVIDIA 在收购 SchedMD/SLURM 和 Hugging Face 后硬件中立性的立场(SemiAnalysis)。

    热门推文(按互动量排序)


    AI Reddit 摘要

    /r/LocalLlama 与 /r/localLLM 热帖回顾

    1. 极致规模的本地 LLM 硬件

    原始来源: Latent Space

    评论 (0)