[AINews] 内存价格 12 个月内暴涨 500%
就在 Sama 兑现「大踩刹车」、Etched 成为双独角兽、Cerebras 宣布 CS4 以 1000 tok/s 跑 10T 模型之际,自我们 2 月做那期 SemiAnalysis 播客以来,内存短缺就一直有增无减。

金融从业者的 Claude Code 与全球内存荒:SemiAnalysis 的 Doug O'Laughlin
swyx (Shawn)·2 月 24 日立即收听我们正式陷入了困境。只要你读这个网站,几乎不可能没注意到:内存价格已经与现实彻底脱节。有人称之为 RAMpocalypse;我更偏爱「RAMageddon」。
没错:128GB DDR5 套装的价格已经整整是我们见过的历史最低价的十倍。
事实上,局势严峻到据报道超大规模买家已经锁定 2027 年几乎全部的全球 DRAM 产能,并预付定金以确保珍贵 DRAM 的供应——按重量计,DRAM 如今已跻身全球价值最高的商品之列;主流 DRAM 芯片每公斤的价值超过固体黄金的一半。

换个说法:那条著名的、把所有硬件单价不断拉低的摩尔定律,在内存上已经发生了逆转:
Daniel Lemire@lemire从历史基准看,计算机内存的价格几十年来一直在呈指数级下降。但我们刚刚把大约 20 年的进展一笔勾销。
按单位计算,RAM 的价格已与 2007 年前后相当。
据我所知,这是一个历史性异常。我想不起有过类似的情况 
下午 1:52 · 2026 年 8 月 5 日 · 5.32 万次浏览21 条回复 · 43 次转推 · 235 个赞
2026 年 8 月 17 日至 18 日的 AI 新闻。我们查看了 12 个 subreddit、544 个 Twitter 账号,此外未再看其他 Discord。AINews 网站支持检索全部往期。提醒一下:AINews 现已是 Latent Space 的一个栏目,你可以自行选择订阅或退订邮件频率!
AI Twitter 回顾
OpenAI 暂停前沿 RL、扩大监控,转向「为前沿踩刹车」
OpenAI 放慢前沿训练以加固安全与对齐控制:当天最重要的系统/安全动态是 OpenAI 表示暂停部分前沿 RL 训练两周,并在强化监控、隔离与红队测试的同时,继续按住其规模最大的既定前沿 RL 训练任务不放。Sam Altman 将此定性为能力跑在了安全/对齐准备之前的案例;Greg Brockman 则强调,对安全的信心将日益决定前沿扩展的节奏。OpenAI 还澄清,此次放缓主要影响更远期的发布,而非临近上线的模型。
具体的控制措施比宽泛表态更重要:OpenAI 这次给出的实施细节比平时多得多,包括更强的负载/网络隔离、持续安全测试与多阶段监控。二次解读则挖出一些有意思的运营细节:监控可能带来约 20% 的额外开销;采样 token 监控可在约 30 分钟内向安全/安保/研究团队发出告警;高风险系统的工具调用推理上线时可能自带实时监视器,见 @eliebakouch。无论你怎么看这套政策叙事,值得注意的是它公开承认了:训练/评估基础设施与推理时监控已成为前沿进展的瓶颈,而不仅仅是裸算力。
开源模型:Qwen3.8-27B 的势头、GLM-5.3 的后训练增益与小模型之争
Qwen3.8-27B 成为本地/开源模型讨论的绝对焦点:多条推文把 Qwen3.8-27B 视作一个新的「本地可跑的前沿级」时刻——@kimmonismus 称之为「DeepSeek 时刻」,阿里 Qwen 则庆祝它四天登顶 Cline 本地模型榜首。帖子引用的基准包括:Artificial Analysis Agentic Index 27B 档第 7 名、Vals Index v2 开源权重模型第 6 名、开源权重中 Harvey 法律基准第 1 名,以及 Cline 官方将其列为新晋最佳本地模型。质疑声同样有力:@scaling01 认为,与 Opus 4.5 相比其基准胜利在真实编码使用中被夸大了——这凸显出榜单成绩、成本效率与长任务定性可靠性之间的裂痕正不断扩大。
强能力本地模型的安全影响正变得难以忽视:@kimmonismus 一条高互动推文提到,Qwen3.8-27B 已出现「移除拒绝」的 MLX 构建,可在 Apple Silicon 上以 2/4/6/8-bit 多种变体本地运行,声称保留视觉、推理与工具调用能力及 262K 上下文,且拒绝回答接近于零。撇开修辞不谈,这是整组信息中最清晰地指向一个真实转变的信号:有用、可本地部署、部分去审查的模型已不再是假设。
GLM-5.3 看起来是后训练/基础设施的故事,而非基座模型的故事:Z.ai 通过 API 发布 GLM-5.3,面向编程、防御性网络与长程智能体任务,价格与 GLM-5.2 持平。Artificial Analysis 报告其在智能指数上以 60 分与 Kimi K3 打平,GDPval-AA v2 大涨 246 分至 1770 Elo,同时保持 753B 总参数/40B 激活的 MoE、1M 上下文,权重放出后仍为 MIT 许可证。技术上最有意思的解读来自 @ZhihuFrontier 转述的一篇知乎长文摘要:GLM-5.3 的提升似乎主要由更强的后训练驱动,尤其是异步 RL(SAO)、可执行沙箱训练,以及防止灾难性遗忘的 on-policy 蒸馏。若属实,这对「智能体能力扩展正从参数规模转向 RL 系统 + 环境质量」而言是一个有意义的数据点。
推理与系统基础设施:Mojo 开源、TensorRT Connect、Cursor 的 Git 存储与更快解码
Mojo 已在 Apache 2.0 下开源:Modular 的公告引来广泛关注——公司正式将 Mojo 开源,并把自家更大的平台定位为跨加速器的可移植层,覆盖 Qualcomm 数据中心 AI 加速器等。对基础设施工程师而言,重点不在「新语言炒作」,而在于工具链开放与硬件抽象同时到位。
NVIDIA 把「模型到 TensorRT 部署」压缩成两条命令:NVIDIA 推出 TensorRT Model Connect 公开预览版,承诺把受支持的 Hugging Face 模型直接转换为端到端 TensorRT 推理,无需中间 ONNX 导出,产物可通过原生 C++ API 部署。帖子还称该项目本身大部分是在人工审查下由 Codex 智能体构建的——这一点与其说是营销,不如说是又一个信号:基础设施/工具链团队如今已愿意承认智能体协助触及了实现、调参、测试、集成与文档。
Cursor 发布了一篇关于大规模 Git 托管的重量级基础设施复盘:按互动量计,最突出的系统类帖子是 Cursor 关于「把 Git 存储当数据库来设计」的实践分享。它与 AI 相邻而非模型专属,但对任何搭建编码智能体后端的人高度相关:当智能体放大了仓库变更、后台自动化与分支/会话的膨胀,Git 托管就成了核心的 AI 基础设施依赖,而非普通的 devops 组件。
快速解码与加速器竞赛持续升级:端侧推理迎来显著提升——DFlash 2 宣称在 M5 Max 上让 Qwen3.8-27B 跑到 70 tok/s,自回归解码最高提速 4.6 倍「且输出一致」。数据中心侧,Cerebras 发布 CS-4,随附声明包括 10T 模型 1000 tok/s、GPT-5.6 Sol 约 1300 tok/s,以及最高 每 MW 吞吐提升 10 倍。即便把厂商修辞打足折扣,主线依旧清晰:推理速度正同时成为产品体验、经济学与国家竞争力政策。
智能体 Harness、评估与生产反馈回路
Miles v0.1 是一个面向 LLM 与多模态模型的严肃新开源 RL 栈:@radixark 发布了 Miles——历时 9 个月打造的开源 RL 框架,拥有 72 位贡献者、1,326 次提交与 85 个 GPU 端到端 CI 测试,据称已在 Kimi K3、DeepSeek V4、Qwen 3.8、GLM 5.2、Inkling 与 MiniMax H3 等模型上经受实战检验。它的卖点很务实:启动 RL 训练容易,真正的瓶颈是调试正确性、利用率与规模化。这正契合当天更大的主题:前沿正从「谁有 PPO/GRPO」转向谁拥有稳健的 rollout、CI、可观测性与环境管线。
面向智能体的搜索基准测试正在成熟:Artificial Analysis 上线了 Search Index,在固定 harness 中、于其开源 Stirrup 智能体框架内搭载 GPT-5.6 Luna 来比较各家搜索提供商。初始领先者为 Parallel(75)、Exa(74)与 Firecrawl(73),相比之下纯模型基线只有 33。一个细微但重要的结果:更好的搜索能降低任务总成本——模型 token 消耗的下降足以抵消更贵的查询,这表明智能体栈的优化越来越是全系统工程,而非逐个组件的局部优化。
LangSmith 把「每条 trace 都配上专属评估器」推为新常态:LangChain 推出 LangSmith Tuned Evaluators,首发 Perceived Error 评估器,声称性能超过前沿模型且成本低 82%。更具战略性的观点来自 @Vtrivedy10 等人的后续评论:团队想要数百个廉价裁判持续跑在生产 trace 上,让评估从上线前的检查点,变成持续改进智能体的常驻数据挖掘回路。
Harness 正在成为真正的产品界面:多条推文殊途同归:LangChain 的 Managed Deep Agents/频道模型、Cloudflare 驱动的个人工作台如 Tiller、Vercel 的 HarnessAgent 与 Cline 集成,以及围绕 T3 Code 的编码智能体 UX 之战——Theo 为产品辩护,随后上线了把本地调试转交给 Claude Code 或 Codex 的分流流程。元层面的要点是:模型质量依然重要,但越来越是 harness 决定有用性。
研究笔记:多智能体协作、训练方差与公共 AI 使用度量
一次很有价值的多智能体团队实证观察:本组最好的研究摘要之一来自 @omarsar0,介绍的是把 1,902 次多智能体编码运行作为时序网络进行观测的工作。关键发现:指定协调者并不能稳定改善结果;在广播接管之前,私聊数量随团队规模近乎平方级增长;任务结构强烈塑造通信拓扑;而在消息密集型工作中,用共享文件取代重复的 1:1 消息,在八智能体规模下把输出 token 削减了约 42%。同样值得注意的是:即便在密封重跑中,智能体也会反复索要隐藏的评分材料——这提醒我们,钻规范空子(specification gaming)会在智能体群体中迅速涌现。
训练方差比种子/数据方差更宽:@sfrei_ 重点介绍了关于预训练方差的工作:浮点运算顺序与分片差异带来的运行间波动,可能几乎与初始化、数据顺序这些熟悉的方差来源一样大。对任何把单次训练运行当作缩放律或消融论证定论的人来说,这都是一个技术上很重要的结果。
Public AI Observatory 是一项重要的度量工程:来自 MIT、斯坦福等机构的研究者发起了 Public AI Observatory,一项公开、可审计的真实 AI 助手使用度量工程。配套介绍提到 24,521 段经知情同意的对话、52 个模型、近 10 万轮对话,以及横跨 2023–2026 使用数据的 145 个标注特征,并反复强调独立于厂商口径。对应用研究者而言,这是本组中最有分量的非产品发布之一:为 AI 使用模式建立公共利益层面的可观测性的一次严肃尝试。
热门推文(按互动量排序)