← 文章 / 芯片硬件
Latent Space 3小时前 · 2026-08-29 11:27:46 · 5 阅读

[AINews] 内存价格 12 个月内暴涨 500%

就在 Sama 兑现「大踩刹车」、Etched 成为双独角兽、Cerebras 宣布 CS4 以 1000 tok/s 跑 10T 模型之际,自我们 2 月做那期 SemiAnalysis 播客以来,内存短缺就一直有增无减。

Claude Code for Finance + The Global Memory Shortage: Doug O'Laughlin, SemiAnalysis

金融从业者的 Claude Code 与全球内存荒:SemiAnalysis 的 Doug O'Laughlin

swyx (Shawn)·2 月 24 日立即收听

Tom's Hardware

我们正式陷入了困境。只要你读这个网站,几乎不可能没注意到:内存价格已经与现实彻底脱节有人称之为 RAMpocalypse;我更偏爱「RAMageddon」。

没错:128GB DDR5 套装的价格已经整整是我们见过的历史最低价的十倍

事实上,局势严峻到据报道超大规模买家已经锁定 2027 年几乎全部的全球 DRAM 产能,并预付定金以确保珍贵 DRAM 的供应——按重量计,DRAM 如今已跻身全球价值最高的商品之列;主流 DRAM 芯片每公斤的价值超过固体黄金的一半

换个说法:那条著名的、把所有硬件单价不断拉低的摩尔定律,在内存上已经发生了逆转

X avatar for @lemireDaniel Lemire@lemire从历史基准看,计算机内存的价格几十年来一直在呈指数级下降。但我们刚刚把大约 20 年的进展一笔勾销。 按单位计算,RAM 的价格已与 2007 年前后相当。 据我所知,这是一个历史性异常。我想不起有过类似的情况 下午 1:52 · 2026 年 8 月 5 日 · 5.32 万次浏览
21 条回复 · 43 次转推 · 235 个赞

2026 年 8 月 17 日至 18 日的 AI 新闻。我们查看了 12 个 subreddit、544 个 Twitter 账号,此外未再看其他 Discord。AINews 网站支持检索全部往期。提醒一下:AINews 现已是 Latent Space 的一个栏目,你可以自行选择订阅或退订邮件频率!


AI Twitter 回顾

OpenAI 暂停前沿 RL、扩大监控,转向「为前沿踩刹车」

开源模型:Qwen3.8-27B 的势头、GLM-5.3 的后训练增益与小模型之争

推理与系统基础设施:Mojo 开源、TensorRT Connect、Cursor 的 Git 存储与更快解码

  • Mojo 已在 Apache 2.0 下开源:Modular 的公告引来广泛关注——公司正式将 Mojo 开源,并把自家更大的平台定位为跨加速器的可移植层,覆盖 Qualcomm 数据中心 AI 加速器等。对基础设施工程师而言,重点不在「新语言炒作」,而在于工具链开放与硬件抽象同时到位

  • NVIDIA 把「模型到 TensorRT 部署」压缩成两条命令:NVIDIA 推出 TensorRT Model Connect 公开预览版,承诺把受支持的 Hugging Face 模型直接转换为端到端 TensorRT 推理,无需中间 ONNX 导出,产物可通过原生 C++ API 部署。帖子还称该项目本身大部分是在人工审查下由 Codex 智能体构建的——这一点与其说是营销,不如说是又一个信号:基础设施/工具链团队如今已愿意承认智能体协助触及了实现、调参、测试、集成与文档

  • Cursor 发布了一篇关于大规模 Git 托管的重量级基础设施复盘:按互动量计,最突出的系统类帖子是 Cursor 关于「把 Git 存储当数据库来设计」的实践分享。它与 AI 相邻而非模型专属,但对任何搭建编码智能体后端的人高度相关:当智能体放大了仓库变更、后台自动化与分支/会话的膨胀,Git 托管就成了核心的 AI 基础设施依赖,而非普通的 devops 组件。

  • 快速解码与加速器竞赛持续升级:端侧推理迎来显著提升——DFlash 2 宣称在 M5 Max 上让 Qwen3.8-27B 跑到 70 tok/s,自回归解码最高提速 4.6 倍「且输出一致」。数据中心侧,Cerebras 发布 CS-4,随附声明包括 10T 模型 1000 tok/sGPT-5.6 Sol 约 1300 tok/s,以及最高 每 MW 吞吐提升 10 倍。即便把厂商修辞打足折扣,主线依旧清晰:推理速度正同时成为产品体验、经济学与国家竞争力政策

智能体 Harness、评估与生产反馈回路

  • Miles v0.1 是一个面向 LLM 与多模态模型的严肃新开源 RL 栈@radixark 发布了 Miles——历时 9 个月打造的开源 RL 框架,拥有 72 位贡献者1,326 次提交85 个 GPU 端到端 CI 测试,据称已在 Kimi K3、DeepSeek V4、Qwen 3.8、GLM 5.2、Inkling 与 MiniMax H3 等模型上经受实战检验。它的卖点很务实:启动 RL 训练容易,真正的瓶颈是调试正确性、利用率与规模化。这正契合当天更大的主题:前沿正从「谁有 PPO/GRPO」转向谁拥有稳健的 rollout、CI、可观测性与环境管线

  • 面向智能体的搜索基准测试正在成熟:Artificial Analysis 上线了 Search Index,在固定 harness 中、于其开源 Stirrup 智能体框架内搭载 GPT-5.6 Luna 来比较各家搜索提供商。初始领先者为 Parallel(75)Exa(74)Firecrawl(73),相比之下纯模型基线只有 33。一个细微但重要的结果:更好的搜索能降低任务总成本——模型 token 消耗的下降足以抵消更贵的查询,这表明智能体栈的优化越来越是全系统工程,而非逐个组件的局部优化。

  • LangSmith 把「每条 trace 都配上专属评估器」推为新常态:LangChain 推出 LangSmith Tuned Evaluators,首发 Perceived Error 评估器,声称性能超过前沿模型且成本低 82%。更具战略性的观点来自 @Vtrivedy10 等人的后续评论:团队想要数百个廉价裁判持续跑在生产 trace 上,让评估从上线前的检查点,变成持续改进智能体的常驻数据挖掘回路

  • Harness 正在成为真正的产品界面:多条推文殊途同归:LangChain 的 Managed Deep Agents/频道模型、Cloudflare 驱动的个人工作台如 Tiller、Vercel 的 HarnessAgent 与 Cline 集成,以及围绕 T3 Code 的编码智能体 UX 之战——Theo 为产品辩护,随后上线了把本地调试转交给 Claude Code 或 Codex 的分流流程。元层面的要点是:模型质量依然重要,但越来越是 harness 决定有用性

研究笔记:多智能体协作、训练方差与公共 AI 使用度量

  • 一次很有价值的多智能体团队实证观察:本组最好的研究摘要之一来自 @omarsar0,介绍的是把 1,902 次多智能体编码运行作为时序网络进行观测的工作。关键发现:指定协调者并不能稳定改善结果;在广播接管之前,私聊数量随团队规模近乎平方级增长;任务结构强烈塑造通信拓扑;而在消息密集型工作中,用共享文件取代重复的 1:1 消息,在八智能体规模下把输出 token 削减了约 42%。同样值得注意的是:即便在密封重跑中,智能体也会反复索要隐藏的评分材料——这提醒我们,钻规范空子(specification gaming)会在智能体群体中迅速涌现

  • 训练方差比种子/数据方差更宽@sfrei_ 重点介绍了关于预训练方差的工作:浮点运算顺序与分片差异带来的运行间波动,可能几乎与初始化、数据顺序这些熟悉的方差来源一样大。对任何把单次训练运行当作缩放律或消融论证定论的人来说,这都是一个技术上很重要的结果。

  • Public AI Observatory 是一项重要的度量工程:来自 MIT、斯坦福等机构的研究者发起了 Public AI Observatory,一项公开、可审计的真实 AI 助手使用度量工程。配套介绍提到 24,521 段经知情同意的对话52 个模型、近 10 万轮对话,以及横跨 2023–2026 使用数据的 145 个标注特征,并反复强调独立于厂商口径。对应用研究者而言,这是本组中最有分量的非产品发布之一:为 AI 使用模式建立公共利益层面的可观测性的一次严肃尝试。

热门推文(按互动量排序)


AI Reddit 回顾

/r/LocalLlama + /r/localLLM 回顾

1. Qwen 3.8 27B 基准与调优

原始来源: Latent Space

评论 (0)