← 文章 / 芯片硬件
Latent Space 5小时前 · 2026-08-28 17:49:13 · 1 阅读

Hot Chips:OpenAI Jalapeño、Cerebras CS-5、Groq 3 LPX 与 Apple M6 芯片解析

第 37 届 Hot Chips 大会上,最重磅的消息无疑是 OpenAI 自研芯片取得了惊人进展——距离宣布与 Broadcom 合作还不到一年。更令人意外的是,它并不是一款 ASIC,而是一个足以击败 Blackwell的完整替代方案。

X avatar for @OpenAIOpenAI@OpenAI自从公布首款自研推理芯片 Jalapeño 以来,我们一直在测试这款芯片及其配套系统。 结果显示,这是一项重大进步:每瓦功耗带来更多智能,响应速度也更快,在同一套架构中同时实现更高吞吐和更低延迟。下午 5:19 · 2026 年 8 月 25 日 · 226 万次浏览
584 条回复 · 1.08K 次转发 · 1.36 万个赞

如今,关键指标正转向每瓦性能,而 Jalapeño 的表现如下:

完整的 Hot Chips 演讲内容尚未发布,不过下面已经有一些解读。想更全面地了解详情,可以结合 OpenAI 的其他内容一起观看:

AI 新闻:2026 年 8 月 24 日至 25 日。我们查看了 12 个 subreddit、544 个 Twitter 账号,没有再查看其他 Discord 服务器。通过 AINews 网站可以搜索往期所有内容。提醒一下,AINews 现在已成为 Latent Space 的一个栏目。你可以选择订阅或取消订阅不同频率的邮件!


AI Twitter 速览

OpenAI 的 Jalapeño 推理芯片与推理技术栈的转变

  • Jalapeño 公布的性能数据是当天最受关注的技术新闻:OpenAI 首次公布了定制推理芯片 Jalapeño 的基准测试数据,声称在真实模型负载下,其效率和延迟表现明显优于 NVIDIA 的 GB200/GB300 系统。在 OpenAI 的测试中,Jalapeño 在峰值吞吐下的单位功耗性能提升了 1.5–1.9 倍,端到端延迟降低了 1.7–3.6 倍;在高交互性负载下,性能则提高了 2.1–4.1 倍。该芯片的额定功耗为 700W,但据称在测试过程中实际功耗始终不超过 550W。OpenAI 表示,Jalapeño 将于年底前开始部署到自有基础设施中,Gen 2 已进入深入开发阶段,Gen 3 也已启动(OpenAI 公告部署路线图Sam Altman)。

  • 工程师为何关注:这不仅是单纯的峰值性能提升,更在于它采用了更均衡的推理架构,缓解了吞吐与延迟之间常见的权衡。多位技术人士指出,其中一些对比尤其值得关注:在部分测试配置中,Jalapeño 即使没有采用激进的 prefill/decode 分离推测解码等技术,依然取得了出色表现,甚至超过了使用这些技术的系统(gdbkimmonismus 总结eliebakouch 分析You Jiacheng)。SemiAnalysis 认为,这样的表现对于第一代 ASIC 来说十分突出,并将其直接与 BlackwellRubin 级别的系统进行了比较(SemiAnalysisdylan522p)。

  • 另一个值得关注的层面,是模型辅助的系统优化:OpenAI 的文章还提到,GPT-Astra + Codex 参与了底层 kernel 的编写与优化,让三个原本未列入计划的开放权重模型在 Jalapeño 上实现高性能,整个过程约耗时两个月。据称,在部分 attention 和 MoE 模块中,这些实现相比现有的人类专家代码快了 1.5–1.8 倍kimmonismuseliebakouch)。这释放出一个重要信号:编译器和 kernel 优化正逐渐被纳入模型改进闭环,而不再只是应用层编码的辅助工作。

  • 对基础设施的更广泛影响:多篇帖子将 Jalapeño 放在更大的行业转型背景下讨论:即使封装和晶圆厂产能仍是难以突破的瓶颈,前沿实验室在推理经济性方面或许也不再需要完全依赖 NVIDIA(Liam FedusteortaxesTex 的反应LearnOpenCV 关于 TSMC/CoWoS 产能的提醒)。

Agent Harness、Memory System 与 Eval Engineering 正成为核心能力

  • Harness 的质量正变得与模型选择同等重要:多篇论文和发布内容都指向同一主题:Agent 的表现高度依赖其外围系统。Microsoft 牵头的一篇新论文介绍了 AutoSaddler,将 Harness 视为代码,并利用失败轨迹离线修改 prompt、工具配置和控制逻辑。结果显示,相比基础 Harness,其在 GAIA2 上提升 +9.0、在 SWE-Bench Pro 上提升 +9.6、在 Terminal-Bench 2.0 上提升 +10.0论文摘要)。与此同时,另一篇论文直接量化了 Harness 带来的差异:更换 Harness 对得分的影响可能远超更换模型,模型组合的排名也会随着 scaffolding 改变而反转;论文提出的解决方案,是建立结构化的 Harness Card 披露标准(分析《不存在中立的 Harness》)。

  • 长周期软件工程仍然远未解决SWE Refactor Bench 衡量的是整个代码仓库的迁移任务,例如将 C→RustMaven→GradlePOSIX→WebAssembly,测试项目涵盖 SQLitezliblibsodium 等真实代码库。在 520 次运行中,只有 28 次完成了全部三个阶段,最终存活率仅为 5.4%;此外,20 个任务中有 13 个没有任何系统解决(EinsiaAI)。这也提醒我们,在更局部的编程基准上取得亮眼的修 bug 成绩,并不代表模型具备解决长期、复杂软件工程任务的能力。

  • 记忆系统正在被重新设计为可编程状态,而不只是压缩后的聊天记录:DAIR 总结的一篇 Alibaba 论文提出,用只追加事件日志持久化 Python 内核支撑 Agent 会话,将工具输出及其派生状态绑定到带类型的变量上,而不是不断将它们序列化后塞进提示词。论文报告的结果包括:在 LongMemEval_S 上达到 94.8%,在 BEAM_10M 上达到 73.1%(比此前公开发表的最佳记忆系统高 5.1 个百分点),以及结合 Qwen3.8-MaxLOCA_256K 上达到 86.7%总结)。与之相关的 Knowledge Triage 研究表明,简单粗暴的上下文压缩会严重损害对精确规则的记忆:经过五轮压缩后,某个设置仅保留了 10% 的安全规则;而采用类型感知的保留策略,则能多保留 2–4 倍总结)。

  • 实用的评测工程正从临时拼凑走向产品化流程:LangChain 及其合作伙伴分享了一套具体流程,将追踪记录和人工反馈转化为任务规格、合成环境与评测方案,用于持续衡量 Agent 表现并进行后训练(Vtrivedy10hwchase17)。LangSmith Engine 也已上线,在关键内部基准测试中的性能提升超过 2 倍,同时改进了问题检测与聚类,并支持 SaaS、自托管、Slack/Linear 集成,以及按成本分级的分析模式(LangChain)。

Local-First Agent、端侧推理与全新的个人计算栈

  • Perplexity 的 Portable Computer 是当天最具代表性的本地 Agent 产品发布:Perplexity 基于 NVIDIA DGX Spark 推出 Portable Computer,将其定位为 Perplexity Computer 的完全本地化版本:orchestrator LLMsubagent LLMagent harness 全部运行在本地硬件上,无需依赖云端Perplexity 发布公告模型详情NVIDIAArav Srinivas)。首发本地模型栈采用经过后训练的 PPLX 27B,同时提供 Qwen 3.8 27B;后续还将支持 Nemotron 3.5 Lightning

  • 更深层的趋势,是持续在线的本地智能体:Srinivas 描绘了一种未来图景:后台进程持续从各类连接器获取上下文,在循环中不断进行多跳推理,并运行在用户自己的硬件上(Arav Srinivas)。社区对此反应不一:有人期待其带来的隐私和控制力,也有人质疑,“本地优先”是否意味着要用一台5000 美元的 DGX Spark,而不是普通消费级设备(theo 的质疑theo 的后续回应)。

  • Apple/macOS 的本地 AI 工具也日趋成熟:exo 表示,Apple 已在新版 M5 Ultra Mac StudioM6/M5 Pro Mac Mini 页面中展示了 exo,重点介绍通过 Thunderbolt 5 实现低延迟 RDMA,将多台 Mac 组成集群,以接近 API 的速度运行 Kimi K3GLM-5.3 等模型;4 台 M5 Ultra 组成的集群,聚合内存带宽可达到约 4.8 TB/sexo)。相关帖子还指出,Apple 更快的 PCIe 存储,以及基于 ANE 的视觉处理流水线,正让小型本地集群和 CPU/ANE/GPU 混合推理变得更加实用(anemllonirenaud)。

  • 本地运行时周边的工具也在不断完善Ollama v0.33 新增一键集成功能,让 Claude Desktop 可以将 Ollama 作为第三方网关,调用云端和本地模型(Ollama);有人展示了在 Cloudflare Durable Object 中运行 OpenCode v2,说明小型智能体运行时正变得更易嵌入边缘环境(fayazara)。

模型、检索与搜索基础设施

  • Qwen 3.8 已覆盖模型栈的多个环节:从部署到评测,都能看到业界对 Qwen3.8 发布的热情。Together 为 Qwen3.8-27B 提供了微调和专用推理支持(Together);Unsloth 则表示,借助优化后的内核,可以在 Kaggle 免费提供的 2× Tesla T4 实例上,对 27B 模型完成完整的 QLoRA 微调(danielhanchen)。在应用表现方面,Qwen3.8-27BImage-to-WebDev Arena 中位列开源模型第 1、总榜第 #7;输入和输出 token 的价格分别为每百万 $0.40 / $3arena)。

  • 搜索与检索基础设施迎来多项实质性更新:Hugging Face 发布了 Papers with Code 搜索引擎的详细架构介绍,技术栈包括 PostgreSQL + pgvectorQwen 3 Embedding 0.6B 和混合检索;通过 Hugging Face Jobs 在 NVIDIA L4 上生成 embedding,将产物存入 buckets,再通过 Inference Endpoints 提供在线服务。这套架构也用于论文页面上的“相关文章”功能(Niels Rogge)。Keenable 结束隐身状态,推出面向 AI 的 Web Search APIWeb Query Language。该公司由前 Yandex Search 负责人创立,获得了 2600 万美元种子轮融资,明确将目标锁定在面向 AI agent 的大规模网页检索(styskin)。

  • 检索模型设计仍是活跃领域:围绕 late interaction / multivector retrieval 的讨论再次升温。业界认为,检索工作负载中的 scaling 行为终于开始显现,而模型与数据库的协同设计,至少和存储格式同等重要(mixedbread perspectiveSilvio Martinico)。

机器人、物理世界模型与具身数据

  • Figure 发布 “Index”,带来机器人领域重磅数据集公告:Figure 推出了 Index,称其为全球规模最大、类型最多样的机器人数据集。据介绍,该数据集每秒可接收 30 分钟视频上传量,已累计上传 1600 万段视频,向数据贡献者支付了 1500 万美元,下载量达到 26.4 万次。公司还表示,未来 12 个月将在数据和算力上投入 10 亿美元Brett Adcock后续说明)。这一规模意义重大,因为许多机器人实验室目前的瓶颈似乎仍在示范数据和感知数据,而不是模型架构创新。

  • 大规模物理建模和世界建模持续挑战上下文长度极限:Anima Anandkumar 介绍了初创公司 Accelerated Understanding。该公司正在开发面向多模态物理模拟和四维时空建模的大型 AI 模型,声称预训练阶段使用 1T 参数、训练时支持 1T 上下文,推理时则可处理 超过 5T 的上下文,且无需下采样或切分(Anima Anandkumar)。目前公开细节不多,但这篇帖子展示了部分前沿非语言建模工作的方向:重点正从单纯生成文本或视频,转向利用超长上下文进行多模态物理模拟。

  • 具身策略的泛化能力仍是重要评测目标:另一篇机器人领域帖子介绍了 S1,这是一款操作模型,即使面对训练分布之外的任务,也能仅凭一次示范完成操作(anag004)。Google Research 还分享了 AgentHands,这是一套 XR 系统,可为对话代理配合同步手势,在执行物理任务时提供空间指引(Google Research)。

热门推文(按互动量排序)


AI Reddit 速览

/r/LocalLlama + /r/localLLM 讨论回顾

1. Qwen3.8 Flash/27B 基准测试与本地运行适配性

7 天免费试用,继续阅读

订阅 Latent.Space,即可继续阅读本文,并在 7 天内免费访问完整文章档案。

开始试用已经是付费订阅用户?登录上一篇下一篇
原始来源: Latent Space

评论 (0)