← 文章 / 行业与公司动态
Latent Space 1小时前 · 2026-08-29 11:28:34 · 0 阅读

Poolside获英伟达120亿美元“反向人才收购”:创始人留守获10亿美元,员工转投获60亿美元,Infraco扩至7GW新云

不到一个月前,我们刚在播客中介绍了 Poolside 的 Model Factory,以及对 Eiso Kant 的访谈(此前我们还报道过Paper Club):

看来 Jensen 也非常、非常欣赏 Poolside——他不仅从投资人变成了其 Model Factory 的授权方,还聘用了 Poolside 的 109 名员工:

X avatar for @EricNewcomerEric Newcomer@EricNewcomer据 Newcomer 获得的一封投资者信,AI 模型开发初创公司 Poolside 已与 NVIDIA 达成一项非独家授权协议,交易金额为 60 亿美元;此外,NVIDIA 还将以 120 亿美元的投前估值向 Poolside 投资 10 亿美元。 作为其中一部分7:27 PM · Aug 20, 2026 · 32K Views
7 Replies · 11 Reposts · 78 Likes

除非情况发生了巨变,否则这应该涵盖了Poolside 绝大多数技术员工

Eiso Kant [01:52:31]:我们几乎在应用研究和工程的所有岗位上招聘,从训练、评测一直到后训练架构。我们仍处于这样一个阶段:个人可以产生巨大的影响。我认为,加入 Poolside 的理由之一,就是这里可能是个人影响力与团队规模比值最高的地方,对吧?这个模型由不到 70 人打造完成;工程师和研究人员加起来不到 115 人,共同完成了这项工作。当然,“115 人”是个很宽泛的定义,因为我也把自己算在这 115 人里。

正如创始人所说,这“既不是收购,也不是 acquihire(人才收购)”:

我们把 Windsurf-Google、Character-Google、Scale-Meta 和 Instacart-OpenAI 的交易称为 execuhire,因为通常是高管离开、员工获得丰厚回报,而公司主体得以保留。但这次却完全反过来了。创始人相当于让公司彻底转向某个新方向,同时为投资者和员工安排了极其优厚的退出方案,让他们可以继续原本的使命,或留下来参与新的转型:

过去三年半,我们在方向上一直走对了,只是在这场资本需求陡增的竞赛中,形势发生了变化。

去年年底,我们有一个为期 6 周的窗口期,需要筹集 20 亿美元,用来支付一套预计于今年 1 月上线的 40,000 张 GB300 集群。但我们没能及时完成融资,最终失去了这套集群

他们还表示:

我们也知道,拥有 10,000~20,000 张 GB300 后,就能训练出足以与当前前沿模型竞争的优秀模型。但明年前沿模型的规模,要求的集群至少要比这大一个数量级。而如今的瓶颈不仅是资本,还有实体数据中心空间和已签约的算力

要跟上当前模型配方的前沿水平,所需算力正在呈指数级增长。随着整个行业沿着递归自我改进的路径加速发展,这一点只会越来越明显。

为此,2026 年 1 月分拆成立的 PIC 基础设施公司(infraco),其野心同样值得关注……

X avatar for @eliebakouchelie@eliebakouch我猜,新 Poolside 会大幅转向基础设施,今后不再训练模型。 Poolside Infrastructure Company(PIC)目前仍是独立实体,正在得州建设一座 1.2GW 的数据中心。两个月前刚任命了新 CEO,三天前又任命了新 CFO。X avatar for @eliebakouchelie @eliebakouch这多少有点令人震惊。据我了解,NVIDIA 买下了 Poolside 的“模型工厂”业务,还有不少员工(研究人员?)收到了 NVIDIA 的 offer。创始人留在 Poolside 的安排很不寻常,不知道他们是不是要把公司转型成一家新云或算力供应商。因为我…… https://t.co/Ugpgm1ZvfG12:12 AM · Aug 21, 2026 · 10.6K 次浏览
6 条回复 · 85 个赞

我们也感到困惑。创始人表示,他们“还没准备好公布更新后的愿景”。不过,相关各方这次都拿到了大笔资金,所以我们也很想看看,原 Poolside 接下来分化出的三条路线会分别走向何方。

目前留下的唯一线索是:

我们坚信,一切具有经济价值、科学意义的事物,以及许多对个人而言真正重要的事物,最终都将建立在 AI 之上。这场转型目前还不到 0.1%……

……我们认为,具备人类水平的智能能力最终会被开源模型完全商品化,而超级智能很可能不会如此

从经济价值来看,世界上的问题大致分为两类:智能受限型实验受限型。前者可以通过提升智能水平来解决,比如开发软件、做会计、证明数学定理。后者则必须依靠现实世界中的实验才能取得进展;如果没有实验结果作为反馈,再多的智能也无法推动问题向前发展。即便把全球最聪明的 10 万人聚在一起研究癌症,如果缺乏真实世界的实验反馈闭环,他们很可能依然无法攻克癌症。

如今,模型的收入主要来自编程,未来还会覆盖所有知识工作。再往后,那些能够超越人类能力的公司,将从科学发现中获得收入;这类收入背后是真实世界实验形成的、真正难以复制的数据壁垒。依我们浅见,AI 的终极价值并不在于第一类能力——那最终会变成低利润的商品化服务——而在于第二类能力。AI 将成为全球最有价值的科学发现引擎

很有意思。看来我们推出《AI for Science》播客的时机再合适不过了。

AI News(2026 年 8 月 19 日至 20 日)。我们查看了 12 个 subreddit、544 个 Twitter 账号,没有再查看其他 Discord。你可以在AINews 网站搜索往期全部内容。提醒一下,AINews 现在已成为 Latent Space 的一个栏目。你可以选择订阅或取消订阅不同的邮件频率!


AI Twitter 速览

OpenAI 和 Anthropic 扩大 Agent 产品版图

  • OpenAI 一口气推出多项桌面端和开发者功能@ChatGPT 为 Mac 版 ChatGPT Work/Codex 上线了 Apple Messages 插件,用户可以直接在桌面应用中搜索消息、查看未读内容、起草并发送消息。@OpenAIDevs 还为 ChatGPT Sites 增加协作编辑功能,团队成员可以共享项目,由 Codex 负责 git/CI;共享只读对话链接共享 PR 上下文等功能,也在推动 ChatGPT/Codex 从单纯的聊天界面转变为协作协调平台。在 API 方面,GPT-Image-2 的透明背景功能现已开放预览,方便生成可复用的设计素材。

  • OpenAI 的桌面端记忆和工作流功能仍在分地区逐步上线@OpenAIDevs 表示,Mac 版 Pro/Business/Enterprise 用户现在可以在欧洲经济区、英国和瑞士使用 Computer History 和跨应用记忆,Record & Replay 也已在这些地区上线。这些功能共同体现出一种产品策略:在设备端记录用户的工作流,并将重复操作沉淀为可复用的技能。

  • Anthropic 让其智能体平台更具组合性,也更适合投入生产环境@ClaudeDevs 宣布,Claude Platform 上的 computer use、browser tool、Skills API 和 Files API 正式开放。Skills API 支持带版本管理的可复用流程;Files API 现已支持过期控制,速率限制提高 5 倍每分钟 500 次请求,每个组织的存储上限为 1 TB。Anthropic 还发布了适用于 Claude Managed Agents 的 AG-UI 适配器,可将聊天线程映射为托管会话,并把文本、工具调用和思考过程流式传输到自定义 UI 中。

模型经济学、使用上限,以及企业转向开放模型的趋势

  • AT&T 成为了目前最典型的混合路由公开案例:这组信息中最值得关注的企业数据来自 @Hesamation 对 AT&T 内部 AI 部署情况的总结:员工 AI 使用量中,已有 40% 通过开放模型处理,目标是提升至60%–70%;在每天 450 亿 tokens的用量下,编程成本降低了 56%,而质量仅下降 2%。这进一步印证了一个日益普遍的判断:前沿闭源模型仍主要用于最复杂的任务,而“够用”的开放模型正在覆盖企业需求中更广泛的中间地带。@amir 明确表示,这对 OpenAI 和 Anthropic 的企业护城河敲响了警钟;@ollama 则欢迎 AT&T 使用开放模型。

  • 闭源模型分发渠道的价格压力正在加剧@eglyman 宣布,GPT-5.6 Sol 通过 Router 提供五折优惠;与此同时,@github@code 也为 GitHub Copilot / VS Code 用户宣传了这项限时折扣。另一方面,用户反馈显示,供应受限似乎更多体现为使用上限,而不是质量下降:@bridgemindai 抱怨称,每月 200 美元的 OpenAI Pro 套餐,一天高强度使用 Codex 就可能耗尽;@theo 则指出,即使达到公开的使用上限,用户仍可能继续消耗大量 tokens。更广泛的信号是:各家实验室仍在摸索如何平衡高端模型访问权限与 Agent 使用的经济可持续性。

  • 开放权重模型的采用率和分发范围持续扩大@ollama 表示,Kimi K3 目前已覆盖其超过半数的订阅用户,并提供美国/欧盟托管零数据留存。在开放生态方面,@Google@osanseviero 强调,Gemma 的下载量已突破 10 亿次;与此同时,@_philschmid 发布了 Awesome Gemma 仓库,汇总各类变体、部署指南和微调方案。

多模态与智能体基准测试:Muse Spark、GLM-5.3、Gemini 3.7 Flash

  • Meta 的 Muse Spark 1.2 在多模态和智能体评测中表现亮眼@AIatMeta 展示了涵盖视觉编程、机器人规划和视听理解的多个演示,并预告了 WildArtifactBench。这是一项内部评测,针对实际多模态任务,采用人类和智能体评审得出的胜率与 Elo 进行衡量。第三方测试结果同样不错:@arena 报告称,Muse Spark 1.2 在 Agent Arena 中的净成绩提升了 2.1%,高于 v1.1 的0.9%,其中 Bash Recovery 提升了 11.4%@DesignArena 则将 Muse Spark 1.2 评为Video-to-Website 第 1 名Image-to-HTML 第 2 名Image-to-Frontend 第 3 名,并指出它位于价格偏好 Pareto 前沿

  • 智谱的 GLM-5.3 持续在智能体和代码评测中取得亮眼表现@AutoClawAIer宣布将GLM-5.3 集成到 AutoClaw中。AutoClaw 是智谱旗下的工作智能体。更值得关注的是,@arena表示,GLM-5.3 Max重新定义了Code Arena:WebDev Pareto 前沿,预计将以1597 分$3.65/M的成绩,位列开源模型第 2总体第 8。此外,@ZixuanLi_再次提到 SAO(Single-Rollout Asynchronous Optimization,单 Rollout 异步优化),称其是 GLM-5.2/5.3 在强化学习方面实现稳定异步智能体 RL 的关键进展。

  • Gemini 3.7 Flash 不断积累“便宜又强”的证据@arcprize报告称,ARC-AGI-2 达到 84.6%,每项任务成本 $0.25ARC-AGI-1 达到 95.5%,每项任务成本 $0.12。按成本调整后的推理性能来看,Gemini 3.7 Flash 尤为突出。@JonathanJarvis也表示,它非常适合智能体视觉任务

基础设施、硬件与系统进展:Rubin、Cerebras、Linux 智能体与缓存

  • OpenAI 的下一代预训练技术栈正迁移到 Rubin@udayruddarraju发文称,OpenAI 首批NVIDIA Vera Rubin 机架已经安装完毕并开始运行训练技术栈,明确用于下一代前沿模型预训练@gdb称,这是 OpenAI 与 NVIDIA 合作关系中的一个重要里程碑。

  • Cerebras CS-4 展示了无需缩小制程节点也能提升推理性能@kimmonismus 总结称,CS-4 基于同一片5nm 晶圆4 万亿个晶体管90 万个 AI 核心,通过重新设计供电与散热系统,性能基本实现翻倍。公布的规格包括:每个 WSE-3 Turbo 可达250 PFLOPs,内存带宽43.2 PB/s;由 3 片晶圆组成的 CS-4 机架性能达到750 PFLOPs。对开发者而言,更值得关注的是:运行 GPT-OSS-120B 时,单用户吞吐量超过4,400 tok/s,最高比 GPU 系统快 30 倍

  • Agent 运行时的人机工程学正逐渐成为系统瓶颈@theo 认为,Linux 在 Agent 工作负载上的表现明显优于 macOS,尤其是在大量操作文件系统的场景下。@Qdrant_engine 分享了一篇关于语义缓存的实践文章:缓存命中率达到57.1%,Token 消耗减少55.7%,命中延迟约为15 毫秒@MParakhin 则指出,gisting 是一种尚未得到充分利用的生产技术:在效果更好的同时,可将端到端延迟降低约40%、吞吐量提高约15%,并附上了 Shopify 的工程实践文章

Agent、记忆与以 Harness 为核心的学习

  • Chroma 发布了自我改进记忆功能的研究预览版@jeffreyhuber 宣布推出 Foundation,这是 Chroma 基于过往 Agent 会话构建的 Agent 记忆方案。此举正值行业思路转变之际:人们开始从“单次执行的 Agent”转向具备持久状态、技能和记忆、能够不断积累的 Harness。

  • 这组研究中最有意思的方向不是模型权重,而是 harness 的演进@omarsar0重点介绍了一篇关于harness 持续学习的论文。研究认为,提示词、记忆、技能和路由规则都可以独立于模型演进。这里的关键问题是harness 层面的遗忘:改进某个组件,可能在不知不觉间破坏原本可靠的行为。论文提出受保护的 harness 演进(guarded harness evolution),将更新提议与正式提交分开;在文本、多模态和开放世界任务中,实验结果显示性能提升>10%

  • 相关的负面结果同样值得关注@dair_ai指出,一项研究发现,在控制任务顺序效应评测方差后,基于记忆的自我改进 agent 表现反而更差。@omarsar0还总结了另一篇论文:经过 post-training 的 agent 往往会很早锁定初始策略,之后把剩余预算用于局部优化,而不是重新审视策略选择本身。

热门推文(按互动量排序)

  • ChatGPT 桌面端 + Messages@ChatGPT 的 Apple Messages 插件发布是这组内容中互动量最高的产品推文,也体现出助手正逐渐转向原生桌面体验和主动执行操作。

  • AT&T 的开放模型路由经济性@Hesamation 的总结或许是对企业最具战略价值的数据点:目前 40% 使用开放模型,未来将达到 60–70%,编码成本降低 56%

  • OpenAI 的 Rubin 机架@udayruddarraju提供了一个少见而具体的基础设施信号,反映出 frontier 模型预训练规模正在扩大。

  • Claude Platform 正式支持 computer use、Skills 和 Files@ClaudeDevs认为,这标志着 Anthropic agent 平台又向成熟迈进了一大步。

  • Gemini 3.7 Flash 在 ARC-AGI 上的表现@arcprize 的消息进一步强化了 Google 在高性价比推理领域的定位。


AI Reddit 速览

/r/LocalLlama + /r/localLLM 讨论回顾

1. Qwen3.8-27B 量化与编程基准测试

  • Qwen3.8-27B Dynamic v3 Unsloth GGUFs 发布(活跃度:2059):这张图片是 Unsloth Dynamic v3.0 GGUF 量化版 Qwen3.8-27B 的技术公告图,声称在模型大小相同的情况下,top-1 准确率比其他量化方案提供商高出 >10%。公告强调该版本仅采用训练后量化,不使用 QAT/QAD,也未在 imatrix 校准数据集上训练;同时覆盖从约 8GB RAM 即可运行的 1-bit 量化版本到 BF16,评估指标包括 Divergence-300 @32、KLD 和 top-1% 准确率对比。相关发布内容见 Unsloth 博客和 Hugging Face GGUF 仓库:https://unsloth.ai/docs/basics/dynamic-3.0-ggufs 以及 https://huggingface.co/unsloth/Qwen3.8-27B-GGUF评论者总体反响积极,但希望看到更多对比数据,尤其是将此前的 Qwen 3.8 27B UD 2.0 量化版本加入图表,以便判断是否值得升级。还有用户关心实际硬件需求:现在 IQ4XS 是否已经可以在不使用 MTP 的情况下运行于 16GB 显存上。

    • 用户希望补充与此前 Qwen 3.8 27B UD 2.0 GGUF 的量化对比指标,并特别要求在图表中加入 KLD 和/或 top-1 误差曲线,以便将现有本地文件与新的 Dynamic v3 量化版本直接比较。

    • 有人提出一个技术问题:如果不启用 MTP,新的 IQ4XS 量化版本或许能装进 16 GB VRAM,而且画质损失不明显,那么它对单 GPU 本地推理将很有意义。另一位用户指出,Q4_K_M 的体积似乎约为 ~15 GB,并询问它能否在保持足够质量的同时具备实际使用价值。

    • 鉴于 oobabooga 现已参与其中,一位评论者希望看到更细致的评测,尤其是按类别统计的 KLD,以及 KV-cache 量化 KLD 指标,类似 localbench.substack.com 展示的数据,从而更清楚地了解量化损失会在哪些任务和缓存设置中出现。

  • Qwen3.8-27B 的知识能力相比 3.6 大幅倒退(热度:758):用户报告称,在离线、仅基于权重的事实回忆测试中,Qwen3.8-27B 不如 Qwen3.6-27B;这与 Artificial Analysis 的 Omniscience 知识基准中较低的得分一致。整体来看,Qwen3.8 似乎在工具调用、编程和 Agent 工作流方面更强,但在禁用网页或搜索工具后,面对冷门知识、历史或地点识别,以及隔离网络环境下的知识检索时表现更弱。 评论者普遍认为,这是有意为之、也可以接受的专业化取舍:Qwen 3.x 可能正转向编程和 Agent 场景,默认这些场景会依赖外部检索;如果更看重广泛的“迷你 Google”式事实问答,Gemma 可能更合适。一位评论者明确表示,如果能提升编程表现,他并不介意模型减少对冷门知识的参数投入。

    • 几位评论者的看法逐渐趋于一致:Qwen 3.8-27B 似乎在刻意弱化对记忆事实的直接召回,转而优化编程和智能体工作流。有用户表示,在禁用网页搜索和抓取后,Qwen 3.8 在识别邮票、历史地点和老照片等小众知识任务上的表现明显退步;但在检索工具可用时,它的工具调用和编程能力却相当“惊艳”

    • 讨论认为,这种退步可能是针对 27B 模型的一种有意取舍:减少对冷门知识的记忆,同时保留推理、编程和工具使用能力。评论者建议, trivia 或广泛事实检索可以交给 Gemma 等其他模型;而 Qwen 3.x 更适合先从外部获取信息、再据此执行任务的智能体场景。

    • 一个颇有技术意味的猜想,是未来可能出现模块化的模型知识/技能扩展,形式类似 LoRAs 的“神经插件”。这种架构可以让基础模型保持精简,再通过可选插件添加特定领域或语言能力,例如日语支持或金融服务领域知识,而不必把所有知识都固化进基础模型。

  • 我用 Qwen3.8-27B 对比了 Opus、Sonnet、GPT 等模型,结果如下。(热度:422):这张图片是作者自制代码评测的结果面板,比较了 Qwen3.8-27B、DS4 0731、GPT-5.6-sol、Opus 5、Sonnet 5 和 Haiku 4.5 在算法测试、代码仓库 bug 修复与功能开发任务、实际完成时间,以及盲评代码质量等方面的表现(图片)。主要结论是,GPT-5.6-sol 综合表现领先:代码仓库任务满分,算法测试也接近满分。不过,本地模型的表现也出人意料地有竞争力:Qwen3.8-27B 在 xhigh 思考级别下,复杂算法和“精准修复”任务表现突出,但速度慢得多;DS4 0731 即使采用 2-bit 本地量化,在两个代码仓库任务等级中都取得了 8/8。作者指出,这里存在实际取舍:提高“思考”强度有助于解决部分复杂推理和代码质量问题,但也可能导致过度思考、延迟增加,甚至不如中等思考强度准确。 评论者质疑评测是否已经饱和以及任务难度是否足够,认为如果几乎所有模型都接近满分,这套评测就很难有效区分前沿模型和本地模型的能力。还有人希望了解“算法”和“代码仓库工作”任务的具体定义、预期输出以及隐藏测试的设计,以便更好地复现和解读结果。

    • 多位评论者认为,这套评测似乎已经饱和,出现了“所有模型都在顶端”的情况,因此很难区分 Qwen3.8-27B 与 Opus、Sonnet、GPT 等模型。一位评论者打了个比方:这就像用过于简单、无法拉开能力差距的题目测试更强的模型,说明评测集需要更难、更有区分度的任务。

    • 一位评论者要求更详细地说明“算法”“代码仓库工作”任务的方法论,尤其希望看到更完整的任务描述和预期结果。这也反映出评测的可复现性问题:如果没有明确的提示词、评分标准和目标输出,跨模型比较就很难准确解读。

    • 有个技术性问题值得关注:在比较 Qwen3.8 xhighmedium 设置时,Qwen3.8 medium 中的“DNF”具体是什么意思?这说明基准测试表中可能包含未完成或失败的运行结果,但文中没有清晰定义失败状态的含义,读者因而难以判断这些结果是否可靠。

2. Qwen3.8-27B DFlash2 推理加速

原始来源: Latent Space

评论 (0)