← 文章 / 科技资讯
Latent Space 6小时前 · 2026-10-02 15:26:11 · 5 阅读

Pi 1.0 与 Pi Durable 发布,Earendil 团队再引关注

AI Engineer NYC 常规票即将售罄,最后召集!两周后见!

作为 Latent Space 订阅者的专属福利,前 30 位读者可以使用 7 折优惠码(仅限新购票,不退不改)。


Pi 常常和 OpenClaw 一起被提起,就像我们今年早些时候报道的那样:

但今天轮到口碑越来越好的 Earendil 团队(Pi 加入的公司)大放异彩了:Pi 1.0 和 Pi Durable 双双登上 HN 首页。

Pi 1.0:

  • Codemode(原生支持 MCP、Jev 和图像模型)

  • 虚拟模型的扩展支持

  • 延迟加载工具

  • Anthropic 模型的缓存预热

  • 会话中途的系统消息(可感知对话记录的 prompt 和工具变更)

  • 全新 TUI 主题

  • 默认启用全屏模式

Pi Durable 将 Pi 移植到 TypeScript,并把所有有状态组件外部化:

  • 崩溃恢复:每一步都以检查点任务的形式记录。进程失败或重启后,agent 和子 agent 会自动从上次的确切状态恢复。

  • 可移植性:只要有一个 JavaScript 运行时(Node、Bun、Cloudflare 等)就能运行,支持可插拔的存储后端(Memory、SQLite、JSONL),以及灵活的远程或本地执行环境。

  • 并发能力:单个 harness 可以同时运行多个并行、可分支的对话——比如主频道和独立的线程——互不阻塞。

  • 可扩展性:开发者可以将自定义系统提示、工具、钩子及持久任务(例如具备回滚能力的多步结账流程)打包为可安装的扩展。

  • 上下文管理:自动后台压缩功能会对旧消息进行摘要,在保持智能体活跃工作不受阻的情况下维持 Token 限制。

  • 多人协作与状态同步:应用状态(如待办事项列表)直接与对话记录一同存储在文档中,允许多个用户或界面同时连接、监控并引导同一智能体。

  • 热切换:智能体运行时可动态更新工具和扩展代码,下一次工具调用将自动加载新代码。

2026年10月1日至9月30日 AI 资讯。我们查阅了 12 个 Subreddit、544 个 Twitter 账号,未涉及 Discord。通过 AINews 网站可搜索所有往期内容。提醒: AINews 已成为 Latent Space 的一个版块。您可以自由订阅或退订邮件频率!


AI Twitter 综述

前沿与多模态发布:Gemini 4 Argon、GPT-6.1 Sol 和 FLUX 3

  • Gemini 4 Argon:谷歌发布了新一代 Gemini,贡献者指出其调整了预训练混合策略、使用了长周期后训练数据,并在内存优化、代码迁移及数学应用等内部场景中有所运用。这些是开发者关于模型构建与使用的第一手描述,并非模型具备通用优越性的独立证据(谷歌研究员)。

    • 验证机制:谷歌称新版 Gemini 在发布前需经过数千名内部软件工程师为期数周的测试(Logan Kilpatrick)。

    • 就绪状态存疑:彭博社报道的一则匿名内部人士称该模型存在编码弱点;随后有报道称一名 DeepMind 高级工程师驳回了这一说法。应将编码质量的实际争议视为未决,而非将基准测试或员工反应视为定论(所报道的批评, 所报道的反驳)。

  • GPT-6.1 Sol:OpenAI 的更新主要体现为效率提升。Sam Altman 称这是该公司增长最快的模型,并表示在解决了发布初期的负载问题后,服务性能已得到改善(更新)。

    • 量化经济成本:Artificial Analysis 报告称,在最大努力模式下,每个 Intelligence Index 任务的成本为 0.72 美元,而 GPT-6 Sol 为 1.04 美元,Astra 为 3.26 美元。性能提升主要得益于更少的交互轮次和更低的缓存读取成本,而不仅仅是生成的 token 数量减少(结果, 解释)。

    • 多模态修复:OpenAI 还修复了 Luna 和 Sol 的图像编码问题。Luna 的 Intelligence Index 分数提升 1 分,包括在视觉文档和知识工作评估方面的改进;Sol 的变化微乎其微(测量)。

  • Solar Mini 4:Upstage 的专有纯文本推理模型报告称总参数量 35B/激活参数量 3B,上下文窗口为 1M token,最大输出 262K。由于权重未开放,参数量仍为厂商自行报告(分析)。

    • 定价:输入/输出/缓存命中每百万 token 分别为 0.10/0.40/0.01 美元。

    • 权衡:Artificial Analysis 给其总体得分 24 分,长上下文推理得分 83%,但在 Terminal-Bench 4.0 上仅得 1%。尽管输出速度为 208 tokens/s,但每个任务约产生 88K 输出 token,导致平均完成时间为 7.1 分钟,任务成本约为 Luna 的五倍。

  • FLUX 3 Image:Black Forest Labs 发布了原生最高 4K 的图像生成能力,支持最多十张参考图、边界框布局控制和定向多轮编辑。“保留所有未修改像素”是厂商的宣传说法,此处未经独立验证(公告)。

    • 可用性:商业版权重已开放;官方承诺未来几周推出开源权重版本。托管服务可经 fal 和 Krea 使用(fal、Krea)。

    • 定价:BFL 宣布 API 临时五折优惠至 10 月 8 日,但帖中未给出原价(详情)。

  • 交互式视频智能体:Tavus 推出了视频到视频交互模型 Griffin。据称 48% 的实时参与者误以为它是真人,而早期系统这一比例不到 3%;在缺乏测试协议细节的情况下,不宜将这一结果推广为“通过了图灵测试”的结论(公告)。

    • 企业级部署:另一边,Synthesia 发布了 Sessions,一种面向角色扮演和调研访谈的对话式虚拟人,在其此前单向培训视频产品的基础上更进一步(发布)。

原始来源: Latent Space

评论 (0)