Pi 1.0 与 Pi Durable 发布,Earendil 团队再引关注
AI Engineer NYC 常规票即将售罄,最后召集!两周后见!
作为 Latent Space 订阅者的专属福利,前 30 位读者可以使用 7 折优惠码(仅限新购票,不退不改)。
Pi 常常和 OpenClaw 一起被提起,就像我们今年早些时候报道的那样:
但今天轮到口碑越来越好的 Earendil 团队(Pi 加入的公司)大放异彩了:Pi 1.0 和 Pi Durable 双双登上 HN 首页。
Codemode(原生支持 MCP、Jev 和图像模型)
虚拟模型的扩展支持
延迟加载工具
Anthropic 模型的缓存预热
会话中途的系统消息(可感知对话记录的 prompt 和工具变更)
全新 TUI 主题
默认启用全屏模式
Pi Durable 将 Pi 移植到 TypeScript,并把所有有状态组件外部化:
崩溃恢复:每一步都以检查点任务的形式记录。进程失败或重启后,agent 和子 agent 会自动从上次的确切状态恢复。
可移植性:只要有一个 JavaScript 运行时(Node、Bun、Cloudflare 等)就能运行,支持可插拔的存储后端(Memory、SQLite、JSONL),以及灵活的远程或本地执行环境。
并发能力:单个 harness 可以同时运行多个并行、可分支的对话——比如主频道和独立的线程——互不阻塞。
可扩展性:开发者可以将自定义系统提示、工具、钩子及持久任务(例如具备回滚能力的多步结账流程)打包为可安装的扩展。
上下文管理:自动后台压缩功能会对旧消息进行摘要,在保持智能体活跃工作不受阻的情况下维持 Token 限制。
多人协作与状态同步:应用状态(如待办事项列表)直接与对话记录一同存储在文档中,允许多个用户或界面同时连接、监控并引导同一智能体。
热切换:智能体运行时可动态更新工具和扩展代码,下一次工具调用将自动加载新代码。
2026年10月1日至9月30日 AI 资讯。我们查阅了 12 个 Subreddit、544 个 Twitter 账号,未涉及 Discord。通过 AINews 网站可搜索所有往期内容。提醒: AINews 已成为 Latent Space 的一个版块。您可以自由订阅或退订邮件频率!
AI Twitter 综述
前沿与多模态发布:Gemini 4 Argon、GPT-6.1 Sol 和 FLUX 3
Gemini 4 Argon:谷歌发布了新一代 Gemini,贡献者指出其调整了预训练混合策略、使用了长周期后训练数据,并在内存优化、代码迁移及数学应用等内部场景中有所运用。这些是开发者关于模型构建与使用的第一手描述,并非模型具备通用优越性的独立证据(谷歌研究员)。
验证机制:谷歌称新版 Gemini 在发布前需经过数千名内部软件工程师为期数周的测试(Logan Kilpatrick)。
就绪状态存疑:彭博社报道的一则匿名内部人士称该模型存在编码弱点;随后有报道称一名 DeepMind 高级工程师驳回了这一说法。应将编码质量的实际争议视为未决,而非将基准测试或员工反应视为定论(所报道的批评, 所报道的反驳)。
GPT-6.1 Sol:OpenAI 的更新主要体现为效率提升。Sam Altman 称这是该公司增长最快的模型,并表示在解决了发布初期的负载问题后,服务性能已得到改善(更新)。
Solar Mini 4:Upstage 的专有纯文本推理模型报告称总参数量 35B/激活参数量 3B,上下文窗口为 1M token,最大输出 262K。由于权重未开放,参数量仍为厂商自行报告(分析)。
定价:输入/输出/缓存命中每百万 token 分别为 0.10/0.40/0.01 美元。
权衡:Artificial Analysis 给其总体得分 24 分,长上下文推理得分 83%,但在 Terminal-Bench 4.0 上仅得 1%。尽管输出速度为 208 tokens/s,但每个任务约产生 88K 输出 token,导致平均完成时间为 7.1 分钟,任务成本约为 Luna 的五倍。
FLUX 3 Image:Black Forest Labs 发布了原生最高 4K 的图像生成能力,支持最多十张参考图、边界框布局控制和定向多轮编辑。“保留所有未修改像素”是厂商的宣传说法,此处未经独立验证(公告)。
交互式视频智能体:Tavus 推出了视频到视频交互模型 Griffin。据称 48% 的实时参与者误以为它是真人,而早期系统这一比例不到 3%;在缺乏测试协议细节的情况下,不宜将这一结果推广为“通过了图灵测试”的结论(公告)。
企业级部署:另一边,Synthesia 发布了 Sessions,一种面向角色扮演和调研访谈的对话式虚拟人,在其此前单向培训视频产品的基础上更进一步(发布)。