Meta 布局编码数据、Google 机器人多形态与 MiniMax 开放视频模型
- 构建和部署 AI 应用
- 软件工程基础
- 使用编码 Agent
- 主导技术选型

构建和部署 AI 应用。AI 应用与传统应用的关键区别在于,前者的输出不可预测。给 LLM 发送 prompt 时,你不知道会得到什么回复;训练深度学习算法时,你也不知道它对新的样本会做出什么预测。相比之下,传统软件的行为要可预测得多。
擅长构建和部署 AI 应用的人,不仅熟悉 AI 的底层组件(如 LLM、上下文工程、RAG、agentic 工作流、机器学习和深度学习),更关键的是懂得用统计手段来度量、调控和治理 AI 系统,使其行为更可预测。做到这一点,核心能力在于能否推动有纪律的 eval 和误差分析循环。
软件工程基础。 真正理解软件如何运作,才能更高效地构建系统。工程化开发需要在成本、可扩展性、可靠性、速度之间不断取舍,安全和隐私更增添了额外的复杂度。
理解软件基础,才能看清哪些取舍选项真正存在。这会让你在选型技术栈、设计系统架构、规划数据存储、编写测试等决策上更加精准。效果也远胜于一个经验不足的开发者靠 vibe coding 交出方案,却完全不知道自己的 coding agent 正在做什么取舍——这些取舍往往并不理想,因为他们不知道该给 agent 喂什么上下文。掌握软件工程基础,你就能用精确的工程语言去引导 coding agent,做出合理的取舍。
使用 coding agent。 高效使用 agentic coding 如今已是每位开发者的核心技能。具备这项能力,说明你对 agent 的工作方式有清晰的认知模型:你了解它们的局限和应对方法,知道何时介入、何时放手,从而在不浪费过多时间和 tokens 的前提下,构建出健壮的软件。
这意味着你得知道如何管理 coding agent 的 context,如何在 planning 和 execution 之间做取舍,以及如何通过提供 verifiers 或 evals 让 agent 自主闭环。你还需要清楚什么时候该写一份明确的 spec(什么时候可以省掉)、如何编排多个 agent 协作、以及如何避免 agent 把你的生产数据库搞坏这类陷阱。Agentic coding 迭代极快,熟练驾驭 coding agent 不仅要求你掌握前沿实践,还得养成习惯——不断尝试新工具,随最佳实践的变化调整自己的 workflow。
塑造构建。 给定一份清晰的 spec,coding agent 的交付能力正在飞速提升。因此,工程师的工作重心正从"怎么写代码"转向"该定义什么"。工程师不该再期待拿到一份像素级精确的设计稿、然后只管实现。真正有效的 AI engineering 要求你具备产品直觉,理解业务上下文和用户目标,从而真正参与塑造和推动构建。
AI 也让你有机会承担比以前更大的 ownership。你可以主动发现有趣的问题和机会,并以负责任的方式去抓住它们。要利用好这个机遇,你得知道怎么推动项目往前走——什么时候该快速搭一个 MVP 拿到用户手里测试,什么时候该慢下来、多花些时间把东西做得更扎实。
支撑所有这些技能的,是一种持续学习的心态。AI 变化太快,我们都得不断精进、去接纳新兴的最佳实践。
DeepLearning.AI 的核心使命就是帮开发者掌握这些 AI engineering 技能。关于上述四项能力,我还有更多想聊的,会在接下来几封 letter 中逐一展开,并分享一份更详细的 AI Engineering Skills Map。展望 AI Engineering 的走向,我对我们即将能构建的一切感到无比兴奋。希望你也在这个未来里扮演一个精彩的角色。
继续构建!
Andrew
附注:随着 AI 的不断演进,我会持续更新 AI 工程技能图谱。如果你愿意参与贡献,请花几分钟填写我们的调查问卷(点此进入)。问卷大约需要 5-7 分钟,你的反馈将帮助我们为社区打造更好的资源。
来自 DEEPLEARNING.AI 的推广

把 AI 编码的默认设置变成你的主动选择。在云端、混合和完全本地三种环境中重建同一个应用——从 Claude Code 到运行在自己机器上的模型。免费报名
新闻

Muse Code 想要你的数据
只要开发者愿意让 Meta 从他们的工作中学习,Meta 就能把他们的编码账单从几美元降到几美分。
最新动态:Meta 发布了 Muse Code——一个命令行 agentic 编码框架,以及驱动它的 Muse Spark 1.2,一个能力强、单任务成本低的模型。
- 输入/输出:输入支持文本、图像、视频和 PDF(最多 1,048,576 tokens),输出为文本
- 功能:可调节的推理等级(none、minimal、low、medium、high、xhigh)、工具调用、结构化输出、网页搜索、上下文缓存,以及可在会话中持续运行的后台子代理
- 性能:在 Artificial Analysis 的 Intelligence Index 上拿到 57 分,在 Vals AI 的 Finance Agent v2 和 Artificial Analysis 的 AA-LCR 上排名第一
- 可用性/价格:Muse Code 已在 macOS 和 Linux 上开放 beta,Muse Spark 1.2 可通过 Meta Model API 使用。标准档每百万 input/cached/output tokens 收费 $1.25/$0.15/$4.25(提示词和输出不用于训练);贡献者档每百万 tokens 收费 $0.10/$0.002/$0.20(提示词和输出会用于训练);网页搜索每千次查询 $2.50
- 未披露:参数量、架构、知识截止日期、训练数据及训练方法细节
工作原理: Muse Code 在终端中运行。面对一个软件任务,它会用 Muse Spark 1.2 逐步规划改动、编写代码并验证结果。Meta 使用 Muse Spark 1.1 的数据训练模型以适配 Muse Code。Meta 阐述了三项设计,使该 agent 区别于反复调用单一模型的传统循环。
- 主 agent 将任务分派给一组子 agent,这些子 agent 在整个会话期间持续存在,而非每次任务都创建后丢弃。子 agent 在隔离的 worktree(仓库的独立工作副本)中并行编辑,避免同时修改产生冲突。Mark Zuckerberg 写道。
- 由于持续存在,子 agent 会保留对仓库已有的理解,无需每次重新推导,并能自主判断何时向主 agent 汇报。
- agent 会将每次模型调用、工具执行、方案审批和文件编辑写入用户本机日志。若 agent 崩溃,它会读取日志并从断点续跑而非从头开始,从而支持长时间任务。
- agent 内置三项默认技能,用户可直接调用:/plan 将请求转化为需用户确认的路线图,/grill 揪出方案的薄弱环节,/goal 驱动工作直至达成目标。
性能表现: 独立评测显示,Muse Spark 1.2 略低于当前智能前沿,但单位任务成本低于同级或更高级别的大部分模型。
- 在 Artificial Analysis 的智能指数(由九项经济实用任务评测综合而成)上,Muse Spark 1.2 开启 xhigh 推理模式(得分 57,每任务 0.40 美元)排名第六,高于开启 high 推理模式的 Grok 4.5(56,每任务 0.36 美元),紧随开启推理模式的 Qwen3.8-Max(58,每任务 1.13 美元)。新模型的智能指数比上月 Muse Spark 1.1(53,每任务 0.29 美元)高出 4 分。
- 在 Artificial Analysis 的 AA-LCR(长文档推理测试)上,Muse Spark 1.2 开启 xhigh 推理模式(83.3%)超越了所有受测模型。
新闻背后: Muse Spark 1.2 本身已是一款低价模型,但如果它真正打开市场——OpenAI 及其他公司曾尝试过类似举措——那么通过 Muse Code 使用模型时的贡献者折扣,可能具有颠覆性意义。企业对训练数据的渴求正在推动新的政策主张与商业计划。
- 在一篇长文中,Mark Zuckerberg 认为美国实验室在训练数据获取方面受到限制,处于竞争劣势。
- 在所有训练数据中,高质量代码尤为稀缺。Hugging Face 上周发布了 The Stack v3,一个基于公开 GitHub 爬取、规模达 4.9 万亿 token 的语料库,用以替代多年前的前代版本。但公开仓库只呈现最终打磨好的代码,不包含背后的推理、错误与修复过程;来自实际编码环境的完整会话记录才能捕捉这一全过程。
- Muse Spark 1.2 的折扣恰逢今夏白热化的价格战:OpenAI 将 GPT-5.6 Luna 降价 80%,降至每百万输入/输出 token 分别 $0.20/$1.20;DeepSeek-V4-Flash-0731 的定价为每百万输入/输出 token 分别 $0.14/$0.28。Meta 的贡献者层级比这两家乃至几乎所有通过 API 提供高性能模型的企业都要便宜。
为什么重要:贡献者层级能让 Meta 获得其自家应用无法提供的东西。Facebook、Instagram 和 WhatsApp 虽然产生海量数据,但都不是训练编程智能体所需的那种代码数据。Meta 缺这类数据,甚至愿意放弃 Muse Spark 1.2 的大部分售价来换取。Meta 对同一个模型定两个价,折扣换来的是 Meta 有权用智能体处理过的所有代码来训练。这笔交易不需要签合同:开发者只要换个模型名称就等于默认了。包含这些数据条款的层级限速为每团队每分钟 100 次请求,而标准层级是每分钟 3000 次——这意味着它主要适合个人和小团队,恰恰是最不可能请得起律师的开发者,而他们的整个产品可能就躺在智能体能读到的代码仓库里。
我们的看法:没有人被强迫放弃数据才能用上 Meta 最好的模型或智能体。但开发者在权衡 Muse Code 的折扣时,无论是否刻意思考,实际上都在给自己代码和专长的价值定价。模型厂商过去靠爬取公开代码仓库和论坛来训练开发者的代码,而 Meta 想把这种知识转移变成一个市场。和市场一样,谁更清楚自己手中筹码的价值,谁就占便宜——而这里待售的商品(公开或私有的代码仓库,以及工作过程的记录)此前从未有过明确的定价。Meta 把折扣的价格标得明明白白,开发者也应该在成交之前先给自己的数据定个价。

Google 的机器人模型能走会抓
Google 最新的视觉-语言-动作模型能让一个人形机器人穿过房间、蹲下够到低矮的货架,再用五指手掌握住一个灯泡。Google 称这是其机器人模型家族中首个用同一组权重同时控制腿部和手部的模型,这一突破简化了模型训练和设计。
What's new:Google 发布了 Gemini Robotics 2(GR2),该模型将摄像头画面和文字指令转化为机器人关节指令。此前 Gemini Robotics 系列只能驱动上半身完成桌面操作,而 GR2 能让人形机器人同时协调腿部、躯干、双臂和双手。一套固定的训练权重即可驱动两种机器人本体上的三种机械配置。
- 输入/输出:输入为摄像头画面和文字指令,输出为关节指令,可驱动 22 自由度的五指手(Sharpa 或 Inspire)或简单的两指夹爪(Robotiq)
- 特性:腿部与手部控制;多具身能力(同一份模型权重可同时运行 Apptronik 的 Apollo 2 人形机器人搭配 Sharpa 手、Apollo 2 搭配 Inspire 手,以及 Franka Duo 机械臂搭配 Robotiq 夹爪)
- 性能:官方自报成功率:全身拾取任务 45.7%–76.3%,多指操作任务 32%–92%,夹爪任务 74.2%–89.6%
- 可用性:面向早期合作伙伴,未开放公开 API
- 未披露:Google 未发布 Gemini Robotics 2 的模型卡片,也未披露基础模型、参数量、训练数据构成或定价
How it works:此次发布将 Gemini Robotics 2 与 Gemini Robotics ER 2 搭配使用,后者是独立的推理模型,负责将任务拆解为步骤并逐步交给 GR2 执行。由于 Google 未发布 GR2 的模型卡片或技术论文,我们目前了解的信息主要来自其安全报告和官方公告。
- Google 针对演示视频中的每项任务,采用遥操作(人工远程操控机器人并同步记录动作)、视频示例和仿真相结合的方式进行训练。
- GR2 用同一组训练权重运行三套不同机型配置,并未针对每种配置单独训练版本。伴随 Gemini Robotics 1.5 推出的运动迁移技术,将来自不同形态、传感器和关节数量机器人的数据汇聚起来训练单一模型,使得在一个机型上采集的数据同样能为其他机型的学习提供有价值的素材。
性能:Google 对 GR2 的所有评估均在自定任务与自研硬件上完成,目前尚无外部团队发表过针对该模型的测试。全身与夹爪的各项数据是同一类别内多个任务的平均值,而手指操作的数据则对应单一任务。最接近的基准是 Google 于 2025 年 3 月发布的首个机器人模型,该模型适配双臂 Franka 机器人后,在所分配任务上的平均完成率为 63%。
- 配备 Inspire 手部的 Apollo 2 机器人在同时利用腿部和手部抓取物品的训练中,从货架取物成功率 76.3%,从桌面取物 68.4%,从地面拾取 45.7%。Google 报告称这些数字均为同类别内多个任务的平均值。
- 使用 Sharpa 手部的 Apollo 2 进行精细手指操作时,成绩是 Google 公布数据中最低的:系垃圾袋成功率 44%,拉合拉链袋 40%,用簸箕扫地 32%。
- 在 Franka 机器人上,GR2 在精密插接、工具分装和通用取放任务上的平均完成率分别为 89.6%、78.9% 和 74.2%。该任务清单与 Gemini Robotics 1 的测试任务略有不同。
- Gemini Robotics ER 2 判断某项任务在物理上是否可执行时,取决于是否获得了 Gemini Robotics 2 的训练内容摘要。未提供摘要时,判断正确率为 62.0%;提供高度详细的摘要后,正确率升至 95.8%。
- Google 还推出了一项安全基准 ASIMOV-Agentic。测试表明,包括 Google 自身在内的所有系统,都无法同时做到捕捉移动机器人对人的危险并避免无谓停机。将无谓停机控制在 5% 以内时,会漏掉超过 40% 的人员距离过近的时刻。因此,Google 建议将这些模型与传统物理安全设备配合使用,而非替代。
拧灯泡的例子:Google 结果中有一对任务很能说明问题——看似简单的动作,一旦反过来做,在机器人领域就成了难题。拧出灯泡的成功率高达 92%,是 Google 手指精细操作任务中的最高成绩;而拧入灯泡的成功率只有 36%。区别在于,拧出时灯泡已经在灯座里,手只需抓住并旋转;拧入则要先把灯泡对准灯座,同时手还得包住灯泡。
背景:这次发布还带来了升级版 Gemini Robotics 推理模型 ER 2。ER 2 负责规划步骤、通过视频流追踪进度,并把动作模型当作工具来调用。另一个模型 Gemini Robotics On-Device 2 则完全运行在机器人本体硬件上,无需联网,只需几个小时、通常不到 200 个样本,就能适应陌生的双臂机体。
为什么重要:许多机器人模型每次只为一个任务、一台机器、一个环境训练,稍改一个变量往往就得从头再来。而且机器人运动数据的规模,也远不及支撑视觉语言模型的文本和图像语料。最新的 Gemini Robotics 模型是一次实验,尝试用比以往更通用的训练数据来学习。真正的多本体机器人模型,目标是无论换手型、换关节数量还是换任务,都能把知识成功迁移到新配置上——正如 Transformer 语言模型在文本领域做到的那样。
我们的看法:拧一个灯泡需要几个 Gemini 机器人?按目前 36% 的成功率,不到三个。

MiniMax 的顶尖视频模型,只开放了一点点
这款可免费下载的模型为视频生成与编辑树立了新标杆,但它的许可证却附带了一些出人意料的限制。
最新进展: MiniMax 发布了 H3,一个支持多种输入媒体的高清视频生成模型。不过其许可协议规定,美国、英国、欧盟和韩国的用户需向 MiniMax 提交申请,才能获得与全球其他地区相同的使用条款。模型的核心组件目前仍为专有(proprietary),至少暂时如此。
- 输入/输出: 输入最多支持 12 个文件,包括文本(7000 字符)、图片(每张 30 MB)、音频(15 MB)和视频(50 MB);输出为最长 15 秒、宽度最高 2000 像素的视频,附带音频和文字字幕
- 架构: Transformer,330 亿参数;独立的文本、音频和视频编码器,预处理器,2K 视频超分辨率模块
- 功能: 视频和音频编辑、多镜头输出、六种宽高比
- 性能: 位列 Artificial Analysis 视频编辑排行榜第一;文本转视频和图像转视频任务中排名第二(或在误差范围内并列第一)
- 获取/价格: 模型权重在 MiniMax H3 许可协议下免费下载,非商业和商业用途均可;通过 MiniMax API 调用时,2K 分辨率输出每秒 0.13 美元,768p 分辨率输出每秒 0.08 美元;输入费用因类型而异,音频免费,图片每张 0.04 美元,高清视频每秒 0.13 美元;提示词重新生成模块输入每百万 token 0.90 美元,输出每百万 token 3.60 美元
- 未公开: 精确参数量、训练数据、技术报告
工作原理: H3 的架构由 三个模块组成——上下文处理系统、视频/音频生成基础模型、高清超分辨率模块。目前仅基础模型可免费获取,且附带使用限制。
- MiniMax 表示 H3 使用真实自然数据训练,以确保数据质量与可扩展性。与 MiniMax 此前的视频模型不同,所有音频类型(语音、音乐、音效)统一训练,由单一编码器建模。团队用自然语言而非固定预设来训练模型的参考和编辑功能,并希望在流程更早阶段融合不同媒体类型(音频、视频等)。
- 支持的生成模式包括文生视频、首帧或尾帧图生视频、图像/音频/视频参考,以及上述任意组合。例如,用户提示可指示模型以一张静态图片为起点,参考两个视频的镜头运动,引用第三个视频的配乐,并用文字描述场景应如何展开。
- 输入先由 H3-Context-IR 处理。该推理模块解析提示词和输入媒体,生成一段新的文本提示,指导基础模型如何将它们融合。仅使用基础模型的用户需要为每种媒体类型编写明确的指令,或自建预处理流程;使用完整 API 流水线的用户则可由 Context-IR 模块完成大部分此类工作。
- 基础模块生成 768p 视频,即 1792×768 像素(最高支持 21:9 宽高比)。三个编码器分别处理文本、视频和音频,另有一个独立的变分自编码器也用于编码视频。
- 第三个模块 H3-Regenerate-2K 指示基础模块将 768p 视频以原生 2K 分辨率(宽 2000 像素,最长 4667 像素)重新生成。优化后的提示还将原始媒体参考和用户提示作为上下文纳入,使重新生成的视频能补充缺失细节,而非仅从源视频外推。
新闻背后:MiniMax H3 在人类偏好对战的ELO 评分上稳居前三,与 Google 的 Gemini Omni Flash 和字节的 Dreamina Seedance 2.0 并列。Black Forest Labs 的 FLUX 系列通常会发布开源权重,但其最新的 FLUX 3 模型闭源且仅提供 API。虽然尚无独立测试,但该公司自己的测试显示它有望成为冲击最先进水平的第四个模型。Dreamina Seedance 2.5 同样有待测试。
为何重要:尽管许可证限制不少、地区限制也很罕见,MiniMax H3 无疑是顶级的视频生成模型,为商业用户提供了一套强大且多功能的视频生成工具,足以与 Google 更昂贵的竞品相媲美。我们还得以一窥顶级视频模型的内部机制。MiniMax 放弃合成数据——在优质视频转录文本难以获取的情况下这尤其明智——并把提示词优化整合进流程,这一策略显然卓有成效。
我们的看法:即使在如今这个对 AI 高度警惕的时期,超出当地法律法规范畴、按国别限制权重使用也毫无道理。这违背了开放的根本意义——任何人都能下载模型、了解其原理并加以使用。希望这类限制不要成为趋势。

AI 能缓解失恋带来的心理创伤
旨在治疗心理健康问题的聊天机器人通常需要多次会话,这意味着用户往往还没获得多少收益就放弃了。研究人员证明,聊天机器人可以仅通过一次会话就提供缓解。
新在哪里:慕尼黑工业大学的 Thomas Menzel 与剑桥大学的 Michel Schimpf、Thomas Bohné 共同开发了 overit,一款帮助用户从失恋中恢复的聊天机器人应用。在一项随机对照试验中,用户仅需一次对话,情绪就有了显著改善。
核心洞察:分手造成的心理痛苦往往在事件发生很久之后仍然存在。前任恋人常常被关于自身或世界的限制性信念所困扰——"我被抛弃是因为我不够好"、"没有人会想要我"。根据记忆再巩固理论,先唤起一段痛苦的记忆,再围绕它产生一个限制性信念,随后给出一个与先前信念相矛盾的新解读("你已经尽力了,只是你信任的那个人辜负了你"),就能持久地改写那段痛苦记忆。如果这一理论成立,那么一个能引导用户说出限制性信念、再将其引向反事实解读的聊天机器人,就能够帮助痛苦感长期减轻。
运作方式:用户先填写一份问卷,内容包含分手痛苦评分、分手时间以及前任姓名(试验结束后还有后续跟踪问卷)。之后,他们通过一款基于 Claude Sonnet 4.5 的移动端应用与 AI 讨论自己的分手经历。
- 根据问卷回答,应用引导用户完成四个阶段的对话:(i)就分手经历及其影响提出开放式问题;(ii)挖掘用户信念,识别至少一条限制性自我信念;(iii)提供替代性视角;(iv)询问用户从对话中学到了什么、现在的感受如何。每经过若干轮次或达到某个里程碑后,对话便进入下一阶段,整段对话上限为 18 轮。
- 每次用户输入后,应用都会让 Claude Sonnet 4.5 根据最近三轮对话,对照五个里程碑来评估当前所处阶段:(i)识别限制性自我信念;(ii)质疑该信念;(iii)引导用户形成反事实解读;(iv)表达新的领悟;(v)结束对话。
- 随后,模型结合对话历史、当前阶段的指令(例如第二阶段需识别核心限制性自我信念)以及问卷数据,生成回复。
结果:作者在美国和英国开展了一项随机对照试验,共 171 名参与者,他们平均在 18 个月内经历过分手。其中一半参与者通过文字或语音与应用进行了约 20 分钟的单次对话,另一半未使用应用。作者使用"分手痛苦量表"(Breakup Distress Scale)测量参与者的痛苦程度,该量表包含 16 个条目,得分范围为 16 至 64。
- 7 天后,使用应用组的痛苦程度大幅降低(从 35.3 降至 26.6),而对照组仅从 35.9 降至 32.2。
- 一个月后,使用应用组的痛苦得分(26.0)仍低于对照组(29.0)。
- 使用应用的用户更有可能报告对分手产生"顿悟"(例如"我一直把失败的恋情归咎于自己,而没有意识到自己已经尽力了,是信任的人辜负了我"),比例分别为 61.7% 和 19.3%。经历过这种顿悟的人,事后通常感觉更好。
关键点:聊天机器人常常一味附和用户的说法。这在心理治疗场景中会带来问题,因为更有价值的是分析性的引导。这项工作的做法是把每次输入拆分为评估和生成两个调用:先让 LLM 评估对话状态,再生成回复,把追踪治疗进展和向用户表达共情这两件事分开,从而让 LLM 更容易给出有用的输出。这种方式为构建有目标导向的对话智能体提供了模板——它挑战用户(在这里是审视和重新解读痛苦的记忆),而不是简单地进行安慰。
我们的看法:和人类治疗师相比,任何聊天机器人的成本都低得多。而一次 20 分钟的对话就能切实改善受访者的情绪和心态,即便按 Claude 的价格计算,这笔账也非常划算。