← 文章 / AI技术
The Decoder 4小时前 · 2026-08-29 10:17:34 · 1 阅读

谷歌 DeepMind 的 AI 科学家升级:可规划实验、操控设备并撰写论文

谷歌 DeepMind 已将其多智能体系统 Co-Scientist 从假设生成器升级为与实验室集成的研究伙伴。据谷歌介绍,该系统已在三个学科交付了经实验验证的结果。

Co-Scientist 基于当前的 Gemini 模型构建,如今不仅能生成假设,还能规划实验、编写代码并操控实验设备。技术上的新意在于闭环研究工作流:系统从研究问题出发推导假设,制定实验方案或机器可读的实验室协议,分析结果,并生成科学论文手稿。

验证模块会将文本中的数值论断与所生成代码的实际执行日志交叉核对,以减少伪造结果。谷歌于 2025 年 2 月首次推出 Co-Scientist,当时基于 Gemini 2.0,在事实核查和文献综述方面还有不少短板。

升级后的系统以逐步提升的自主度在三个学科完成了验证:在材料科学中,Co-Scientist 设计出供人类执行的合成配方;在生物学中,它在专家反馈下构建预测管线;在计算机科学中,它则完全独立开展研究。

Co-Scientist 依次经历三个阶段:构思、实验和论文生成(左)。三项应用(右)从人类引导的材料合成,到协作式生物学研究,再到完全自主的 AI 架构开发。| 图片来源:Schmidgall, Zhu et al. (2026)

Co-Scientist 会合成、预测和设计

在材料合成方面,研究人员将 Co-Scientist 与一台半自动化高温炉搭配使用。该系统为一种此前主要靠危险蚀刻工艺制备的热门二维材料找到了更安全的制备路径,并生成了与该实验室设备相匹配的完整生长配方。经过 25 轮人工打磨,团队制备出性质接近目标材料的层状结构,但其原子结构的最终确认仍有待完成。

在第二项实验中,三种半导体薄膜一次合成即获成功。Co-Scientist 使用 Gemini 3 Deep Think 直接控制设备,把配方开发时间从数天缩短到几分钟。不过,样品和前驱体装料仍需人工完成,且快速模式产出的晶体比精细优化配方所得的更小、更不均匀。这些配方能否迁移到其他实验室仍是未知数,第一作者 Samuel Schmidgall 写道

在生物学领域,Co-Scientist 自主构建了一套图像分析管线,用于预测基因改造大肠杆菌(E. coli)菌落在不同化学浓度下会形成何种图案。用 Gemini 3 Pro Image 生成的预测中,四个形状特征有三个与未发表的实验结果吻合。研究人员承认,该系统只能在已知条件之间推理,无法预测全新系统中的行为,而那才是真正了不起的能力

一项计算机科学实验除初始设置外全程无人参与。Co-Scientist 设计了一个名为"Agent_H"的医疗 AI 架构:它对输入的查询进行分类,并行生成数十个候选回答再逐步精炼。在针对回答过长问题进行修正后,Agent_H 在健康基准测试上超越了包括 GPT-5 和 Claude Opus 5 在内的六个前沿模型。

但这些基准成绩没能经受住人类评估的检验。三位持证专科医师从九个类别对回答打分,Agent_H 仅在一个类别上相对基线 Gemini 3.1 Pro 具备统计学显著优势——潜在有害回答的风险更低。

自动化基准评估器与医师判断的相关性同样很弱。研究人员表示,基准分数高并不意味着系统真的能从临床角度给出更好的回答,这也让人质疑这些基准究竟在测什么。

三位医师对 Agent_H 与基线 Gemini 3.1 Pro 进行了九个类别的盲评对比(左),只有"减少危害"一项差异显著。自动评估器 Gemini 3.5 Flash 与医师判断的一致率(右)始终偏低。| 图片来源:Schmidgall, Zhu et al. (2026)

可靠性模块把幻觉率压到 4%

基于 LLM 的自主研究系统的一个核心问题是AI 胡编乱造。当 AI 智能体因好结果获得奖励时,它就有编造结果的动机。既往分析记录到现有系统 80% 到 100% 的造假率。Co-Scientist 从两方面应对:对伪造或抄袭内容进行惩罚,并由独立的验证模块把每个数值论断与已执行代码的实际结果交叉核对。

在 30 位领域专家、450 份独立评审参与的双盲研究中,研究人员评估了 150 篇自主生成的论文。启用可靠性模块时,Co-Scientist 在 4% 的案例中伪造了关键结果;关闭后,这一比例升至 46%;对比系统则高达 90%。

完全捏造的数据从未出现在 Co-Scientist 的产出中,却在对比系统 44% 的论文里出现。近似抄袭内容的占比从 60% 降到 16%。内置安全架构拒绝了 98.7% 的潜在有害研究方向。

尽管改进显著,研究人员仍观察到残留错误。该系统倾向于选择性报告,而且按 Schmidgall 的说法,它会在论文里写下"与其实际代码不符、但看起来非常合理的方法"。

从实验室助手到自主研究者,差距依然很大

研究人员将这些结果视为迈向闭环多智能体 AI 系统的一步——这类系统能通过实验反馈不断改进,并有望加速科学研究。"在 AI 系统能够驾驭科学的物理现实之前,还有很长的路要走。但我们对 LLM 帮助人类、加速真实世界进步的潜力深感兴奋,"Schmidgall 写道

自动化研究目前是最被炒作的 AI 应用方向之一。OpenAI 计划今年秋天发布一个至少能达到实习生水平、可独立开展研究的 AI 智能体系统。但围绕当前基于 LLM 的系统能否真正发现新知识,还是只是在把训练数据里已有的东西复述出来,争论一直存在。

原始来源: The Decoder

评论 (0)