Foundries 与 Navigators:降低科学研究成本的路径
在 AI 时代,科学研究的未来图景如何?Anthropic 提出了宏大的科学愿景,甚至正在开设湿实验室。与此同时,一场静默的变革1正在 AI 与科学的交叉领域全面展开。
在这篇客座文章中,Adrian Sanborn 谈论了他观察到的 AI 如何以不那么炫目但更为直接的方式,变革一线科学研究。他结合自己在公司 Endura Therapeutics 的实践进行阐述。
Adrian 曾在斯坦福大学攻读计算机科学博士,大部分时间都在实验室台面上做实验。这使他能从代码库和湿实验室两个维度,讲述 LLM 带来的变化。Enjoy!
语言模型已经改变了软件构建的方式。编写代码、处理数据、设计架构,如今的速度在三年前难以想象。
当产品是软件、结果可验证时,编码成本的降低直接转化为更多软件产品和更多开发者。2 但在科学领域,一切最终都要受制于需要数天甚至数周才能验证的物理实验。围绕实验的知识工作因 AI 而变得极快,但 AI 对实验本身通量的提升却微乎其微。思考变便宜了,但执行没有。
我们认为,生物技术行业已以两种方式适应这种变化:

Foundries 降低执行成本。它们将测量过程工业化,利用新技术以快一个数量级的速度生成数据。Xaira、NewLimit、Octant、Tahoe 和 Endura 通过下一代测序和多路复用技术实现了这一目标;Insitro、Eikon 和 Noetik 依赖高通量显微成像;Lila 和 Periodic Labs 则采用物理自动化手段,等等。AI 让这些数据变得可读且具备预测性,但真正的差异化资产在于实验数据本身。
Navigators 消耗思考盈余。AI 模型作为公司常规运营机制的一部分,驱动着更好的决策和更高效的流程。它们日益主导着工作的执行方式、工具的建设以及哪些问题值得实验验证。这类模式不需要专有模型或海量数据集,只需愿意改变公司运作方式的意愿。
建立 Foundry 是一项真正的战略承诺,需要资本投入、多年时间以及对特定技术的押注。Foundry 容易引人注目:其技术令人着迷,与 AI 的关联直观,总有新模型或数据集可供发布。相比之下,Navigators 往往默默无闻,因为其收益体现于运营层面,没有人会为决定放弃某条路径而发布新闻稿。但 Navigation 能力对所有公司开放。显著的变化发生在几十家公司中,而不显眼的变化正发生在所有公司中。
Navigation 在早期初创公司中运行最快,因为它们没有历史包袱:没有软件合同历史、没有标准化流程、没有僵化的组织架构,也没有合规制度。同时,它们也面临着在资源极少情况下快速行动的压力。当更高效的工作方式出现时,它便直接成为新常态。
影响体现在方方面面。分析从一个星期缩短到一个小时,实验迭代速度随之加快。原本要花六位数许可费的软件,现在一天就能写出来。疾病研究项目可以在 500 个候选方案中挑选,而过去一个团队通常只能评估五个。下面从内部视角看看这一切是如何发生的。
代码终于跟上了科学的节奏
实验科学中存在一种结构性张力,在软件工程里没有真正的对应物。在工程领域,需求每隔几周就变是规划不善的征兆;而在研究中,需求变化本身就是目标。实验的目的在于学到新东西,而这些新认知会改变下一个实验的方向。3 如果一种方法半年都没变过,那说明什么都没被发现。
一个新实验的方案在第一年里会改上十几次,而每一次改动都会传导到分析环节。每一项测量数据都需要用与实验紧密同步的代码来处理、归一化和解读。传统上,分析由另一个人负责,于是“懂实验在测什么的人”和“懂代码在做什么的人”之间出现了一道断层。这种摩擦导致人们倾向于少提实验改动、避免分析返工,久而久之,许多本可探索的路径就被搁置了。
如今写代码很快,把分析适配到修改后的方案只需一个下午,而不再是一个项目。实验不再被改动分析流程的负担所束缚。当调整成本足够低、问题容易修复时,实验就能保持敏捷;换句话说,科学也可以“快速行动、大胆试错”了。
同样的变化也发生在上一层的解读环节。过去要花几天搭建的交互式可视化仪表盘,现在几分钟就能搞定。

最显著的影响在于数据访问权限。过去,每个实验都要由计算人员分析,结果只能排队等待。如今,执行实验并掌握背景信息的科学家可以直接呈现结果,数据不再被禁锢在别人的 Python notebook 里。
软件现在也能表达观点
每一个软件界面都有它的立场。数据系统决定了哪些比较一键可达,哪些需要费力寻找。每个实验室都需要存储和展示数据的地方,而系统内置的观点最终会影响实验室能察觉到什么。
二十多年来,这种观点由他人制定:少数几家为实验室提供记录系统的软件供应商。它们为上千个实验室打造同一套系统,必然面向最大公约数设计。大家接受这种近似,因为自研系统的工作量超出任何实验室的承受范围。
但现在情况变了。内部构建的数据门户能包容那些商业产品未曾预料到的数据怪癖,复杂度恰好匹配团队需求,并随问题演进而扩展。浏览和探索变得简单轻松,进而改变行为模式。试想,如果每次查看下一条帖子都要切换标签页并复制粘贴,谁还会花多少时间在社交媒体上?那些散落在不同幻灯片里的模式开始浮出水面。
实施层面只需一天,但确定门户该做什么可能耗时数周。这些设计讨论至关重要,因为把功能压缩到单一屏幕上,会迫使团队明确哪些比较真正驱动其决策。购买软件平台,意味着你不仅外包了工程,还外包了如何实现目标这个问题的答案。
取舍是存在的:内部自研门户不够精致,也没有客服团队。拥有多层验证要求和合同义务的大型机构,依然难以照此模式跟进。但软件公司早已明白,最好的内部工具往往来自那些嵌入用户群体中的工程师。如今,每个研发团队都可以成为自己的前沿部署工程师。
旧规则是“能买就别造”。新规则是造出那些塑造你思考方式的工具。
专家级深度终于可规模化
选择攻克哪些疾病,是制药公司做出的最具决定性的判断。一切后续工作都由此决定,并为特定疾病的生物学特性和市场状况量身定做。这一选择实际上不可逆,单个成功项目需要约十年时间和十亿美元投入,因此决策过程需反复推敲。典型流程会召集一组内外部专家,花一个月或更长时间收集、整合并辩论科学与市场证据。
这套流程假设你已清楚要争辩的五种疾病是什么。因药品的独特机制,我司 Endura 当时没有这份短名单。我们在开发“胶囊版 CRISPR”:一种可以在家中服用的药物,它在特定的遗传信息上形成化学疤痕,从而关闭致病蛋白的生产。4 寻找这些药物,需要开发一种全新的 DNA 测序方法,一次性读取所有基因上的疤痕,让单次实验即可返回数百种疾病中的候选药物。不是从五种疾病出发,我们必须分诊整个疾病图谱。5
我们搭建了一套两阶段的筛选流程,派出一批 LLM research agent 来执行。第一阶段覆盖约 500 个疾病靶点,每个靶点生成相当于三页的报告,并基于几个基础问题进行筛选:这个疾病的患病率是否值得我们投入、现有药物是否已经解决了这个问题、我们的药物降低靶点后是否真能缓解病情。第二阶段针对剩下的约 100 个疾病靶点,每个生成相当于三十页的内容,深入梳理疾病生物学机制和竞争格局。我们给第二阶段写的 prompt 是让它扮演一个持怀疑态度的专家,而不是摘要工具:点名哪些项目失败了、各自失败的原因,以及我们需要什么条件才能在他们失败的地方成功。这种细节深度是必要的,因为和任何市场一样,明显优质的靶点早已人满为患。要站住脚,就得找到那个具体的疾病、以及我们的药物能做出现有方法做不到之事的那个具体理由。

在科研领域,最昂贵的错误往往来自那些未知的盲区。团队可能全力投入某个研究方向,直到数月后实验结果呈阴性才发现走错了。事实上,许多这类错误本来可以由专家一针见血地指出:这条技术路线前人已经试过、这个读数从未预测出有效结果,或者某家公司在特定患者群体中已折戟沉沙。能够大规模地获取这种专家级的深度洞察是变革性的,因为在科研中,尽早听到“不行”极具价值。
这只是入门阶段
上述功能均已在 Endura 平台实现——包括灵活动态的分析、单日构建的内部工具以及跨越 500 种疾病的搜索能力——但这只是导航能力的初学者版本。随着语言模型每一代迭代,我们习以为常的限制不断被打破。很快,我们将完全省去构建分析流程或数据仪表盘的步骤,科学家只需提出自己真正关心的问题,系统就会即时组装出回答该问题所需的分析与界面。软件不再是最终的交付物,而是围绕问题自然生成的工具。7
这种大规模的专业知识访问权限,使得以前根本无法想象的工作成为可能。一个典型的例子是老药新用:某些已在人体中验证安全的药物,可能作用于此前未被关注的疾病机制。已发表文献浩如烟海,其中正隐藏着许多有用的结论,却因没有任何人阅读过那组关键文献的组合而未被发现。但 AI 模型能够消化所有信息,在恰当的提示词引导下串联起分散的线索。目前,围绕这一愿景的生态系统正在迅速形成,各大制药公司和投资者也在各自运行不同的版本。8 未来尚待观察的是,这一趋势究竟会催生三种还是三百种新药。
导航型角色印证了一个事实:当下在科学领域迭代最快的 AI,并非那些专门用科学数据训练出来的模型,而是能帮助科学家或高管在每周周一早晨厘清哪些事值得优先做的工具。
Adrian Sanborn 是 Endura Therapeutics 的 CEO 与联合创始人。他是 Atomic AI 的创始成员之一,曾主导该平台的技术生物研发方向并制定了公司的治疗策略。他拥有斯坦福大学计算机科学博士学位,博士期间的大部分时间都在 Roger Kornberg 的生物化学实验室里度过。他在 X 上的账号是 @AdrianSanborn。
衷心感谢 Brandon Anderson、swyx 和 Lauren Richardson 审阅了本文草稿并提供了宝贵的反馈意见。
1在这篇博客还在打磨之际,这篇论文 发布了,其中探讨了“AI x 科学”的早期洞察。看到许多我们的观点也得到了实证观察的支持,我们感到十分振奋!
2这就是杰文斯悖论,得名于 1865 年的一项观察:蒸汽机效率的提升反而增加了煤炭消耗量,而非降低消耗。软件领域的版本则是:编写代码成本的每一次下降,都伴随着更多软件的诞生,而非工程师人数的减少。
3实际上,软件产品开发中也存在强调学习的流程,并借用了“实验”这一词汇。产品团队运行 A/B 测试、在功能开关后发布特性,并将每次发布视为关于用户需求的假设验证。
4大多数基因疗法药物,如 CRISPR,都是大分子,无法自行进入细胞。它们只能到达少数组织,而要将它们送达往往意味着需要输注、注射,或者对于脑部而言,需要通过椎管穿刺。相比之下,小分子药物以片剂形式存在,能自行在体内流动并可通过口服服用。当罗氏推出治疗脊髓性肌萎缩症的口服药物时,家庭们便逐渐从已经起效的注射型药物转向了这种口服药。
5大多数公司都有充分理由先聚焦某个治疗领域,这取决于其既有的科学专长、临床资源和业务优先级。而我们的方法可以先广泛撒网、找出最有前景的方向,再回头深耕。
6语言模型并不完美,在这个规模下部分报告会包含错误。不过这是可以接受的:第一轮筛选中的错误最多只是错过一个机会,而不是浪费时间在错误的方向上。
7按需生成的分析有一个尚未解决的问题:可复现性。如果某张图表背后的代码只是为回答某个问题临时拼凑的,其来源可信度就不如版本化的 pipeline。
8比如 Edison Scientific 的构建就接近这一理念,Metsera 背后的团队也利用其 AI Scientist 系统来生成新的公司创意。