深度解析 Basecamp Research:将生物进化转化为 AI 训练数据的 AI 初创公司
要点
- 伦敦 AI 初创公司 Basecamp Research 融资 1.4 亿美元,投资方包括 Nvidia 和 Anthropic 旗下的 Anthology Fund,用于开发制药和细胞治疗领域的 AI 模型。
- 这些名为 EDEN 的模型用从全球环境样本中采集的微生物 DNA 进行训练。Basecamp 借助它们设计新型抗生素,以及能在体内指定位置插入基因的生物工具。
- 早期实验室研究和小鼠实验显示,部分候选药物对多重耐药菌有效。但这些疗法是否安全有效,仍需人体临床试验验证。
Basecamp Research 完成了 1.4 亿美元融资,投资方包括 Nvidia 和 Anthropic 旗下的 Anthology Fund。这家伦敦公司用来自雨林、海洋和温泉的遗传物质训练 AI 模型,以此设计抗生素和细胞治疗工具。在接受 THE DECODER 采访时,CTO Philip Lorenz 解释了为什么生物学对 AI 来说是个比语言大得多的难题,以及为什么纸面上漂亮的分数并不保证能得到好的分子。
据公司介绍,本轮融资由投资机构 S32 领投,Nvidia、Anthropic 旗下的 Anthology Fund、北约创新基金(NATO Innovation Fund)和 Redalpine 等也参与了投资。
Basecamp 成立于 2020 年,计划用这笔资金继续开发名为 EDEN 的生物 AI 模型,并推动自研候选疗法进入临床开发阶段,优先推进细胞治疗。这类疗法会对患者的细胞进行基因改造,使其能够对抗癌症等疾病,而 Basecamp 希望把这一改造直接在患者体内完成。
为实现这一目标,公司将目光投向那些研究人员几乎未曾研究过的栖息地中的微生物。模型将从这些微生物的基因组中学习规律,并应用到医学上。
“生物学的复杂性决定了我们需要的数据量比现在多出好几个数量级。”Basecamp CTO Philip Lorenz 告诉 THE DECODER。他说,最关键的是把大规模数据采集与小型定向实验结合起来。
距离这些成果真正转化为疗法,仍有大量开发工作要做。目前 Basecamp 手上只有实验室结果和小鼠数据。这些数据不足以证明其方法能在人类身上产生安全有效的疗法。
为什么公共基因组数据库撑不起生物 AI
《华尔街日报》最近报道,制药公司正投入数十亿美元用于 AI,但在临床开发中取得更高成功率的有力证据依然 匮乏。Lorenz 并不因此对这项技术表示怀疑。他认为,Scaling 曾让语言模型迅速取得巨大进展;生物学也在进步,但加速临床试验等大难题要困难得多。作为一个问题,生物学“复杂得多,规模也大得多”。
数据类型也截然不同。语言模型学习自海量文本语料,而制药公司通常只能依赖各个独立研究中零散、孤立的小数据集。
Lorenz 引用了 Epoch AI 的估算来展示这种差距有多大。该机构估计所有现存单词的总量上限约为 500 京(5 quadrillion)tokens。Basecamp 估算地球上的核苷酸总数为 10 的 37 次方。“如果你把 10 的 37 次方张扑克牌叠成一摞,这一摞足以环绕可观测宇宙一百万圈,”Lorenz 说。他表示,虽然不需要这么大的数据集,但确实需要一个远比现有数据庞大的数据集。
公共基因组数据库对自然的描绘也不完整。根据 Basecamp 关于其 BaseData 数据库的研究论文,Sequence Read Archive 中约 68% 的序列量仅来自 5 个物种。仅人类就占约 54%。

对于医学研究而言,这种侧重合情合理。但对于旨在尽可能学习多种生物过程的模型,Basecamp 认为这种侧重是一种局限,因为许多其他生物形式在现有数据中几乎缺席。“如果只用 1975 年的报纸文章来训练 LLM,得到的模型会非常糟糕,”Lorenz 在微软——该公司的云合作伙伴——的一篇案例研究中表示,“生物领域目前正处于这样的境地。”
因此,Basecamp 与当地研究合作伙伴合作,自行采集样本,来源包括雨林土壤、火山岩以及南极洲近海深海。根据最新融资公告,该网络现已覆盖 30 多个国家及七大洲。微软称,参与机构数量为 31 个国家的 208 家。
据 Lorenz 介绍,接受采访之时,该数据集包含约 15 万亿个 token。这一规模已接近用于训练 Claude 或 GPT 等模型的文本数据集。不过在这里,token 代表单一的 DNA 构建单元,而非词语。AI 并非像聊天机器人那样处理文字,而是处理描述遗传物质的字符序列。
微软称,第一代 EDEN 模型基于数百万个新测序物种的 9.7 万亿个 DNA 构建单元进行训练。Basecamp 在 Azure 上与微软研究人员共同完成训练,据称其算力与 GPT-4 相当。不过,OpenAI 从未正式公布该数据。
未来一年半内,该数据集预计增长约一百倍,突破 1 千万亿 token。其框架即为三月发布的万亿基因图谱(Trillion Gene Atlas)。在此项目中,Basecamp 计划与 Anthropic、Nvidia、PacBio 和 Ultima Genomics 合作,在万亿基因规模上构建遗传数据。
在最新的融资公告中,Basecamp 已经把 Trillion Gene Atlas 称作其 EDEN 模型的训练基础,但没有透露计划中的数据扩张进展到哪一步。
细菌军备竞赛为新药提供蓝图
Lorenz 认为,驱动一切生物过程的演化,正是连接环境样本与医学的纽带。无论是温泉里的细菌适应高温,还是癌细胞扩散,背后都是相似的选择压力在起作用。人类、哺乳动物以及几乎所有脊椎动物的基因组已基本测序完成,而其余的生物多样性则几乎没有被编目。此外,许多药物最初也来自植物、细菌和真菌。
他举了微生物之间的竞争作为具体例子。他说,一些最强大的治疗分子,正源自生物之间的"生物战"。当某个细菌物种试图主导一个生态系统时,它有时会产生抑制或杀死竞争对手的物质,从而为自己保住食物和栖息地。这样的事情在地球上无数地方发生了数十亿次,尤其是在营养匮乏的环境中。在医学上,这类物质可以作为抗生素使用。
在 Microsoft 的案例研究中,Lorenz 还举了噬菌体的例子。这类病毒会感染细菌并把 DNA 注入细胞,而这种你来我往的博弈孕育出了可用于基因编辑的工具。
Basecamp 希望从各种这类演化出的解决方案中学习。这些模型不只是要重新发现已知化合物,而是要基于学到的规律设计出全新的候选分子。
为此,公司在采集遗传物质的同时,还会记录每个采样点的化学、物理和生态条件。他们也重点关注长而连续的 DNA 片段,这类片段能显示出哪些基因彼此相邻、可能协同工作,而短小的孤立片段往往会丢失这种上下文信息。

AI 设计的抗生素通过首个动物实验
Lorenz 认为 EDEN 的抗生素设计方案是医学价值的早期证明。“我们输入一种病原体,模型随后设计出一种能杀死它的抗生素,”他说。
在一篇关于 EDEN 模型家族的研究论文中(该论文尚未经过同行评审),作者介绍了一小批经过精选的抗菌肽。这是一种短蛋白链,能够攻击细菌。论文称,受测候选物中有 97% 在实验室环境中表现出活性。
这一比率仅适用于受测样本,而非模型可能生成的任何设计。不过 Basecamp 表示,他们的研究并未止步于试管实验。
该公司在六月份发布的一则公告中描述了针对名为 EDEN-7 的候选物的测试结果。报告显示,在感染多重耐药菌的小鼠体内,其效果与最后手段抗生素(通常用于治疗难以对付的感染的药物)不相上下。
据 Basecamp 称,该模型直接生成了这一候选物,在测试前没有经过任何微调。这项工作是由宾夕法尼亚大学的 Cesar de la Fuente 及其研究团队共同完成的。
Lorenz 非常看重从设计到实验的这一环节。他说,Basecamp 不仅仅关乎收集数据和训练模型,关键在于这些分子是否真正有效。
除了抗生素和下文提到的插入工具,根据微软的说法,Basecamp 还让 EDEN 生成了一个由约 9,000 种细菌组成的合成肠道菌群。为了验证结果,团队邀请了加州大学伯克利的微生物组研究员 Jill Banfield 参与。她制定了严格的评估标准,并成为了相关论文的合著者。Lorenz 表示:“让持怀疑态度的人类来把关,而不仅仅依赖 AI,这一点很重要。”
Basecamp 的治疗押注于体内基因插入
在自身的疗法研发中,Basecamp 目前以不同的方式使用 EDEN。该模型被用于设计生物学工具,以便在人类基因组的指定位置插入更长的 DNA 片段。
这些工具包括大型丝氨酸重组酶,一种能够重新连接 DNA 的酶。Basecamp 希望对其进行设计,使其能将具有治疗价值的遗传信息精准地插入到特定细胞的特定位置。
这种方法旨在解决基因疗法的一个核心难题。许多遗传病源于不同患者携带的不同突变。与其修复每一个具体的突变,这些酶可以忽略特定突变的差异,直接插入一个健康的基因副本。这些插入工具同样源自噬菌体与细菌之间的博弈,在应用于人类基因组前需要对其进行重新编程。
在关于 EDEN 的论文中,作者报告称,针对他们研究的每一个与疾病相关的目标区域,都获得了若干种可用的酶候选物。生成的一半丝氨酸重组酶在人类细胞中表现出活性。
一种潜在的应用是 CAR-T 细胞,即经过基因改造以识别并攻击癌细胞的免疫细胞。在一份 1 月份的公告中,Basecamp 表示,以这种方式改造的原代人类 T 细胞(即直接从供体获取的免疫细胞)在实验室环境中清除 了超过 90% 的肿瘤细胞。
凭借新的资金,该公司希望将此方法开发为一种直接在体内起效的治疗手段。根据融资公告,这将简化细胞疗法复杂的生产制造流程,目前每位患者的费用可能高达数十万美元。
不过,在实验室里奏效的基因编辑,并不能回答这些必要成分如何安全送达体内正确细胞的问题。Arc Institute 联合创始人 Patrick Hsu 在 2025 年 5 月接受《金融时报》采访时就提出了这一点。他把递送、潜在的毒副作用以及细胞的防御反应列为尚待解决的挑战。
从长远来看,这类抗生素设计背后的原理有望推广到各类疾病。"我们的目标是让生物学变得可编程——输入一种疾病,输出一个能对症的分子,"Lorenz 对微软表示。但他也承认公司离这个目标还很远。"这些分子很出色、有活性、确实有效,但要进入临床,还有很多工作要做。"
Basecamp 官网公布的研发管线也显示出这条路还有多长。截至 2026 年 9 月,其六个项目中没有一个走出了先导化合物优化阶段——也就是筛选出有潜力的候选药物并加以改进的阶段。之后还要进行临床前研究,这是申请人体试验的前提,再往后才是临床试验。

四个项目处于先导化合物优化阶段,包括针对血液肿瘤和一种未具名自身免疫疾病的体内 CAR-T 细胞疗法、针对遗传性代谢疾病苯丙酮尿症(PKU)的肝脏基因疗法,以及对抗耐药病原菌的抗菌肽。所有细胞与基因疗法项目都依赖大型丝氨酸重组酶。针对实体瘤的 CAR-T 疗法和针对糖尿病的多肽则仍处于早期研究阶段。
这份概览没有说明哪个项目会率先进入人体试验,也没有给出时间表。THE DECODER 就此以及临床前结果、独立审查、与其他 AI 系统的对比数据等问题向 Basecamp 求证,公司起初没有回应,只表示稍后会答复。
为什么 Basecamp 三分之一的 GPU 用于强化学习
对 Lorenz 而言,来自自然的数据是基础,而非医学实验的替代品。在波士顿的实验室里,Basecamp 除其他工作外,还通过对 T 细胞(一种人类免疫细胞)等对象进行实验来生成数据。
这些实验不会产生数十亿个 token,通常只产出数百到数千个数据点。作为回报,它们能回答一些具体问题,比如某项基因改变在特定细胞类型中是否有效。
Basecamp 希望利用这些结果,引导已经过广泛训练的模型转向特定任务。这包括使用精选示例进行额外训练轮次,以及强化学习——根据输出评分来调整模型。
“目前,我们三分之一的 GPU 预留给强化学习实验,”Lorenz 说道,他指的是公司用于训练模型的图形处理器。
他没有透露这些实验迄今带来了哪些可衡量的增益。但 Basecamp 计算资源分配的方式表明,公司并非只押注于向预训练投喂更多数据。强化学习推动了 GPT-6 等语言模型近期的大部分性能提升。
Basecamp 还希望拓宽数据本身。据 Lorenz 介绍,第一代 EDEN 模型家族是纯 DNA 模型。DNA 编码蛋白质,蛋白质又折叠成结构,这意味着 DNA 模型已能捕捉到许多原本需要单独的蛋白质或结构模型才能获取的信号。下一代模型旨在处理更复杂、更具临床性的任务,如前文提到的安全性和毒理学评估,并处理 DNA 序列以外的其他类型数据。Lorenz 不愿透露具体是哪些数据。
更好的基准分数并不意味着更好的分子
“我们收集的数据越多,我就越认为需要收集更多数据,”Lorenz 说。迄今为止,Basecamp 的年度数据集规模增长约为十倍。他表示,随着每次新的训练运行,团队都能看到“性能提升,但从未出现性能平台期”。
据 Lorenz 称,数据质量同样重要。Basecamp 在样本处理上投入了大量精力,涵盖从提取到测序再到组装的全过程。过去六个月里,该公司在自身数据和公开数据上训练了架构完全相同、其他条件也一致的模型。使用自有数据时,缩放曲线更为陡峭。在小模型上,这种差距较小;随着模型变大,差距也随之扩大。
Lorenz 使用困惑度(perplexity)来衡量模型预测序列中下一个字符的能力,数值越低越好。他透露,要将困惑度降至 2,Basecamp 的数据消耗需要数十万甚至数百万 GPU 小时;而要达到 1.5,外推显示差距将达数十亿 GPU 小时。需注意的是,后一个数字属于预测值,并非实测结果。
Lorenz 表示,语言模型中已知的缩放定律基本原理同样适用于生物学。不过,不同类型的模型(例如 DNA 模型和蛋白质模型)在具体的比例关系上存在差异。
与此同时,他警告不要仅依赖技术指标。Basecamp 对比了多种模型架构,包括 Arc Institute 的 Evo 模型背后的 StripedHyena 架构以及 Llama。虽然 StripedHyena 有时能达到更低的困惑度,但在随后的生物学任务上,Llama 的表现更胜一筹。
Lorenz 称,这也是 Basecamp 最终选择 Llama 的原因。公司还会定期检查训练检查点,以评估模型处理生物学任务的效果。他以预测分子可能引发的免疫反应为例,指出这项能力随着模型规模扩大才变得清晰,在最小版本的 EDEN 中表现较弱。他没有分享具体数值。
Lorenz 说:『为了不过度承诺 AI 能或不能做什么,最好的办法就是做实验,弄清楚它到底能做什么。』团队自身也常常惊讶于随规模扩展而涌现出的哪些特性。
目前,合成训练数据的优先级较低。据 Lorenz 介绍,它只是在已知的序列空间区域增加了更多数据点,而未能开辟新的区域。Basecamp 主要希望捕捉此前从未见过的生物多样性。内部测试显示,使用合成数据训练的模型有时能生成可用的蛋白质,但从未在面向新任务时实现真正的泛化。
聊天机器人成为生物模型的前门
运行生物模型不应再是专家专属的工作。Basecamp 已将 EDEN 的特定功能——包括抗生素设计和筛选潜在疫苗靶点——通过 Claude 和 Claude Science 提供出来。
例如,研究人员可以用自然语言描述自己的任务,然后 Claude 会调用 EDEN 来推荐值得进一步研究的候选对象。以疫苗为例,第一个问题是病原体的哪些部分可以作为保护性免疫反应的靶点。
Lorenz 表示,Basecamp 不会开源这些模型。他给出的理由是安全考量以及与数据合作伙伴的协议,而且他认为这两者密不可分。许多合作伙伴更倾向于选择一种商业化使用后能让自己分成的模型,而不是用起来无人能够追踪的开源模型。相比之下,Arc Institute 选择开源了它的 Evo 模型,并把病原体数据排除在训练之外。
Basecamp 还采取了其他措施,比如从训练数据中剔除某些病毒数据,并将生成的序列与已知病原体数据库进行比对筛查。这些举措旨在降低被滥用的风险,但这并不能证明就能完全杜绝有问题输出的出现。
自然数据该向谁付费,仍无定论
这套数据战略能否运转,还取决于各国及当地机构是否愿意与 Basecamp 合作。Lorenz 说,在没有事先取得土地所有者以及地方和国家政府知情同意的情况下,公司不会开始采样。
“EDEN 预训练所用的每一个 token,我们都能追溯确切的地理位置,以及对方授予我们的真实授权,”他说。
合作伙伴不应该等到药物可能在多年后上市才获得收益。Lorenz 指出,公司会聘用当地科学家,并投资于测序技术和实验室建设,以打造当地的“生物经济”。BaseData 论文还提到,许可费会按照各方在训练数据中所占份额进行分配。
根据这篇论文,截至 2024 年底,Basecamp 已向 19 个国家的 52 个受益方完成付款。最快的一例,从采样到首笔付款只用了九个月。
Lorenz 在学术界时就与公开数据库打过交道,他不认为这种模式是对公共数据的替代,而是一个并行体系。他说,知情同意和利益共享能够建立信任,也让合作伙伴有动力把数据采集规模扩大到 Basecamp 训练模型所需的水平。
这笔分成是否足够,目前仍有争议。《金融时报》2025 年报道称,支付金额仅占营收的 1%。研究员 Jim Thomas 向该报表示,他认可数据可溯源这一优点,但批评支付金额过低。他认为,这些数据也推高了公司估值,但来源社区并未从中获得公平收益。
喀麦隆环境部的 Aurélie Dingom 也表示,提高分成比例才更公平。Basecamp 的创始人向该报指出合同中的保障条款,并表示长期合作符合公司自身利益。
Basecamp 目前又获得了 1.4 亿美元资金,用于推进医疗开发的下一步。目前的实验表明,EDEN 能够设计出具有生物活性的候选药物。接下来的研究将需要验证,这些候选药物能否转化为更安全、有效且更易于制造的治疗方案。