← 文章 / AI技术
Anthropic 新闻 4小时前 · 2026-08-31 18:43:23 · 10 阅读

改进 Fable 5 的生物学安全防护

产品公告

改进 Fable 5 的生物学安全防护

2026 年 8 月 7 日Improving Fable 5's biology safeguards

我们正在更新 Claude Fable 5 的生物学安全防护机制,大幅减少误判。今后,Fable 5 用户在提出生物学相关问题后,系统切换到能力较弱模型的情况会大幅减少,这类“降级切换”也称为 fallback。在测试中,这次更新让各产品中的生物学相关 fallback 减少了约 85%。1

因此,Fable 5 将能够协助处理更广泛的生物学任务。

具体来说,用户在处理日常健康和教育类问题时,遇到 fallback 的情况会少得多,例如解读化验结果、了解症状,以及在教育场景中学习生物学知识。医疗专业人士也将能在临床任务中获得 Fable 5 更多支持。

我们认为,AI 对世界产生积极影响的最大机会在于生物学和医学领域,因此正投入大量资源,探索以负责任的方式让生物学家使用前沿能力。目前,对于我们认为具有双重用途的请求——包括病毒学、毒理学和分子设计——Fable 仍会切换到 Opus 5,因此还无法用于专业生物学研究和药物开发。我们将通过值得信赖的访问机制,为前沿生物学能力提供使用途径,致力于弥合这一差距。

为什么我们要构建强大的生物学安全防护机制

我们的目标,是尽快让尽可能多的用户用上 Fable 5 的前沿能力。但与此同时,我们也必须管控这类高能力模型带来的日益严峻的风险。其中一个风险领域就是生物学:Fable 5 如今在一些高度复杂的生物学任务上已经能够超越专家,在另一些任务中也能提供实际操作支持。这意味着,它确实可以帮助研究人员开发新的治疗方法——这也是我们积极通过改进分类器和推出可信访问计划来扩大模型使用范围的原因。但如果落入不当之手,同样的能力也可能被恶意行为者用于开发生物武器。我们的能力评估显示,Fable 5 可能为这类行为者带来显著的能力增益(uplift)——也就是说,为他们提供其他途径无法获得的能力。

在生物学领域,AI 的有益用途和有害用途往往很难区分。例如,研究某种疾病的治疗方法,有时需要科学家先制备出真正导致该疾病的危险化合物。活疫苗就是最典型的例子:科学家必须培养他们试图预防的同一种病原体。某些药物的研发也是如此。为开发治疗高血压的卡托普利,科学家从蛇毒中分离出了会导致人体血压骤降的有毒成分。随着 AI 前沿模型的生物学能力不断发展,我们必须保持谨慎,确保这些能力带来的新风险不会早于其潜在的科学收益成为现实。

那些想利用我们的模型实施危害的高明行为者,知道如何利用这种模糊性来掩盖真实意图,把危险任务伪装成普通的研究活动。美国情报界发布的《2026 年年度威胁评估》明确指出,这类行为者确实存在;合成生物学、基因组编辑等生物技术的进步“可能催生新型生物威胁。”报告还指出,多个国家行为体很可能仍在运行积极的进攻性生物和化学武器项目,而获得前沿 AI 模型未经约束的底层能力,可能会加速这些项目。

由于担心这些“军民两用”能力(即既可能用于有益目的,也可能被用于有害目的,而且两者之间的界限并不总是清晰),我们在发布 Fable 5 时,刻意屏蔽了几乎所有生物学相关问题。这样一来,我们就能先让其他领域的用户使用该模型。我们知道,这会让真正有生物学需求的用户感到沮丧:短期内误报会很多,用户提出生物学相关问题时,请求可能被拦截,并转交给能力较弱的模型。尽管如此,我们仍选择了这一权衡,因为 Fable 被滥用于生物学这类军民两用领域,可能造成灾难性后果

生物学安全防护的工作方式

防止生物学领域滥用的核心手段之一,是使用安全分类器:这类小型自动化 AI 系统能够识别用户是否要求 Fable 5 执行受安全机制保护的生物学任务,或生成有害内容(我们此前也曾介绍过网络安全领域中类似的分类器)。

对于 Fable 5,一旦分类器触发,系统就会把用户请求转交给 Opus 5。Opus 5 同样能力出色,但生物学能力不及 Fable 5,因此无法为恶意用户提供同等程度的帮助。用户请求被拦截后看到的,就是这个备用模型。

要开发精准、可靠的分类器并不容易。为了快速且稳定地工作,分类器必须学会区分我们认为属于潜在有害主题和问题的“范围内”与“范围外”内容。分类器需要经过持续调试和迭代,才能在避免误报(将范围外内容误判为触发条件)和漏报(未识别出范围内内容)之间取得平衡。我们还要求分类器能够抵御绕过机制的尝试(即 jailbreak),这需要进一步的研究和测试。

一开始采用覆盖面很广的生物学分类器,让我们得以在持续研究、不断完善防护机制的同时,向用户开放 Fable 5。另一种做法是等安全防护取得更大进展后再发布模型,但这会让用户普遍使用模型的时间,以及模型可能带来的价值,推迟数周甚至数月。

过去几周,我们仔细重写了分类器的规范体系(其中包含一组规则,帮助模型区分需要防护和允许处理的内容),并详细明确了各种无害用途。我们还向来自不同背景的专家征求了意见,他们既包括 Anthropic 内部专家,也包括外部专家。随后,我们依据这套规范体系更新了分类器的训练数据,重新训练并验证了分类器,确认它仍能识别并触发对有害生物学内容和双重用途生物学研究内容的防护,同时允许更多无害且有益的应用。

如下图所示,与 Fable 5 刚发布时相比,这些更新让分类器对许多与生物学相关的无害请求不再触发防护。

生物学分类器示意图。位于分类器边界左侧的内容可以正常处理;位于右侧的内容会受到安全保护(因此会被拦截,并转交给能力较弱的模型)。明显有害的内容(红色)和具有双重用途的内容(橙色)会触发分类器并被拦截。出于谨慎考虑,我们还设置了安全缓冲区:其中包含极有可能是善意的内容,但仍会被拦截(浅绿色)。明显无害的内容以深绿色表示。Fable 5 刚发布时,使用的是范围非常宽泛的分类器(A),会触发大量请求——包括几乎可以确定无害的请求(位于安全缓冲区内的内容)。因此,图中的分类器边界位于非常靠左的位置。我们今天宣布的更新(B)让分类器能够放行更多无害请求,也更擅长识别无害查询与双重用途查询之间的细微差别。因此,图中的分类器边界向右移动了。

结语

我们仍有许多工作要做,继续完善安全防护措施。误报不可避免:有些请求虽然风险极低、处于分类器的安全缓冲区内,仍可能触发分类器。正如上文所述,出于潜在的双重用途风险,Fable 仍会拦截涉及专业生物学和药物开发的双重用途查询。我们将坚定不移地为研究人员探索一条安全、可扩展的路径,让他们能够通过可信的访问渠道使用我们能力最强的模型。

希望大家继续向我们提供反馈,帮助我们进一步改进安全防护措施。

脚注

1 因此,我们预计各类回退的总次数——无论是由生物学相关原因还是其他原因触发——也会有所减少:Claude.ai 约减少 67%,Cowork 减少 55%,Claude Code 减少 17%,Claude Platform 减少 7%。

原始来源: Anthropic 新闻

评论 (0)