← 文章 / AI技术
DeepMind 博客 5小时前 · 2026-08-28 18:11:50 · 3 阅读

开展全球首个双盲 AI 评估试点

A translucent blue-green cube with keyholes and a padlock symbol, with glowing yellow and green light beams passing through it.

借助具备密码学安全性的环境,提升专有模型基准测试的可信度

想象一名学生即将参加一场重要考试。如果他提前偷看了试题,之后取得满分也会受到这份“先验知识”的影响,成绩便失去了意义。要真正评估他的知识水平,就必须确保他在考试开始前完全看不到试题。这正是整个行业在评估先进 AI 模型时面临的难题。如果模型已经见过测试题——这类问题被称为基准污染(benchmark contamination)——那么评估结果的可信度就会大打折扣。

今天,我们宣布开展全球首个针对专有前沿级 AI 模型的双盲评估。外部评估会被限制在一个具备密码学安全性的“盒子”中,模型无法在测试前获取这些评估内容并据此优化表现。我们将与新加坡 AI 安全研究院、OpenMined、AVERI 以及 MLCommons 合作,在保护隐私的环境中,使用保密基准测试 Gemini Flash Lite 模型,从而提升评估的完整性。

在 Google,我们会在模型开发和部署的整个过程中,通过广泛的评估来检验 AI 系统,但不会只依赖内部测试。为了发现潜在的盲点,我们与多元化的外部合作伙伴携手,包括专业研究实验室、民间社会组织,以及各国 AI 安全与安保研究院(AISI)。借助他们的独特专长,我们对模型进行压力测试。

随着 AI 模型能力不断提升,确保模型事先没有见过测试问题或提示词至关重要,否则评估结果可能失真。政策制定者、研究人员和企业都需要相信,AI 基准测试能够准确反映模型的真实能力与安全性。但如果模型能提前“偷看”评估题目,就可能人为抬高分数,削弱各方对评估结果的信任。

长期以来,无日志记录协议和严格的合同保障措施一直在保护外部测试提示词的机密性。如今,进一步引入技术和密码学防护,为安全开展模型评估迈出了重要一步。

双盲评估如何运作

An architectural diagram illustrating a 7-step secure evaluation workflow between an "AI Owner" and an "Evaluator" using a secure "GPU Enclave."An architectural diagram illustrating a 7-step secure evaluation workflow between an "AI Owner" and an "Evaluator" using a secure "GPU Enclave."

过去,高风险外部评估往往需要在两种风险之间做出取舍:要么评估方交出测试提示词,承担模型提供方提前看到测试题目的风险;要么模型提供方交出模型权重,承担知识产权泄露的风险。

双盲评估消除了这种两难。借助 Google Cloud 机密计算产品体系中的 Confidential Space,我们可以通过密码学手段验证:外部评估数据和专有模型始终仅对各自所有者可见。评估方无法看到 Gemini 的模型权重,Google 也无法看到评估方的测试提示词。

建立模型评估信任的新方法

这些加密证据有助于防止基准测试污染,并保护敏感数据。随着模型能力不断提升,这一点对于网络安全评测、政府机构使用的评测等高度敏感的场景尤为重要。双盲评测让独立机构能够在不牺牲数据主权和安全性的前提下,严格测试先进模型。

我们希望,这项试点能为模型监督开辟新方向,助力整个行业构建更安全、更可靠、也更值得广泛信赖的 AI 系统。有关我们的方法和研究结果,请参阅技术报告

原始来源: DeepMind 博客

评论 (0)