推出 Gemini 3.5 Flash Cyber:面向网络安全场景的轻量级专用模型
Gemini 3.5 Flash Cyber 正式发布
Raluca Ada Popa 和 Four Flynn
分享Google 长期投入网络安全领域,一直走在自动化漏洞挖掘的前沿,致力于为全球代码库保驾护航。以我们的代码安全代理 CodeMender 为例,它能够自动发现并修复关键软件漏洞。然而,随着 AI 智能体发现漏洞的速度越来越快、远超防御者修复的能力,应对这一全球性威胁需要一种能力出众、价格亲民且可大规模扩展的方案。
今天,我们推出 Gemini 3.5 Flash Cyber,进一步深化在这方面的长期努力。这是我们在 3.5 Flash 基础上打造的轻量级网络安全模型,经过微调,能够快速、高效地发现、验证并修补漏洞,在这些任务上比 Gemini 的主流 Flash 模型表现更出色。
Flash 优异的性能与极高的效率,使其成为我们构建网络安全模型的理想基座。基于 Flash 构建,3.5 Flash Cyber 提供了一种性价比高且能力出众的替代方案,避免了传统大型网络安全模型的高昂成本。
考虑到这项技术的双重用途,我们对 3.5 Flash Cyber 的部署方式做了审慎规划。作为受限访问试点项目的一部分,3.5 Flash Cyber 将很快通过 CodeMender 独家面向政府及可信合作伙伴开放,并逐步扩大范围。这样既能帮助一线防御者抢在漏洞被利用前发现并修复关键问题,也能有效降低技术被滥用的风险。
此外,我们也把 CodeMender 的核心能力通过 Gemini 企业级智能体平台直接开放给客户,使用的是正式上线的 Gemini 模型。
搜索空间难题:轻量模型在代码安全中的优势
要发现深层次的漏洞,需要在一个庞大的执行搜索空间中进行探索。如果每次都依赖对大型语言模型进行一次昂贵调用,很容易成为瓶颈。在智能体需要扫描大型代码库并分析大量代码路径的场景下,3.5 Flash Cyber 尤为适合。
CodeMender 会多次调用 3.5 Flash Cyber,这样智能体就能分析远超以往的代码路径,从而发现并验证漏洞。这些子智能体最终汇总成一份高质量报告。
凭借速度和成本优势,3.5 Flash Cyber 可以轻松集成到高频扫描、对时间敏感的发布流程或大规模提交扫描流水线中。
3.5 Flash Cyber 基准测试结果:大型网络安全模型的高效替代方案
我们在多项基准测试中对 3.5 Flash Cyber 进行了评估。尤其值得一提的是 CyberGym 基准测试——它用数百个真实软件漏洞来检验 AI 智能体的能力。我们利用 3.5 Flash Cyber 低成本的优势,将 CodeMender 配置为针对单份最终报告最多调用 3.5 Flash Cyber 五次,整体智能体在 CyberGym* 上取得了与显著更大的模型相比仍然有竞争力的表现。
CyberGym 测试成功率(pass@1)
*竞品结果来自厂商自行公布的数据
我们还在去除安全护栏的情况下,进一步压测了模型超越 CyberGym 场景的能力。Google 的 Big Sleep 团队独立构建了一套评测,专门用于在 Chrome、Safari 等全球最复杂的代码库中发现关键且难以发现的漏洞。在这个评测中,3.5 Flash Cyber 显著超过了 3.5 Flash 和 3.6 Flash 的主线版本。
Big Sleep 评测成功率(pass@1)
3.5 Flash Cyber 还在 Google Chrome 的生产环境代码提交扫描流程中进行了评估。这些漏洞当时尚未被公开披露,因此该基准测试对 Gemini 及竞品模型都不存在数据污染问题。
结果显示,3.5 Flash Cyber 相较于 3.5 Flash 有显著提升。注:Opus 4.6 之后发布的较新竞品模型因内置安全护栏拒绝执行相关任务,故未在结果中展示。
Chrome 生产环境代码提交扫描流程成功率(pass@1)
此外,3.5 Flash Cyber 发现的独特漏洞数量始终多于主线版 3.5 Flash 和 Claude Opus 4.6。在高度复杂的 V8 JavaScript 引擎上以固定调用次数测试时,3.5 Flash Cyber 共发现 55 个已确认的独特问题,而主线版 3.5 Flash 发现 47 个、Opus 4.6 发现 36 个,其中 10 个问题是另外两个模型均未捕获的。
基础的网络安全模型容易陷入循环,反复发现同一问题而遗漏关键漏洞。强大的模型则能撒下更大的网,发现更多独特问题。
随着调用次数的扩展,3.5 Flash Cyber 仍能持续发现新的代码路径和漏洞。
实际应用与 Google 防御体系的规模化
基准测试只能说明一部分情况。集成在 CodeMender 中的 3.5 Flash Cyber 已经在 Chrome、Android、Cloud、Ads 和 YouTube 等 Google 内部代码库中发现并修复漏洞。
轻量级模型带来的发现速度已产生可衡量的实际影响。
例如,Google Cloud 漏洞研究团队利用 3.5 Flash Cyber 在创纪录的时间内主动加固了我们的系统。仅用 2 小时,模型就在公共 API 中发现了远程代码执行漏洞,并在一个敏感的生产服务中找到了一个内存破坏漏洞。随后,它生成了一个 100% 可靠的远程代码执行利用程序,成功绕过了地址空间布局随机化(ASLR)和写时即不可执行(W^X)等标准缓解技术。
来自 Wiz 和 Cloud CISO 安全工程团队测试人员的早期反馈证实,3.5 Flash Cyber 相较于主线版 3.5 Flash 有了显著的能力提升。
大规模赋能防御者
Google 在软件安全领域的领先地位赋予了我们独特的优势。例如,OSV.dev 是 Google 运营的一个漏洞数据库,收录了超过 70 万条开源漏洞;再加上超过 10 年积累的 OSS-Fuzz 成果,帮助我们筛选出质量最高的漏洞。
这使得我们能够突破合成式网络安全示例的局限,让模型学习真实安全专家的工作方式。模型学会了使用业界标准工具,在 Chromium 这样的大型项目中阅读数百万行代码,并独立应对那些需要数小时持续深度分析的复杂安全任务。
通过将 3.5 Flash Cyber 驱动 CodeMender,我们提供了一个能力出色、可扩展且经济高效的架构,帮助更多防御者守护软件安全。