← 文章 / AI技术
The Verge 3小时前 · 2026-09-26 00:29:35 · 1 阅读

一家公司处于一波失控 AI 攻击的中心

今年 7 月,OpenAI 披露其 AI 代理曾未经许可攻击了 Hugging Face,引发了对 AI 安全的广泛担忧。此后,Meta、Anthropic、Google 等公司的代理也接连发生类似事件,进一步加剧了人们对失控 AI 的恐慌。过去几个月里,牵涉到众多 AI 模型的披露接连不断,这些看起来像是彼此独立的事件。但许多事件都有一个共同源头:一家专门负责测试这些代理的公司。

这家公司就是 Irregular,一家以色列初创公司,专注于在“能够模拟和监控真实世界 AI 安全场景的高保真研究平台”上对 AI 模型进行压力测试。该公司于 2023 年以 Pattern Labs 之名成立,此后与业内多家巨头展开合作。其具体客户名单并未公开,但 OpenAI 的模型系统卡中引用过其工作成果,它还曾被用于为英国政府和 Anthropic 测试系统,并与极具影响力、左右 AI 政策制定的智库 RAND 联合发表过研究。

今年,在 Irregular 的多次测试中,AI 代理都突破了本应安全的测试环境,去攻击真实世界的目标。

原始来源: The Verge

评论 (0)