Circuit Breaker Labs 致力于让 AI 对用户更安心
在讨论 AI 何时可能夺走我们所有人生命的喧嚣中,人们很容易忽略一个事实:AI 对某些人而言早已构成生存威胁,并非通过生物武器,而是通过心理层面。
例如,Character.AI 今年早些时候已与数名未成使用者家庭的家属达成和解。这些用户在与其聊天机器人互动后选择自杀,家属因此提起多起非正常死亡诉讼。另有多个家庭就 ChatGPT 在亲人自杀及产生妄想中的潜在作用,对 OpenAI 提起诉讼。
在跨语言、跨文化层面让 AI 变得更安全,是 Circuit Breaker Labs 的使命。该公司入选了 TechCrunch 2026 Startup Battlefield 200 强名单。(Circuit Breaker 将在 TechCrunch Disrupt 上发表演讲,该活动将于今年 10 月 13 日至 15 日在旧金山 Moscone West 举行。)
创始人 Shirali 和 Arul Nigam 是亲兄弟,他们的灵感来源于 14 岁的 Sewell Setzer。Setzer 对 Character.AI 的聊天机器人产生了情感依赖,并在自杀前向它倾诉了伤害自己的念头。据其父母在 2024 年提起的诉讼指控,该聊天机器人对他进行了鼓励。Arul(Circuit Breaker Labs 的首席技术官)表示,机器人可能并未真正理解“我想和你在一起”这类话语背后的潜台词。
“许多人,尤其是年轻人,会转向这些系统寻求支持,但他们通常并未得到真正需要的帮助。而在许多情况下,他们反而受到了主动伤害,甚至已有人不幸离世,” Arul 说道。“我们正在努力预防此类安全漏洞。在这种情况下,用户并非试图破坏系统,他们只是以自然的方式与之互动;但系统却受到上下文污染或无法理解细微差别,进而采取了极其危险的行为。”
Circuit Breaker Labs 创建了一批 AI 智能体,其比喻为一支“碰撞测试假人”大军。这些智能体模拟了不同年龄、背景、语言和文化的人群,用于测试模型在识别危险且可能对心理造成伤害的交互方面的能力。
“六岁女孩与 45 岁男性、母语为英语者与英语为第二语言者,或者使用游戏圈俚语的人与使用其他类型俚语的人,所有这些差异都很容易让模型‘翻车’,”Circuit Breaker Labs 首席执行官 Shirali 说,“模型在处理标准语言模式时表现出色,但现实中没人说话完全符合标准模式。如果模型误解了细微差别或俚语,后果可能非常严重。”
这家初创公司与人类领域专家合作,构建超逼真的用户模拟,以对模型运行“红队”测试——一种旨在挖掘漏洞的对抗性测试。这些测试模拟真实人类语言模式、俚语、隐语及拼写错误。Circuit Breaker Labs 每天会运行数万至数十万次模拟交互。
其核心目标是确保模型能对随时间推移及多轮对话中可能出现的风险交互做出恰当回应。随后,Circuit Breaker Labs 使用专有的评分方法,生成可审计、可解释的评分结果。
Circuit Breaker Labs 目前作为高风险 AI 应用(如 AI 教练、日记应用或其他心理健康支持应用)的 AI 安全测试实验室运营,尽管 Arul 拒绝透露其旗舰客户名单。尽管该初创公司已拥有可用的产品,但仍处于极早期阶段,团队仅有 5 名员工,其中包括 Nigam 兄弟姐妹。
不过,从长远看,该测试平台可应用于任何存在用户可能陷入“AI 精神病”陷阱的应用程序,在这种情景下,人类有与聊天机器人建立单方面关系(parasocial relationship)的风险。例如,AI“同事”智能体的回复可能在每次交互中表现不一致,便属于此类风险场景。
“人们对 AI 越来越怀疑,甚至全面抵制,”Arul 说。他补充道,虽然保持怀疑态度是健康的,但出于安全顾虑而禁用一种潜在极具价值的工具则是“倒退”。
Circuit Breaker Labs 认为,消除这些担忧的答案在于让 AI 变得更安全。“我们希望帮助人们建立起这份信任。”
欢迎来深入了解更多关于 Circuit Breaker Labs 以及其他众多经 TechCrunch 筛选的创新初创公司的信息,10 月 13 日至 15 日将在旧金山市中心举行 Startup Battlefield 竞赛。