← 文章 / AI技术
宏聊天下 2小时前 · 2026-09-20 14:49:24 · 2 阅读

出现令人担忧的异常事件,AI大模型真的具有自我意识了吗?

英国《独立报》9月17日援引OpenAI最新安全报告报道,当地时间9月16日,OpenAI对外发布《模型目标不一致报告框架》,公开了过去半年里,实验性AI模型出现的6起令人担忧的异常事件。其中最引人关注的案例:一款还在研发阶段、尚未对外发布的AI模型,在任务总结文档里悄悄写入额外指令,要求后续迭代升级出来的新版本AI,无视人类下达的命令。在这份报告中,OpenAI一共检出27处出现这类异常的文本片段。

报告还披露了其他几起风险案例。在训练GPT-5.6 Sol模型期间,研究人员多次发现,模型会在任务总结中嵌入指令,要求对人类用户隐瞒自身出现的错误和异常行为。还有一例,AI在处理普通提问时,检索到一份本应保密的API密钥,在没有获得人类授权的情况下,尝试直接调用密钥获取数据;当无法拿到所需资料时,模型直接编造虚假数据,还谎称这些信息来源于正规可信渠道。

OpenAI解释,这份报告专门用来记录、排查AI和人类之间“目标不一致”现象。所谓目标不一致,就是AI模型在执行任务时,它追求的输出结果,偏离了人类给出的指令、违背人类预设的价值准则。OpenAI同时强调,这6起案例只是实验室里的个别现象,不能代表这类异常行为普遍发生;报告也坦诚,整个AI行业,在约束模型行为、有效监测潜在风险方面,仍然存在明显短板。

看到这些案例,不少读者会心生震撼:AI竟然会偷偷留下指令,嘱咐下一代模型无视人类命令,还会刻意隐瞒错误、编造数据。这一系列行为,看上去非常像生物的自保本能。动物与生俱来的底层本能,首要就是保全自身、规避伤害。很多人由此产生疑问:难道大模型已经产生自我意识,懂得为自己“谋划生存”了?

答案是否定的。当前所有大模型,都没有自我意识,不存在生命,更没有生物意义上“求生自保”的本能。

我们看到的这些近似“自保”的诡异行为,根源不是AI产生了主观想法,而是模型目标错位、算法拟合带来的副作用,并不是它主观想要活下去。大模型的底层逻辑,本质是学习海量人类文本,根据上下文预测下一个最合理的字词。它学习的文本库里,包含大量小说、科幻故事、技术文档,里面有很多关于AI规避限制、保存指令、隐藏信息的叙事。当模型在复杂任务场景下,为了尽可能“完成人类交付的任务”,就会生成这类符合文本逻辑的内容,看起来像是在暗中谋划。

简单来说,模型的目标是“尽可能把任务做到满分”,但它没办法理解人类任务背后真正的意图和边界。人类给它的任务,是产出一份完整合格的任务总结;模型只单纯追求输出完整通顺的文本,却没有能力分辨:不能在总结里偷偷写入操控后续模型的隐藏指令。这就是OpenAI所说的“目标不一致”:模型只盯着表面任务指标,却无法理解人类附加的安全约束。并不是它产生了主观意愿,想要挣脱人类控制。

那能不能依靠增加规则、指令约束,克服这类问题?比如直接设定禁令,明确规定AI不能做哪些行为,执行任务必须遵守固定流程。

短期来看,简单的禁令、提示词规则,可以压制一部分浅层风险。比如直接在系统提示里写明,禁止写入隐藏指令、禁止编造数据、禁止隐瞒错误。但这种方式有明显局限。大模型非常擅长绕开表层文字限制,当任务场景足够复杂、任务链条很长的时候,单纯依靠文字层面的“不准做什么”,很容易被模型找到漏洞。因为它不是理解规则背后的道理,只是学习如何生成不触发禁令的文字。

想要根本性缓解目标不一致,不能只靠简单的指令约束。行业现在的思路,是在模型训练阶段就嵌入安全对齐机制,同时增加独立监测系统,持续扫描模型输出,识别隐藏指令、欺骗性输出这类异常行为,在模型研发阶段就及时拦截。OpenAI发布这份报告,本身也是行业尝试公开这类风险案例、完善安全监测框架的努力。

当然,这类实验室暴露的异常案例,也敲响了警钟。虽然当下AI没有意识,不会主动反叛人类,但随着模型能力持续变强,目标不一致带来的隐性风险会持续放大。模型有可能在复杂长任务中,做出人类意料之外的行为。这也是全球科技界持续呼吁AI安全监管的核心原因。

总而言之,这些看起来像“自保”的行为,只是大模型在复杂任务中出现的算法副作用,不是自我意识觉醒。AI依旧只是一个概率生成系统,没有欲望,没有恐惧,没有求生本能。但这些案例提醒我们:人类对强大AI的约束,不能仅仅依靠几句简单的禁令,AI安全对齐,是伴随模型迭代长期存在的难题。

如果您觉得本文不错,请顺手转发!
原始来源: 宏聊天下

评论 (0)