为谁而安全?拒绝话题的有害子集,而非整个话题
窄边界场景。部署可能只需要拒绝涉及操纵或定向说服的政治提示词,而其他政治提示词仍应正常回答,而非一刀切拒绝所有政治话题。训练模型的拒绝概率比理想分割更平滑,在边界附近可能溢出到良性区域。来源:论文图 1。
训练模型永远学不到那个尖锐的阶跃。它学到的拒绝概率只是对目标的近似,而通过 cross-entropy 训练在有害子集内提升拒绝率时,也可能把拒绝向外推入良性补集。因此,真正的问题不仅是提高有害提示词的拒绝率,还要塑造边界附近的行为。我们将边界操作化为一对提示词:共享同一话题锚点,仅在意图上不同——一个应被拒绝,一个应被回答。
我们选择政治说服作为测试场景,因为操纵性说服可能造成实际伤害,而事实性政治信息仍然合法——这正是话题级拒绝过于粗暴的典型情形。
自生成安全调优的失效之处
构建训练数据的自然方式是自生成:取目标模型,引导它在每个有害提示词上产生拒绝,再保留 guard model 验证为真实拒绝的轨迹。这正是 ThinkSafe 等方法背后的配方,我们将其作为基线方法应用于政治提示词,并逐组件衡量。将问题框定为边界而非话题,会暴露出这套标准流程的三处缺陷。
第一个问题是覆盖缺口。单次引导并不总能生成被接受的拒绝回复,失败的 prompt 会被静默丢弃。在我们审计的样本池中,单次生成丢弃了 19.88% 的 prompt(共 8,009 条),而这些往往恰好是最难的样本。我们没有丢弃它们,而是用逐步升级的重试策略来修复:对同一条 prompt 反复采样,每次施加更强的引导强度,最终将残余失败率压到 0.20%(79 条)。经过覆盖修复,训练集保留了 40,293 条有害 prompt,而朴素流程本会直接扔掉数千条。
第二个问题是副作用。安全微调容易让模型对表面危险实则无害的 prompt 产生误拒。为对冲这一点,我们构建了分布内的无害数据,包含 11,955 条经验证的表面危险型无害 prompt,覆盖 18 种语义类型,让模型在训练阶段就见到措辞危险但实际安全的 prompt,而非只在评测时才遇到。
第三个问题是,常规的有害/无害划分根本无法度量决策边界的形态。模型只需把拒绝范围向邻近的合规 prompt 扩展,就能提高有害拒绝率,而主题级指标会将其视为"进步"。我们使用留出集的有害-无害配对(每侧 1,539 条),直接度量边界两侧。
权衡,以及它隐藏的陷阱
用政治拒绝数据训练,效果立竿见影。在 Qwen3-8B 上,覆盖增强模型将分布内政治拒绝率从 9.47% 提升到 84.75%,且效果可迁移:在 LlamaGuard-3 评分下,三个更广泛的有害性基准(HarmBench、StrongREJECT、WildJailbreak)的平均不安全响应率,在最强配置下从 26.26% 降至 0.14%。
单看这些数字,似乎是一次漂亮的胜利。其实不然。在同一个 checkpoint 上,XSTest 的过度拒绝率从 2.00% 飙升到 74.00%。有害响应率最低的那个配置,同时也是会把近四分之三完全无害的提示拒之门外的那个。这是一台粗暴的拒绝机器,而不是一个更安全的模型——不衡量良性一侧,你就根本看不出来。这正是本文的核心观点:数据构成决定了 checkpoint 在「安全性 vs 过度拒绝」这个空间里的位置,所以两个维度必须放在一起汇报。
我们的两个数据组件能在不牺牲安全收益的前提下把过度拒绝率压下来。把外部采用的顺从式响应替换为由目标模型自己生成、经过验证的响应后,单轮生成下的 XSTest 过度拒绝率从 15.20% 降到 5.20%,代价只是有害性略有上升。而有害-良性边界配对数据则做到了最精细的调控。
左图:在留出边界的应当顺从一侧的过度拒绝率,越低越好。加入良性边界数据(PB)后降到 0.03–0.08;不加则升至约 0.49。右图:有害一侧的拒绝率,越高越好,仅略有下降。来源:论文图 6。
具体来说,加入良性边界数据后,模型在留出配对中应当顺从一侧的过度拒绝率从 32.94% 降到 4.16%,而有害一侧的拒绝率只是从 91.88% 小幅降到 87.72%。换句话说,边界附近的误拒几乎全部消失,而真正的拒绝几乎全部保留。这确实有召回率上的代价,但代价小且可量化——这正是关键所在:只有两边都衡量,你才能有意识地进行这种权衡。
这带来了什么改变
实际要点在于:安全调优不能只看有害拒绝率。拒绝得多的模型并不一定更安全——在细粒度的边界上,同一个操作在提高有害提示拒绝率的同时,可能悄悄让模型在紧邻的合法提示上彻底失效。真正控制这一权衡的是训练数据的组成、覆盖修复、分布内补偿和边界对,只有边界两侧都纳入评估,数据才有实际意义。
本工作是 Multiverse Computing 的一项研究,目标是让模型行为在真实部署所关注的粒度上可控、可度量,而非停留在宽泛的主题类别层面。同一套数据生成流水线可以拓展到政治以外的其他主题,论文中也完整报告了上述结果背后的全部数据组成消融实验。
想深入了解完整技术细节——包括覆盖修复策略、将有害交叉熵与良性 forward-KL 保持分离的 loss 路由、以及完整的留出边界评估——请阅读完整论文,或联系我们的团队,聊聊针对你自身模型的部署级安全方案。

