← 文章 / 行业与公司动态
Anthropic 新闻 4小时前 · 2026-09-07 08:32:04 · 0 阅读

Anthropic 启动 500 万美元资助计划,支持 AI 对用户幸福感影响的独立评估

资助更完善的 AI 对幸福感影响评估

2026 年 8 月 25 日Funding better evaluations of AI's impact on wellbeing

我们启动了一项 500 万美元的资助计划,用于支持独立研究,探讨 AI 如何影响用户的幸福感。该计划将为受资助者提供直接资金、模型访问权限以及技术支持,助力其构建开源评估工具,帮助 AI 行业衡量我们的模型对用户产生的影响。受资助者将保持完全独立的运作方式,并以其开源项目的形式发布研究成果,供任何开发者使用。

AI 系统已成为许多人工作、学习和解决问题的核心工具。它们还成为了对话伙伴,可以在困难时期成为情感支持的来源。然而,作为整个行业,我们仍在努力制定明确的标准,规范模型在这些对话中的行为,例如当用户开始从模型中寻求陪伴,或使用 AI 应对心理健康危机时。

此外,幸福感是一个特别难以评估的领域。对于大多数模型行为,我们可以通过查看单个回答来判断其是否准确和恰当。但评估幸福感需要更多的上下文。例如,处于痛苦中的用户可能不会立刻透露自残的念头;需要更谨慎回应的情况,往往只有在长篇对话的过程中才会逐渐显现。而且,在一个情境中看似合理的回答,在另一个情境中可能会造成伤害。例如,Claude 可能会就减肥为用户建议均衡的饮食和锻炼方案,但如果用户曾有饮食失调的历史,这样的回答可能就不太合适,甚至可能产生实际的伤害。

我们致力于开发防护措施,以识别此类对话并确保 Claude 做出恰当回应;同时发表研究,探讨用户与 Claude 交互的对话类型,从而更好地指导防护措施的构建与评估,以及保护用户福祉的其他举措。然而这些考量十分微妙,且影响重大,因此正确的方法需随着模型及其应用场景的不断演进而同步调整。

通过资助建立独立的用户福祉评估与基准测试,我们希望邀请更多人——包括临床医生、心理学家、方法学家及其他专家——投身这一新兴且至关重要的领域。

迈向更有效的福祉评估与基准

作为该项目的一部分,我们分享了安全防护团队认为哪些要素能使福祉评估具备足够的严谨性以作为基础,以及可能限制评估价值的常见挑战。

简言之,我们希望寻找符合以下条件的评估:

  • 明确说明测量目标(即何种情况算通过、何种算失败,以及其意义所在);
  • 在设计与验证阶段纳入临床及领域专家;
  • 同时测试保护措施与潜在危害(即评估过度遵从与过度拒绝的风险);
  • 反映用户的实际使用方式(通常需构建代表多轮对话的场景,因为风险会在长对话中逐步升级,语境也会发生变化);
  • 通过与真实领域专家比对来验证评分者的可靠性。

如需了解资助项目详情并提交申请,请填写申请表。有关构建高质量福祉评估与基准的更多信息,请参阅我们的指导文件。申请截止日期为 9 月 21 日;入选者将于 10 月 5 日前收到提交完整提案的通知。

原始来源: Anthropic 新闻

评论 (0)