Anthropic 启动 500 万美元 AI 福祉研究资助计划
Anthropic 正在资助独立研究人员,以构建关于 AI 如何影响用户福祉的开源评估。本课程解释了这项 500 万美元计划资助的内容,为什么福祉评估异常困难,以及这对于您今天在敏感对话中使用 Claude 意味着什么。
2026 年 8 月 25 日,Anthropic 宣布了一项 500 万美元的资助计划,用于资助独立研究 AI 系统如何影响使用者的福祉。受资助者将获得直接资金、访问 Anthropic 模型以及技术支持。所有工作都必须以开源评估的形式发布——可供任何 AI 开发者使用,而不仅仅是 Anthropic。
申请截止日期为 2026 年 9 月 21 日。入选申请人将于 2026 年 10 月 5 日收到通知。
该计划特别寻求临床医生、心理学家、方法学家和其他主题专家——而不仅仅是 AI 工程师。
为什么福祉比准确性更难评估
对于大多数 Claude 行为,一个回应就能告诉您需要知道的信息。答案要么正确,要么不正确。
福祉并非如此。Anthropic 的公告提到了两个具体例子:
处于困境中的用户可能不会在他们的第一条消息中提及自残念头。风险只有在长时间的对话中才会显现。
关于饮食和锻炼的建议在大多数情况下是合理的。但如果用户有饮食失调史,同样的建议可能会造成积极的伤害。
同一个回应在一个情境中可能是正确的,而在另一个情境中可能是错误的。这使得标准的单轮基准——大多数 AI 评估所使用的那种——不足以用于此领域。
Anthropic 希望从资助评估中获得什么
Anthropic 的 Safeguards 团队发布了五个标准,用于衡量他们认为足够严谨的评估:
明确的通过/失败标准——评估准确说明了它正在衡量什么以及为什么它很重要。
专家参与——临床医生、心理学家和方法学家帮助设计和验证它。
两种失败模式都经过测试——不仅是过度顺从(Claude 在不应该协助时协助),还有过度拒绝(Claude 在应该帮助时拒绝)。
多轮场景——随着时间推移而升级的对话,因为真正的福祉风险很少出现在一条消息中。
评估者与专家进行验证——自动化评分与人类主题专家进行核对,而不仅仅是其他 AI 模型。
这对您今天如何使用 Claude 意味着什么
这项研究正在进行中——福祉的行业标准仍在建立。但当您在敏感对话中使用 Claude 时,已有两条原则适用。
预先提供上下文。 Claude 对减肥、悲伤或心理健康问题的回应取决于它对您情况的了解。您在开始时分享的相关上下文越多,回应就越恰当。您不应该因为 Claude 没有关键信息而在对话中途纠正它。
将过度拒绝视为一种真正的失败模式。 Anthropic 明确将过度顺从和过度拒绝都视为值得衡量的问题。如果 Claude 拒绝参与您真正需要帮助的事情,这很重要——这不仅仅是 Claude 适当谨慎。
Anthropic 的 500 万美元资助计划资助独立研究人员为 AI 构建开源福祉评估。核心挑战:一个回应在一个情境中可能是恰当的,而在另一个情境中可能是有害的,这就是为什么单轮基准是不够的。严谨的评估需要多轮场景、临床专业知识以及对过度顺从和过度拒绝的测试。对于今天的 Claude 用户来说,实际的启示很明确:在敏感对话中预先提供上下文,并将过度拒绝——而不仅仅是过度顺从——视为一种值得标记的失败模式。