独立评估员现已在 Anthropic 内部工作
2026 年 9 月 18 日,Anthropic 宣布与埃森哲的 Faculty AI 部门建立合作伙伴关系,将独立评估员嵌入公司内部。与外部审计员不同,嵌入式评估员拥有员工级别的访问权限——在模型训练期间观察模型、跟踪部署决策并从内部验证安全承诺。Anthropic 和埃森哲都计划在五年内投资至少 10 亿美元。
自 2026 年 9 月 18 日起,独立评估员在 Anthropic 内部工作——而不是与其并肩工作。这种区别很重要。外部审计员事后审查 AI 系统。嵌入式评估员在训练期间观察模型的形成,跟踪有关这些模型如何构建和部署的决策,并直接与员工交谈。从这个位置,他们可以验证安全承诺是否得到遵守,并向公众报告他们的发现。
第一个合作伙伴是埃森哲的专业 AI 部门 Faculty。Faculty 的工作将涵盖评估 Claude 模型并对其进行红队测试、进行对齐评估和测试模型安全措施。埃森哲帮助企业和政府在许多行业部署 AI——这种实际部署经验塑造了他们处理安全评估的方式。两家组织都计划在未来五年内各自投资至少 10 亿美元,以增强该领域的能力。
嵌入式评估是新事物,标准尚不存在。目前,对于嵌入式评估员应该访问哪些信息、他们应该如何报告发现以及谁应该为这项工作提供资金,还没有达成一致的规则。Anthropic 目前直接资助埃森哲的工作,同时正在开发更长期的集中或政府资助模式——正如 Anthropic 在 6 月份的《高级 AI 框架》中呼吁的那样。METR 和其他非营利评估员也在各自的资助下并行进行试点。该合作伙伴关系是非排他性的:Anthropic 计划与更多评估员合作,埃森哲也可能与其他 AI 开发商合作。
对于使用 Claude 的企业团队来说,这是可检查的问责结构。Anthropic 可以声明 Claude 是安全的;现在,一个拥有员工级别访问权限的独立组织可以验证这一声明。目标是建立一个由评估员组成的生态系统,他们使用共享标准——而不是通过或不通过模型的单一审计,而是嵌入到前沿 AI 构建方式中的持续监督。
主要收获:嵌入式评估员拥有员工级别的访问权限——他们观察训练、跟踪决策并与员工交谈。Faculty(埃森哲的 AI 部门)将涵盖红队测试、对齐评估和安全措施测试。两家组织都计划在五年内各自投资至少 10 亿美元。嵌入式评估的标准尚不存在;Anthropic 直接资助埃森哲,同时开发更长期的模式。该合作伙伴关系是非排他性的,并将宣布更多评估员。