Anthropic, AI 웰빙 연구를 위한 500만 달러 보조금 프로그램 시작
Anthropic은 AI가 사용자 웰빙에 미치는 영향을 평가하는 오픈 소스 도구를 구축하기 위해 독립 연구자들에게 자금을 지원하고 있습니다. 이 강의에서는 500만 달러 프로그램이 무엇에 자금을 지원하는지, 웰빙을 평가하는 것이 왜 유난히 어려운지, 그리고 오늘날 민감한 대화에서 Claude를 사용하는 방식에 어떤 의미가 있는지 설명합니다.
2026년 8월 25일, Anthropic은 AI 시스템이 사용자 웰빙에 미치는 영향에 대한 독립적인 연구에 자금을 지원하기 위해 500만 달러 보조금 프로그램을 발표했습니다. 수혜자는 직접적인 자금 지원, Anthropic 모델에 대한 접근 권한 및 기술 지원을 받습니다. 모든 작업은 오픈 소스 평가로 게시되어야 하며, 이는 Anthropic뿐만 아니라 모든 AI 개발자가 사용할 수 있습니다.
신청 마감일은 2026년 9월 21일입니다. 선정된 신청자는 2026년 10월 5일까지 통보됩니다.
이 프로그램은 AI 엔지니어뿐만 아니라 임상의, 심리학자, 방법론자 및 기타 주제 전문가를 특별히 찾고 있습니다.
웰빙이 정확성보다 평가하기 어려운 이유
대부분의 Claude 동작의 경우, 하나의 응답으로 필요한 정보를 알 수 있습니다. 답변이 정확하거나 그렇지 않거나 둘 중 하나입니다.
웰빙은 그렇게 작동하지 않습니다. Anthropic의 발표는 두 가지 구체적인 예를 제시합니다.
고통받는 사용자는 첫 메시지에서 자해 생각을 언급하지 않을 수 있습니다. 위험은 긴 대화를 통해서만 드러납니다.
식단 및 운동에 대한 조언은 대부분의 상황에서 합리적입니다. 그러나 사용자가 섭식 장애 이력을 보인 경우, 동일한 조언이 적극적으로 해로울 수 있습니다.
동일한 응답이 한 상황에서는 옳고 다른 상황에서는 틀릴 수 있습니다. 이는 대부분의 AI 평가에서 사용하는 표준적인 단일 턴 벤치마크가 이 영역에 부적합하다는 것을 의미합니다.
Anthropic이 자금 지원 평가에서 원하는 것
Anthropic의 Safeguards 팀은 구축하기에 충분히 엄격하다고 간주하는 평가를 위한 다섯 가지 기준을 발표했습니다.
명확한 합격/불합격 기준 — 평가는 측정하는 내용과 그 중요성을 정확히 명시합니다.
전문가 참여 — 임상의, 심리학자 및 방법론자가 설계 및 검증을 돕습니다.
두 가지 실패 모드 모두 테스트 — 과잉 순응(Claude가 도와주지 말아야 할 때 돕는 경우)뿐만 아니라 과잉 거부(Claude가 도와야 할 때 거부하는 경우)도 테스트합니다.
다중 턴 시나리오 — 실제 웰빙 위험은 단일 메시지에서 거의 나타나지 않으므로 시간이 지남에 따라 심화되는 대화입니다.
전문가에 대한 평가자 검증 — 자동화된 점수는 다른 AI 모델뿐만 아니라 인간 주제 전문가에 대해 확인됩니다.
오늘날 Claude를 사용하는 방식에 대한 의미
이 연구는 진행 중이며, 웰빙에 대한 산업 표준은 아직 구축되고 있습니다. 그러나 민감한 대화에서 Claude를 사용할 때 이미 두 가지 원칙이 적용됩니다.
사전에 맥락을 제공하십시오. 체중 감량, 슬픔 또는 정신 건강 문제에 대한 질문에 대한 Claude의 응답은 상황에 대해 알고 있는 내용에 따라 달라집니다. 처음에 더 관련성 있는 맥락을 공유할수록 응답이 더 적절해집니다. Claude가 주요 정보를 가지고 있지 않았기 때문에 대화 중간에 Claude를 수정할 필요가 없습니다.
과잉 거부를 실제 실패 모드로 취급하십시오. Anthropic은 과잉 순응과 과잉 거부 모두를 측정할 가치가 있는 문제로 명시적으로 언급합니다. Claude가 진정으로 도움이 필요한 것에 참여하기를 거부한다면, 그것은 중요합니다. 단순히 Claude가 적절하게 조심하는 것이 아닙니다.
Anthropic의 500만 달러 보조금 프로그램은 AI를 위한 오픈 소스 웰빙 평가를 구축하기 위해 독립 연구자들에게 자금을 지원합니다. 핵심 과제: 단일 응답이 한 상황에서는 적절하고 다른 상황에서는 해로울 수 있으며, 이것이 단일 턴 벤치마크로는 충분하지 않은 이유입니다. 엄격한 평가는 다중 턴 시나리오, 임상 전문 지식, 과잉 순응 및 과잉 거부 테스트가 필요합니다. 오늘날 Claude 사용자에게 실질적인 시사점은 분명합니다. 민감한 대화에서 사전에 맥락을 제공하고, 과잉 순응뿐만 아니라 과잉 거부도 플래그를 지정할 가치가 있는 실패 모드로 취급하십시오.