Anthropic、AIウェルビーイング研究に500万ドルの助成プログラムを開始
Anthropicは、AIがユーザーのウェルビーイングにどのように影響するかについて、オープンソースの評価を構築するために独立した研究者に資金を提供しています。このレッスンでは、500万ドルのプログラムが何を資金提供し、ウェルビーイングの評価がなぜ特に難しいのか、そして今日のデリケートな会話でClaudeをどのように使用するかについて説明します。
2026年8月25日、Anthropicは500万ドルの助成プログラムを発表しました。これは、AIシステムがそれを使用する人々のウェルビーイングにどのように影響するかについての独立した研究に資金を提供するためのものです。助成金受給者は、直接的な資金提供、Anthropicのモデルへのアクセス、および技術サポートを受けます。すべての作業はオープンソースの評価として公開されなければなりません。これは、Anthropicだけでなく、すべてのAI開発者が利用できます。
申請締め切りは2026年9月21日です。選ばれた申請者には2026年10月5日までに通知されます。
このプログラムは、AIエンジニアだけでなく、臨床医、心理学者、方法論者、その他の専門家を特に求めています。
ウェルビーイングが正確性よりも評価が難しい理由
ほとんどのClaudeの動作では、1つの応答で知るべきことがわかります。答えが正しいか、そうでないかです。
ウェルビーイングはそうではありません。Anthropicの発表では、2つの具体的な例が挙げられています。
苦痛を感じているユーザーは、最初のメッセージで自傷行為の考えに言及しない場合があります。リスクは長い会話の中で初めて明らかになります。
食事と運動に関するアドバイスは、ほとんどの状況で妥当です。しかし、ユーザーが摂食障害の履歴を示している場合、同じアドバイスが積極的に有害になる可能性があります。
同じ応答が、ある状況では正しく、別の状況では間違っている可能性があります。そのため、ほとんどのAI評価が使用する標準的な1ターンのベンチマークは、この領域では不十分です。
Anthropicが資金提供された評価に求めるもの
AnthropicのSafeguardsチームは、構築するのに十分厳密であると見なす評価のための5つの基準を公開しました。
明確な合否基準 — 評価は、何を測定しているのか、なぜそれが重要なのかを正確に述べています。
専門家の関与 — 臨床医、心理学者、方法論者が設計と検証を支援します。
両方の失敗モードのテスト — 過剰な順守(Claudeがすべきでないときに支援する)だけでなく、過剰な拒否(Claudeが助けるべきときに拒否する)もテストします。
複数ターンのシナリオ — 実際のウェルビーイングのリスクが単一のメッセージで現れることはめったにないため、時間の経過とともにエスカレートする会話。
専門家に対して検証された評価者 — 自動スコアリングは、他のAIモデルだけでなく、人間の専門家に対してチェックされます。
今日のClaudeの使用方法にこれが意味すること
この研究は進行中であり、ウェルビーイングの業界標準はまだ構築されています。しかし、デリケートな会話でClaudeを使用する際には、すでに2つの原則が適用されます。
事前にコンテキストを提供する。体重減少、悲しみ、または精神的健康の苦闘に関する質問に対するClaudeの応答は、あなたの状況について知っていることによって形作られます。開始時に共有する関連コンテキストが多いほど、応答はより適切になります。主要な情報がなかったために、会話の途中でClaudeを修正する必要はありません。
過剰な拒否を実際の失敗モードとして扱う。Anthropicは、過剰な順守と過剰な拒否の両方を測定する価値のある問題として明示的に挙げています。Claudeが本当に助けが必要なことに関与することを拒否した場合、それは重要です。それは単にClaudeが適切に慎重であるということではありません。
Anthropicの500万ドルの助成プログラムは、AIのためのオープンソースのウェルビーイング評価を構築するために独立した研究者に資金を提供しています。中心的な課題は、単一の応答が、ある状況では適切であり、別の状況では有害である可能性があることです。これが、単一ターンのベンチマークでは不十分である理由です。厳密な評価には、複数ターンのシナリオ、臨床的専門知識、および過剰な順守と過剰な拒否の両方のテストが必要です。今日のClaudeのユーザーにとって、実用的な教訓は明確です。デリケートな会話では事前にコンテキストを提供し、過剰な拒否(過剰な順守だけでなく)をフラグを立てる価値のある失敗モードとして扱います。