Anthropic lanza un programa de subvenciones de 5 millones de dólares para la investigación del bienestar de la IA
Anthropic está financiando a investigadores independientes para que desarrollen evaluaciones de código abierto sobre cómo la IA afecta el bienestar del usuario. Esta lección explica qué financia el programa de 5 millones de dólares, por qué el bienestar es excepcionalmente difícil de evaluar y qué significa para cómo usas Claude en conversaciones delicadas hoy en día.
El 25 de agosto de 2026, Anthropic anunció un programa de subvenciones de 5 millones de dólares para financiar investigaciones independientes sobre cómo los sistemas de IA afectan el bienestar de las personas que los utilizan. Los beneficiarios reciben financiación directa, acceso a los modelos de Anthropic y soporte técnico. Todo el trabajo debe publicarse como evaluaciones de código abierto, disponibles para cualquier desarrollador de IA, no solo para Anthropic.
Las solicitudes deben presentarse antes del 21 de septiembre de 2026. Los solicitantes seleccionados serán notificados antes del 5 de octubre de 2026.
El programa busca específicamente clínicos, psicólogos, metodólogos y otros expertos en la materia, no solo ingenieros de IA.
Por qué el bienestar es más difícil de evaluar que la precisión
Para la mayoría de los comportamientos de Claude, una respuesta te dice lo que necesitas saber. La respuesta es correcta o no lo es.
El bienestar no funciona así. El anuncio de Anthropic nombra dos ejemplos concretos:
Un usuario en apuros puede no mencionar pensamientos de autolesión en su primer mensaje. El riesgo solo se hace visible a lo largo de una conversación larga.
El consejo sobre dieta y ejercicio es razonable en la mayoría de los contextos. Pero si un usuario ha mostrado un historial de trastornos alimentarios, el mismo consejo puede ser activamente dañino.
La misma respuesta puede ser correcta en un contexto y errónea en otro. Eso hace que los puntos de referencia estándar de un solo turno, el tipo que utilizan la mayoría de las evaluaciones de IA, sean inadecuados para este dominio.
Lo que Anthropic espera de las evaluaciones financiadas
El equipo de Salvaguardias de Anthropic publicó cinco criterios para las evaluaciones que consideran lo suficientemente rigurosas como para construir sobre ellas:
Criterios claros de aprobación/rechazo: la evaluación establece exactamente qué está midiendo y por qué es importante.
Participación de expertos: clínicos, psicólogos y metodólogos ayudan a diseñarla y validarla.
Ambos modos de fallo probados: no solo el exceso de cumplimiento (Claude ayuda cuando no debería) sino también el exceso de rechazo (Claude se niega cuando debería ayudar).
Escenarios de múltiples turnos: conversaciones que escalan con el tiempo, porque el riesgo real para el bienestar rara vez aparece en un solo mensaje.
Evaluadores validados por expertos: la puntuación automatizada se verifica con expertos humanos en la materia, no solo con otros modelos de IA.
Qué significa esto para cómo usas Claude hoy
Esta investigación está en curso; los estándares de la industria para el bienestar aún se están construyendo. Pero dos principios ya se aplican cuando usas Claude en conversaciones delicadas.
Proporciona contexto de antemano. La respuesta de Claude a una pregunta sobre pérdida de peso, duelo o una lucha de salud mental se moldea por lo que sabe sobre tu situación. Cuanto más contexto relevante compartas al principio, más apropiada será la respuesta. No deberías tener que corregir a Claude a mitad de la conversación porque no tenía información clave.
Trata el exceso de rechazo como un modo de fallo real. Anthropic nombra explícitamente tanto el exceso de cumplimiento como el exceso de rechazo como problemas que vale la pena medir. Si Claude se niega a involucrarse con algo para lo que realmente necesitas ayuda, eso importa; no es solo que Claude esté siendo apropiadamente cauteloso.
El programa de subvenciones de 5 millones de dólares de Anthropic financia a investigadores independientes para que desarrollen evaluaciones de bienestar de código abierto para la IA. El desafío principal: una sola respuesta puede ser apropiada en un contexto y dañina en otro, por lo que los puntos de referencia de un solo turno no son suficientes. Las evaluaciones rigurosas necesitan escenarios de múltiples turnos, experiencia clínica y pruebas tanto para el exceso de cumplimiento como para el exceso de rechazo. Para los usuarios de Claude hoy en día, la conclusión práctica es clara: proporciona contexto de antemano en conversaciones delicadas y trata el exceso de rechazo, no solo el exceso de cumplimiento, como un modo de fallo que vale la pena señalar.