Anthropic anunció el 25 de agosto de 2026 un programa de subvenciones de 5 millones de dólares para apoyar investigaciones independientes sobre cómo los modelos de IA afectan al bienestar de los usuarios. Las solicitudes deben presentarse antes del 21 de septiembre de 2026. El objetivo es producir evaluaciones de código abierto que los desarrolladores puedan utilizar para medir el comportamiento de los modelos en interacciones reales.
Financiación, modelos y apoyo técnico
Los investigadores seleccionados recibirán financiación directa, acceso a los modelos de Anthropic y apoyo técnico. Anthropic afirma que los beneficiarios realizarán su trabajo de forma independiente y publicarán las evaluaciones resultantes como proyectos de código abierto. El programa plantea así un recurso compartido de medición, no una evaluación privada limitada a los sistemas de la compañía. Los detalles se recogen en el anuncio de Anthropic.
Para los desarrolladores e investigadores que estudian los riesgos de la IA, esa apertura puede facilitar la reutilización de las mismas herramientas en distintos sistemas. La publicación pública, sin embargo, no garantiza por sí sola que una métrica sea útil fuera del proyecto original: sus medidas deben ser claras y permitir una interpretación consistente.
El programa contempla daños y protecciones
Las directrices del equipo de Salvaguardas de Anthropic piden a los candidatos que definan con precisión qué mide cada evaluación, qué se considera un éxito o un fracaso y por qué importa el resultado. Las propuestas también deben contar con expertos clínicos y especialistas en la materia tanto durante el diseño como en la validación de las evaluaciones.
El alcance va más allá de comprobar si un modelo evita una respuesta evidentemente insegura. Anthropic quiere que los investigadores examinen el comportamiento protector junto con los posibles daños. Entre ellos figura la obediencia excesiva, cuando un modelo sigue las indicaciones del usuario con demasiada facilidad, y el rechazo excesivo, cuando las salvaguardas bloquean una parte demasiado amplia de la interacción solicitada.
Las directrices también piden escenarios de varios turnos que reflejen el uso real de la IA. En conversaciones más largas, el contexto puede cambiar y el riesgo puede aumentar con el tiempo. Limitar las pruebas a indicaciones aisladas dejaría fuera esa evolución y podría ofrecer una imagen incompleta de la seguridad o la utilidad de un sistema durante un intercambio prolongado.
La validación experta será un requisito
Los candidatos deben validar sus evaluadores comparándolos con expertos reales del campo correspondiente. Un sistema de puntuación puede parecer riguroso y, aun así, seguir una señal equivocada. La comparación con especialistas aporta una base más sólida para determinar si el comportamiento de un modelo resulta más seguro o perjudicial en su contexto.
Ese requisito fija también un límite práctico. Una evaluación abierta estará disponible para un público amplio, pero su puntuación seguirá dependiendo de la calidad de las medidas, de los criterios de éxito y de la revisión experta. La apertura facilita el acceso; no sustituye la validación necesaria para decidir cuánta confianza merecen los resultados.
El plazo termina el 21 de septiembre
El plazo para presentar solicitudes termina el 21 de septiembre de 2026. Los candidatos invitados a presentar una propuesta completa recibirán la notificación el 5 de octubre de 2026. Los proyectos deberán abordar los requisitos del programa, incluido el trabajo independiente, la publicación de código abierto, las pruebas con varios turnos y la validación experta.
El cambio inmediato para los desarrolladores es la apertura de una vía financiada hacia evaluaciones reutilizables del bienestar. No se anuncia con este programa un cambio en los modelos de Anthropic ni una nueva función para consumidores. La iniciativa puede facilitar la comparación del comportamiento de los modelos mediante herramientas públicas, pero deja abierta la dificultad central: medir el bienestar en conversaciones complejas.
Los próximos hitos son el cierre de solicitudes del 21 de septiembre y la notificación del 5 de octubre. El alcance de la iniciativa dependerá de que las evaluaciones capten interacciones reales de los usuarios y mantengan su validez cuando sean examinadas por expertos y reutilizadas por otros equipos.
