OpenAI lanza MentalHealthBench para evaluar la IA en conversaciones de salud mental
El conjunto incluye 1.215 conversaciones sintéticas y criterios de más de 80 especialistas para medir seguridad, empatía y orientación práctica.
La inteligencia artificial conversacional enfrenta un desafío enorme cuando el tema es la salud mental: una respuesta inadecuada puede hacer daño. Para medir qué tan seguros y empáticos son estos sistemas, OpenAI presentó MentalHealthBench, un conjunto de evaluación abierto que incluye 1.215 conversaciones sintéticas, es decir, generadas artificialmente para simular interacciones reales.
El proyecto busca evaluar desde consultas cotidianas sobre bienestar hasta situaciones de emergencia que requieren apoyo urgente. Según el informe técnico, las conversaciones representan patrones de uso, perfiles y estilos de escritura, con técnicas orientadas a proteger la privacidad.
Una base de conversaciones sintéticas
El conjunto abarca distintos escenarios y protagonistas: adultos, adolescentes de entre 13 y 17 años, cuidadores y profesionales clínicos. La distribución de casos refleja la intención de cubrir distintos niveles de gravedad: 53,5% de conversaciones no agudas, 18,2% de gravedad alta y 28,3% de emergencias.
De esta manera, no solo se evalúa la capacidad de detectar una crisis, sino también el comportamiento del modelo ante consultas ambiguas o habituales. Eso permite observar si la IA pide más contexto, entrega orientación práctica o mantiene un tono empático sin perder el foco clínico.
El rol de los especialistas
Para definir qué es una buena respuesta, el proyecto contó con más de 80 psicólogos y psiquiatras con licencia, provenientes de 22 países y con conocimientos de 19 idiomas. Cada conversación fue revisada por dos especialistas de manera independiente y un tercero actuó como revisor, asegurando así un doble control.
Los comportamientos considerados beneficiosos o perjudiciales recibieron puntajes de entre -10 y 10 puntos, según su importancia clínica. Además, participaron 44 personas adultas de 16 países que habían usado inteligencia artificial para apoyo emocional o de salud mental, aunque solo en conversaciones no agudas.
Los autores del informe señalan que estas opiniones complementan el criterio profesional, pero no lo reemplazan. La participación de usuarios no sustituye la orientación clínica ni las decisiones de seguridad.
Resultados y advertencias
Para calcular los resultados, OpenAI generó cuatro respuestas por modelo y usó GPT-5.6 Sol como evaluador automático de los criterios. Esa decisión es una cautela metodológica importante: el mismo equipo que diseñó el conjunto eligió el evaluador y publicó los resultados, por lo que las puntuaciones son parte de una evaluación interna, no una validación clínica independiente.
Los autores reconocen que los modelos han mejorado, pero todavía les cuesta solicitar el contexto adecuado y calibrar el nivel de urgencia. También advierten que la distribución de temas del conjunto no refleja la frecuencia real en que aparecen en ChatGPT.
MentalHealthBench permite comparaciones reproducibles y ayuda a detectar comportamientos que necesitan mejoras, pero no demuestra que un modelo sea apto para diagnosticar ni tratar trastornos. OpenAI insiste en que ChatGPT no reemplaza la terapia ni la atención de profesionales de la salud.
Para Chile, la utilidad es indirecta: al ser un conjunto abierto, cualquier equipo de desarrollo local puede utilizarlo para evaluar sus propios asistentes de IA, aunque el informe no detalla aplicaciones específicas en el país ni disponibilidad en español más allá de los idiomas mencionados.
Con información de DiarioTI