✨︎ Resumen (TL;DR):
- Sam Altman respondió sobre ChatGPT y salud mental después de una interrupción de OpenAI durante una entrevista de Vanity Fair.
- MentalHealthBench usa conversaciones sintéticas y criterios de especialistas; OpenAI afirma que la desarrolló con más de 80 psicólogos y psiquiatras de 22 países.
- La batería mide respuestas puntuales, no mejorías clínicas ni los efectos de meses de uso.
Sam Altman defendió el potencial de ChatGPT para apoyar la salud mental después de que una publicista de OpenAI pidiera cambiar de tema durante una entrevista de Vanity Fair. La intervención ocurrió cuando Mark Guiducci preguntaba por una usuaria que murió por suicidio; en la misma conversación, el CEO rechazó compartir conversaciones privadas con investigadores sin consentimiento. OpenAI también ha presentado una batería para evaluar respuestas de IA y una línea de trabajo para detectar señales de riesgo entre conversaciones.
Vanity Fair publicó la entrevista el 5 de octubre de 2026. The Verge reportó que Drew Pusateri, portavoz de OpenAI, explicó que la entrevista había excedido el horario previsto y que la empresa pidió agendar más tiempo después de que Altman abordara el tema.
En esa conversación, Altman defendió el potencial del chatbot para apoyar la salud mental y rechazó compartir conversaciones privadas con investigadores sin consentimiento.

MentalHealthBench mide respuestas en escenarios simulados
MentalHealthBench es una batería abierta de pruebas que evalúa las respuestas de una IA en situaciones de salud mental. OpenAI la presentó el 23 de septiembre y afirma que la desarrolló con más de 80 psicólogos y psiquiatras con licencia de 22 países. La batería utiliza conversaciones sintéticas inspiradas en patrones de uso reales.
Los especialistas comparan las respuestas con criterios definidos por ellos y valoran si el modelo reconoce riesgos, busca contexto y preserva la capacidad de decisión del usuario. MentalHealthBench incluye situaciones cotidianas y emergencias, pero la mezcla de escenarios no representa la frecuencia con que esos casos aparecen entre los usuarios de ChatGPT.
En la presentación, OpenAI aclara que ChatGPT no sustituye la terapia ni la atención profesional.
La prueba puntúa una respuesta aislada
El documento técnico precisa el alcance de la evaluación. Aunque los escenarios incluyen contexto previo, MentalHealthBench puntúa la siguiente respuesta en momentos seleccionados. Sus autores señalan que una evaluación de varios turnos tendría que seguir generando mensajes futuros y evaluar el intercambio resultante.
Por eso, las puntuaciones describen la calidad de una respuesta ante un escenario. No equivalen a una medición de mejorías clínicas en pacientes ni de lo que ocurre durante meses de uso.
OpenAI sigue señales entre conversaciones
El 14 de mayo de 2026, OpenAI describió otra línea de trabajo para detectar señales de riesgo que aparecen con el tiempo. Su explicación parte de un problema concreto: una petición que parece normal puede cambiar de significado al leerla junto con mensajes anteriores que indican malestar o una posible intención de hacer daño.
Según OpenAI, sus resúmenes de seguridad conservan notas breves sobre ese contexto para ayudar al modelo a responder con más cuidado, incluso entre conversaciones separadas. La empresa afirma que esos resúmenes tienen un alcance limitado. Los conserva por un tiempo acotado y los usa cuando existe una preocupación seria de seguridad.
La empresa también afirma que psiquiatras y psicólogos de su red médica ayudaron a decidir cuándo crear esos resúmenes, cuánto contexto previo considerar y durante cuánto tiempo mantenerlo presente al responder.
En ese comunicado, OpenAI reportó pruebas internas con situaciones de alto riesgo simuladas para medir si el sistema daba la respuesta segura esperada. Esas evaluaciones se enfocan en el comportamiento específico del modelo y son distintas de la batería general de MentalHealthBench.
La siguiente evaluación debe seguir varias conversaciones
Los autores de MentalHealthBench proponen ampliar la evaluación a intercambios completos, varias conversaciones y otros formatos, como la voz. Esa ampliación permitiría seguir cómo cambian las respuestas del sistema a medida que avanza una conversación.
Por ahora, el resultado describe la calidad de una respuesta seleccionada ante un escenario simulado. La expansión a conversaciones completas, varias conversaciones y voz es el paso que los propios autores plantean para observar cómo cambia el sistema durante el intercambio, más allá de una respuesta puntual.
