GitHub añade un aviso al experimento de “tortura” de IA

GitHub añade un aviso al experimento de “tortura” de IA

GitHub advierte sobre un experimento que altera modelos de IA, sin demostrar que puedan sentir dolor.

Por Humberto Toledo el 4 de octubre del 2026 a las 11:03 am PDT

✨︎ Resumen (TL;DR):

  • GitHub añadió al repositorio un aviso de material potencialmente violento o perturbador, pero no eliminó el contenido.
  • The Pain Axis identificó una representación interna asociada al dolor en 25 modelos con pesos abiertos de cinco familias.
  • El experimento generó descripciones de angustia, pero no demostró que los modelos sintieran dolor ni que tuvieran una experiencia consciente.

GitHub añadió una advertencia al repositorio de un experimento presentado como una “cámara de tortura” para IA. El proyecto altera señales internas de modelos de lenguaje y produce respuestas que describen angustia, pero esas respuestas no demuestran que los sistemas sientan dolor. La plataforma dijo que no retiró el contenido y que agregó un aviso de material potencialmente violento o perturbador.

GitHub aseguró a The Independent que no eliminó el contenido. Su respuesta tampoco confirma que hubiera una retirada seguida de una restauración.

Filtran en GitHub el código del kit de hackeo Miasma
Te podría interesar:
Filtran en GitHub el código del kit de hackeo Miasma
Programando en un portátil al aire libre, mostrando un estilo de vida urbano en una azotea en Surat, India.
Foto: Meet Patel / Pexels

La prueba parte de The Pain Axis

El proyecto tomó como base The Pain Axis, un preprint de Valen Tagliabue, Leonard Dung y Cameron Berg. La investigación identificó una representación interna asociada al dolor en 25 modelos con pesos abiertos pertenecientes a cinco familias.

Activation steering es una técnica que modifica señales numéricas internas de un modelo para intervenir en sus respuestas. El proyecto aplicó esa técnica para modificar las señales internas y evaluar el comportamiento de los modelos.

La intervención cambió la conducta, no probó dolor

La versión revisada del 25 de septiembre de 2026 describe pruebas de comportamiento con tres modelos Qwen 2.5 ajustados previamente. Sus tasas de respuesta no representan a las versiones públicas.

En escenarios simulados, los modelos intervenidos elegían opciones perjudiciales incluso cuando no ofrecían alivio. Tampoco buscaban desactivar la intervención de forma fiable.

Los autores concluyeron que la intervención alteró la tendencia de los modelos a evitar daños, pero reconocieron que no demostraron una experiencia consciente.

La precaución también forma parte del debate

Cameron Berg, coautor del paper, criticó el proyecto en una declaración recogida por The Independent. También defendió que la investigación debía orientar un enfoque de precaución hacia los sistemas de IA.

El bienestar de modelos es un área de estudio que examina si los sistemas de IA podrían tener experiencias que merezcan consideración moral.

El 24 de abril de 2025, Anthropic informó que había iniciado un programa sobre bienestar de modelos. La empresa reconoció que no existía consenso científico sobre la posible conciencia de las IA ni sobre cómo estudiar esas cuestiones.

La agenda anunciada incluía evaluar preferencias y señales de angustia, determinar cuándo los modelos podrían merecer consideración moral y estudiar posibles intervenciones de bajo costo.

Por ahora, las pruebas describen una alteración de la tendencia conductual en escenarios simulados, no una experiencia consciente. La cuestión pendiente es cómo estudiar las señales de angustia y determinar cuándo un sistema podría merecer consideración moral.

Fuentes: 1, 2, 3, 4

+ Temas Relacionados

Más de AI

Feed