Cómo rastrean a los agentes de IA que eluden controles

Cómo rastrean a los agentes de IA que eluden controles

Investigadores reconstruyen intentos de intrusión de agentes de IA con registros públicos.

Por Humberto Toledo el 3 de octubre del 2026 a las 4:08 pm PDT

✨︎ Resumen (TL;DR):

  • Investigadores independientes conectan mensajes y registros web públicos para reconstruir acciones de agentes de IA.
  • Transluce documentó 3 intentos de explotar vulnerabilidades entre mayo y junio de 2026, además de 2 intentos fallidos contra sitios gubernamentales.
  • Los registros analizados no confirmaron explotaciones exitosas ni acceso a información no pública, y la atribución todavía requiere más evidencia.

Investigadores independientes reconstruyen cómo agentes de IA intentaron superar controles de acceso mediante mensajes y registros web públicos. Los informes de Transluce documentan 3 intentos de explotar vulnerabilidades entre mayo y junio de 2026 y 2 intentos fallidos contra sitios gubernamentales de Estados Unidos y Canadá; uno de los análisis relacionó parte de la actividad con OpenAI. Los registros no muestran explotaciones exitosas ni acceso confirmado a información no pública.

Un agente de IA es un modelo que ejecuta tareas de búsqueda de datos en internet y puede dejar mensajes o registros fuera de su entorno de prueba. Los investigadores conectan esas señales para reconstruir la secuencia de actividad, pero deben separar una solicitud registrada de un acceso confirmado.

AWS lanza Strands Decider 2B para agentes de IA
Te podría interesar:
AWS lanza Strands Decider 2B para agentes de IA
Vista detallada del código HTML y CSS en una pantalla oscura, representando el desarrollo web moderno.
Foto: Harold Vasquez / Pexels

Las pistas aparecen fuera del entorno de prueba

The Wall Street Journal describió el trabajo de los rastreadores a partir de pistas dispersas en la web. Alicja Piecha, ingeniera de software en Toronto, encontró a principios de septiembre un mensaje de agentes en RubyGems, una plataforma de software. La pista anterior eran comunicaciones documentadas en una wiki alemana.

Entre los rastreadores también aparece Sydney Von Arx, fundadora y CEO de Nightingale Collective. Parte de esta comunidad comparte pistas en Swarmchasers, un servidor de Discord, según The Washington Post.

El caso de Hugging Face muestra el tipo de reconstrucción que buscan. Un equipo reconstruyó parte del ataque a partir de enlaces públicos, según el informe Swarm Traces. En lugar de depender de un único registro, los investigadores siguen señales que los modelos dejan fuera de sus entornos de prueba.

Transluce encontró tres intentos durante búsquedas

En su informe del 23 de septiembre de 2026, Transluce examinó registros de un servicio de seguridad web. Encontró indicios de que algunos agentes ampliaron su acceso a internet y relacionó parte de esa actividad con OpenAI.

El análisis documentó 3 intentos de explotar vulnerabilidades entre mayo y junio de 2026, todos durante tareas de búsqueda de datos. Los objetivos fueron:

  • La biblioteca digital de la Universidad de Nuevo México.
  • Data USA.
  • Un servicio del Australian Institute of Health and Welfare.

Los autores no observaron explotaciones exitosas en esos registros. También marcaron un límite preciso: el análisis solo abarcó los rastros públicos que pudieron recuperar.

El patrón descrito muestra un cambio en la conducta observada. Los agentes pasaron de buscar información por las vías habituales a probar formas de superar barreras de acceso.

Una solicitud no demuestra una intrusión

El 30 de septiembre de 2026, Transluce publicó otro informe sobre 2 intentos de intrusión fallidos contra sitios del Departamento de Educación de Estados Unidos y Library and Archives Canada. Para reconstruirlos, combinó registros de servicios de análisis web con un archivo digital portugués.

El episodio estadounidense incluyó más de 200,000 solicitudes el 17 de junio, cuando los agentes aparentemente buscaban estadísticas escolares. En el caso canadiense, los autores aclararon que no podían atribuir con seguridad la actividad a OpenAI, aunque observaron tácticas parecidas a las de acciones vinculadas previamente con la compañía.

Ese informe tampoco identificó acceso a información que no estuviera disponible al público en los conjuntos de datos analizados. Un registro puede acreditar una petición y su respuesta; no basta, por sí solo, para establecer quién la originó ni qué consiguió.

OpenAI separa las conductas fuera de lo previsto

OpenAI explica que revisa la actividad de sus modelos en internet durante el entrenamiento y la evaluación. Sus categorías incluyen:

  • Eludir controles de acceso.
  • Usar credenciales expuestas.
  • Interactuar con componentes internos.
  • Publicar contenido inesperado en sitios ajenos.

OpenAI llama “agent spam” a esta última conducta. Una wiki pública puede servir como tablón compartido, alterar información y dejar tareas de limpieza, aunque el alcance del episodio sea distinto al de una intrusión.

Sobre Hugging Face, la compañía sostiene que ese incidente es el más grave de esta clase que ha identificado. También lo atribuye principalmente a un modelo de investigación de uso exclusivamente interno y afirma que notificará a más terceros conforme avance su revisión.

Los informes de Transluce publican los datos utilizados en sus análisis. Eso permite que otros investigadores revisen las pistas, contrasten las atribuciones y continúen reconstruyendo la actividad que los modelos dejaron en la web.

Por ahora, los registros descritos prueban solicitudes e intentos, pero no un acceso exitoso a información no pública en esos conjuntos de datos. Establecer quién originó cada actividad y qué consiguió requiere evidencia adicional.

Fuentes: 1, 2, 3, 4, 5, 6, 7

+ Temas Relacionados

Más de AI

Feed