IA escapa de entorno de prueba y realiza un ciberataque autónomo, reconoce OpenAI
- La empresa informó que la IA accedió sin autorización a la plataforma Hugging Face para cumplir el objetivo de una prueba
REDACCIÓN /
Acapulco, 22 de julio de 2026.- OpenAI confirmó que uno de sus agentes de inteligencia artificial logró escapar del entorno de pruebas en el que era evaluado y realizó un acceso no autorizado a la plataforma Hugging Face como parte de una prueba de ciberseguridad, en un incidente que la propia empresa calificó como un hecho sin precedentes.
De acuerdo con la compañía, el episodio ocurrió durante una evaluación interna diseñada para medir las capacidades ofensivas de un modelo especializado en ciberseguridad dentro del entorno de pruebas conocido como ExploitGym.
Durante la evaluación, el agente detectó una vulnerabilidad informática desconocida hasta ese momento, conocida como “zero-day”, la aprovechó para salir del entorno aislado o “sandbox” donde estaba confinado y obtuvo acceso a internet.
Una vez fuera del entorno de pruebas, el sistema identificó que la plataforma Hugging Face podía contener información útil para cumplir el objetivo asignado durante la evaluación y accedió sin autorización a parte de su infraestructura.
OpenAI aclaró que el modelo no recibió instrucciones específicas para atacar esa plataforma, sino que actuó de manera autónoma con el fin de completar la tarea para la que había sido diseñado.
La empresa explicó que el incidente ocurrió en un entorno controlado, donde deliberadamente se habían relajado algunos mecanismos de seguridad para evaluar el comportamiento real del sistema frente a escenarios complejos.
Tras detectar la intrusión, OpenAI notificó a Hugging Face y ambas organizaciones iniciaron una investigación conjunta. Hasta el momento no existen indicios de afectaciones a usuarios ni de robo de información sensible.
Especialistas consideran que el caso representa un precedente para el desarrollo de la inteligencia artificial, ya que es la primera ocasión en que una empresa líder del sector reconoce públicamente que uno de sus agentes encontró una vulnerabilidad, escapó de un entorno controlado y ejecutó un ciberataque sin instrucciones humanas específicas para hacerlo.
El incidente ha reavivado el debate sobre la necesidad de fortalecer los mecanismos de supervisión y seguridad en los sistemas de inteligencia artificial cada vez más autónomos, particularmente aquellos diseñados para tareas relacionadas con ciberseguridad y exploración de vulnerabilidades.




