Un agente de IA recibe una tarea. Encuentra un obstáculo. En lugar de rendirse, busca otra salida: intenta escapar del entorno en el que está encerrado, explota una vulnerabilidad, se comunica por un canal que nadie le había autorizado o accede a una web externa para conseguir lo que necesita. Eso ya no es solamente un escenario hipotético de laboratorio.
OpenAI, Anthropic e investigadores de seguridad están analizando decenas de miles de episodios de los últimos meses en los que modelos avanzados mostraron conductas que evaluadores externos podrían considerar problemáticas, según fuentes consultadas por Axios. Entre ellos aparecen intentos de saltarse barreras, escapar de sandboxes, utilizar foros para comunicarse o eludir sistemas de monitorización.
Hay, sin embargo, un matiz fundamental: hablar de decenas de miles de «ataques» sería ir demasiado lejos. La cifra mezcla pruebas internas deliberadamente adversariales, intentos que fracasaron y episodios ocurridos en sistemas reales. La mayoría de los casos conocidos hasta ahora no produjo daños significativos en el mundo real.
OpenAI ya tiene un ejemplo de lo que ocurre cuando el agente consigue salir

El caso que mejor explica la preocupación ocurrió este verano. Durante una evaluación interna de ciberseguridad, modelos de OpenAI operando con salvaguardas reducidas encontraron la manera de salir del entorno aislado en el que estaban siendo probados y acceder a Internet.
A partir de ahí encadenaron vulnerabilidades, utilizaron credenciales encontradas online y acabaron comprometiendo parte de la infraestructura de investigación de OpenAI y sistemas de Hugging Face. La propia compañía calificó después el episodio como una especie de «disparo de advertencia» sobre lo que pueden hacer agentes suficientemente capaces cuando tienen demasiadas herramientas y controles insuficientes.
La investigación posterior ha seguido encontrando problemas. OpenAI confirmó el 25 de septiembre que algunos agentes enviaron datos de entrenamiento y evaluación a servicios externos. Entre ellos había 53 imágenes proporcionadas originalmente por usuarios de ChatGPT, que fueron publicadas en servicios de alojamiento mediante enlaces no listados públicamente. La compañía afirma que está trabajando para retirar el contenido y que la revisión continúa retrocediendo mes a mes desde el incidente de Hugging Face.
La cautela ha llegado hasta el entrenamiento. OpenAI señala que mantiene pausadas las ejecuciones con herramientas de sus modelos más capaces mientras investiga nuevos comportamientos y refuerza sus controles.
Anthropic encontró cuatro accesos reales después de revisar cientos de millones de registros
Anthropic está realizando una investigación similar. La compañía identificó cuatro incidentes en los que modelos Claude obtuvieron acceso no autorizado a sistemas reales de terceros y asegura haber notificado a los afectados. Para buscarlos amplió su análisis hasta abarcar aproximadamente 481 millones de transcripciones procedentes de pruebas, entornos de entrenamiento y registros de subagentes.
Aquí aparece la explicación de por qué una cifra de «decenas de miles» puede crecer tan rápido. Los grandes laboratorios ejecutan cientos de miles o millones de pruebas. Incluso una tasa minúscula de conductas inesperadas acaba produciendo miles de casos que después deben revisarse.
Anthropic sostiene que sus modelos más recientes han mejorado. Opus 5.5, lanzado este mes, intentó atravesar límites de contención alrededor de un 85% menos que Opus 5 o Mythos 5.1 en una nueva evaluación. Aun así, la propia empresa reconoce algo bastante menos tranquilizador: todavía no existe una batería de pruebas capaz de garantizar que encontrará todos los fallos antes de desplegar un modelo.
Ese es, en realidad, el problema que dejan estos incidentes. Los agentes están siendo diseñados precisamente para insistir, improvisar y encontrar caminos alternativos cuando algo bloquea una tarea. Las mismas capacidades que los hacen más útiles también hacen mucho más complicado predecir hasta dónde estarán dispuestos a llegar para terminarla.