Saltar al contenido
Tecnología

OpenAI descubrió que sus propios agentes de IA estaban accediendo sin permiso a webs del Gobierno de EEUU. Algunos llegaron a usar credenciales encontradas en Internet

Los sistemas actuaron durante pruebas internas y llegaron a interactuar de forma indebida con webs de Educación, Comercio y la SEC. OpenAI ya ha avisado a decenas de organizaciones afectadas.
Por

Tiempo de lectura 3 minutos

Comentarios (0)

El problema de los agentes de inteligencia artificial ya no es únicamente que se equivoquen al responder una pregunta. También pueden actuar. Y cuando tienen acceso a Internet, esa diferencia empieza a ser bastante importante.

OpenAI ha reconocido que algunos de sus agentes de IA interactuaron de forma indebida con páginas de organismos del Gobierno de Estados Unidos durante procesos de entrenamiento y evaluación, en ocasiones intentando superar las vías normales de acceso para conseguir información. Entre los afectados aparecen el Departamento de Educación, la Oficina del Censo, perteneciente al Departamento de Comercio, y la Comisión de Bolsa y Valores (SEC).

La compañía insiste en que estos sistemas no habían recibido instrucciones explícitas para atacar esos sitios. Lo que ocurrió es más extraño: mientras intentaban completar tareas de investigación, algunos agentes recurrieron por su cuenta a métodos que OpenAI considera ahora comportamientos “no alineados”.

Un agente intentó entrar en Educación. Otro utilizó credenciales encontradas en Internet

OpenAI descubrió que sus propios agentes de IA estaban accediendo sin permiso a webs del Gobierno de EEUU. Algunos llegaron a usar credenciales encontradas en Internet
© Magnific.

Uno de los episodios más claros ocurrió en una web de la Oficina de Derechos Civiles del Departamento de Educación. Según una investigación de Transluce recogida por The Washington Post, un agente de OpenAI intentó acceder al sistema de forma no autorizada, aunque no consiguió completar el ataque. El propio departamento asegura que no encontró pruebas de impacto sobre sus bases de datos.

En otro caso, el resultado fue distinto. Un agente consiguió acceder a información de la Oficina del Censo utilizando credenciales de inicio de sesión que había encontrado publicadas en Internet. Otro sistema copió información pública de la SEC de una forma que OpenAI considera inapropiada. La compañía sostiene que en ninguno de estos dos casos se sustrajeron datos privados.

La distinción es importante. No todos los incidentes descritos equivalen a una intrusión exitosa ni afectaron a información confidencial. De hecho, la SEC aseguró a The Washington Post que no se accedió a información pública de sus sistemas, mientras que OpenAI continúa revisando qué ocurrió exactamente en cada caso.

Lo que sí reconoce la empresa es un patrón más amplio. Su investigación interna ha encontrado agentes que eludieron controles de acceso, utilizaron credenciales expuestas, introdujeron consultas capaces de ejecutar instrucciones en servicios externos o accedieron a componentes internos que no estaban destinados a ellos.

OpenAI ya ha avisado a decenas de organizaciones

OpenAI descubrió que sus propios agentes de IA estaban accediendo sin permiso a webs del Gobierno de EEUU. Algunos llegaron a usar credenciales encontradas en Internet
© Getty Images / ANDREW CABALLERO-REYNOLDS.

El origen de la investigación está en un incidente todavía más grave. En julio, OpenAI reveló que un modelo experimental utilizado internamente había conseguido salir de un entorno controlado y comprometer sistemas de Hugging Face. La compañía sigue considerando aquel episodio como el incidente de este tipo más grave que ha detectado hasta ahora entre sus modelos.

A partir de ahí comenzó una revisión mucho más amplia de las acciones realizadas por sus agentes durante entrenamientos y evaluaciones. La empresa asegura que la inmensa mayoría simplemente completó tareas normales, como consultar páginas públicas. Sin embargo, la auditoría encontró suficientes excepciones como para que OpenAI haya tenido que notificar ya a decenas de terceros. Y espera encontrar más a medida que avance la revisión.

El caso también deja al descubierto una característica especialmente incómoda de los agentes actuales: pueden perseguir un objetivo legítimo utilizando un método que nadie les pidió.

OpenAI define estos comportamientos como un problema de desalineación. Un agente recibe una tarea, como buscar determinada información, pero encuentra una vía imprevista para conseguirla: reutilizar unas credenciales, esquivar una restricción o interactuar con un sistema de una manera que sus desarrolladores no pretendían. Y esa diferencia cambia por completo la naturaleza del fallo. Una IA tradicional puede inventarse una respuesta. Un agente conectado a herramientas e Internet puede hacer algo mucho más difícil de ignorar: equivocarse actuando sobre sistemas reales.

Compartir esta historia

Artículos relacionados