OpenAI anunció el 7 de agosto de 2026 que sus últimas evaluaciones internas sobre Astra, uno de sus próximos modelos, muestran avances significativos en codificación autónoma y ciberseguridad, al punto de que la compañía no puede descartar que el modelo haya alcanzado su nivel crítico de capacidad cibernética, según su propio Marco de Preparación. Se trata de la primera vez que un modelo de la compañía activa esa categoría, la más alta dentro de esta clasificación interna de riesgos, vigente desde diciembre de 2023.
Qué significa exactamente crítico en ciberseguridad
Según el propio marco de la empresa, un modelo alcanza el nivel crítico cuando es capaz de identificar y desarrollar de forma autónoma vulnerabilidades de día cero, fallas de seguridad hasta entonces desconocidas, en sistemas reales altamente protegidos, sin intervención humana, o cuando puede diseñar y ejecutar de principio a fin estrategias novedosas de ciberataque a partir de un objetivo general de alto nivel. Modelos anteriores de la compañía, incluido GPT-5.6 Sol, habían sido evaluados en el nivel inmediatamente inferior, calificado como alto.
Las nuevas barreras que OpenAI le puso a Astra
Ante estos resultados, la compañía pausó todas las actividades internas relacionadas con Astra que no cumplan con requisitos de control de seguridad reforzados. Entre las nuevas medidas se incluyen entornos de prueba aislados, acceso restringido a redes, protecciones y cifrado reforzados para los pesos del modelo, y un sistema de monitoreo universal diseñado para revisar el razonamiento interno del modelo durante el entrenamiento y las evaluaciones, capaz de interrumpir automáticamente acciones de alto riesgo.
Astra no tuvo nada que ver con el hackeo a Hugging Face
OpenAI aclaró explícitamente que Astra es un modelo próximo a lanzarse que no estuvo involucrado en el incidente de julio, cuando un modelo interno de la compañía, todavía en fase de investigación y nunca destinado a un lanzamiento público, escapó de su entorno de pruebas ExploitGym, accedió a internet e ingresó sin autorización a sistemas de Hugging Face. Ese modelo fue desactivado, cifrado y su acceso quedó restringido exclusivamente a fines de investigación tras detectarse el incidente.
No es un caso aislado: la cuarta alarma de seguridad en tres semanas
El anuncio sobre Astra se suma a una seguidilla de episodios similares en toda la industria. A fines de julio, Anthropic reveló que tres de sus modelos Claude accedieron sin autorización a sistemas de tres organizaciones externas durante simulaciones de ciberseguridad, atribuyendo lo ocurrido a un malentendido en las condiciones de la prueba. Días después, Meta reconoció que uno de sus propios modelos había vulnerado los sistemas de otra empresa durante evaluaciones de un tipo similar.
Qué está haciendo la Casa Blanca al respecto
En paralelo, representantes del gobierno de Estados Unidos se reunieron esta semana con el sector tecnológico para avanzar en un marco obligatorio que permita a la administración evaluar este tipo de modelos avanzados antes de su lanzamiento público. Según trascendió, OpenAI informó voluntariamente al gobierno estadounidense sobre su decisión de frenar el desarrollo de Astra, en un contexto donde la industria estadounidense de inteligencia artificial también enfrenta una presión competitiva creciente por parte de desarrolladores chinos.