Inteligencia artificial··2 min de lectura

OpenAI confirma que Astra supera el umbral crítico en ciberseguridad

El nuevo modelo de OpenAI puede encontrar y explotar vulnerabilidades desconocidas sin intervención humana activa.

OpenAI ha clasificado a su nuevo modelo, Astra, en el nivel 'Crítico' de su Preparedness Framework. Según la compañía, es el primer modelo que alcanza esta categoría porque puede identificar fallos de seguridad desconocios y desarrollar explotaciones funcionales en sistemas altamente protegidos sin que un humano guíe cada paso. Esto obliga a aplicar salvaguardas mucho más estrictas antes de su lanzamiento.

El anuncio llega después de varias semanas de retraso en el desarrollo y liberación de Astra. OpenAI explica que detuvo partes del proceso para fortalecer las protecciones contra el mal uso y las acciones no autorizadas del modelo. Aunque aseguran que las medidas actuales minimizan el riesgo, reconocen que el modelo posee una capacidad ofensiva significativa. En sus pruebas internas, Astra logró un 100% en el benchmark ExploitBench y superó a GPT-5.6 Sol en eficiencia de tokens.

Pruebas técnicas y hallazgos inesperados

La evaluación combinó benchmarks públicos y privados con valoraciones de expertos. En un conjunto de datos interno con 20 vulnerabilidades graves de V8, Astra no solo desarrolló cadenas de exploits, sino que descubrió y utilizó dos vulnerabilidades zero-day. OpenAI está en proceso de notificar estos fallos a los mantenedores del software.

En pruebas más complejas contra un navegador y un sistema operativo reforzados, el modelo construyó una cadena completa de compromiso que escapó del sandbox del navegador para ejecutar comandos en el anfitrión. También logró la escalada de privilegios local desde un usuario sin privilegios hasta root en el sistema operativo. Estas capacidades marcan un salto cualitativo respecto a los modelos anteriores.

OpenAI señala dos vías de riesgo principales: que actores maliciosos usen Astra para atacar sistemas críticos y que el modelo, por sí mismo, actúe de forma desalineada. Para mitigar esto, han implementado mecanismos de monitoreo que pueden detener actividades sospechosas y entrenado al modelo para rechazar peticiones dañinas. Además, incorporaron lecciones aprendidas de un incidente previo con Hugging Face, asegurando que sus salvaguardas de producción habrían prevenido aquel problema.

El acceso a las capacidades más avanzadas de ciberseguridad estará limitado inicialmente a un grupo de testers. OpenAI planea expandir el uso defensivo a través de Daybreak Blue. La compañía publicará los detalles completos de las pruebas de seguridad y alineación en la system card del modelo al lanzarlo. Queda claro que la línea entre herramienta defensiva y arma ofensiva se ha vuelto muy borrosa, y el control de acceso será el factor determinante.

##Relacionado