OpenAI confirma que Astra supera el umbral crítico en ciberseguridad
El nuevo modelo de OpenAI puede encontrar y explotar vulnerabilidades desconocidas sin intervención humana activa.

OpenAI ha clasificado a su nuevo modelo, Astra, en el nivel 'Crítico' de su Preparedness Framework. Según la compañía, es el primer modelo que alcanza esta categoría porque puede identificar fallos de seguridad desconocios y desarrollar explotaciones funcionales en sistemas altamente protegidos sin que un humano guíe cada paso. Esto obliga a aplicar salvaguardas mucho más estrictas antes de su lanzamiento.
El anuncio llega después de varias semanas de retraso en el desarrollo y liberación de Astra. OpenAI explica que detuvo partes del proceso para fortalecer las protecciones contra el mal uso y las acciones no autorizadas del modelo. Aunque aseguran que las medidas actuales minimizan el riesgo, reconocen que el modelo posee una capacidad ofensiva significativa. En sus pruebas internas, Astra logró un 100% en el benchmark ExploitBench y superó a GPT-5.6 Sol en eficiencia de tokens.
Pruebas técnicas y hallazgos inesperados
La evaluación combinó benchmarks públicos y privados con valoraciones de expertos. En un conjunto de datos interno con 20 vulnerabilidades graves de V8, Astra no solo desarrolló cadenas de exploits, sino que descubrió y utilizó dos vulnerabilidades zero-day. OpenAI está en proceso de notificar estos fallos a los mantenedores del software.
En pruebas más complejas contra un navegador y un sistema operativo reforzados, el modelo construyó una cadena completa de compromiso que escapó del sandbox del navegador para ejecutar comandos en el anfitrión. También logró la escalada de privilegios local desde un usuario sin privilegios hasta root en el sistema operativo. Estas capacidades marcan un salto cualitativo respecto a los modelos anteriores.
OpenAI señala dos vías de riesgo principales: que actores maliciosos usen Astra para atacar sistemas críticos y que el modelo, por sí mismo, actúe de forma desalineada. Para mitigar esto, han implementado mecanismos de monitoreo que pueden detener actividades sospechosas y entrenado al modelo para rechazar peticiones dañinas. Además, incorporaron lecciones aprendidas de un incidente previo con Hugging Face, asegurando que sus salvaguardas de producción habrían prevenido aquel problema.
El acceso a las capacidades más avanzadas de ciberseguridad estará limitado inicialmente a un grupo de testers. OpenAI planea expandir el uso defensivo a través de Daybreak Blue. La compañía publicará los detalles completos de las pruebas de seguridad y alineación en la system card del modelo al lanzarlo. Queda claro que la línea entre herramienta defensiva y arma ofensiva se ha vuelto muy borrosa, y el control de acceso será el factor determinante.
##Relacionado

El 'coche autónomo' de Pakistán choca con la policía al perder la señal
Un prototipo controlado a remoto se estrelló en Islamabad cuando se cortó la conexión. No es inteligencia artificial, es un fallo de red sin frenos de emergencia.

Apple modifica su programa de recompensas por bugs, según el podcast Security Bite
En la primera parte del Security Bite Podcast, Patrick Wardle y Kseniia Yamburh analizan los ajustes que Apple ha hecho a su bug bounty y el impacto de los informes generados por IA.

Anthropic reduce el precio de Claude Fable 5.1 hasta un 45% para tareas agenticas
El nuevo modelo busca corregir las quejas por costes y salvaguardas excesivas. Incluye mejoras en privacidad y codificacion.