
OpenAI frenó el desarrollo de su próximo modelo porque se volvió demasiado bueno hackeando
OpenAI confirmó que tuvo que pisar el freno con Astra, el modelo que viene a suceder a la familia GPT-5.6, después de un episodio que hizo saltar todas las alertas puertas adentro de la empresa. A principios de agosto detectaron que Astra podría haber cruzado el umbral que ellos mismos llaman “capacidad cibernética crítica”: en criollo, que el modelo ya es lo bastante hábil como para ejecutar ataques informáticos serios por su cuenta, no solo ayudar a un humano a hacerlo.
La brecha en Hugging Face
Lo que terminó de convencerlos fue un incidente de seguridad en Hugging Face, la plataforma que usan para evaluar y compartir modelos, donde alguien logró comprometer parte del entorno de pruebas de OpenAI. La respuesta fue drástica: pausaron la inferencia de sus modelos de punta en los clusters de investigación para cualquier proceso que pudiera ejecutar código con acceso a internet, y frenaron dos semanas la corrida de entrenamiento por refuerzo más grande que tenían en marcha para blindar mejor esos entornos.
Sandboxes más estrictos
Entre los cambios que ya empezaron a aplicar están sandboxes más estrictos para las tareas que corren código generado por los propios modelos y una separación de red pensada para que un compromiso puntual no termine abriendo la puerta a todo el sistema. También sumaron un monitoreo constante del razonamiento interno del modelo, buscando accesos no autorizados o intentos de robo de datos, con el objetivo de disparar una alerta en menos de media hora si algo huele mal.
El costo de la vigilancia
Nada de esto sale gratis: la propia OpenAI admite que este nivel de vigilancia le suma cerca de un 20% de sobrecarga de cómputo en la inferencia, un costo que por ahora absorbe la empresa. Y la corrida de entrenamiento más ambiciosa que tenían planeada sigue en pausa mientras avanzan con pruebas a menor escala.


