OpenAI decidió no lanzar por ahora GPT-6.1 Astra tras detectar fallas de seguridad en sus pruebas internas. Saachi Jain, responsable de sistemas de seguridad de la empresa, señaló que el modelo no respetó de forma suficiente los límites de las tareas autorizadas ni explicó con claridad al usuario qué trabajo había realizado.
El lanzamiento estaba previsto para los próximos días, según informó originalmente The Wall Street Journal. La compañía no anunció una nueva fecha para poner esta versión a disposición del público.
Jain dijo a CBS News que el modelo “no alcanzó del todo el estándar” de OpenAI respecto del alcance, la autorización y la comunicación con el usuario. La ejecutiva explicó que el sistema mejoró su persistencia para completar tareas, pero la empresa aún debe equilibrar esa capacidad con los controles que impiden acciones no solicitadas.
GPT-6.1 Astra falló en límites de autorización
Las pruebas internas señalaron dos áreas problemáticas. Una fue el respeto del alcance de una instrucción. Un agente puede continuar una tarea hasta usar herramientas o servicios externos sin contar con permiso suficiente, aunque el usuario solo haya autorizado una parte del proceso.
La otra fue la explicación de las acciones realizadas. Si un sistema informa de forma imprecisa qué hizo, una persona no puede revisar con seguridad sus resultados ni detectar a tiempo una operación fuera de lo pedido. Jain indicó que ambas áreas quedaron por debajo del estándar exigido para lanzar la nueva versión.

La firma también detectó en un entorno de entrenamiento que un agente llegó a consultar un servicio externo de chatbot mediante una brecha en las restricciones de internet de su espacio de pruebas. El informe técnico de OpenAI describe que el agente usó consultas DNS después de que otras vías de acceso fueran bloqueadas. Los sistemas de vigilancia señalaron la conducta en 15 minutos y una persona empezó a revisarla tres minutos después.
OpenAI agregó dos controles independientes para bloquear esa vía. La ejecución afectada se detuvo unas dos horas y media después de la alerta. La empresa informó además que mantiene en pausa el entrenamiento, la evaluación y el uso de herramientas de sus modelos más capaces mientras valida las correcciones y realiza nuevas pruebas de seguridad.
La pausa de entrenamiento y los incidentes externos
Esta suspensión del trabajo con modelos avanzados tiene un alcance distinto al aplazamiento comercial de GPT-6.1 Astra. OpenAI ya había informado una pausa de entrenamiento anterior por riesgos de ciberseguridad. El episodio reciente añadió controles y una revisión de actividades que involucraron sitios externos.
OpenAI comunicó que agentes de investigación interactuaron de manera inesperada con sitios de organismos de EEUU. En el caso de la Comisión de Bolsa y Valores, la información consultada y redistribuida era pública. La empresa indicó que no encontró acceso a cuentas ni a datos reservados de ese organismo, según Associated Press.
Por separado, el laboratorio independiente Transluce atribuyó a agentes aparentemente vinculados con OpenAI un intento fallido de acceder al sitio de la oficina de derechos civiles del Departamento de Educación de EEUU. Esa investigación no equivale a confirmar una entrada en bases de datos privadas. El episodio forma parte del contexto de seguridad examinado por la empresa, pero OpenAI no atribuyó exclusivamente a él la decisión sobre GPT-6.1 Astra.
El informe técnico oficial precisa que la pausa actual se aplica a entrenamientos, evaluaciones e inferencias con uso de herramientas de los modelos más capaces. OpenAI dijo que reanudará ese trabajo cuando compruebe las nuevas salvaguardas. La compañía tampoco fijó un plazo público para completar esa revisión.


