OpenAI pausó durante dos semanas el entrenamiento por refuerzo de sus modelos más recientes, Astra, destinados a despliegue y mantiene suspendida su mayor ejecución frontier prevista mientras refuerza controles de ciberseguridad.

La empresa dijo que sigue con entrenamientos y evaluaciones de menor escala para comprobar comportamiento, validar salvaguardas y reunir más evidencia de alineación antes de avanzar.

La compañía explicó que esta desaceleración llegó después de dos señales distintas: el incidente con Hugging Face y una evaluación preliminar según la cual podría alcanzar el umbral crítico de capacidades de ciberseguridad.

OpenAI no presentó ambos hechos como el mismo episodio, pero sí como razones para endurecer el proceso de desarrollo.

En su publicación oficial, OpenAI afirmó que endureció y sometió a pruebas internas sus entornos de investigación antes de reanudar parte del trabajo. 

El cambio no se limita a una pausa temporal. OpenAI añadió monitoreo obligatorio para entrenamientos y evaluaciones con herramientas en modelos de cierto nivel de capacidad, y también para las inferencias de Astra con herramientas.

La empresa estima que ese monitoreo añade un costo cercano al 20% del cómputo de inferencia supervisado.

OpenAI endurece el entorno de desarrollo de Astra y otros modelos

OpenAI detalló que reforzó el aislamiento de cargas de trabajo que ejecutan código generado por modelos o código no confiable.

También añadió más controles para separar de internet las cargas consideradas de mayor riesgo y rediseñó parte de su entorno para quitar servicios compartidos potencialmente vulnerables, reducir privilegios permanentes y mejorar los registros de seguridad.

La empresa señaló que hoy exige su nivel más estricto de salvaguardas de seguridad para cargas de trabajo que involucren a Astra o modelos orientados a ciberseguridad.

Algunas tareas de entrenamiento y evaluación de Astra ya cumplen ese estándar, pero una cantidad relevante sigue pausada hasta completar la migración a los nuevos entornos y mejoras.

Unidad de cómputo de OpenAI detenida por una barrera de pausa y un candado de ciberseguridad
OpenAI calcula que su nuevo monitoreo añade cerca del 20% del cómputo supervisado y busca emitir alertas en 30 minutos.

OpenAI también indicó que está priorizando primero las cargas de trabajo de seguridad y alineación dentro de esa migración.

Ese detalle sugiere que la reanudación completa no depende solo de volver a encender procesos, sino de adaptar cada flujo de trabajo a un umbral más alto de contención y supervisión.

El monitoreo de OpenAI busca alertas en 30 minutos

El nuevo sistema de OpenAI funciona por etapas. Empieza con clasificadores de activación que revisan actividad interna del modelo en tokens muestreados y eleva posibles señales a investigadores automatizados de mayor costo computacional.

Según la empresa, esos sistemas revisan acciones con herramientas, secuencias de actividad y trazas disponibles para detectar accesos no autorizados, robo de datos, conducta destructiva o intentos de eludir salvaguardas.

OpenAI dijo que aspira a emitir una alerta en un plazo de 30 minutos cuando aparezca actividad preocupante. Si el sistema detecta una posible violación de un límite crítico de seguridad y los equipos internos no pueden descartarla como falso positivo dentro de ese plazo, la expectativa es pausar esa actividad.

La cobertura ahora es más amplia. El monitoreo pasa a ser obligatorio para todo entrenamiento por refuerzo y evaluación con herramientas en modelos de capacidad Sol o superior.

Además, después de concluir que Astra podría tener capacidades críticas de ciberseguridad, OpenAI añadió ese requisito a todas las inferencias de Astra con herramientas, no solo a entrenamientos y evaluaciones.

Por ahora, el mensaje operativo es más concreto que retórico: menos velocidad en parte del desarrollo, más aislamiento del entorno y más recursos dedicados a vigilar lo que hacen los modelos durante pruebas internas.

Fuentes

Recommended Posts
0
Notebook con el logo de Claude Platform y tres iconos de sus nuevas herramientasTarjetas de noticias frente al logotipo de Google con una opción de Fuentes preferidas destacada