GuideLight publicó una evaluación de controles internos en cinco laboratorios de IA de frontera: Anthropic y OpenAI obtuvieron C+, Google recibió D+, xAI quedó en D− y Meta terminó con F.

La revisión se centró en cómo estas empresas controlan el uso interno de sus modelos, no en la calidad de sus productos públicos.

La organización revisó seis prácticas: registro de actividad, eficacia del monitoreo, acciones sujetas a aprobación, interrupción automática ante rachas de conducta marcada, revisión de terceros y plan de contención.

La escala va de 0 a 5, y ninguna empresa superó 3 puntos en ninguna categoría, lo que GuideLight describe como una implementación parcial sustancial, no completa.

Anthropic y OpenAI lideraron gracias a mejores notas en registro y monitoreo. Google destacó por tener la hoja de ruta pública más detallada sobre control, pero GuideLight dijo que encontró poca evidencia pública de que la mayor parte ya esté aplicada.

xAI fue además la única empresa evaluada que no participó en el Frontier Risk Report de METR (organización dedicada a evaluar riesgos y capacidades de IA), citado por GuideLight como una de sus referencias externas.

El trabajo no equivale a una auditoría oficial con acceso pleno a sistemas internos. GuideLight construyó las notas a partir de material público vigente hasta el 18 de agosto, así que un cero no prueba por sí solo que un control no exista, sino que no hubo evidencia pública suficiente para contarlo como implementado.

GuideLight midió seis controles para el uso interno de modelos de frontera

Los dos mejores resultados, ambos con C+, fueron para Anthropic y OpenAI, con promedio 2,50 sobre 5. En la tabla general, Anthropic logró 3 puntos en registro, eficacia del monitoreo, acciones sujetas a aprobación, interrupción automática y revisión de terceros, pero 0 en plan de contención. OpenAI también alcanzó 3 en registro y eficacia del monitoreo, y obtuvo otro 3 en plan de contención.

Google quedó con D+ y 1,50 puntos de promedio. Según GuideLight, su caso combina planes públicos bastante concretos con poca evidencia de despliegue ya operativo en varias áreas.

Meta terminó con F y 0,67 puntos, con 0 en acciones sujetas a aprobación, interrupción automática y plan de contención. xAI recibió D− y 0,83 puntos, con 0 en registro, eficacia del monitoreo y revisión de terceros.

Hoja de evaluación de GuideLight con sello C+ sobre controles internos de IA
GuideLight evaluó seis controles internos en cinco laboratorios y ninguna empresa superó 3 puntos sobre 5 en una práctica.

Las categorías peor resueltas fueron las que intentan frenar o contener fallos antes de que escalen. En acciones sujetas a aprobación e interrupción automática, solo Anthropic pasó de una implementación parcial limitada.

En plan de contención, OpenAI fue la única empresa con 3 puntos. GuideLight sostiene que ahí aparece una fragilidad concreta: si un sistema interno empieza a acumular acciones marcadas en rápida sucesión, los controles pueden no reaccionar con la suficiente rapidez o profundidad.

La parte más sólida del panorama aparece en detección y revisión externa. Tres empresas describen registro de al menos parte de su actividad interna para ser escaneada, y cuatro participaron en el ejercicio de METR.

Aun así, la propia evaluación de GuideLight remarca que ninguna compañía mostró un esquema plenamente implementado en las seis prácticas al mismo tiempo.

METR aporta contexto, pero no convierte estas notas en una certificación total

Esta evaluación se diferencia del AI Safety Index publicado en julio, que comparó 37 indicadores en nueve empresas. El informe de GuideLight es más estrecho: pregunta si cinco laboratorios tienen barreras concretas para vigilar y limitar lo que sus propios modelos hacen dentro de la empresa.

El antecedente externo más útil fue el Frontier Risk Report de METR, publicado en mayo, que trabajó con Anthropic, Google, Meta y OpenAI.

METR informó que los monitores automatizados detectaron muchas acciones dañinas, pero también encontró huecos de cobertura y varias maneras relativamente simples de desactivar o rodear esos controles.

Ese contexto ayuda a entender por qué GuideLight concentra sus críticas en prevención y contención, incluso cuando reconoce avances en registro y monitoreo.

Fuentes

Recommended Posts
0
Cámara Physis de Orbbec montada en un banco de calibración industrialFernando Chomalí habla en un atril universitario sobre empleo e IA