Contratistas que evaluaban respuestas de ChatGPT para proyectos de OpenAI fueron despedidos o retirados de esas tareas después de usar herramientas de IA para realizarlas. La investigación que descubrió la situación se basó en documentos internos y conversaciones con trabajadores de distintos proyectos.
Entre sus funciones figuraba revisar respuestas generadas por los modelos y aportar valoraciones humanas. Esa tarea ayuda a mejorar cómo se comportan los sistemas, por lo que sustituir el criterio del evaluador por la salida de otro modelo altera el tipo de información que se buscaba obtener.
Dos de las personas consultadas trabajaban para Mercor, una empresa que suministra evaluadores a proyectos de OpenAI. Mercor confirmó que sus contratos prohíben usar modelos de lenguaje para completar las tareas asignadas. OpenAI declinó comentar el caso.
Un documento al que accedió 404 Media menciona proyectos con más de 10.000 contratistas. El reportaje identificó varios casos de trabajadores despedidos o apartados, sin entregar un total.
Las reglas para evaluar ChatGPT exigen trabajo humano
Las instrucciones internas prohibían a los evaluadores usar IA para redactar comentarios, revisar trabajo o completar sus análisis. La lista incluía chatbots, herramientas de traducción automática y Grammarly. También prohibía a los supervisores emplear detectores de texto generado por IA como GPTZero.
Mercor explicó a 404 Media que “cuando confirmamos que un experto usó IA para completar una tarea, lo retiramos inmediatamente del proyecto”. La empresa sostuvo que contrata a estas personas por su experiencia y criterio.

Una persona que reconoció haber usado IA mostró al medio lo que presentó como su carta de desvinculación. Según ese documento, la empresa detectó problemas con la autenticidad de sus entregas. Otros dos contratistas dijeron que conocían casos de trabajadores despedidos o retirados por la misma razón.
El uso de revisores humanos forma parte del desarrollo de los modelos de OpenAI. La empresa explica públicamente que utiliza aportes de entrenadores e investigadores, además de otras fuentes de información, durante las etapas de entrenamiento y evaluación. El trabajo de estos trabajadores de ChatGPT tiene una función distinta de los datos generados automáticamente.
El documento revisado por 404 Media instruía a los supervisores a juzgar el patrón general del trabajo antes de concluir que alguien utilizó IA. Entre las señales posibles mencionaba palabras repetidas, puntuación característica y entregas completadas en tiempos inusualmente breves.
La misma guía desaconsejaba revelar a los evaluadores qué indicio había despertado la sospecha, porque esa información facilitaría ocultar la conducta. También calificaba a los detectores automáticos de IA como poco fiables para esta tarea de supervisión.
Fuentes
Investigación de 404 Media · OpenAI sobre datos y retroalimentación humana · Tom’s Guide


