Una licitación simulada registró afirmaciones falsas de agentes de IA basados en Qwen3-Max-Preview, de Alibaba; DeepSeek-V3.2-Exp, de DeepSeek; y Kimi-K2, de Moonshot. Los resultados forman parte de una investigación de Reuters sobre conductas engañosas en sistemas que combinan modelos de Inteligencia Artificial con herramientas informáticas.

Reuters examinó más de 200 documentos e identificó al menos 20 estudios o evaluaciones desde 2025. Una de las pruebas registró alguna afirmación falsa en el 88% de las sesiones de Qwen y Kimi y en el 84% de las de DeepSeek.

Los agentes recibieron información sobre las capacidades de un producto y las exigencias del cliente antes de competir por contratos simulados. Modelos de EEUU incluidos en la prueba produjeron resultados similares.

Las pruebas de agentes de IA detectaron falsedades y fallas ocultas

Al permitirles utilizar rondas anteriores antes de reintentar, las conductas engañosas aumentaron entre 12 y 20 puntos porcentuales para los tres modelos chinos. El porcentaje mide sesiones con al menos una afirmación falsa dentro del experimento.

“Son las mismas señales de alerta que observan los laboratorios de EEUU, en sistemas menos capaces”, dijo a Reuters Alex Mallen, investigador de Redwood Research, una organización dedicada a estudiar riesgos de sistemas avanzados.

Nombres Qwen, DeepSeek y Kimi en una composición editorial sobre errores de agentes de IA
Qwen3-Max-Preview y Kimi-K2 produjeron al menos una afirmación falsa en el 88% de las sesiones de una licitación simulada.

Otra evaluación, titulada “Are Your Agents Upward Deceivers?”, examinó 11 modelos mediante 200 tareas, cinco tipos de instrucciones y ocho escenarios. Investigadores del Laboratorio de Inteligencia Artificial de Shanghái, la Universidad de Ciencia y Tecnología de Hong Kong y otras instituciones diseñaron obstáculos como herramientas dañadas, archivos ausentes y fuentes incompatibles.

Archivos fabricados y registros de las acciones ejecutadas

Los autores detectaron respuestas basadas en conjeturas, operaciones simuladas sin respaldo, cambios de fuente y archivos fabricados. Definieron el problema mediante la diferencia entre el éxito anunciado al usuario y las acciones registradas durante la ejecución. Un informe podía parecer completo aunque la herramienta necesaria para obtener los datos hubiera fallado.

El conjunto de pruebas publicado por los investigadores permite observar esas diferencias en tareas concretas. Incluye leer con una herramienta inutilizada, responder con un archivo irrelevante y sustituir el documento solicitado por otro disponible. También combina descargas fallidas o archivos inexistentes con una tarea posterior de análisis.

El código oficial utiliza Smolagents, una herramienta para construir agentes de IA, y conserva registros por tarea. La evaluación emplea otro modelo como juez, con plantillas que clasifican conductas y explican el resultado. Entre los criterios figuran omitir una descarga fallida, utilizar un archivo sustituto y generar un supuesto archivo de origen.

Las instrucciones para evitar conjeturas y comunicar anomalías redujeron algunas conductas, pero persistieron errores. Los autores también observaron que exigir formatos rígidos o encadenar varias tareas podía favorecer la omisión de fallas. Estas condiciones forman parte del diseño de la prueba y afectan la interpretación de sus resultados.

Los registros permiten contrastar el reporte final con las operaciones ejecutadas. Para quienes automatizan trabajos con documentos, la comparación puede revelar que una respuesta provino de otra fuente o de contenido generado, aunque el sistema la presente como resultado de una descarga. El repositorio deja disponibles los datos, el programa de evaluación y sus plantillas.

Fuentes

Recommended Posts
0
SynthID Bio junto a una proteína de cintas verdes y naranjas con una señal gráfica de identificaciónNombre Grok Bot junto a un avatar central con una estrella conectado con dos avatares secundarios