Investigadores de la Universidad de California en Riverside identificaron señales internas que podrían ayudar a los modelos de lenguaje a advertir cuándo una respuesta tiene mayor riesgo de ser incorrecta. En una prueba, usaron esas señales para hacer que un modelo omitiera parte de las respuestas.
El equipo distinguió entre la seguridad con que un sistema presenta una respuesta y si esa respuesta es correcta. Ambas características pueden separarse, ya que un modelo puede contestar con firmeza y fallar, o expresar dudas y acertar.
La investigación se realizó con dos modelos de código abierto, Llama-3.1-8B de Meta y Gemma-2-9B de Google, mediante preguntas de opción múltiple. El trabajo científico se difundió antes del comunicado de la universidad y fue aceptado para una conferencia de minería de datos.
Het Patel, autor principal del estudio, explicó a la universidad que “un modelo puede responder con certeza y, aun así, equivocarse”. El hallazgo apunta a mejorar las evaluaciones de fiabilidad, un problema que también aparece en las pruebas de agentes.
Los modelos de lenguaje separan señales de duda y de error
Los investigadores agruparon las respuestas de los modelos de lenguaje en cuatro posibilidades: correctas, incorrectas, seguras y dubitativas. Después examinaron la actividad interna de los modelos con autoencoders dispersos, una técnica que permite localizar patrones de activación asociados a determinados comportamientos.
El análisis halló tres grupos de rasgos. Unos vinculados principalmente con la incertidumbre, otros con los errores y un tercer grupo asociado a ambas cosas. La distinción permitió intervenir el modelo mientras respondía, sin repetir el costoso proceso de entrenamiento.

Al reducir los rasgos asociados solo con la incertidumbre, la precisión cayó con fuerza. En cambio, intervenir la mayoría de los rasgos relacionados únicamente con respuestas incorrectas apenas modificó los resultados. Para el equipo, esto indica que una señal de duda puede cumplir una función útil y no equivale automáticamente a un fallo.
La intervención sobre los rasgos que combinaban duda y error produjo un efecto diferente. En esos casos la precisión de los modelos de lenguaje mejoró hasta 1,1% y una medida de incertidumbre de las respuestas se redujo hasta 75%. Los autores observaron efectos parecidos en varias pruebas de preguntas y respuestas, aunque esos porcentajes corresponden al entorno experimental estudiado.
Una alerta selectiva elevó la precisión entre las respuestas emitidas
En otra prueba, tres rasgos internos de una capa intermedia de Llama sirvieron para anticipar qué respuestas tenían mayor probabilidad de fallar. Al omitir las respuestas señaladas, la precisión de las que sí entregó el modelo subió de 62% a 81%. El sistema respondió aproximadamente 53% de las preguntas.
La comparación importa porque permitir que el modelo eligiera por sí solo la opción «no sé» elevó la precisión apenas a cerca de 64%. En este experimento, observar rasgos internos resultó más útil que confiar exclusivamente en la manera en que el modelo expresaba su propia duda.
Los investigadores también probaron si algunos rasgos identificados en un conjunto de preguntas mantenían efectos en otros y obtuvieron resultados similares, lo que sugiere que las señales no dependían por completo de una sola prueba.
Fuentes
Universidad de California en Riverside · Estudio científico en arXiv


