Investigadores de NVIDIA reportaron que Nemotron-3-Ultra-CC obtuvo 535,4 de 600 puntos en la IOI 2026, la Olimpiada Internacional de Informática para estudiantes escolares.
Según su paper, la marca quedó por encima del mejor puntaje humano oficial, 498,27, y del corte de oro de 361,12 puntos.
El experimento no fue una participación oficial ni estuvo supervisado por la organización de la competencia. El resultado debe leerse como una cifra publicada por el equipo de NVIDIA, no como una clasificación de la IOI.
El paper fue publicado en arXiv el 2 de septiembre. Sus autores sostienen que hicieron la prueba durante la competencia, antes de que los problemas se hicieran públicos, sin acceso a internet, con ejecución local de código y un máximo de 50 envíos por problema.
La tabla oficial de resultados muestra que el mejor competidor humano fue Xu Qiwen, de China, con 498,27 puntos.
Nemotron-3-Ultra-CC parte de un modelo de 550.000 millones de parámetros totales y 55.000 millones activos, según NVIDIA. El trabajo llega mientras la empresa también avanza con la compra de Hugging Face.
Cómo fue la prueba de Nemotron-3-Ultra-CC en la IOI 2026
La IOI se desarrolla en dos sesiones de cinco horas, repartidas en dos días, con tres problemas por sesión.
NVIDIA dice que su sistema trabajó sobre ese conjunto de ejercicios durante la ventana oficial y antes de su publicación abierta, una condición que busca evitar que las soluciones ya circularan por internet.
Los autores describen un solo intento en vivo, no una selección posterior entre muchas corridas para elegir la cifra más alta.
En ese intento, el sistema alcanzó 535,4 puntos. El documento especifica que Nemotron-3-Ultra-CC no fue inscrito como concursante, por lo que su marca quedó fuera del ranking formal.

NVIDIA afirma que utilizó hasta 760 GPU GB300 durante el despliegue. Ese dato es necesario para interpretar el resultado: la infraestructura del experimento es muy distinta de los recursos disponibles para una persona que compite en la olimpiada.
El equipo también comparó el intento con cinco corridas independientes posteriores. En ellas reportó un promedio de 521,72 puntos, con resultados entre 495,0 y 545,8.
La repetición aporta contexto, pero la evidencia sigue siendo un paper del propio equipo, sin validación externa independiente.
El entrenamiento y la inferencia que describe el paper de NVIDIA
El trabajo presenta una canalización para programación competitiva que combina curación de datos, ajuste supervisado y un método de inferencia llamado GenCorrect.
Los investigadores indican que reunieron 22.000 problemas para entrenar variantes centradas en este tipo de tareas.
Para la versión evaluada en la IOI, NVIDIA usó datos generados por GLM-5.2 como profesor para el ajuste supervisado.
También aumentó el presupuesto de generación de 200 a 1.000 soluciones por problema en la etapa final, para ampliar el número de candidatos que podía evaluar antes de enviar una respuesta.
Otro cambio fue usar cuantización NVFP4 para acelerar la inferencia. El paper reporta 736,8 tokens por segundo por GPU en la configuración elegida, frente a 199,1 en su comparación con BF16.
Esa reducción de precisión busca producir más alternativas dentro del tiempo limitado de la competencia.
NVIDIA señala que planea liberar el checkpoint específico para programación competitiva junto con sus recetas de inferencia y evaluación.
La comparación con el puntaje humano oficial describe un resultado técnico llamativo, pero no demuestra que el modelo pueda reemplazar a programadores ni que su resultado haya sido certificado por la IOI.


