Artificial Analysis, la web independiente de análisis de IA, publicó una evaluación de Grok 4.6 y le asignó 61 puntos en su Intelligence Index, cinco más que Grok 4.5.
La firma ubicó el avance principalmente en tareas que combinan varias instrucciones, herramientas y pasos de trabajo.
La evaluación registró 1.753 de Elo en GDPval-AA v2, una prueba de trabajo de conocimiento con agentes; 50,7% en 𝜏³-Banking, enfocada en atención bancaria con herramientas; y 88,4% en Terminal-Bench v2.1, que revisa tareas de software ejecutadas desde terminal.
El precio de la API se mantuvo en US$2 por millón de tokens de entrada y US$6 por millón de tokens de salida, según la ficha de Artificial Analysis. Esa tarifa es la misma que la que el sitio había informado para Grok 4.5.
Los indicadores comparan modelos bajo condiciones estandarizadas. Sirven para observar cambios entre versiones y alternativas, pero no reemplazan las pruebas que cada organización debe hacer con sus propios datos, herramientas y tiempos de respuesta.
Grok 4.6 mejora en tareas de agentes sin subir su tarifa base
Artificial Analysis señaló que Grok 4.6 alcanzó 61 puntos en su índice compuesto y quedó en línea con GPT-5.6 Sol Max dentro de esa medición.
El resultado no describe una superioridad general: en la misma tabla, los modelos de Anthropic quedaron por encima en la puntuación total.
El avance se observa en tres tipos de tareas distintas. GDPval-AA v2 emplea encargos de trabajo de conocimiento; 𝜏³-Banking combina conversación, recuperación de información y uso de herramientas; Terminal-Bench v2.1 mide resolución de tareas desde una terminal.
Esa diversidad ayuda a entender que la puntuación no se apoya en un único test.

La firma calculó un costo de US$0,84 por tarea dentro de su propia suite. Esa cifra depende de los prompts, los tokens generados y la ponderación de cada prueba, por lo que no equivale al costo fijo de una operación real. Sí permite comparar eficiencia entre modelos sometidos al mismo protocolo.
Para equipos que consumen modelos mediante API, el precio sin cambios es parte central de la actualización. Las tareas con razonamiento y herramientas suelen producir salidas extensas; mantener la tarifa de salida puede pesar más que una pequeña diferencia en el precio de entrada cuando se calcula el gasto total.
La ficha de Grok 4.6 también muestra límites de velocidad y contexto
La página del modelo en Artificial Analysis registra una ventana de contexto de 500 mil tokens. El límite permite trabajar con documentos o historiales largos, aunque por sí solo no garantiza que un modelo use bien toda esa información ni que entregue respuestas correctas en cada caso.
La misma medición sitúa su velocidad de salida en 65,5 tokens por segundo y señala que el modelo acepta texto e imágenes, pero genera texto.
También estima 39,57 segundos hasta el primer token de respuesta, una latencia superior a la mediana de modelos del mismo rango de precio en su base de datos.
El lanzamiento es una mejora de la posición competitiva de SpaceXAI frente a los principales laboratorios.
La evidencia independiente disponible respalda esa lectura en el segmento de agentes y costos, pero la utilidad final seguirá dependiendo del tipo de trabajo, el volumen de contexto y los requisitos de cada implementación.


