Google lanzó Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, dos modelos de voz en tiempo real capaces de mantener una conversación mientras ejecutan herramientas y llamadas a API en segundo plano. La segunda variante incorpora procesamiento de varios pasos para tareas más complejas.
Gemini 3.8 Live está orientado a servicios que necesitan operar a mayor escala y controlar costos. Extended Thinking prioriza tareas que requieren encadenar acciones, comunicar avances y gestionar funciones asíncronas durante una misma interacción.
Artificial Analysis registró 82,6 puntos para Extended Thinking High en su índice de calidad de voz a voz y un 68,6% en su evaluación de desempeño agéntico. Estas pruebas permiten comparar modelos bajo condiciones comunes, pero no garantizan resultados idénticos en cada aplicación real.
Google también indicó que el audio generado por sus productos de IA incorpora SynthID, una marca de agua imperceptible diseñada para facilitar la identificación de contenido sintético.
Cómo opera Gemini 3.8 Live Extended Thinking
“Gemini 3.8 Live Extended Thinking razona y habla simultáneamente”, afirmó Google en su anuncio oficial. La palabra “razona” corresponde a la descripción técnica empleada por la empresa: el sistema procesa una tarea de varios pasos mientras entrega señales verbales tempranas y narra su progreso.
Las llamadas a funciones pueden continuar en segundo plano sin interrumpir el intercambio de voz. Una aplicación puede solicitar datos o activar una herramienta mediante una API mientras el modelo mantiene la conversación, en lugar de dejar al usuario esperando en silencio hasta recibir el resultado.

Ambos modelos admiten entradas visuales casi en tiempo real y pueden cambiar automáticamente entre 97 idiomas. Esa combinación permite que una aplicación procese voz, imágenes y resultados de herramientas dentro de una misma sesión.
Google reportó para Extended Thinking un 68,6% en tau-Voice, un 35,1% en la prueba bancaria Sierra tau-Voice y un 97,7% en Big Bench Audio. Son mediciones de tareas específicas y no sustituyen las pruebas con los idiomas, herramientas, tiempos de respuesta y condiciones de uso de cada producto.
Disponibilidad en la API, Gemini Live y Workspace
Los desarrolladores comenzaron a recibir ambos modelos mediante Gemini API y Google AI Studio. Esto permite probar conversaciones de voz y conectar funciones externas antes de incorporar la tecnología a una aplicación destinada a usuarios finales.
Para el público general, Gemini 3.8 Live también se integra en Search Live. Extended Thinking se despliega en Gemini Live y en funciones de Workspace, aunque el acceso depende del producto y del plan contratado; no todas las capacidades quedan abiertas para todas las personas al mismo tiempo.
Las ediciones empresariales permanecen en vista previa privada. Google anunció que después estarán disponibles para Gemini Enterprise y para clientes empresariales de Workspace, sin presentar el acceso inicial como un lanzamiento general para todas las organizaciones.


