Microsoft lanzó MAI-Transcribe-2 como vista previa pública y redujo el costo de su servicio de transcripción de audio. El modelo admite 60 idiomas y tiene una tarifa promocional de US$0,10 por hora de audio hasta el 31 de diciembre de 2026.
MAI-Transcribe-2 está disponible mediante Azure Speech dentro de Microsoft Foundry, donde los desarrolladores pueden incorporarlo a aplicaciones y flujos empresariales. También se puede probar en MAI Playground antes de preparar una integración.
La herramienta identifica automáticamente el idioma, procesa conversaciones que alternan entre lenguas, separa a los participantes y asigna marcas de tiempo a cada palabra. Estas funciones permiten obtener registros estructurados de reuniones, entrevistas y llamadas en vez de un bloque continuo de texto.
Microsoft cobró US$0,36 por hora cuando presentó MAI-Transcribe-1 en abril. La promoción de la segunda generación reduce esa referencia cerca de un 72% y regirá hasta el 31 de diciembre de 2026.
MAI-Transcribe-2 separa hablantes y adapta el vocabulario
La separación de hablantes atribuye cada segmento de una conversación a una persona distinta. Las marcas de tiempo permiten localizar el momento exacto de una palabra, sincronizar subtítulos, navegar por una grabación y editar fragmentos concretos sin revisar el archivo completo.
Los desarrolladores pueden favorecer términos especializados mediante palabras clave, una función pensada para nombres de productos, conceptos médicos o vocabulario propio de una organización. El servicio también ofrece un estilo literal, que conserva muletillas y repeticiones, y otro limpio, que las elimina para producir textos más fáciles de leer.

Microsoft propone el modelo para subtítulos, transcripción de reuniones y entrevistas, análisis de llamadas, accesibilidad, archivos de contenido y agentes de voz. Los desarrolladores pueden usarlo mediante Azure Speech en Microsoft Foundry; MAI Playground ofrece un entorno separado para probar el modelo antes de integrarlo.
La empresa afirma que MAI-Transcribe-2 obtuvo una tasa media de error por palabra del 5,2% en FLEURS al evaluar 60 idiomas. FLEURS utiliza grabaciones de habla leída, una condición diferente de las conversaciones espontáneas o del audio con ruido intenso.
VentureBeat informó que Artificial Analysis situó el modelo en el segundo lugar de su medición de error por palabra y en la frontera que compara precisión con latencia. Esa evaluación independiente emplea las API públicas y tiene una presencia elevada de audio empresarial en inglés.
Acceso, costos y una alternativa gratuita para archivos
La tarifa de US$0,10 se cobra por cada hora de audio procesada durante la promoción. Una organización que transcriba 1.000 horas pagaría US$100 con la nueva tarifa, frente a US$360 con el precio de lanzamiento de MAI-Transcribe-1. La vigencia publicada termina el 31 de diciembre de 2026.
Microsoft Foundry está orientado a equipos que necesitan conectar la transcripción con productos, bases de datos o procesos automatizados mediante Azure Speech. MAI Playground permite probar las funciones del modelo antes de desarrollar esa conexión.
Quienes solo necesitan cargar grabaciones y obtener texto sin integrar una API pueden recurrir a Pinpoint. La herramienta gratuita de Google está dirigida principalmente a periodistas, académicos e investigadores y funciona mediante colecciones de archivos; Microsoft Foundry se orienta a integraciones programadas dentro de otros productos.


