Traducir ya no significa únicamente escribir un texto en otro idioma. En 2026, la inteligencia artificial (IA) está llevando esta tecnología a conversaciones en tiempo real, donde los sistemas pueden escuchar una voz, interpretar lo que se dice y responder en otro idioma con pocos segundos de diferencia.
El cambio se apoya en modelos de IA capaces de procesar directamente audio, además de texto. Google, por ejemplo, afirma que Gemini 3.5 Live Translate permite traducción de voz en tiempo real en más de 70 idiomas y 2.000 combinaciones lingüísticas.
El avance coincide con el Día Internacional de la Traducción, que se celebra cada 30 de septiembre. En 2026, la Federación Internacional de Traductores (FIT) eligió como tema ‘Diversidad lingüística y derechos lingüísticos’, con el lema ‘el poder de ser comprendido’.
TE PUEDE INTERESAR: Meta presenta Muse para la gestión de PYMEs
De traducir textos a traducir conversaciones
- Durante años, la traducción automática funcionó principalmente como una herramienta de texto: el usuario escribía una frase, seleccionaba un idioma y recibía una versión traducida.
- La IA está cambiando ese flujo. Los nuevos modelos pueden trabajar directamente con audio y generar una respuesta hablada en otro idioma, sin depender necesariamente de una cadena de pasos separados de transcripción, traducción y síntesis de voz.
- Google explica que su modelo de traducción en tiempo real puede detectar más de 70 idiomas y generar voz traducida mientras avanza la conversación. También busca conservar elementos como la entonación, el ritmo y el tono de quien habla.
- Microsoft trabaja en una aproximación similar con GPT Realtime Translate, un modelo diseñado para procesar flujos de audio de manera continua y generar voz y texto traducidos mientras la conversación ocurre.
El celular se convierte en intérprete
- En septiembre de 2026, Google anunció nuevas funciones de Live Translate en Google Translate. En Android, las traducciones pueden continuar funcionando en segundo plano y, en iPhone, la traducción puede escucharse directamente a través del auricular del teléfono. La compañía señala que más de un tercio de las sesiones de traducción en vivo duran más de cinco minutos.
- Google afirma que sus modelos más recientes están diseñados para procesar audio directamente y reconocer elementos como el tono, la emoción y el cambio entre idiomas dentro de una misma conversación. La compañía también señala que sus tecnologías actuales funcionan en más de 300 idiomas y que busca ampliar el soporte hasta las 1.000 lenguas más habladas.
Foto: Brett Jordan en Unsplash.