Google presentó Gemini 3.5 Transcribe, un nuevo modelo de reconocimiento de voz diseñado para manejar la forma imperfecta en que hablamos. Este avance tecnológico promete convertir tu discurso desordenado en texto limpio y formateado, sin necesidad de sonar como un presentador de noticias.
Gemini 3.5 Transcribe se lanza junto con dos modelos complementarios, Gemini 3.5 Live y Gemini 3.5 Live Experimental, formando lo que Google llama ‘Gemini Audio’.
Este modelo elimina automáticamente palabras de relleno como ‘eh’ y ‘ah’, corrige en tiempo real las autocorrecciones (por ejemplo, si dices ‘quedamos el martes, no, espera, miércoles’, entiende que te refieres al miércoles) y permite editar el texto usando solo tu voz. Además, puede delegar tareas a otros modelos Gemini, como la generación de imágenes o el análisis de archivos, a través de llamadas a funciones.
TE PUEDE INTERESAR: Llega ChatGPT para adolescentes con medidas de seguridad estrictas
Qué debes saber
- Gemini 3.5 Transcribe tiene una tasa de error de palabras del 4% para streaming en tiempo real y del 2,6% para audio pregrabado.
- Soporta más de 85 idiomas, acentos regionales y jerga especializada.
- Puede atribuir la voz a hasta tres altavoces diferentes en una grabación, con marcas de tiempo incluidas.
- Ya alimenta Rambler, la función de dictado en Gboard de Android, y la app Gemini en macOS.
- El soporte para Chrome llegará pronto, permitiendo dictar directamente en cualquier campo web.
Especificaciones técnicas
- Tasa de error de palabras: 4% (streaming en tiempo real), 2,6% (audio pregrabado)
- Idiomas soportados: Más de 85
- Acentos y jerga: Soportados
- Número de altavoces detectables: Hasta 3
Contenido generado con IA y editado por el equipo editorial.
Foto: Google.