La compañía tecnológica estadounidense ha revelado su más reciente avance en inteligencia artificial: Gemini 3.5 Transcribe, un modelo de conversión de voz a texto diseñado para capturar el estilo natural del habla, reconocer vocabulario personalizado y ejecutar órdenes directamente desde la voz, incluso rellenando formularios en el navegador Chrome.
Según informó la empresa en un comunicado oficial, se trata de su modelo “más preciso hasta la fecha”, capaz de entender y transcribir el lenguaje hablado en más de 85 idiomas. Además, elimina automáticamente palabras de relleno como “ums” o “ahs” y preserva la intención y el estilo original del usuario.
El sistema también ha sido optimizado para funcionar con precisión en entornos ruidosos, puede distinguir hasta tres hablantes diferentes con marcas de tiempo, y detecta acentos regionales o dialectos, lo que lo hace especialmente útil para contextos diversos como el ecuatoriano.
En concreto, Google explicó que el modelo transforma el audio sin procesar directamente en texto “preciso, pulido y formateado”, gestionando las autocorrecciones mientras la persona habla y dando formato automático al texto para reflejar la intención final del mensaje.
Las cifras de rendimiento son llamativas. Según mediciones de Análisis Artificial, Gemini 3.5 Transcribe alcanza una tasa de error de palabras (WER) promedio del 4% para transmisión de datos en tiempo real y del 2,6% para casos de uso sin transmisión. En comparación con su predecesor, la latencia se ha reducido significativamente: el tiempo para la transcripción final mejora en un 70%.
Integración con herramientas cotidianas
Más allá del modelo en sí, Google ha detallado cómo esta tecnología hará que el trabajo sea “más natural e intuitivo”. Gemini 3.5 Transcribe ya está integrado en interfaces como Gboard, Antigravity, la aplicación Gemini y, próximamente, en Chrome.
En Gboard para Android, los usuarios podrán dictar pensamientos y el sistema eliminará automáticamente las palabras de relleno. En Google Antigravity, la transcripción se combinará con el contexto de pantalla y el historial de chat para lograr una precisión aún mayor.
Para los desarrolladores, Google AI Studio permite utilizar el modelo para escribir código de aplicaciones con la voz, aunque solo está disponible en el modo Build. En la aplicación Gemini para macOS, se habilitan comandos de voz que se integran con el contexto de pantalla para optimizar flujos de trabajo: resumir archivos, reutilizar texto entre aplicaciones o generar imágenes, todo con solo hablar.
Finalmente, Google está trabajando en una función para Chrome que permitirá dictar texto en cualquier campo web, facilitando la redacción de respuestas, publicaciones o el uso de Gemini mediante la voz.
Disponibilidad actual
Gemini 3.5 Transcribe ya está al alcance de todos los usuarios en la aplicación de Gemini para macOS (en inglés) y en Rambler para Android. Para los desarrolladores, se ha lanzado en versión preliminar pública en la API Gemini a través de Google AI Studio y Google Antigravity. También está disponible en versión preliminar en Gemini Enterprise Agent Platform.
Fuente: Infobae