OpenAI ha presentado oficialmente dos nuevos modelos de conversación: GPT-Live-1 y GPT-Live-1 mini, diseñados para ofrecer una experiencia de voz mucho más natural y fluida dentro de ChatGPT. Esta actualización busca revolucionar la interacción entre los usuarios y los asistentes virtuales, acercando el diálogo con inteligencia artificial a una dinámica casi humana.
Estos modelos funcionan bajo un sistema full-duplex, lo que permite hablar y escuchar al mismo tiempo. Así, las personas pueden interrumpir al asistente de manera natural y la IA gestiona la conversación en tiempo real. OpenAI destacó que esta tecnología habilita funciones como la traducción simultánea y que la comunicación se asemeje a una charla cotidiana.
La nueva versión reemplaza el anterior Advanced Voice Mode y ahora GPT-Live-1 mini es la configuración estándar para todos los usuarios. Quienes tengan una suscripción paga a ChatGPT pueden acceder al modelo más grande, GPT-Live-1. Previamente, el sistema integraba tres componentes separados: un modelo de reconocimiento de voz, un modelo de lenguaje y un generador de voz.

Modelos full-duplex: conversaciones sin interrupciones
OpenAI señaló que los modelos GPT-Live-1 y GPT-Live-1 mini resuelven problemas de versiones previas, como la incapacidad para detenerse ante una interrupción o la falta de precisión en las respuestas. Ahora el sistema envía consultas a los modelos de texto más recientes, como GPT-5.5, para mejorar la búsqueda, el razonamiento y la ejecución de tareas complejas, mientras mantiene la conversación activa.
Una característica novedosa es la capacidad del modelo para permanecer en silencio y captar el contexto durante períodos extensos, respondiendo solo cuando el usuario lo requiere. Además, el nuevo modo de voz puede presentar información visual gracias a su acceso a los modelos GPT más recientes, una tendencia que también exploran otras empresas tecnológicas.
Novedades técnicas
Atty Eleti, responsable de producto de ChatGPT Voice, afirmó durante la presentación que ha mantenido conversaciones de entre 30 y 40 minutos consecutivos con el asistente mientras caminaba. Este avance apunta a que la voz se convierta en una interfaz principal para gestionar tareas informáticas complejas, más allá de consultas o comandos breves.

La compañía estima que más de 150 millones de personas ya interactúan con ChatGPT mediante funciones de voz y dictado, lo que subraya el impacto de esta tecnología. El objetivo de OpenAI es facilitar conversaciones más prolongadas y naturales, promoviendo un uso manos libres del asistente. Pese a las mejoras, la empresa aclaró que no busca posicionar su tecnología como un “compañero” digital, sino como una herramienta eficiente y segura, con salvaguardas para ofrecer respuestas adecuadas a adolescentes y recursos ante temas sensibles.
Interacciones más largas y mejoras en la experiencia de usuario
El desarrollo de asistentes conversacionales más expresivos y útiles no es exclusivo de OpenAI. Tanto Apple como Amazon actualizaron recientemente sus asistentes para optimizar la gestión del contexto y mejorar la naturalidad en las respuestas. Por su parte, startups como Sesame, fundada por Brendan Iribe y Ankit Kumar, exploran asistentes capaces de mantener conversaciones naturales mientras ejecutan tareas en segundo plano.
Otras empresas, como Monogram, también apuestan por respuestas visuales e interactivas, un enfoque en el que han invertido más de 40 millones de dólares estadounidenses en rondas iniciales de financiación.

Aspectos por perfeccionar
Durante una demostración, OpenAI mostró la función de traducción en vivo en hindi. Sin embargo, el asistente presentó un marcado acento estadounidense y una entonación poco natural, con un tono literario en el idioma que no resultó del todo fluido. La empresa explicó que el nuevo modo de voz está optimizado para la mayoría de los idiomas hablados, aunque no especificó cuáles forman parte de esa lista.
La compañía vislumbra que la voz podría convertirse en la interfaz principal para trabajar con sistemas de inteligencia artificial capaces de manejar tareas complejas y prolongadas. Aunque algunos informes mencionan la posibilidad de que OpenAI lance auriculares con capacidades de IA este año, hasta el momento no se ha compartido información concreta sobre productos de hardware.
Fuente: Infobae