OpenAI lanza dos nuevos modelos de voz con IA para transcripción y chats en vivo

La empresa OpenAI, creadora de ChatGPT, ha presentado oficialmente dos nuevos modelos de inteligencia artificial especializados en el procesamiento de voz, diseñados tanto para transcribir conversaciones en vivo como para analizar archivos de audio completos de manera diferida.

Desde su cuenta oficial para desarrolladores en la red social X (anteriormente Twitter), el laboratorio de IA reveló la disponibilidad de GPT-Live-Transcribe, un modelo optimizado para transcripciones de baja latencia, y GPT-Transcribe, enfocado en el procesamiento por lotes de archivos de audio completos de forma asíncrona.

Ambos sistemas destacan por su capacidad para entender el contexto de las interacciones, lo que se traduce en transcripciones de mayor calidad. Pueden interpretar mejor diversos acentos, idiomas, frases cortas, números, terminología técnica especializada e incluso conversaciones con altos niveles de ruido de fondo.

Contexto como clave del rendimiento

Una característica distintiva de GPT-Live-Transcribe es su habilidad para emplear automáticamente textos previamente transcritos como referencia contextual. Esto permite que el modelo no comience desde cero en cada interacción, mejorando la coherencia de la transcripción.

OpenAI compartió resultados de su prueba interna de Reconocimiento Automático del Habla con Conciencia de Contexto (Context Aware ASR). En ella, la precisión semántica de GPT-Live-Transcribe saltó del 38,5% al 44,6% cuando se le proporcionaba información adicional. Por su parte, GPT-Transcribe mejoró del 41,6% al 45,2% en las mismas condiciones.

Estos datos demuestran que suministrar datos previos –como los idiomas esperados o la temática de una reunión– incrementa de forma notable la efectividad de ambos modelos, ya sea en conversaciones en tiempo real o con audios pregrabados.

Mejoras frente a versiones anteriores

En cuanto al desempeño con audios reales, GPT-Live-Transcribe registró una tasa de error de transcripción del 9,60%, superando al 11,65% de su antecesor GPT-Realtime-Whisper. De manera similar, GPT-Transcribe alcanzó un 8,98% de error, una mejora significativa frente al 15,21% del modelo original Whisper-1.

El laboratorio independiente Artificial Analysis reportó una tasa de error de palabras del 3,31% para GPT-Transcribe, consolidándolo como el mejor modelo de OpenAI en su categoría. No obstante, aún se sitúa ligeramente por detrás de competidores como Voxtral Small de Mistral y Gemini 3.1 Pro de Google, ambos con una tasa de error del 2,8%.

Precio y disponibilidad

OpenAI ha fijado el costo de GPT-Transcribe en 4,50 dólares por cada mil minutos de procesamiento, un precio pensado para desarrolladores y empresas que necesiten transcripciones masivas de alta fidelidad.

Fuente: Infobae

COMPARTIR ESTA NOTICIA

Facebook
Twitter

FACEBOOK