
Foto: Axel Olivares (Composición/NotiPress)
OpenAI presentó GPT-Live, una nueva generación de modelos de voz destinada a impulsar ChatGPT Voice. La compañía busca reducir la sensación de hablar con una máquina mediante una inteligencia artificial capaz de escuchar, responder, manejar interrupciones y adaptarse al ritmo de una conversación humana.
El lanzamiento comenzó a desplegarse a nivel global desde este 8 de julio en iOS, Android y el sitio web de ChatGPT. GPT-Live se convertirá en el modelo predeterminado de ChatGPT Voice para usuarios de Go, Plus y Pro, mientras las cuentas Free tendrán acceso a una versión mini.
OpenAI describió el sistema como su "modelo de voz más inteligente hasta ahora". La principal novedad de GPT-Live es su capacidad para escuchar y hablar de manera simultánea. Según la información compartida por OpenAI, esta función permitirá manejar mejor las interrupciones, las pausas naturales y los momentos en los cuales el usuario prefiera que ChatGPT escuche sin intervenir.
El modelo también incorpora mejoras para mantener el enfoque aun con ruido de fondo. Tráfico en la calle, conversaciones cercanas u otros sonidos del entorno forman parte de los escenarios considerados para mejorar la experiencia de voz.
Además, GPT-Live cuenta con una arquitectura diseñada para delegar tareas más complejas a otro modelo en segundo plano, como GPT-5.5. Esa capacidad permite sostener la conversación por voz mientras se procesan solicitudes con mayor nivel de razonamiento.
Más opciones para ajustar la experiencia
OpenAI informó que cada semana más de 150 millones de personas usan Voice y Dictation en ChatGPT. Con GPT-Live, esa base de usuarios comenzará a recibir una experiencia de voz más flexible y adaptada a distintos tipos de conversación.
La actualización incorporará tres niveles de inteligencia para las respuestas: Instant, Medium y High. Con estas opciones, los usuarios podrán elegir entre una interacción más rápida o respuestas con mayor profundidad, según la tarea o el contexto de uso.
La experiencia también incluirá tarjetas visuales enriquecidas durante la conversación. Estas respuestas podrán mostrar información sobre clima, deportes, acciones y otros contenidos sin interrumpir el flujo de la interacción por voz.
Traducción en vivo
La traducción en vivo será otra función impulsada por GPT-Live. OpenAI plantea que la interacción continua permitirá una traducción en tiempo real más natural, con menor dependencia de frases aisladas o pausas constantes entre intervenciones.
Esta actualización forma parte de una línea de desarrollo más amplia para la voz en ChatGPT. "Con el tiempo, creemos que esta investigación permitirá usar la voz para trabajos cada vez más complejos, de mayor duración y con mayor capacidad agéntica", señaló OpenAI.
Finalmente, OpenAI informó que planea llevar estos modelos a la API próximamente. La compañía no detalló una fecha específica para su disponibilidad entre desarrolladores.
DESCARGA LA NOTA SÍGUENOS EN GOOGLE NEWS