El modo de voz de ChatGPT ha sido reescrito: te hará olvidar que estás hablando con una inteligencia artificial
OpenAI ha presentado los modelos GPT-Live-1 y GPT-Live-1 mini, con el objetivo de hacer que la experiencia de voz de ChatGPT sea más natural.
OpenAI ha anunciado nuevos modelos de voz para el modo de voz de ChatGPT. Los modelos, denominados GPT-Live-1 y GPT-Live-1 mini, tienen como objetivo permitir que los usuarios conversen con la inteligencia artificial de una manera más natural y fluida.
Según la información proporcionada por la empresa, los nuevos modelos pueden gestionar mejor las pausas y las transiciones durante la conversación. De este modo, se pretende que las conversaciones de voz con ChatGPT se acerquen más a la sensación de una charla mutua que a la clásica experiencia de comando y respuesta.
PODRÁ HABLAR Y ESCUCHAR AL MISMO TIEMPO
Una de las características destacadas de los nuevos modelos de voz es el soporte para comunicación bidireccional completa, definida como "full-duplex". Gracias a esta estructura, el asistente puede continuar hablando mientras escucha la voz del usuario al mismo tiempo. Esto tiene como objetivo proporcionar una experiencia más fluida, especialmente en conversaciones largas.
Se ha indicado que el modo de voz actual en ChatGPT será reemplazado por defecto por el modelo GPT-Live-1 mini. Los usuarios con suscripciones de pago podrán acceder a GPT-Live-1, que se presenta como un modelo más grande y avanzado.
La infraestructura de voz anterior de OpenAI consistía en múltiples etapas, como un sistema de voz a texto que convertía la voz del usuario en texto, un modelo de lenguaje que generaba la respuesta y un sistema de texto a voz que expresaba esa respuesta. Se afirma que los nuevos modelos transforman esta estructura en una experiencia más directamente basada en la voz.
La empresa subraya que el nuevo modo de voz ha sido desarrollado para conversaciones de larga duración. Según la información transmitida, un ejecutivo de OpenAI comentó que pudo mantener conversaciones ininterrumpidas de 30 a 40 minutos durante sus caminatas utilizando esta función. Se espera que la nueva estructura también reduzca problemas como que el asistente interrumpa innecesariamente a los usuarios.
El modo de voz puede recurrir en segundo plano a GPT-5.5, el modelo de texto actual de la empresa, para consultas más complejas que requieran búsqueda, razonamiento o capacidades de agente. En este proceso, el objetivo es que el flujo de la conversación de voz continúe sin interrupciones.
Sin embargo, aún no está claro si el nuevo sistema ofrecerá el mismo nivel de rendimiento en todos los idiomas. En una demostración de traducción en vivo al hindi, se informó que el asistente hablaba con un marcado acento estadounidense y que el idioma sonaba artificial. Aunque OpenAI afirma que el nuevo modo está optimizado para "la mayoría de los idiomas más hablados", no compartió una lista detallada de idiomas.
Fuente de la noticia: 12punto
Mas leidos
Serdal Adalı presenta una denuncia contra la prensa
¡A tal cabeza, tal corte de pelo!
Una votación triste
El Fenerbahçe organizará una ceremonia de firma para Romelu Lukaku
Evaluación jurídica sobre la 'Ley Marco'
Cargando nueva infraestructura 3- Centros de datos y el orden mundial
El precio más bajo en vehículos sin ÖTV es de 783 mil liras turcas: Aquí está la lista
La encuesta del YENİ Parti sacude el panorama
Sale a la luz la declaración de la sospechosa que quemó la bandera en Muğla
El líder de los Süleymancılar, Alihan Kuriş, bajo custodia