OpenAI presentó este viernes dos nuevos modelos conversacionales, llamados GPT-Live-1 y GPT-Live-1 mini, con la promesa de que suenan más naturales y gestionan mejor los turnos de una conversación. Son modelos full-duplex, es decir que hablan y escuchan a la vez, lo que habilita interrumpir al asistente sin cortar el hilo y funciones como la traducción en vivo.

La empresa también reemplazará por defecto el actual Modo de Voz Avanzado de ChatGPT con GPT-Live-1 mini. Los usuarios de los planes de pago podrán acceder al modelo más grande, GPT-Live-1. El sistema anterior encadenaba tres piezas separadas: un modelo de voz a texto para transcribir, un modelo de lenguaje para generar la respuesta y un modelo de texto a voz para entregarla en audio.

¿Qué resuelven los nuevos modelos de voz?

Según OpenAI, los modelos anteriores fallaban en dos frentes: interrumpían al usuario mientras hablaba y no tenían suficiente capacidad de razonamiento para responder preguntas complejas. Para cubrir ese vacío, GPT-Live-1 deriva la consulta a los modelos de texto más recientes de la compañía, como GPT-5.5, para tareas de búsqueda, razonamiento o acciones de agente, mientras mantiene la conversación en curso.

La empresa mostró además que el modelo puede permanecer en silencio durante largos períodos y absorber el contexto de la charla hasta que se lo necesita. Como la nueva voz tiene acceso a los modelos GPT más nuevos, también puede presentar información en formato visual. Otras startups como Monogram, que levantó 40 millones de dólares en una ronda semilla de DST y Lux Capital, también apuestan por respuestas visuales para volver a los asistentes más interactivos.

Conversaciones largas y voz como interfaz

OpenAI diseñó la nueva voz de ChatGPT para sostener conversaciones extensas. Durante la presentación a la prensa, el líder de producto de ChatGPT Voice, Atty Eleti, contó que mantuvo charlas de 30 a 40 minutos con la función mientras salía a caminar.

La compañía cree que la voz puede convertirse en la interfaz principal de la computación para el trabajo complejo. Algunos reportes sugieren que podría lanzar un par de audífonos con capacidades de IA este año, aunque OpenAI no entregó información sobre productos de hardware.

"Con el tiempo, creemos que esto también va a habilitar el uso de la voz como una especie de interfaz principal de la computación, y para gestionar tareas de agente cada vez más largas y complejas", dijo Eleti. "Los casos de uso increíbles que vemos con Codex y ChatGPT creemos que la voz puede ser la interfaz del futuro para todo tipo de trabajo".

OpenAI viene reforzando sus funciones de voz durante los últimos años para que el modo de voz de ChatGPT suene más natural. La empresa afirmó que más de 150 millones de personas ya hablan con ChatGPT a través de funciones como Voz y Dictado.

La competencia también busca voces más expresivas

Los rivales también intentan volver más expresivos a sus asistentes. Tanto Apple como Amazon actualizaron los suyos para que sean más conversacionales y manejen mejor el contexto. Startups como Sesame, fundada por el cofundador de Oculus Brendan Iribe junto a Ankit Kumar, lanzaron asistentes de IA con conversación más natural que completan tareas en segundo plano.

OpenAI se mueve en la misma dirección, con el objetivo de que los usuarios hablen con su asistente sin usar las manos y durante más tiempo. Pese a que asegura que la nueva voz suena más natural, la compañía recalcó que no busca convertirla en un compañero de IA. Aclaró que los modelos incorporan salvaguardas para dar respuestas apropiadas a la edad de los adolescentes y ofrecer recursos si la conversación deriva hacia temas como la autolesión.

Todavía queda trabajo por hacer

El nuevo modo de voz aún necesita ajustes. Durante la demostración, cuando la empresa mostró la traducción en vivo al hindi, el asistente hablaba con un marcado acento estadounidense y un hindi poco natural, de tono algo libresco. OpenAI dijo que el nuevo modo está optimizado para "la mayoría de los idiomas hablados", pero no especificó cuáles.

Para el mercado hispanohablante, la calidad del acento será decisiva: una voz que traduce en vivo pero arrastra un dejo extranjero pierde buena parte de su utilidad frente a intérpretes humanos o soluciones locales.