OpenAI lanzó GPT-Live, una nueva clase de modelos de voz diseñados para que conversar con ChatGPT se sienta como hablar con una persona real. La novedad técnica es una arquitectura full-duplex: el modelo puede escuchar y hablar al mismo tiempo, en lugar del rígido turno de "usuario habla, IA responde" al que estábamos acostumbrados.

Hay dos versiones desplegándose a nivel mundial de inmediato. GPT-Live-1 es para usuarios de pago en los planes Go, Plus y Pro, mientras que GPT-Live-1 mini está disponible en cuentas gratuitas. Ambas funcionan en iOS, Android y en ChatGPT.com, y OpenAI adelantó que sumará acceso vía API pronto.

¿Cómo logra sonar más humano?

Según OpenAI, GPT-Live toma decisiones varias veces por segundo sobre si hablar, seguir escuchando, pausar, interrumpir o llamar a una herramienta. El modelo puede usar frases de relleno como "mmm" o "entiendo" para señalar que está siguiendo la conversación, y el usuario puede interrumpirlo, tomarse un momento para pensar o pedirle que hable más lento.

Los números de preferencia acompañan el cambio. Comparado con el anterior "Modo de voz avanzado", los evaluadores prefirieron GPT-Live-1 en el 75,7 por ciento de los casos y a GPT-Live-1 mini en el 69,2 por ciento. La actualización también agrega tarjetas visuales que la voz puede mostrar durante una conversación para datos como clima, precios de acciones o resultados deportivos, y renueva las nueve voces disponibles.

¿Cómo cierra la brecha de inteligencia?

El cambio más profundo es la separación entre gestionar la conversación en vivo y razonar de verdad. Cuando una pregunta necesita búsqueda web, razonamiento o capacidades de agente, GPT-Live entrega la tarea a un modelo de fondo, hoy GPT-5.5, y mantiene la conversación viva mientras ese modelo trabaja.

Esa delegación corrige una debilidad grave de los modelos de voz anteriores, que respondían solo con sus propias capacidades y quedaban muy por detrás de los modelos de frontera. Los benchmarks lo reflejan con claridad:

  • En la prueba GPQA de razonamiento científico, GPT-Live-1 alcanza 84,2 por ciento de precisión en nivel de razonamiento alto, frente a 45,3 por ciento del Modo de voz avanzado.
  • En BrowseComp, un benchmark de búsqueda web basada en agentes, GPT-Live-1 anota 75,2 por ciento, mientras que el Modo de voz avanzado apenas llega a 0,7 por ciento. La versión mini alcanza 31,6 por ciento.
  • En el test interno tau3 Voice Telecom, GPT-Live-1 (High) resuelve cerca del 65 por ciento de las tareas de soporte en unos 385 segundos, contra el 30 por ciento del modo anterior.

El usuario además puede elegir un nivel de razonamiento, desde "Instant" para respuestas rápidas hasta "Medium" y "High" para tareas que ameritan más tiempo de reflexión.

Sonar más humano también sube las apuestas de seguridad

Existe una tendencia bien documentada de las personas a tratar a los modelos de IA como humanos y a dejarse convencer de todo tipo de acciones, a veces con consecuencias serias. Un sistema que suena y responde aún más como una persona probablemente amplifica ese riesgo.

OpenAI dice haber incorporado medidas de seguridad que se activan incluso mientras el usuario todavía habla: el sistema puede orientar al modelo hacia respuestas más seguras, mostrar información adicional o terminar la conversación en situaciones de alto riesgo. Aparecen líneas de ayuda en crisis cuando surgen temas de autolesión, y para usuarios menores el modelo fue entrenado para comportarse de forma apropiada a la edad, con controles parentales asociados. Cabe notar que a comienzos de este año NVIDIA había liberado un modelo similar de código abierto llamado PersonaPlex.