El 8 de julio de 2026, OpenAI lanzó a todo el mundo un nuevo modelo que renueva la voz de ChatGPT: «GPT-Live» (anuncio oficial de OpenAI). Fue un anuncio previo a la disponibilidad general de GPT-5.6 al día siguiente, el 9, y su mayor rasgo distintivo es una arquitectura full-duplex: «puede escuchar y hablar al mismo tiempo».

Hasta ahora, la voz de la IA funcionaba por turnos: «espera a que termines de hablar y luego responde». GPT-Live, como en una conversación humana, asiente, encaja las interrupciones y no corta el silencio en el que estás pensando. En este artículo explicamos, basándonos en el anuncio oficial, qué es GPT-Live, en qué se diferencia del anterior Advanced Voice Mode, cómo funciona, en qué planes se puede usar y qué cosas todavía no puede hacer.

Actualización a 25 de septiembre de 2026: desde la publicación cambiaron el modelo en segundo plano y los límites de uso de voz (9 de septiembre), la API pasó a disponibilidad general (10 de septiembre) y la voz llegó a ChatGPT Work (23 de septiembre). Mantenemos la explicación del lanzamiento y reescribimos, con fechas, las partes que hoy son distintas (fuentes: notas de versión de OpenAI, artículo de ayuda de ChatGPT Voice, registro de cambios de la API).

FULL-DUPLEX VOICE · 2026

El fin de los turnos

— Escuchar mientras se habla, hacia una conversación humana

Full-duplex
Escuchar y hablar a la vez
Asentir e interrumpir OK
Preferido
Claramente preferido frente a Advanced Voice Mode
Evaluación humana, charlas de 5–10 min
2 modelos
Live-1 / Live-1 mini
mini disponible incluso gratis
Delegación
La búsqueda y el razonamiento profundo van a otro modelo
El modelo de fondo se actualiza con cada lanzamiento

1. Qué es GPT-Live: voz full-duplex que «escucha mientras habla»

GPT-Live es una nueva serie de modelos de voz encargada de las conversaciones habladas de ChatGPT. Sustituye a la función de voz anterior (Advanced Voice Mode) y, desde el 8 de julio de 2026, se desplegó en todo el mundo en iOS, Android y la web de ChatGPT.

Su esencia está en el diseño «full-duplex». Como en una llamada telefónica, procesa la entrada (tu voz) mientras genera simultáneamente la salida (la voz de la IA). Por eso:

  • Mientras estás hablando, puede devolverte señales de asentimiento como «ajá» o «claro»
  • Si interrumpes mientras la IA habla, te escucha bien y cambia de rumbo
  • Aunque te quedes en silencio pensando, no lo malinterpreta como «he terminado de hablar» ni te corta

En resumen, lo que logra GPT-Live es una conversación en tiempo real sin «esperar tu turno».

2. En qué se diferencia del anterior Advanced Voice Mode

La voz de IA anterior (Advanced Voice Mode) funcionaba por turnos (half-duplex). Por su diseño, tenía estas debilidades.

AspectoAntes: Advanced Voice ModeNuevo: GPT-Live
Método básicoPor turnos (half-duplex): espera a que termines de hablarFull-duplex: escucha y habla a la vez
Detección del fin del hablaBasada en el silencioNo espera a una pausa clara: sigue las pausas, las interrupciones y los cambios de ritmo mientras escucha, y decide al momento
Silencio para pensarTiende a interrumpir al creer que «has terminado»Sabe esperar sin cortar
AsentimientoBásicamente no lo haceDevuelve «mhmm», «yeah», etc.
InterrupcionesA veces se corta de forma poco naturalLas encaja y se ajusta
Frecuencia de decisiónPor turnoVarias veces por segundo (hablar / escuchar / pausar / interrumpir / llamar a herramientas)

Según OpenAI, en una comparación evaluada por personas sobre conversaciones de 5 a 10 minutos en igualdad de condiciones, tanto GPT-Live-1 como GPT-Live-1 mini fueron claramente preferidos frente a Advanced Voice Mode. Además, se reportan mejoras en GPQA (razonamiento científico especializado), BrowseComp (búsqueda web de tipo agente) y tareas de atención al cliente.

3. Cómo funciona: decisiones cada segundo y delegación en un modelo en segundo plano

GPT-Live genera la salida de voz mientras procesa de forma continua la entrada de voz, y decide «qué hacer ahora» varias veces por segundo: hablar, seguir escuchando, hacer una pausa, interrumpir o llamar a una herramienta. Esta toma de decisiones de alta frecuencia es la que produce un ritmo humano.

Otro diseño clave es que «el procesamiento profundo se delega en el modelo de fondo». La inmediatez de la conversación la asume GPT-Live y, cuando hacen falta búsqueda web, razonamiento profundo o tareas complejas, entrega el trabajo a un modelo mayor en segundo plano (en el lanzamiento, GPT-5.5) y, una vez obtenido el resultado, vuelve a la conversación. Es un mecanismo que compagina el «pensar» sin interrumpir la conversación.

OpenAI escribió en el anuncio que "a medida que lancemos nuevos modelos de frontera, actualizaremos de forma continua el modelo que usa GPT-Live", y así fue: desde el 9 de septiembre de 2026, la voz usa GPT-5.6 o GPT-6 Astra (notas de versión de OpenAI). Es decir, el nombre del modelo de fondo seguirá cambiando. Lo que conviene recordar no es el nombre sino la estructura: una parte mantiene la conversación y otra se encarga de pensar. Lo inteligente de las respuestas depende del modelo de fondo; lo fácil que resulta hablar, de GPT-Live.

En el lanzamiento, la profundidad del razonamiento se elegía entre tres niveles: Instant (GPT-5.5 Instant) / Medium / High (GPT-5.5 Thinking). Estos niveles exclusivos de voz se retiraron el 9 de septiembre de 2026; ahora el modelo y el esfuerzo de razonamiento se eligen con los mismos controles que el chat de texto (lo disponible depende del plan; notas de versión de OpenAI). La idea de fondo no cambia: velocidad para una charla ligera y más reflexión para consultas complejas.

4. Dos modelos y disponibilidad por plan

PlanEn el lanzamiento (8 de julio de 2026)A 25 de septiembre de 2026 (voz en Chat, por 24 horas)
GratisGPT-Live-1 miniGPT-Live-1 mini (acceso limitado; los límites pueden cambiar)
GoGPT-Live-13 horas con GPT-Live-1 mini
PlusGPT-Live-13 horas con GPT-Live-1
ProGPT-Live-115 horas en el plan de $100 e ilimitado en el de $200 (GPT-Live-1)
Business / Enterprise / EduNo disponibleDisponible según la configuración del espacio de trabajo. Business Standard tiene 3 horas y Premium 15; el uso adicional cuesta 1,25 créditos por minuto

Lo clave es que incluso el plan gratuito puede usar la versión mini de GPT-Live. La conversación natural full-duplex no se limita a los planes de pago. En el lanzamiento, GPT-Live-1 era el predeterminado en Go/Plus/Pro, pero desde el 9 de septiembre de 2026 Go usa GPT-Live-1 mini, y Plus y Pro ya no pasan a mini al alcanzar un límite de voz (notas de versión de OpenAI). Los espacios de Business, Enterprise y Edu, excluidos en el lanzamiento, ahora pueden usarlo según su configuración (OpenAI Help). Está disponible en ChatGPT para iOS, Android y ChatGPT.com, con un despliegue gradual en todo el mundo. Los límites se revisan, así que consulta la tabla de OpenAI Help antes de contar con ellos.

5. Principales avances

🗣️ Asentimiento (backchanneling)

Reacciona con un «ajá» mientras hablas. Aparece la sensación de que te está escuchando.

⏱️ Intercambio ágil

Decide varias veces por segundo si hablar o seguir escuchando, y responde con buen ritmo. Ni el anuncio de OpenAI ni la página del modelo dan una cifra de latencia.

✋ Sigue las interrupciones

Aunque cortes a mitad de frase, te escucha y corrige el rumbo del contenido.

🤫 No corta el silencio

No confunde la pausa para pensar con el «fin del habla»: te espera.

6. Limitaciones actuales: seamos honestos

Como las expectativas pueden ir por delante de la realidad, conviene ser honestos sobre lo que no puede hacer. A continuación separamos las limitaciones del lanzamiento entre las que siguen vigentes y las que ya se resolvieron (a 25 de septiembre de 2026).

  • 🟡 Sin vídeo ni pantalla compartida: igual que en el lanzamiento, Live no admite entrada de vídeo ni compartir pantalla (OpenAI Help). Si los necesitas, cambia a la voz Advanced anterior en la app de iOS o Android.
  • 🟡 El soporte multilingüe completo aún está por llegar: en el lanzamiento, OpenAI escribió que GPT-Live está optimizado para los idiomas más usados y que en algunos puede tener acento no nativo o carencias de fluidez.
  • 🟡 Pensado para conversaciones uno a uno: todavía no está optimizado para varias personas hablando a la vez y puede responder cuando las personas hablan entre sí (OpenAI Help).
  • 🟢 La API ya está disponible: en el lanzamiento era "próximamente" y pasó a disponibilidad general el 10 de septiembre de 2026 (ver capítulo 8).
  • 🟡 Despliegue escalonado: qué funciones tienes, y cuándo, depende del plan, la región, la configuración del espacio de trabajo y la versión de la app.

Se espera que estas cosas se amplíen en futuras actualizaciones, pero conviene entender que no es «vídeo y pantalla ya mismo».

7. Dónde usarlo

  • Consultas y lluvia de ideas manos libres: mientras caminas o trabajas, ordenas las ideas en voz alta. Como no te corta el silencio, cuesta menos que se rompa el hilo del pensamiento.
  • Práctica de conversación en idiomas: con el asentimiento y las interrupciones naturales, la práctica se acerca a una conversación real.
  • Investigar y resumir por voz: la búsqueda profunda se delega en un modelo en segundo plano, así que puedes investigar mientras hablas.
  • Encargar trabajo hablando: desde el 23 de septiembre de 2026 puedes hablarle a ChatGPT Work en web y móvil y pedirle documentos, diapositivas y hojas de cálculo. Si una tarea sigue en marcha al colgar, continúa por texto (hace falta acceso a Voice y a Work; notas de versión de OpenAI).
  • Accesibilidad: en situaciones en las que escribir resulta difícil, una interfaz de voz con buen ritmo resulta útil.

OpenAI Help también da consejos concretos para sacarle más partido.

  • Si quieres pensar en voz alta, avísalo antes: al empezar, dile algo como "espera hasta que te pida que respondas" y se contendrá. Las pausas largas o los ruidos de fondo aún pueden hacer que responda.
  • Si te interrumpe a menudo, cambia el entorno: usa auriculares, busca un sitio más silencioso o sube el volumen del dispositivo. En iPhone, abre el Centro de control, elige Modo de micrófono y activa Aislamiento de voz.
  • Para texto dictado, usa el dictado: las transcripciones de voz no son literales y pueden no coincidir exactamente con lo dicho. Si quieres revisar y editar lo que dijiste antes de enviarlo, el dictado (Dictation) encaja mejor que la conversación (Voice).
  • Conoce cómo se tratan las grabaciones: los clips de audio se guardan con la transcripción del chat y se conservan 30 días. Solo se usan para entrenar si activas tú mismo la opción de compartirlos (en Business, Enterprise y Edu no se pueden compartir). Las transcripciones pueden usarse según tu ajuste "Mejorar el modelo para todos".

Si quieres trabajar con una grabación ya guardada, en lugar de conversar por voz, consulta cómo subir audio a ChatGPT y revisar la transcripción. Adjuntar un MP3 o M4A es una función distinta de Voice, con sus propias condiciones de disponibilidad y tamaño.

8. Estado de la API y diferencia con GPT-Realtime

En el lanzamiento, la API de GPT-Live era "próximamente" y los desarrolladores y empresas solo podían apuntarse para recibir avisos. Después, el 10 de septiembre de 2026 pasó a disponibilidad general en la API (registro de cambios de la API de OpenAI). Según la página del modelo a 25 de septiembre de 2026, el ID del modelo es gpt-live-1, funciona con un endpoint Live propio (v1/live/sessions) y las sesiones de voz cuestan $0.05 por minuto, facturadas por segundo. El modelo de fondo y las herramientas se facturan aparte.

En la API, igual que en ChatGPT, se monta con GPT-Live llevando la conversación y un backend que piensa. Puedes dejar que OpenAI ejecute el modelo del backend o conectar tu propio agente o servicio (guía oficial). Tu aplicación sigue encargándose de comprobar permisos y de todo lo que toque tus propios sistemas.

Para aclarar la confusión: la API también tiene modelos de voz distintos de GPT-Live: GPT-Realtime-2.1 / GPT-Realtime-2.1 mini (lanzados el 6 de julio de 2026), modelos de voz con razonamiento y uso de herramientas para la Realtime API. Están construidos de forma distinta: GPT-Live = una capa de conversación full-duplex que escucha mientras habla y pasa el razonamiento a un backend, y GPT-Realtime = una base para agentes de voz sobre la Realtime API. La guía de agentes de voz de OpenAI compara cuándo usar cada uno.

Conclusión

  • GPT-Live es un nuevo modelo que cambia la voz de ChatGPT de «por turnos» a full-duplex (escuchar mientras se habla) (8 de julio de 2026, a nivel mundial).
  • Con asentimiento, interrupciones y tolerancia al silencio, logra un ritmo de conversación cercano al humano. Fue claramente preferido frente a Advanced Voice Mode.
  • GPT-Live se encarga de la agilidad de la conversación, mientras que el razonamiento profundo y la búsqueda se delegan en un modelo en segundo plano (GPT-5.5 en el lanzamiento; GPT-5.6 o GPT-6 Astra desde el 9 de septiembre de 2026).
  • Gratis y Go usan GPT-Live-1 mini; Plus y Pro, GPT-Live-1 (a 25 de septiembre de 2026). Business, Enterprise y Edu pueden usarlo según su configuración. Disponible en ChatGPT para iOS/Android/web.
  • Limitaciones actuales: sin vídeo ni pantalla compartida, y el soporte multilingüe completo aún no llega. La API pasó a disponibilidad general el 10 de septiembre de 2026 ($0.05 por minuto). GPT-Realtime-2.1 es otra línea de modelos de voz de la API.

FAQ

P1. ¿Se puede usar GPT-Live gratis?

Sí. El plan gratuito puede usar GPT-Live-1 mini con acceso limitado. A 25 de septiembre de 2026, Go también usa GPT-Live-1 mini (hasta 3 horas al día), y Plus y Pro usan el superior, GPT-Live-1. Está disponible en ChatGPT para iOS, Android y web (despliegue gradual).

P2. ¿Qué es exactamente «full-duplex»?

Es un método que permite escuchar y hablar al mismo tiempo, como en una llamada telefónica. A diferencia del sistema por turnos anterior (esperar a que termines de hablar para responder), puede devolverte señales de asentimiento mientras hablas, encajar las interrupciones y esperar sin cortar el silencio en el que estás pensando.

P3. ¿Cuál es la mayor diferencia con el anterior Advanced Voice Mode?

El método para detectar el fin del habla. Antes se basaba en el silencio y tendía a interrumpir al malinterpretar la pausa para pensar como «he terminado». GPT-Live no espera a una pausa clara: sigue las pausas, las interrupciones y los cambios de ritmo mientras escucha, y decide varias veces por segundo si responder o seguir escuchando (tarjeta de sistema de OpenAI), por lo que es más difícil que te corte y resulta más natural. También fue claramente preferido en la evaluación humana.

P4. ¿Puede responder también a preguntas difíciles?

Sí. GPT-Live se encarga de la agilidad de la conversación y, cuando hace falta búsqueda web o razonamiento profundo, delega el procesamiento en un modelo en segundo plano y devuelve los resultados a la conversación. En el lanzamiento ese modelo era GPT-5.5; desde el 9 de septiembre de 2026 usa GPT-5.6 o GPT-6 Astra, y el modelo y el esfuerzo de razonamiento se eligen con los mismos controles que el chat de texto.

P5. ¿Puede hacer vídeo o pantalla compartida?

No, a 25 de septiembre de 2026. Live no admite vídeo ni compartir pantalla, así que, cuando los necesites, cambia a la voz Advanced anterior en la app de iOS o Android (OpenAI Help). En el lanzamiento, OpenAI dijo que trabajaba para añadir estas funciones.

P6. ¿Puedo integrarlo en mi propia app por API?

Sí. La API de GPT-Live pasó a disponibilidad general el 10 de septiembre de 2026; el ID del modelo es gpt-live-1 y las sesiones de voz cuestan $0.05 por minuto (el modelo de fondo y las herramientas se facturan aparte). También existe la línea separada GPT-Realtime-2.1 / mini, así que elige según priorices la naturalidad de la conversación o prefieras apoyarte en la Realtime API existente.

P7. ¿Cómo se compara con Gemini Live de Google?

Gemini Live de Google permite compartir la cámara o la pantalla del móvil mientras hablas (ayuda de Gemini Live). A 25 de septiembre de 2026, GPT-Live no admite vídeo ni compartir pantalla, así que, si quieres mostrar lo que estás viendo, Gemini Live lleva ventaja. El punto fuerte que OpenAI destaca de GPT-Live es la naturalidad de la conversación full-duplex: da señales de escucha mientras hablas, acepta que lo interrumpas a mitad de frase y espera en silencio mientras piensas. OpenAI no ha publicado cifras de latencia, así que la velocidad de respuesta no se puede comparar. Para más detalles, consulta también la comparación GPT-5.6 vs Gemini.

Artículos relacionados