Em 8 de julho de 2026, a OpenAI lançou mundialmente o "GPT-Live", um novo modelo que renova a voz do ChatGPT (anúncio oficial da OpenAI). Feito na véspera da disponibilização geral do GPT-5.6 no dia 9, seu maior diferencial é a arquitetura full-duplex (duplex total), que permite "ouvir e falar ao mesmo tempo".

Até agora, a voz da IA funcionava por turnos: "espera você terminar de falar para responder". O GPT-Live dá retornos afirmativos, acomoda interrupções e não corta o silêncio de quando você está pensando, como numa conversa humana. Neste artigo, explicamos, com base no anúncio oficial, o que é o GPT-Live, o que muda em relação ao Advanced Voice Mode tradicional, como ele funciona, em quais planos está disponível e o que ainda não consegue fazer.

Atualização em 25 de setembro de 2026: desde a publicação, mudaram o modelo dos bastidores e os limites de uso de voz (9 de setembro), a API passou a ter disponibilidade geral (10 de setembro) e a voz chegou ao ChatGPT Work (23 de setembro). Mantivemos a explicação do lançamento e reescrevemos, com datas, as partes que hoje são diferentes (fontes: notas de versão da OpenAI, artigo de ajuda do ChatGPT Voice, changelog da API).

FULL-DUPLEX VOICE · 2026

O fim do sistema de turnos

— rumo a uma conversa humana, que fala enquanto ouve

Duplex total
Ouvir + falar ao mesmo tempo
Retornos e interrupções OK
Preferido
Claramente preferido ao Advanced Voice Mode
Avaliação humana, conversas de 5–10 min
2 modelos
Live-1 / Live-1 mini
O mini está disponível até no plano gratuito
Delegação
Busca e raciocínio profundo vão para outro modelo
O modelo dos bastidores é atualizado a cada lançamento

1. O que é o GPT-Live — voz full-duplex que "fala enquanto ouve"

O GPT-Live é uma nova série de modelos de voz responsável pela conversa por voz do ChatGPT. Substituindo o recurso de voz anterior (Advanced Voice Mode), ele foi lançado mundialmente no iOS, Android e Web do ChatGPT a partir de 8 de julho de 2026.

O cerne está no design "full-duplex (duplex total)". Como num telefone, ele processa a entrada (a sua voz) enquanto, ao mesmo tempo, continua gerando a saída (a voz da IA). Por isso —

  • enquanto você está falando, ele consegue devolver retornos afirmativos como "aham" ou "entendi"
  • se você interromper no meio da fala da IA, ela ouve direitinho e muda de rumo
  • se você ficar em silêncio pensando, ele não interpreta isso como "fim da fala" e não corta você

Em resumo, o GPT-Live viabiliza uma conversa em tempo real, sem "fila de espera".

2. O que muda em relação ao Advanced Voice Mode tradicional

A voz de IA anterior (Advanced Voice Mode) funcionava por turnos (half-duplex). Pela própria concepção, tinha estas fraquezas.

AspectoAnterior: Advanced Voice ModeNovo: GPT-Live
Método básicoPor turnos (half-duplex) — espera você terminar de falarDuplex total — fala enquanto ouve
Detecção do fim da falaBaseada no silêncioNão espera uma pausa clara: acompanha pausas, interrupções e mudanças de ritmo enquanto ouve, e decide na hora
Silêncio de reflexãoTende a interromper, achando que "acabou"Consegue esperar sem cortar
Retornos afirmativosBasicamente inexistentesDevolve "mhmm", "yeah", etc.
InterrupçõesÀs vezes corta de forma artificialAcomoda e se ajusta
Frequência de decisãoPor turnoVárias vezes por segundo (falar / ouvir / fazer pausa / interromper / chamar ferramentas)

Segundo a OpenAI, numa comparação avaliada por humanos em conversas de 5 a 10 minutos sob as mesmas condições, tanto o GPT-Live-1 quanto o GPT-Live-1 mini foram claramente preferidos em relação ao Advanced Voice Mode. Além disso, foram relatadas melhorias em GPQA (raciocínio científico especializado), BrowseComp (busca web agêntica) e tarefas de atendimento ao cliente.

3. Como funciona — decisões a cada segundo e delegação a um modelo nos bastidores

O GPT-Live gera a saída de áudio enquanto processa continuamente a entrada de áudio e, várias vezes por segundo, decide "o que fazer agora" — falar, continuar ouvindo, fazer uma pausa, interromper ou chamar uma ferramenta. Essa tomada de decisão em alta frequência é o que produz um ritmo humano.

Outro ponto importante do design é "delegar o processamento profundo a um modelo nos bastidores". A prontidão da conversa fica a cargo do GPT-Live e, quando é preciso fazer busca na web, raciocínio profundo ou tarefas complexas, ele passa o processamento a um modelo maior nos bastidores (no momento do lançamento, o GPT-5.5) e retorna à conversa quando o resultado chega. É um mecanismo que concilia "pensar" sem interromper a conversa.

A OpenAI escreveu no anúncio que "à medida que lançarmos novos modelos de fronteira, atualizaremos continuamente o modelo usado pelo GPT-Live", e foi o que aconteceu: desde 9 de setembro de 2026, a voz usa o GPT-5.6 ou o GPT-6 Astra (notas de versão da OpenAI). Ou seja, o nome do modelo dos bastidores vai continuar mudando. O que vale guardar não é o nome, e sim a estrutura: uma parte mantém a conversa e outra cuida de pensar. A inteligência das respostas depende do modelo dos bastidores; a facilidade de conversar, do GPT-Live.

No lançamento, a profundidade do raciocínio era escolhida entre três níveis: Instant (GPT-5.5 Instant) / Medium / High (GPT-5.5 Thinking). Esses níveis exclusivos da voz foram descontinuados em 9 de setembro de 2026; agora o modelo e o esforço de raciocínio são escolhidos com os mesmos controles do chat de texto (o que está disponível depende do plano; notas de versão da OpenAI). A lógica continua a mesma: rapidez para um papo leve e mais reflexão para consultas complexas.

4. Os dois modelos e a oferta por plano

PlanoNo lançamento (8 de julho de 2026)Em 25 de setembro de 2026 (voz no Chat, a cada 24 horas)
GrátisGPT-Live-1 miniGPT-Live-1 mini (acesso limitado; os limites podem mudar)
GoGPT-Live-13 horas com o GPT-Live-1 mini
PlusGPT-Live-13 horas com o GPT-Live-1
ProGPT-Live-115 horas no plano de $100 e ilimitado no de $200 (GPT-Live-1)
Business / Enterprise / EduNão disponívelDisponível conforme as configurações do workspace. Business Standard tem 3 horas e Premium, 15; o uso extra custa 1,25 crédito por minuto

O ponto principal é que até o plano gratuito pode usar a versão mini do GPT-Live. A conversa natural full-duplex não fica restrita aos planos pagos. No lançamento, o GPT-Live-1 era o padrão no Go/Plus/Pro, mas desde 9 de setembro de 2026 o Go usa o GPT-Live-1 mini, e Plus e Pro não mudam mais para o mini ao atingir um limite de voz (notas de versão da OpenAI). Os workspaces Business, Enterprise e Edu, que ficaram de fora no lançamento, agora podem usá-lo conforme suas configurações (OpenAI Help). Está disponível no ChatGPT para iOS, Android e ChatGPT.com, com liberação gradual no mundo todo. Os limites são revisados, então confira a tabela da OpenAI Help antes de contar com eles.

5. Principais avanços

🗣️ Retornos afirmativos (backchannel)

Reage com "aham" enquanto você fala. Cria a sensação de que está sendo ouvido.

⏱️ Troca ágil

Decide várias vezes por segundo se fala ou continua ouvindo, e responde no ritmo da conversa. Nem o anúncio da OpenAI nem a página do modelo informam um número de latência.

✋ Acompanha interrupções

Mesmo que você corte no meio da fala, ele ouve e reajusta o rumo do conteúdo.

🤫 Não corta o silêncio

Não confunde a pausa para pensar com "fim da fala" e espera por você.

6. Limitações atuais — sejamos honestos

Como as expectativas podem se adiantar à realidade, vale ser honesto sobre o que ele não consegue fazer. Abaixo, separamos as limitações do lançamento entre as que continuam valendo e as que já foram resolvidas (em 25 de setembro de 2026).

  • 🟡 Sem vídeo nem compartilhamento de tela: igual ao lançamento, o Live não aceita entrada de vídeo nem compartilhamento de tela (OpenAI Help). Quando precisar, mude para a voz Advanced anterior no app de iOS ou Android.
  • 🟡 O suporte multilíngue completo ainda está por vir: no lançamento, a OpenAI escreveu que o GPT-Live foi otimizado para os idiomas mais usados e que, em alguns, pode ter sotaque não nativo ou falhas de fluência.
  • 🟡 Feito para conversa a dois: ainda não está otimizado para várias pessoas falando ao mesmo tempo e pode responder quando as pessoas conversam entre si (OpenAI Help).
  • 🟢 A API já está disponível: no lançamento era "em breve", e passou a ter disponibilidade geral em 10 de setembro de 2026 (veja o capítulo 8).
  • 🟡 Liberação escalonada: quais recursos você tem, e quando, depende do plano, da região, das configurações do workspace e da versão do app.

Espera-se que esses pontos sejam ampliados em futuras atualizações, mas convém entender que não é "vídeo e tela já".

7. Onde usar

  • Consultas e brainstorming mãos-livres: caminhando ou trabalhando, organize suas ideias falando em voz alta. Como o silêncio não é cortado, o raciocínio não se interrompe com facilidade.
  • Prática de conversação em idiomas: com retornos afirmativos e interrupções naturais, dá para praticar de forma próxima a uma conversa real.
  • Pesquisar e resumir por voz: a busca profunda é delegada a um modelo nos bastidores, então dá para pesquisar enquanto conversa.
  • Passar trabalho falando: desde 23 de setembro de 2026, você pode falar com o ChatGPT Work na web e no celular e pedir documentos, slides e planilhas. Se uma tarefa ainda estiver em andamento quando você encerrar a chamada, ela continua por texto (é preciso ter acesso a Voice e a Work; notas de versão da OpenAI).
  • Acessibilidade: em situações em que digitar é difícil, uma interface de voz com bom ritmo é útil.

A OpenAI Help também traz dicas concretas para aproveitar melhor.

  • Se quiser pensar em voz alta, avise antes: no começo, diga algo como "espere até eu pedir para você responder", e ele se segura. Pausas longas ou ruídos de fundo ainda podem fazê-lo responder.
  • Se ele interromper demais, mude o ambiente: use fones de ouvido, vá para um lugar mais silencioso ou aumente o volume do aparelho. No iPhone, abra a Central de Controle, escolha Modo do Microfone e ative Isolamento de Voz.
  • Para texto ditado, use o ditado: as transcrições de voz não são literais e podem não bater exatamente com o que foi dito. Se quiser revisar e editar o que falou antes de enviar, o ditado (Dictation) é mais adequado que a conversa (Voice).
  • Saiba como as gravações são tratadas: os clipes de áudio ficam guardados com a transcrição do chat por 30 dias. Eles só são usados para treinamento se você mesmo ativar o compartilhamento (no Business, Enterprise e Edu não é possível compartilhar). As transcrições podem ser usadas conforme a sua configuração "Melhorar o modelo para todos".

Se você quer trabalhar com uma gravação já salva, em vez de conversar por voz, veja como enviar áudio ao ChatGPT e conferir a transcrição. Anexar um MP3 ou M4A é diferente do Voice e tem condições próprias de disponibilidade e tamanho.

8. Situação da API e diferença em relação ao GPT-Realtime

No lançamento, a API do GPT-Live era "em breve", e desenvolvedores e empresas só podiam se inscrever para receber avisos. Depois, em 10 de setembro de 2026, ela passou a ter disponibilidade geral na API (changelog da API da OpenAI). Segundo a página do modelo em 25 de setembro de 2026, o ID do modelo é gpt-live-1, ele roda num endpoint Live próprio (v1/live/sessions) e as sessões de voz custam $0.05 por minuto, cobradas por segundo. O modelo dos bastidores e as ferramentas são cobrados à parte.

Na API, assim como no ChatGPT, a montagem é o GPT-Live conduzindo a conversa e um backend que pensa. Você pode deixar a OpenAI rodar o modelo do backend ou conectar seu próprio agente ou serviço (guia oficial). Sua aplicação continua responsável por checar permissões e por tudo o que mexe nos seus próprios sistemas.

Para desfazer a confusão: a API também tem modelos de voz separados do GPT-Live — GPT-Realtime-2.1 / GPT-Realtime-2.1 mini (lançados em 6 de julho de 2026), modelos de voz com raciocínio e uso de ferramentas para a Realtime API. A construção é diferente: GPT-Live = uma camada de conversa full-duplex que escuta enquanto fala e passa o raciocínio para um backend, e GPT-Realtime = uma base para agentes de voz sobre a Realtime API. O guia de agentes de voz da OpenAI compara quando usar cada um.

Resumo

  • O GPT-Live é um novo modelo que muda a voz do ChatGPT de "por turnos" para duplex total (fala enquanto ouve) (8 de julho de 2026, em todo o mundo).
  • Com retornos afirmativos, aceitação de interrupções e tolerância ao silêncio, alcança um ritmo de conversa próximo do humano. Foi claramente preferido em relação ao Advanced Voice Mode.
  • O GPT-Live cuida da agilidade da conversa, enquanto o raciocínio profundo e a busca são delegados a um modelo nos bastidores (GPT-5.5 no lançamento; GPT-5.6 ou GPT-6 Astra desde 9 de setembro de 2026).
  • Grátis e Go usam o GPT-Live-1 mini; Plus e Pro, o GPT-Live-1 (em 25 de setembro de 2026). Business, Enterprise e Edu podem usá-lo conforme as configurações. Disponível no ChatGPT para iOS/Android/web.
  • Limitações atuais: sem vídeo nem compartilhamento de tela, e o suporte multilíngue completo ainda não chegou. A API passou a ter disponibilidade geral em 10 de setembro de 2026 ($0.05 por minuto). O GPT-Realtime-2.1 é outra linha de modelos de voz da API.

FAQ

Q1. O GPT-Live também funciona no plano gratuito?

Sim. O plano gratuito pode usar o GPT-Live-1 mini com acesso limitado. Em 25 de setembro de 2026, o Go também usa o GPT-Live-1 mini (até 3 horas por dia), e Plus e Pro usam o superior, GPT-Live-1. Está disponível no ChatGPT para iOS, Android e web (liberação gradual).

Q2. O que é exatamente "duplex total"?

É um método que permite ouvir e falar ao mesmo tempo, como num telefone. Diferente do sistema por turnos tradicional (que espera você terminar de falar para responder), ele consegue devolver retornos afirmativos enquanto você fala, acomodar interrupções e esperar sem cortar o seu silêncio de reflexão.

Q3. Qual é a maior diferença em relação ao Advanced Voice Mode tradicional?

É o método de detectar o fim da fala. O anterior era baseado no silêncio e tendia a interromper, confundindo a pausa para pensar com "acabou". O GPT-Live não espera uma pausa clara: acompanha pausas, interrupções e mudanças de ritmo enquanto ouve, e decide várias vezes por segundo se responde ou continua ouvindo (system card da OpenAI), sendo por isso mais difícil de cortar você e mais natural. Também foi claramente preferido em avaliações humanas.

Q4. Ele também responde a perguntas difíceis?

Sim. O GPT-Live cuida da agilidade da conversa e, quando é preciso busca na web ou raciocínio profundo, delega o processamento a um modelo nos bastidores e traz os resultados de volta à conversa. No lançamento esse modelo era o GPT-5.5; desde 9 de setembro de 2026 ele usa o GPT-5.6 ou o GPT-6 Astra, e o modelo e o esforço de raciocínio são escolhidos com os mesmos controles do chat de texto.

Q5. Dá para usar vídeo ou compartilhamento de tela?

Não, em 25 de setembro de 2026. O Live não aceita vídeo nem compartilhamento de tela; quando precisar, mude para a voz Advanced anterior no app de iOS ou Android (OpenAI Help). No lançamento, a OpenAI disse que estava trabalhando para trazer esses recursos.

Q6. Posso integrá-lo ao meu app via API?

Sim. A API do GPT-Live passou a ter disponibilidade geral em 10 de setembro de 2026; o ID do modelo é gpt-live-1, e as sessões de voz custam $0.05 por minuto (o modelo dos bastidores e as ferramentas são cobrados à parte). Existe também a linha separada GPT-Realtime-2.1 / mini, então escolha conforme você priorize a naturalidade da conversa ou prefira se apoiar na Realtime API existente.

Q7. Como ele se compara ao Gemini Live do Google?

O Gemini Live do Google permite compartilhar a câmera ou a tela do celular enquanto você fala (ajuda do Gemini Live). Em 25 de setembro de 2026, o GPT-Live não aceita vídeo nem compartilhamento de tela; por isso, se você quer mostrar o que está vendo, o Gemini Live leva vantagem. O ponto forte que a OpenAI destaca no GPT-Live é a naturalidade da conversa em duplex total: ele dá sinais de que está ouvindo enquanto você fala, aceita interrupções no meio da frase e espera em silêncio enquanto você pensa. A OpenAI não publicou números de latência, então não dá para comparar a velocidade de resposta. Para mais detalhes, veja também a comparação GPT-5.6 vs Gemini.

Artigos relacionados