Sommaire
- 1. Qu'est-ce que GPT-Live — la voix full-duplex qui « écoute en parlant »
- 2. En quoi diffère-t-il de l'Advanced Voice Mode classique
- 3. Comment ça marche — des décisions à chaque seconde et une délégation à un modèle en arrière-plan
- 4. Deux modèles et disponibilité par forfait
- 5. Principales avancées
- 6. Limites actuelles — à connaître honnêtement
- 7. Cas d'usage
- 8. Disponibilité de l'API et différence avec GPT-Realtime
- Conclusion
- FAQ
Le 8 juillet 2026, OpenAI a lancé dans le monde entier « GPT-Live », un nouveau modèle qui renouvelle la voix de ChatGPT (annonce officielle d'OpenAI). Cette annonce, faite la veille de la disponibilité générale de GPT-5.6 le 9, met en avant une caractéristique majeure : une architecture full-duplex qui permet « d'écouter et de parler en même temps ».
Jusqu'ici, les voix IA fonctionnaient par tours de parole : « elles attendent que vous ayez fini de parler avant de répondre ». GPT-Live, lui, ponctue la conversation de signaux d'écoute, encaisse les interruptions et ne coupe pas les silences pendant lesquels vous réfléchissez, comme dans une conversation humaine. Dans cet article, nous expliquons, sur la base de l'annonce officielle, ce qu'est GPT-Live, ce qui le distingue de l'Advanced Voice Mode classique, comment il fonctionne, sur quels forfaits il est disponible et ce qu'il ne sait pas encore faire.
Mise à jour au 25 septembre 2026 : depuis la publication, le modèle d'arrière-plan et les limites d'usage de la voix ont changé (9 septembre), l'API est devenue disponible pour tous (10 septembre) et la voix est arrivée dans ChatGPT Work (23 septembre). Nous avons gardé l'explication du lancement et réécrit, avec les dates, les passages qui diffèrent aujourd'hui (sources : notes de version d'OpenAI, article d'aide ChatGPT Voice, journal des modifications de l'API).
La fin des tours de parole
— vers une conversation humaine, qui écoute en parlant
1. Qu'est-ce que GPT-Live — la voix full-duplex qui « écoute en parlant »
GPT-Live est une nouvelle série de modèles vocaux qui prend en charge les conversations vocales de ChatGPT. Il remplace la fonction vocale précédente (Advanced Voice Mode) et a été déployé dans le monde entier sur ChatGPT (iOS, Android et Web) à partir du 8 juillet 2026.
Le cœur du dispositif réside dans sa conception « full-duplex ». Comme au téléphone, il traite l'entrée (votre voix) tout en générant en même temps et sans interruption la sortie (la voix de l'IA). Résultat —
- Pendant que vous parlez, il peut vous renvoyer des signaux d'écoute comme « oui oui » ou « je vois »
- Si vous l'interrompez alors qu'il parle, il vous écoute bel et bien et réoriente son propos
- Si vous restez silencieux pour réfléchir, il ne prend pas cela pour une « fin de tour » et ne vous coupe pas
En somme, GPT-Live rend possible une conversation en temps réel, sans « file d'attente ».
2. En quoi diffère-t-il de l'Advanced Voice Mode classique
Les voix IA précédentes (Advanced Voice Mode) fonctionnaient par tours de parole (half-duplex). Par construction, elles présentaient les faiblesses suivantes.
| Aspect | Avant : Advanced Voice Mode | Nouveau : GPT-Live |
|---|---|---|
| Mode de base | Tours de parole (half-duplex) — attend la fin de votre phrase | Full-duplex — écoute et parle simultanément |
| Détection de la fin de parole | Basée sur le silence | N'attend pas une pause nette : suit les pauses, les interruptions et les changements de rythme en écoutant, et décide sur le moment |
| Silence de réflexion | Tend à interrompre en croyant à tort que « c'est fini » | Sait attendre sans couper |
| Signaux d'écoute | Absents en principe | Renvoie des « mhmm », « yeah », etc. |
| Interruption | Peut se couper de façon peu naturelle | Encaisse et s'adapte |
| Fréquence de décision | Par tour de parole | Plusieurs fois par seconde (parler / écouter / marquer une pause / interrompre / appeler un outil) |
Selon OpenAI, dans une comparaison où des humains ont évalué des conversations de 5 à 10 minutes menées dans les mêmes conditions, GPT-Live-1 comme GPT-Live-1 mini ont été nettement préférés à l'Advanced Voice Mode. Des améliorations sont également rapportées sur GPQA (raisonnement scientifique spécialisé), BrowseComp (recherche web de type agentique) et les tâches liées au support client.
3. Comment ça marche — des décisions à chaque seconde et une délégation à un modèle en arrière-plan
GPT-Live traite l'entrée vocale en continu tout en générant la sortie vocale, et décide plusieurs fois par seconde de « ce qu'il faut faire maintenant » — parler, continuer d'écouter, marquer une pause, interrompre ou appeler un outil. Cette prise de décision à haute fréquence produit un rythme proche de l'humain.
Autre point de conception essentiel : « les traitements profonds sont délégués au modèle en coulisses ». GPT-Live assure la réactivité de la conversation, et lorsqu'une recherche web, un raisonnement approfondi ou une tâche complexe deviennent nécessaires, il transmet le traitement à un modèle plus grand en arrière-plan (GPT-5.5 au lancement), puis revient à la conversation une fois le résultat obtenu. C'est un mécanisme qui concilie « réfléchir » sans jamais interrompre la conversation.
OpenAI a écrit dans l'annonce qu'« à mesure que nous publierons de nouveaux modèles de pointe, nous mettrons continuellement à jour le modèle utilisé par GPT-Live », et c'est ce qui s'est passé : depuis le 9 septembre 2026, la voix utilise GPT-5.6 ou GPT-6 Astra (notes de version d'OpenAI). Autrement dit, le nom du modèle d'arrière-plan va continuer à changer. Ce qu'il faut retenir, ce n'est pas le nom mais la structure : une partie fait vivre la conversation, une autre se charge de réfléchir. La pertinence des réponses dépend du modèle d'arrière-plan ; l'aisance de l'échange dépend de GPT-Live.
4. Deux modèles et disponibilité par forfait
| Forfait | Au lancement (8 juillet 2026) | Au 25 septembre 2026 (voix dans Chat, par 24 heures) |
|---|---|---|
| Gratuit | GPT-Live-1 mini | GPT-Live-1 mini (accès limité ; les limites peuvent changer) |
| Go | GPT-Live-1 | 3 heures avec GPT-Live-1 mini |
| Plus | GPT-Live-1 | 3 heures avec GPT-Live-1 |
| Pro | GPT-Live-1 | 15 heures avec le forfait à 100 $, illimité avec celui à 200 $ (GPT-Live-1) |
| Business / Enterprise / Edu | Non disponible | Disponible selon les paramètres de l'espace de travail. Business Standard a 3 heures et Premium 15 heures ; l'usage supplémentaire coûte 1,25 crédit par minute |
L'essentiel, c'est que même le forfait gratuit peut utiliser la version mini de GPT-Live. La conversation naturelle en full-duplex n'est pas réservée aux forfaits payants. Au lancement, GPT-Live-1 était le modèle par défaut sur Go/Plus/Pro, mais depuis le 9 septembre 2026, Go utilise GPT-Live-1 mini, et Plus et Pro ne basculent plus sur mini après avoir atteint une limite de voix (notes de version d'OpenAI). Les espaces Business, Enterprise et Edu, exclus au lancement, peuvent désormais l'utiliser selon leurs paramètres (OpenAI Help). Il est disponible dans ChatGPT sur iOS, Android et ChatGPT.com, avec un déploiement progressif dans le monde entier. Les limites sont révisées : vérifiez le tableau d'OpenAI Help avant de compter dessus.
5. Principales avancées
Il réagit par des « oui oui » pendant que vous parlez. On sent qu'il vous écoute vraiment.
Il décide plusieurs fois par seconde s'il parle ou continue d'écouter, et suit ainsi le rythme de la conversation. Ni l'annonce d'OpenAI ni la page du modèle ne donnent de chiffre de latence.
Même si vous le coupez en cours de phrase, il écoute et réajuste son propos.
Il ne prend pas votre temps de réflexion pour une « fin de tour » et sait attendre.
6. Limites actuelles — à connaître honnêtement
Les attentes pouvant devancer la réalité, mieux vaut être honnête sur ce qu'il ne sait pas faire. Ci-dessous, les limites du lancement sont séparées entre celles qui s'appliquent encore et celles qui ont été levées (au 25 septembre 2026).
- 🟡 Ni vidéo ni partage d'écran : comme au lancement, Live ne prend en charge ni l'entrée vidéo ni le partage d'écran (OpenAI Help). Si vous en avez besoin, passez à l'ancienne voix Advanced dans l'appli iOS ou Android.
- 🟡 La prise en charge complète de toutes les langues reste à venir : au lancement, OpenAI a écrit que GPT-Live est optimisé pour les langues les plus utilisées et que, pour certaines, il peut avoir un accent non natif ou des lacunes de fluidité.
- 🟡 Conçu pour le tête-à-tête : il n'est pas encore optimisé pour plusieurs personnes parlant en même temps et peut répondre quand des personnes se parlent entre elles (OpenAI Help).
- 🟢 L'API est désormais disponible : annoncée « bientôt » au lancement, elle est devenue disponible pour tous le 10 septembre 2026 (voir le chapitre 8).
- 🟡 Déploiement progressif : les fonctions dont vous disposez, et quand, dépendent du forfait, de la région, des paramètres de l'espace de travail et de la version de l'appli.
Ces points devraient être étendus par de futures mises à jour, mais il vaut mieux comprendre que ce n'est « ni la vidéo ni l'écran tout de suite ».
7. Cas d'usage
- Réflexion et brainstorming mains libres : mettre ses idées en mots pour les organiser, en marchant ou en travaillant. Comme les silences ne sont pas coupés, la pensée s'interrompt moins.
- Entraînement à la conversation en langue étrangère : avec les signaux d'écoute et des interruptions naturelles, on s'entraîne dans des conditions proches d'une vraie conversation.
- Rechercher et résumer à la voix : la recherche approfondie est déléguée à un modèle en arrière-plan, ce qui permet de se renseigner tout en parlant.
- Confier du travail en parlant : depuis le 23 septembre 2026, vous pouvez parler à ChatGPT Work sur le web et le mobile et lui demander des documents, des diapositives et des tableaux. Si une tâche est encore en cours quand vous raccrochez, elle se poursuit à l'écrit (il faut l'accès à Voice et à Work ; notes de version d'OpenAI).
- Accessibilité : quand taper au clavier est difficile, une interface vocale au bon rythme se révèle précieuse.
OpenAI Help donne aussi des conseils concrets pour en tirer davantage.
- Pour réfléchir à voix haute, prévenez d'abord : au début, dites par exemple « attends que je te demande de répondre », et il patientera. De longs silences ou des bruits ambiants peuvent quand même le faire répondre.
- S'il vous coupe souvent, changez de conditions : utilisez un casque, allez dans un endroit plus calme ou montez le volume de l'appareil. Sur iPhone, ouvrez le Centre de contrôle, choisissez Mode micro et activez Isolement de la voix.
- Pour un texte dicté, utilisez la dictée : les transcriptions de la voix ne sont pas mot pour mot et peuvent ne pas correspondre exactement à ce qui a été dit. Si vous voulez relire et corriger avant d'envoyer, la dictée (Dictation) convient mieux que la conversation (Voice).
- Sachez comment les enregistrements sont traités : les extraits audio sont conservés 30 jours avec la transcription du chat. Ils ne servent à l'entraînement que si vous activez vous-même leur partage (impossible dans Business, Enterprise et Edu). Les transcriptions peuvent être utilisées selon votre réglage « Améliorer le modèle pour tous ».
Pour travailler sur un enregistrement déjà sauvegardé plutôt que converser par voix, découvrez comment importer un fichier audio dans ChatGPT et vérifier sa transcription. Joindre un MP3 ou M4A est une fonction distincte de Voice, avec ses propres conditions de disponibilité et de taille.
8. Disponibilité de l'API et différence avec GPT-Realtime
Au lancement, l'API de GPT-Live était « bientôt disponible », et développeurs et entreprises ne pouvaient que s'inscrire pour être prévenus. Puis, le 10 septembre 2026, elle est devenue disponible pour tous dans l'API (journal des modifications de l'API OpenAI). D'après la page du modèle au 25 septembre 2026, l'identifiant du modèle est gpt-live-1, il passe par un endpoint Live dédié (v1/live/sessions) et les sessions vocales coûtent 0,05 $ par minute, facturées à la seconde. Le modèle d'arrière-plan et les outils sont facturés à part.
Dans l'API comme dans ChatGPT, on assemble GPT-Live, qui mène la conversation, et un backend qui réfléchit. Vous pouvez laisser OpenAI exécuter le modèle du backend ou brancher votre propre agent ou service (guide officiel). Votre application reste chargée de vérifier les droits et de tout ce qui touche vos propres systèmes.
Conclusion
- GPT-Live est un nouveau modèle qui fait passer la voix de ChatGPT des « tours de parole » au full-duplex (écouter en parlant) (8 juillet 2026, dans le monde entier).
- Avec les signaux d'écoute, la gestion des interruptions et la tolérance au silence, il atteint un rythme de conversation proche de l'humain. Il a été nettement préféré à l'Advanced Voice Mode.
- GPT-Live assure la réactivité de la conversation, tandis que le raisonnement poussé et la recherche sont délégués à un modèle en arrière-plan (GPT-5.5 au lancement ; GPT-5.6 ou GPT-6 Astra depuis le 9 septembre 2026).
- Gratuit et Go utilisent GPT-Live-1 mini, Plus et Pro GPT-Live-1 (au 25 septembre 2026). Business, Enterprise et Edu peuvent l'utiliser selon leurs paramètres. Disponible dans ChatGPT sur iOS/Android/web.
- Limites actuelles : ni vidéo ni partage d'écran, et la prise en charge complète de toutes les langues n'est pas encore atteinte. L'API est disponible pour tous depuis le 10 septembre 2026 (0,05 $ par minute). GPT-Realtime-2.1 est une autre gamme de modèles vocaux de l'API.
FAQ
Q1. GPT-Live est-il utilisable gratuitement ?
Oui. Le forfait gratuit peut utiliser GPT-Live-1 mini de façon limitée. Au 25 septembre 2026, Go utilise aussi GPT-Live-1 mini (jusqu'à 3 heures par jour), tandis que Plus et Pro utilisent le modèle supérieur, GPT-Live-1. Il est disponible dans ChatGPT sur iOS, Android et le web (déploiement progressif).
Q2. Qu'est-ce que le « full-duplex », concrètement ?
C'est un mode où l'on peut écouter et parler en même temps, comme au téléphone. Contrairement aux tours de parole classiques (répondre après avoir attendu que vous ayez fini), il peut renvoyer des signaux d'écoute pendant que vous parlez, encaisser une interruption et attendre sans couper le silence de votre réflexion.
Q3. Quelle est la plus grande différence avec l'Advanced Voice Mode classique ?
La façon de détecter la fin de parole. Avant, c'était basé sur le silence, ce qui poussait à interrompre en croyant à tort qu'un temps de réflexion était « la fin ». GPT-Live n'attend pas une pause nette : il suit les pauses, les interruptions et les changements de rythme en écoutant, et décide plusieurs fois par seconde s'il répond ou continue d'écouter (fiche système d'OpenAI) ; il coupe donc moins et paraît plus naturel. Les évaluations humaines le préfèrent nettement.
Q4. Peut-il répondre à des questions difficiles ?
Oui. GPT-Live assure la réactivité de la conversation et, quand une recherche web ou un raisonnement poussé est nécessaire, il délègue le traitement à un modèle en arrière-plan puis ramène les résultats dans la conversation. Au lancement, ce modèle était GPT-5.5 ; depuis le 9 septembre 2026, il utilise GPT-5.6 ou GPT-6 Astra, et l'on choisit le modèle et l'effort de raisonnement avec les mêmes commandes que dans le chat texte.
Q5. Peut-on faire de la vidéo ou du partage d'écran ?
Non, pas au 25 septembre 2026. Live ne prend en charge ni la vidéo ni le partage d'écran ; si vous en avez besoin, passez à l'ancienne voix Advanced dans l'appli iOS ou Android (OpenAI Help). Au lancement, OpenAI a indiqué travailler à ajouter ces fonctions.
Q6. Puis-je l'intégrer à ma propre application via une API ?
Oui. L'API de GPT-Live est disponible pour tous depuis le 10 septembre 2026 ; l'identifiant du modèle est gpt-live-1 et les sessions vocales coûtent 0,05 $ par minute (le modèle d'arrière-plan et les outils sont facturés à part). Il existe aussi la gamme distincte GPT-Realtime-2.1 / mini : choisissez selon que vous privilégiez le naturel de la conversation ou préférez vous appuyer sur la Realtime API existante.
Q7. Comment se compare-t-il à Gemini Live de Google ?
Gemini Live de Google permet de partager la caméra ou l'écran du téléphone pendant que vous parlez (aide de Gemini Live). Au 25 septembre 2026, GPT-Live ne prend en charge ni la vidéo ni le partage d'écran : si vous voulez montrer ce que vous voyez, Gemini Live garde l'avantage. L'atout qu'OpenAI met en avant pour GPT-Live est le naturel de la conversation full-duplex : il montre qu'il écoute pendant que vous parlez, accepte d'être interrompu en pleine phrase et attend en silence pendant que vous réfléchissez. OpenAI n'a pas publié de chiffres de latence, donc la vitesse de réponse ne peut pas être comparée. Pour en savoir plus, consultez aussi la comparaison GPT-5.6 vs Gemini.
Articles liés
- GPT-5.6 : le guide complet de la sortie — les modèles phares de la même période
- GPT-5.6 Sol vs Gemini — axes de comparaison multimodal/voix
- Qu'est-ce que Google Gemini — les bases du concurrent
- Qu'est-ce que ChatGPT Work ? — l'agent de travail qui produit documents, tableaux et diapositives — et auquel on peut désormais confier des tâches à la voix