Inhaltsverzeichnis
- 1. Was ist GPT-Live – Vollduplex-Sprache, die „hört, während sie spricht“
- 2. Worin unterscheidet es sich vom bisherigen Advanced Voice Mode
- 3. So funktioniert es — Entscheidungen im Sekundentakt und Delegation an ein Modell im Hintergrund
- 4. Zwei Modelle und Verfügbarkeit je Tarif
- 5. Die wichtigsten Fortschritte
- 6. Aktuelle Einschränkungen – ehrlich betrachtet
- 7. Einsatzszenarien
- 8. API-Verfügbarkeit und Unterschied zu GPT-Realtime
- Fazit
- FAQ
Am 8. Juli 2026 hat OpenAI mit „GPT-Live“ ein neues Modell weltweit veröffentlicht, das die Sprachfunktion von ChatGPT von Grund auf erneuert (offizielle Ankündigung von OpenAI). Die Ankündigung erfolgte kurz vor der allgemeinen Verfügbarkeit von GPT-5.6 am Folgetag, dem 9. Juli. Das herausragende Merkmal ist die Vollduplex-Architektur (Full-Duplex), bei der gleichzeitig gehört und gesprochen werden kann.
Bisherige KI-Sprache funktionierte nach dem Turn-Prinzip: „Erst wenn du fertig gesprochen hast, folgt die Antwort.“ GPT-Live dagegen gibt wie ein Mensch im Gespräch Hörsignale, fängt Unterbrechungen auf und schneidet dir das Schweigen zum Nachdenken nicht ab. Dieser Beitrag erklärt auf Basis der offiziellen Ankündigung, was GPT-Live ist, worin es sich vom bisherigen Advanced Voice Mode unterscheidet, wie es funktioniert, in welchem Tarif es nutzbar ist und was es noch nicht kann.
Nachtrag, Stand 25. September 2026: Seit der Veröffentlichung haben sich das Hintergrundmodell und die Nutzungslimits für Sprache geändert (9. September), die API ist allgemein verfügbar (10. September), und Sprache ist in ChatGPT Work angekommen (23. September). Wir haben die Erklärung vom Start beibehalten und die Stellen, die heute anders sind, mit Datum neu geschrieben (Quellen: OpenAI-Versionshinweise, Hilfeartikel zu ChatGPT Voice, API-Changelog).
Das Ende des Turn-Prinzips
— Hören, während man spricht: hin zu menschenähnlichen Gesprächen
1. Was ist GPT-Live – Vollduplex-Sprache, die „hört, während sie spricht“
GPT-Live ist eine neue Reihe von Sprachmodellen, die das Sprachgespräch in ChatGPT trägt. Als Ablösung der bisherigen Sprachfunktion (Advanced Voice Mode) wurde es ab dem 8. Juli 2026 weltweit für iOS, Android und Web von ChatGPT ausgerollt.
Der Kern liegt im Design des „Vollduplex (Full-Duplex)“. Wie beim Telefon wird die Eingabe (deine Stimme) verarbeitet und gleichzeitig fortlaufend die Ausgabe (die Stimme der KI) erzeugt. Deshalb gilt –
- Während du sprichst, kann es Hörsignale wie „mhm“ oder „aha“ zurückgeben
- Wenn du die KI mitten im Reden unterbrichst, hört sie richtig zu und ändert den Kurs
- Wenn du zum Nachdenken verstummst, deutet es das nicht fälschlich als „fertig gesprochen“ und schneidet dich nicht ab
Kurz gesagt: GPT-Live realisiert ein Echtzeit-Gespräch ohne „Anstehen in der Reihe“.
2. Worin unterscheidet es sich vom bisherigen Advanced Voice Mode
Die bisherige KI-Sprache (Advanced Voice Mode) arbeitete nach dem Turn-Prinzip (Halbduplex). Konstruktionsbedingt hatte sie folgende Schwächen.
| Aspekt | Bisher: Advanced Voice Mode | Neu: GPT-Live |
|---|---|---|
| Grundprinzip | Turn-Prinzip (Halbduplex) – wartet, bis du fertig sprichst | Vollduplex – spricht gleichzeitig, während es hört |
| Erkennung des Sprechendes | auf Basis von Stille (Schweigen) | Wartet nicht auf eine klare Pause – verfolgt beim Zuhören Pausen, Unterbrechungen und Tempowechsel und entscheidet im Moment |
| Nachdenkliches Schweigen | deutet es als „fertig“ und neigt zum Unterbrechen | kann warten, ohne abzuschneiden |
| Hörsignale | grundsätzlich keine | gibt „mhmm“, „yeah“ usw. zurück |
| Unterbrechungen | bricht mitunter unnatürlich ab | fängt sie auf und passt sich an |
| Entscheidungsfrequenz | pro Turn | mehrmals pro Sekunde (sprechen/hören/pausieren/unterbrechen/Tools aufrufen) |
Laut OpenAI wurden in einem Vergleich, bei dem Menschen 5–10-minütige Gespräche unter gleichen Bedingungen bewerteten, sowohl GPT-Live-1 als auch GPT-Live-1 mini deutlich gegenüber dem Advanced Voice Mode bevorzugt. Zudem werden Verbesserungen bei GPQA (fachwissenschaftliches Schlussfolgern), BrowseComp (agentische Web-Suche) und Kundensupport-Aufgaben berichtet.
3. So funktioniert es — Entscheidungen im Sekundentakt und Delegation an ein Modell im Hintergrund
GPT-Live verarbeitet die Spracheingabe fortlaufend und erzeugt dabei die Sprachausgabe und entscheidet mehrmals pro Sekunde, „was es jetzt tut“ – sprechen, weiter zuhören, pausieren, unterbrechen oder ein Tool aufrufen. Diese hochfrequente Entscheidungsfindung erzeugt ein menschenähnliches Tempo.
Ein weiteres zentrales Design ist, dass „tiefe Verarbeitung an das Modell im Hintergrund delegiert wird“. Die Reaktionsschnelligkeit im Gespräch trägt GPT-Live, und sobald Web-Suche, tiefes Schlussfolgern oder komplexe Arbeit nötig wird, gibt es die Verarbeitung im Hintergrund an ein größeres Modell (zum Launch GPT-5.5) ab und kehrt mit dem Ergebnis ins Gespräch zurück. So werden das „Nachdenken“ und ein ununterbrochenes Gespräch zugleich möglich.
OpenAI schrieb in der Ankündigung: „Wenn wir neue Frontier-Modelle veröffentlichen, aktualisieren wir laufend das Modell, das GPT-Live verwendet“ — und genau so kam es: Seit dem 9. September 2026 nutzt die Sprachfunktion GPT-5.6 oder GPT-6 Astra (OpenAI-Versionshinweise). Der Name des Hintergrundmodells wird sich also weiter ändern. Merken sollte man sich nicht den Namen, sondern den Aufbau: Ein Teil hält das Gespräch am Laufen, ein anderer übernimmt das Denken. Wie klug die Antworten sind, hängt vom Hintergrundmodell ab; wie leicht sich das Gespräch anfühlt, von GPT-Live.
4. Zwei Modelle und Verfügbarkeit je Tarif
| Tarif | Zum Start (8. Juli 2026) | Stand 25. September 2026 (Sprache im Chat, pro 24 Stunden) |
|---|---|---|
| Free (kostenlos) | GPT-Live-1 mini | GPT-Live-1 mini (begrenzt; Limits können sich ändern) |
| Go | GPT-Live-1 | 3 Stunden mit GPT-Live-1 mini |
| Plus | GPT-Live-1 | 3 Stunden mit GPT-Live-1 |
| Pro | GPT-Live-1 | 15 Stunden im 100-$-Tarif, unbegrenzt im 200-$-Tarif (GPT-Live-1) |
| Business / Enterprise / Edu | Nicht verfügbar | Je nach Workspace-Einstellungen verfügbar. Business Standard hat 3 Stunden, Premium 15 Stunden; zusätzliche Nutzung kostet 1,25 Credits pro Minute |
Der Kernpunkt: Selbst der kostenlose Tarif kann die mini-Version von GPT-Live nutzen. Natürliche Vollduplex-Gespräche sind nicht den bezahlten Tarifen vorbehalten. Zum Start war GPT-Live-1 bei Go/Plus/Pro Standard, doch seit dem 9. September 2026 nutzt Go GPT-Live-1 mini, und Plus und Pro wechseln nach Erreichen eines Sprachlimits nicht mehr zu mini (OpenAI-Versionshinweise). Business-, Enterprise- und Edu-Workspaces, die zum Start ausgenommen waren, können es jetzt je nach Einstellungen nutzen (OpenAI Help). Verfügbar ist es in ChatGPT für iOS, Android und auf ChatGPT.com, weltweit schrittweise ausgerollt. Die Limits werden überarbeitet — prüfe die Tabelle in OpenAI Help, bevor du dich darauf verlässt.
5. Die wichtigsten Fortschritte
Reagiert mit „mhm“, während du sprichst. Es entsteht das Gefühl, dass wirklich zugehört wird.
Es entscheidet mehrmals pro Sekunde, ob es spricht oder weiter zuhört, und hält so das Gesprächstempo. Weder OpenAIs Ankündigung noch die Modellseite nennen einen Latenzwert.
Auch wenn du mitten im Reden unterbrichst, hört es zu und korrigiert den Kurs.
Es deutet die Denkpause nicht fälschlich als „fertig gesprochen“ und wartet auf dich.
6. Aktuelle Einschränkungen – ehrlich betrachtet
Weil Erwartungen der Realität gern vorauseilen, lohnt es sich, ehrlich zu sagen, was es nicht kann. Unten sind die Einschränkungen vom Start in solche aufgeteilt, die weiter gelten, und solche, die inzwischen behoben sind (Stand 25. September 2026).
- 🟡 Kein Video und keine Bildschirmfreigabe: Wie zum Start verarbeitet Live weder Videoeingaben noch Bildschirmfreigaben (OpenAI Help). Wenn du beides brauchst, wechsle in der iOS- oder Android-App zur älteren Advanced-Sprachfunktion.
- 🟡 Volle Unterstützung aller Sprachen steht noch aus: Zum Start schrieb OpenAI, GPT-Live sei für die meistgenutzten Sprachen optimiert; in manchen Sprachen könne es einen nicht muttersprachlichen Akzent oder Lücken in der Sprachflüssigkeit geben.
- 🟡 Für Gespräche unter vier Augen gebaut: Für mehrere gleichzeitig sprechende Personen ist es noch nicht optimiert und reagiert mitunter, wenn Menschen miteinander reden (OpenAI Help).
- 🟢 Die API ist inzwischen verfügbar: Zum Start hieß es „demnächst“, am 10. September 2026 wurde sie allgemein verfügbar (siehe Kapitel 8).
- 🟡 Schrittweiser Rollout: Welche Funktionen du wann bekommst, hängt von Tarif, Region, Workspace-Einstellungen und App-Version ab.
Diese Punkte dürften mit künftigen Updates erweitert werden, doch man sollte verstehen, dass es nicht „Video und Bildschirm sofort“ heißt.
7. Einsatzszenarien
- Freihändiges Beraten und Ideen-Sparring: Gedanken beim Gehen oder Arbeiten laut ordnen. Da das Schweigen nicht abgeschnitten wird, reißt der Gedankengang seltener ab.
- Sprach-Gesprächstraining: Durch Hörsignale und natürliche Unterbrechungen lässt sich näher am echten Gespräch üben.
- Recherche und Zusammenfassungen per Sprache: Die tiefe Suche wird an ein Modell im Hintergrund delegiert, sodass du beim Reden recherchieren kannst.
- Arbeit per Zuruf übergeben: Seit dem 23. September 2026 kannst du im Web und auf dem Handy auch mit ChatGPT Work sprechen und Dokumente, Folien und Tabellen anfordern. Läuft eine Aufgabe noch, wenn du auflegst, geht sie per Text weiter (Zugriff auf Voice und Work erforderlich; OpenAI-Versionshinweise).
- Barrierefreiheit: In Situationen, in denen Tippen schwerfällt, ist eine flott getaktete Sprachschnittstelle hilfreich.
OpenAI Help gibt außerdem konkrete Tipps, wie man mehr herausholt.
- Wer laut nachdenken will, sagt es vorher: Sag zu Beginn etwa „Warte, bis ich dich um eine Antwort bitte“, dann hält es sich zurück. Lange Pausen oder Umgebungsgeräusche können trotzdem eine Antwort auslösen.
- Unterbricht es ständig, ändere die Umgebung: Nutze Kopfhörer, geh an einen ruhigeren Ort oder dreh die Lautstärke hoch. Auf dem iPhone öffnest du das Kontrollzentrum, wählst „Mikrofonmodus“ und aktivierst „Sprachisolation“.
- Für diktierten Text die Diktierfunktion nutzen: Transkripte von Sprachgesprächen sind nicht wortgetreu und können vom Gesagten abweichen. Willst du das Gesagte vor dem Senden prüfen und bearbeiten, passt die Diktierfunktion (Dictation) besser als das Gespräch (Voice).
- Wissen, was mit Aufnahmen passiert: Audioclips werden zusammen mit dem Chat-Transkript 30 Tage lang aufbewahrt. Für das Training werden sie nur genutzt, wenn du das Teilen selbst aktivierst (in Business, Enterprise und Edu nicht möglich). Transkripte können je nach deiner Einstellung „Das Modell für alle verbessern“ verwendet werden.
Wenn Sie eine gespeicherte Aufnahme bearbeiten möchten, statt ein Sprachgespräch zu führen, erfahren Sie hier, wie Sie Audio in ChatGPT hochladen und das Transkript prüfen können. Ein MP3- oder M4A-Anhang ist eine andere Funktion als Voice und hat eigene Verfügbarkeits- und Größenvorgaben.
8. API-Verfügbarkeit und Unterschied zu GPT-Realtime
Zum Start hieß es bei der GPT-Live-API „demnächst“, und Entwickler und Unternehmen konnten sich nur für Benachrichtigungen eintragen. Am 10. September 2026 wurde sie dann in der API allgemein verfügbar (OpenAI-API-Changelog). Laut der Modellseite, Stand 25. September 2026, lautet die Modell-ID gpt-live-1, sie läuft über einen eigenen Live-Endpunkt (v1/live/sessions), und Sprachsitzungen kosten 0,05 $ pro Minute, sekundengenau abgerechnet. Hintergrundmodell und Tools werden separat berechnet.
In der API baut man es wie in ChatGPT auf: GPT-Live führt das Gespräch, ein Backend übernimmt das Denken. Du kannst das Backend-Modell von OpenAI betreiben lassen oder einen eigenen Agenten bzw. Dienst anbinden (offizieller Leitfaden). Berechtigungsprüfungen und alles, was deine eigenen Systeme berührt, bleiben Sache deiner Anwendung.
Fazit
- GPT-Live ist ein neues Modell, das die Sprache von ChatGPT vom „Turn-Prinzip“ auf Vollduplex (Hören, während man spricht) umstellt (8. Juli 2026, weltweit).
- Mit Hörsignalen, Unterbrechungen und Toleranz für Schweigen erreicht es ein menschennahes Gesprächstempo. Es wurde deutlich gegenüber dem Advanced Voice Mode bevorzugt.
- GPT-Live sorgt für die Reaktionsschnelligkeit im Gespräch, während tiefes Denken und Suche an ein Modell im Hintergrund delegiert werden (zum Start GPT-5.5; seit dem 9. September 2026 GPT-5.6 oder GPT-6 Astra).
- Free und Go nutzen GPT-Live-1 mini, Plus und Pro GPT-Live-1 (Stand 25. September 2026). Business, Enterprise und Edu können es je nach Einstellungen nutzen. Verfügbar in ChatGPT für iOS/Android/Web.
- Aktuelle Einschränkungen: kein Video und keine Bildschirmfreigabe, volle Unterstützung aller Sprachen noch nicht erreicht. Die API ist seit dem 10. September 2026 allgemein verfügbar (0,05 $ pro Minute). GPT-Realtime-2.1 ist eine separate Reihe von API-Sprachmodellen.
FAQ
F1. Kann man GPT-Live auch kostenlos nutzen?
Ja. Der kostenlose Tarif kann GPT-Live-1 mini begrenzt nutzen. Stand 25. September 2026 nutzt auch Go GPT-Live-1 mini (bis zu 3 Stunden pro Tag), während Plus und Pro das höherwertige GPT-Live-1 nutzen. Verfügbar in ChatGPT für iOS, Android und Web (schrittweiser Rollout).
F2. Was bedeutet „Vollduplex“ konkret?
Es ist ein Verfahren, das wie beim Telefon Hören und Sprechen gleichzeitig ermöglicht. Anders als beim bisherigen Turn-Prinzip (Antwort erst nach deinem Sprechende) kann es dir mitten im Reden Hörsignale geben, Unterbrechungen auffangen und dein nachdenkliches Schweigen abwarten, ohne es abzuschneiden.
F3. Was ist der größte Unterschied zum bisherigen Advanced Voice Mode?
Die Art, das Sprechende zu erkennen. Bisher geschah dies auf Basis von Stille (Schweigen), sodass die Denkpause fälschlich als „fertig“ gedeutet wurde und es zum Unterbrechen neigte. GPT-Live wartet nicht auf eine klare Pause: Es verfolgt beim Zuhören Pausen, Unterbrechungen und Tempowechsel und entscheidet mehrmals pro Sekunde, ob es antwortet oder weiter zuhört (Systemkarte von OpenAI). Deshalb unterbricht es seltener und wirkt natürlicher. Auch in der menschlichen Bewertung wurde es deutlich bevorzugt.
F4. Kann es auch schwierige Fragen beantworten?
Ja. GPT-Live sorgt für die Reaktionsschnelligkeit im Gespräch und delegiert die Verarbeitung an ein Modell im Hintergrund, wenn Websuche oder tiefes Denken nötig sind, und bringt die Ergebnisse zurück ins Gespräch. Zum Start war das GPT-5.5; seit dem 9. September 2026 wird GPT-5.6 oder GPT-6 Astra genutzt, und Modell und Denkaufwand wählst du mit denselben Bedienelementen wie im Text-Chat.
F5. Sind Video oder Bildschirmfreigabe möglich?
Nein, Stand 25. September 2026 nicht. Live unterstützt weder Video noch Bildschirmfreigabe; wenn du beides brauchst, wechsle in der iOS- oder Android-App zur älteren Advanced-Sprachfunktion (OpenAI Help). Zum Start sagte OpenAI, man arbeite daran, diese Funktionen hinzuzufügen.
F6. Kann ich es per API in meine eigene App einbauen?
Ja. Die GPT-Live-API ist seit dem 10. September 2026 allgemein verfügbar; die Modell-ID lautet gpt-live-1, und Sprachsitzungen kosten 0,05 $ pro Minute (Hintergrundmodell und Tools werden separat berechnet). Daneben gibt es die separate Reihe GPT-Realtime-2.1 / mini — entscheide danach, ob dir die Natürlichkeit des Gesprächs wichtiger ist oder ob du auf der bestehenden Realtime API aufbauen willst.
F7. Wie schneidet es im Vergleich zu Googles Gemini Live ab?
Mit Googles Gemini Live kannst du beim Sprechen die Kamera oder den Bildschirm deines Smartphones teilen (Hilfe zu Gemini Live). GPT-Live unterstützt Stand 25. September 2026 weder Video noch Bildschirmfreigabe; wenn du zeigen willst, was du gerade siehst, hat Gemini Live also die Nase vorn. Als Stärke von GPT-Live nennt OpenAI die Natürlichkeit des Vollduplex-Gesprächs: Es signalisiert beim Zuhören, dass es folgt, lässt sich mitten im Satz unterbrechen und wartet ab, während du nachdenkst. Latenzwerte hat OpenAI nicht veröffentlicht, daher lässt sich die Antwortgeschwindigkeit nicht vergleichen. Näheres siehe auch den Vergleich GPT-5.6 vs. Gemini.
Verwandte Artikel
- GPT-5.6 Release – die komplette Erklärung — die Hauptmodelle desselben Zeitraums
- GPT-5.6 Sol vs. Gemini — Vergleichsachsen für Multimodalität/Sprache
- Was ist Google Gemini — Grundlagen zum Wettbewerber
- Was ist ChatGPT Work? — der Arbeits-Agent, der Dokumente, Tabellen und Folien erstellt — und dem du Aufgaben jetzt auch per Sprache geben kannst