8 जुलाई 2026 को OpenAI ने ChatGPT की आवाज़ को नया रूप देने वाला नया मॉडल "GPT-Live" पूरी दुनिया में रिलीज़ किया (OpenAI की आधिकारिक घोषणा)। अगले दिन 9 जुलाई को GPT-5.6 के आम उपलब्ध होने से पहले की गई इस घोषणा की सबसे बड़ी खासियत है "सुनते हुए, साथ-साथ बोल सकने वाली" फुल-डुप्लेक्स आर्किटेक्चर।

अब तक की AI आवाज़ "आपका बोलना खत्म होने का इंतज़ार करके जवाब देती थी"——यानी टर्न-आधारित थी। GPT-Live इंसानी बातचीत की तरह हुंकारा भरता है, बीच में रोकने को संभालता है, और जब आप सोचते हुए चुप होते हैं तो बीच में नहीं टोकता। इस लेख में हम आधिकारिक घोषणा के आधार पर समझाएँगे कि GPT-Live क्या है, पुराने Advanced Voice Mode से यह कैसे अलग है, यह कैसे काम करता है, किस प्लान में उपलब्ध है, और अभी क्या-क्या नहीं कर सकता।

25 सितंबर 2026 की स्थिति में जोड़ा गया: प्रकाशन के बाद पीछे इस्तेमाल होने वाला मॉडल और वॉइस की उपयोग सीमा बदली (9 सितंबर), API आम तौर पर उपलब्ध हुआ (10 सितंबर), और ChatGPT Work में वॉइस आई (23 सितंबर)। हमने लॉन्च के समय की व्याख्या रखी है और जो हिस्से आज अलग हैं, उन्हें तारीख के साथ दोबारा लिखा है (स्रोत: OpenAI रिलीज़ नोट्स, ChatGPT Voice हेल्प लेख, API चेंजलॉग)।

FULL-DUPLEX VOICE · 2026

टर्न-प्रणाली का अंत

— सुनते हुए बोलना, इंसानों जैसी बातचीत की ओर

फुल-डुप्लेक्स
सुनना + बोलना एक साथ
हुंकारा · रुकावट OK
मानव मूल्यांकन
Advanced Voice Mode से स्पष्ट रूप से अधिक पसंद
5–10 मिनट की बातचीत में तुलना
2 मॉडल
Live-1 / Live-1 mini
Free में भी mini मिलता है
काम सौंपना
सर्च और गहरा तर्क दूसरे मॉडल के पास
नए मॉडल आने पर पीछे का मॉडल अपडेट होता है

1. GPT-Live क्या है——"सुनते हुए बोलने वाला" फुल-डुप्लेक्स वॉइस

GPT-Live, ChatGPT की वॉइस बातचीत को संभालने वाली नई वॉइस मॉडल श्रृंखला है। पुराने वॉइस फ़ीचर (Advanced Voice Mode) की जगह लेते हुए, यह 8 जुलाई 2026 से ChatGPT के iOS · Android · Web पर पूरी दुनिया में उपलब्ध कराया गया।

इसका मूल "फुल-डुप्लेक्स" डिज़ाइन में है। फोन की तरह यह इनपुट (आपकी आवाज़) को प्रोसेस करते हुए, साथ-साथ आउटपुट (AI की आवाज़) भी बनाता रहता है। इसीलिए——

  • आपके बोलते समय ही, यह "हाँ-हाँ", "अच्छा" जैसा हुंकारा भर सकता है
  • AI के बोलते समय आप बीच में टोकें, तो भी वह ध्यान से सुनकर दिशा बदल देता है
  • आप सोचते हुए चुप हो जाएँ, तो वह इसे "बात खत्म" समझकर बीच में नहीं टोकता

संक्षेप में, GPT-Live "बारी के इंतज़ार" के बिना रीयल-टाइम बातचीत को साकार करता है।

2. पुराने Advanced Voice Mode से क्या अलग है

अब तक की AI आवाज़ (Advanced Voice Mode) टर्न-आधारित (हाफ-डुप्लेक्स) थी। अपनी बनावट के कारण इसमें ये कमज़ोरियाँ थीं।

पहलूपुराना: Advanced Voice Modeनया: GPT-Live
मूल तरीकाटर्न-आधारित (हाफ-डुप्लेक्स)——बोलना खत्म होने का इंतज़ारफुल-डुप्लेक्स——सुनते हुए साथ-साथ बोलना
बोलना खत्म होने का पताखामोशी (मौन) के आधार परसाफ़ ठहराव का इंतज़ार नहीं——सुनते हुए ठहराव, रुकावट और बोलने की गति के बदलाव पर नज़र रखकर उसी पल फैसला
सोचने वाली खामोशी"खत्म हो गया" समझकर बीच में टोक देता हैबिना टोके इंतज़ार कर सकता है
हुंकाराबुनियादी तौर पर नहीं"mhmm", "yeah" आदि भरता है
रुकावटकभी-कभी अटपटे तरीके से कट जाता हैसंभालकर तालमेल बिठाता है
फैसले की बारंबारताप्रति-टर्नहर सेकंड कई बार (बोलना/सुनना/ठहरना/टोकना/टूल कॉल)

OpenAI के अनुसार, 5–10 मिनट की एक जैसी परिस्थितियों वाली बातचीत का इंसानों द्वारा मूल्यांकन करने पर, GPT-Live-1 और GPT-Live-1 mini दोनों को Advanced Voice Mode की तुलना में स्पष्ट रूप से अधिक पसंद किया गया। इसके अलावा GPQA (विशेषज्ञ वैज्ञानिक तर्क) · BrowseComp (एजेंटिक वेब सर्च) · कस्टमर सपोर्ट संबंधी कार्यों में भी सुधार दर्ज किया गया है।

3. यह कैसे काम करता है — हर सेकंड के फ़ैसले और पीछे चल रहे मॉडल को काम सौंपना

GPT-Live वॉइस इनपुट को लगातार प्रोसेस करते हुए वॉइस आउटपुट बनाता है, और हर सेकंड कई बार "अब क्या करना है" का फैसला करता है——बोलना है, सुनते रहना है, ठहरना है, टोकना है, या टूल बुलाना है। यह उच्च-बारंबारता वाला निर्णय ही इंसानों जैसी लय पैदा करता है।

एक और अहम डिज़ाइन यह है कि "गहरी प्रोसेसिंग पर्दे के पीछे वाले मॉडल को सौंप दी जाती है"। बातचीत की तत्परता GPT-Live संभालता है, और जब वेब सर्च · गहरा तर्क · जटिल काम ज़रूरी हो, तो पर्दे के पीछे किसी बड़े मॉडल (लॉन्च के समय GPT-5.5) को काम सौंप देता है, और नतीजा आने पर बातचीत में लौट आता है। यह बातचीत को बिना टूटे "सोचने" के साथ जोड़े रखने वाली व्यवस्था है।

OpenAI ने घोषणा में लिखा था कि "जैसे-जैसे हम नए फ़्रंटियर मॉडल जारी करेंगे, GPT-Live जिस मॉडल का इस्तेमाल करता है उसे लगातार अपडेट करेंगे", और ऐसा ही हुआ: 9 सितंबर 2026 से वॉइस में GPT-5.6 या GPT-6 Astra इस्तेमाल होता है (OpenAI रिलीज़ नोट्स)। यानी पीछे वाले मॉडल का नाम आगे भी बदलता रहेगा। याद रखने लायक नाम नहीं, ढाँचा है: एक हिस्सा बातचीत चलाता है और दूसरा सोचने का काम करता है। जवाब कितने समझदार हैं, यह पीछे वाले मॉडल पर निर्भर है; बात करना कितना सहज है, यह GPT-Live पर।

लॉन्च के समय तर्क की गहराई तीन स्तरों में से चुनी जाती थी: Instant (GPT-5.5 Instant) / Medium / High (GPT-5.5 Thinking)। वॉइस के ये अलग स्तर 9 सितंबर 2026 को हटा दिए गए; अब मॉडल और तर्क का स्तर उन्हीं कंट्रोल से चुना जाता है जो टेक्स्ट चैट में हैं (क्या उपलब्ध है, यह प्लान पर निर्भर है; OpenAI रिलीज़ नोट्स)। मूल बात वही है: हल्की बातचीत के लिए तेज़ी, उलझे सवालों के लिए ज़्यादा सोच।

4. दो मॉडल और प्लान के अनुसार उपलब्धता

प्लानलॉन्च के समय (8 जुलाई 2026)25 सितंबर 2026 की स्थिति (Chat में वॉइस, हर 24 घंटे)
Free (मुफ़्त)GPT-Live-1 miniGPT-Live-1 mini (सीमित; सीमा बदल सकती है)
GoGPT-Live-1GPT-Live-1 mini के साथ 3 घंटे
PlusGPT-Live-1GPT-Live-1 के साथ 3 घंटे
ProGPT-Live-1$100 प्लान पर 15 घंटे, $200 प्लान पर असीमित (GPT-Live-1)
Business / Enterprise / Eduउपलब्ध नहींवर्कस्पेस सेटिंग्स के अनुसार उपलब्ध। Business Standard को 3 घंटे और Premium को 15 घंटे; अतिरिक्त उपयोग पर प्रति मिनट 1.25 क्रेडिट

मुख्य बात यह है कि मुफ़्त प्लान पर भी GPT-Live का mini संस्करण इस्तेमाल किया जा सकता है। स्वाभाविक फुल-डुप्लेक्स बातचीत सिर्फ पेड प्लान तक सीमित नहीं है। लॉन्च के समय Go/Plus/Pro पर GPT-Live-1 डिफ़ॉल्ट था, लेकिन 9 सितंबर 2026 से Go पर GPT-Live-1 mini है, और Plus व Pro वॉइस सीमा पूरी होने पर अब mini पर नहीं जाते (OpenAI रिलीज़ नोट्स)। लॉन्च के समय बाहर रहे Business, Enterprise और Edu वर्कस्पेस भी अब अपनी सेटिंग्स के अनुसार इसे इस्तेमाल कर सकते हैं (OpenAI Help)। यह iOS, Android और ChatGPT.com पर ChatGPT में उपलब्ध है और दुनिया भर में चरणबद्ध तरीके से आया। सीमाएँ बदलती रहती हैं, इसलिए भरोसा करने से पहले OpenAI Help की तालिका देख लें।

5. मुख्य सुधार

🗣️ हुंकारा (बैकचैनल)

आपके बोलते समय "हाँ-हाँ" जैसी प्रतिक्रिया। यह एहसास होता है कि वह सुन रहा है।

⏱️ तेज़ आपसी बातचीत

यह हर सेकंड कई बार तय करता है कि बोले या सुनता रहे, इसलिए बातचीत की लय बनी रहती है। OpenAI की घोषणा और मॉडल पेज, दोनों में लेटेंसी का कोई आंकड़ा नहीं दिया गया है।

✋ रुकावट के साथ चलना

बात के बीच में टोकें, तो भी सुनकर सामग्री को नए सिरे से दिशा देता है।

🤫 खामोशी में नहीं टोकता

सोचने के ठहराव को "बात खत्म" गलत नहीं समझता, बल्कि इंतज़ार करता है।

6. फिलहाल की सीमाएँ——ईमानदारी से समझ लें

उम्मीदें असलियत से आगे निकल सकती हैं, इसलिए यह क्या नहीं कर सकता, इस पर भी ईमानदार रहना ज़रूरी है। नीचे लॉन्च के समय की सीमाओं को दो हिस्सों में बाँटा गया है — जो अब भी लागू हैं और जो दूर हो चुकी हैं (25 सितंबर 2026 की स्थिति)।

  • 🟡 वीडियो और स्क्रीन शेयरिंग नहीं: लॉन्च की तरह अब भी Live वीडियो इनपुट और स्क्रीन शेयरिंग को नहीं संभालता (OpenAI Help)। ज़रूरत हो तो iOS या Android ऐप में पुराने Advanced वॉइस पर जाएँ।
  • 🟡 सभी भाषाओं का पूरा समर्थन अभी बाकी है: लॉन्च के समय OpenAI ने लिखा था कि GPT-Live सबसे लोकप्रिय भाषाओं के लिए अनुकूलित है, और कुछ भाषाओं में उच्चारण गैर-देशी लग सकता है या प्रवाह में कमी हो सकती है।
  • 🟡 आमने-सामने की बातचीत के लिए बना: एक साथ कई लोगों के बोलने के लिए यह अभी अनुकूलित नहीं है, और लोग आपस में बात करें तो भी यह जवाब दे सकता है (OpenAI Help)।
  • 🟢 API अब उपलब्ध है: लॉन्च के समय यह "जल्द आ रहा है" था, और 10 सितंबर 2026 को आम तौर पर उपलब्ध हो गया (अध्याय 8 देखें)।
  • 🟡 चरणबद्ध रोलआउट: कौन-सी सुविधा कब मिलेगी, यह प्लान, क्षेत्र, वर्कस्पेस सेटिंग्स और ऐप के संस्करण पर निर्भर है।

ये आगे के अपडेट में बढ़ने की उम्मीद है, पर "वीडियो और स्क्रीन भी अभी-अभी" वाली बात नहीं है——यह समझ लेना अच्छा रहेगा।

7. कहाँ उपयोगी है

  • हैंड्स-फ्री सलाह · विचार-मंथन: चलते-फिरते या काम करते हुए, अपने विचारों को बोलकर व्यवस्थित करना। खामोशी में टोका नहीं जाता, इसलिए सोच की कड़ी टूटती नहीं।
  • भाषा की बातचीत अभ्यास: हुंकारा और स्वाभाविक रुकावट होने से, असली बातचीत के करीब अभ्यास हो पाता है।
  • आवाज़ से रिसर्च और सारांश: गहरी सर्च पीछे चल रहे मॉडल को सौंपी जाती है, इसलिए बात करते-करते जानकारी खोजी जा सकती है।
  • बोलकर काम सौंपना: 23 सितंबर 2026 से web और फोन पर ChatGPT Work से भी आवाज़ में बात करके डॉक्युमेंट, स्लाइड और स्प्रेडशीट बनवाई जा सकती हैं। कॉल खत्म करते समय काम अधूरा हो तो वह टेक्स्ट में जारी रहता है (Voice और Work दोनों की पहुँच ज़रूरी; OpenAI रिलीज़ नोट्स)।
  • सुगम्यता (एक्सेसिबिलिटी): जहाँ टाइप करना मुश्किल हो, वहाँ अच्छी लय वाला वॉइस इंटरफ़ेस काम आता है।

OpenAI Help में इसे बेहतर इस्तेमाल करने के ठोस सुझाव भी दिए गए हैं।

  • सोचते हुए बोलना हो तो पहले बता दें: शुरुआत में कुछ ऐसा कहें — "जब तक मैं न कहूँ, जवाब मत देना" — तो यह रुका रहेगा। फिर भी लंबी चुप्पी या आसपास की आवाज़ से यह जवाब दे सकता है।
  • बार-बार टोके तो माहौल बदलें: हेडफ़ोन लगाएँ, शांत जगह जाएँ या डिवाइस की आवाज़ बढ़ाएँ। iPhone पर कंट्रोल सेंटर खोलकर "माइक मोड" में "वॉइस आइसोलेशन" चालू करें।
  • बोला हुआ टेक्स्ट चाहिए तो डिक्टेशन इस्तेमाल करें: वॉइस बातचीत का ट्रांसक्रिप्ट शब्दशः नहीं होता और कही गई बात से पूरी तरह मेल न खाए, ऐसा हो सकता है। भेजने से पहले अपनी बात जाँचनी और बदलनी हो तो बातचीत (Voice) के बजाय डिक्टेशन (Dictation) बेहतर है।
  • रिकॉर्डिंग के साथ क्या होता है, यह जानें: ऑडियो क्लिप चैट के ट्रांसक्रिप्ट के साथ 30 दिन तक रखे जाते हैं। ट्रेनिंग में क्लिप तभी इस्तेमाल होते हैं जब आप खुद शेयरिंग चालू करें (Business, Enterprise और Edu में शेयर नहीं किए जा सकते)। ट्रांसक्रिप्ट आपकी "सभी के लिए मॉडल बेहतर करें" सेटिंग के अनुसार इस्तेमाल हो सकते हैं।

8. API की स्थिति और GPT-Realtime से अंतर

लॉन्च के समय GPT-Live का API "जल्द आ रहा है" था, और डेवलपर व कंपनियाँ सिर्फ सूचना के लिए नाम दर्ज करा सकती थीं। फिर 10 सितंबर 2026 को यह API में आम तौर पर उपलब्ध हो गया (OpenAI API चेंजलॉग)। 25 सितंबर 2026 की स्थिति में मॉडल पेज के अनुसार मॉडल ID gpt-live-1 है, यह अलग Live एंडपॉइंट (v1/live/sessions) पर चलता है, और वॉइस सेशन की कीमत $0.05 प्रति मिनट है (प्रति सेकंड बिलिंग)। पीछे के मॉडल और टूल का शुल्क अलग लगता है।

API में भी ChatGPT की तरह बातचीत चलाने वाले GPT-Live और सोचने वाले बैकएंड को अलग-अलग जोड़ा जाता है। बैकएंड का मॉडल OpenAI को चलाने दे सकते हैं, या अपना एजेंट या सेवा जोड़ सकते हैं (आधिकारिक गाइड)। अनुमतियों की जाँच और आपके अपने सिस्टम को छूने वाला काम आपकी ऐप्लिकेशन ही संभालती है।

भ्रम दूर करने के लिए: API में GPT-Live से अलग वॉइस मॉडल भी हैं — GPT-Realtime-2.1 / GPT-Realtime-2.1 mini (6 जुलाई 2026 को जारी), जो Realtime API के लिए तर्क और टूल-कॉल वाले वॉइस मॉडल हैं। दोनों की बनावट अलग है: GPT-Live = सुनते हुए बोलने वाली और सोचने का काम बैकएंड को सौंपने वाली फुल-डुप्लेक्स बातचीत की परत, जबकि GPT-Realtime = Realtime API पर वॉइस एजेंट की नींव। कब कौन-सा चुनें, इसकी तुलना OpenAI की वॉइस एजेंट गाइड में है।

सारांश

  • GPT-Live, ChatGPT की आवाज़ को "टर्न-प्रणाली" से फुल-डुप्लेक्स (सुनते हुए बोलना) में बदलने वाला नया मॉडल है (8 जुलाई 2026, पूरी दुनिया में)।
  • हुंकारा · रुकावट · खामोशी को सहना के साथ, इंसानों के करीब की बातचीत लय साकार करता है। Advanced Voice Mode की तुलना में स्पष्ट रूप से अधिक पसंद किया गया।
  • बातचीत की फुर्ती GPT-Live संभालता है, जबकि गहरा तर्क और सर्च पीछे चल रहे मॉडल को सौंपे जाते हैं (लॉन्च पर GPT-5.5; 9 सितंबर 2026 से GPT-5.6 या GPT-6 Astra)।
  • Free और Go पर GPT-Live-1 mini, Plus और Pro पर GPT-Live-1 (25 सितंबर 2026 की स्थिति)। Business, Enterprise और Edu भी सेटिंग्स के अनुसार इस्तेमाल कर सकते हैं। ChatGPT के iOS/Android/Web पर उपलब्ध।
  • मौजूदा सीमाएँ: वीडियो और स्क्रीन शेयरिंग नहीं, और सभी भाषाओं का पूरा समर्थन अभी नहीं। API 10 सितंबर 2026 को आम तौर पर उपलब्ध हुआ ($0.05 प्रति मिनट)। GPT-Realtime-2.1 API के वॉइस मॉडलों की अलग श्रृंखला है।

FAQ

Q1. क्या GPT-Live मुफ़्त में भी उपयोग कर सकते हैं?

हाँ। मुफ़्त प्लान पर GPT-Live-1 mini सीमित रूप से इस्तेमाल किया जा सकता है। 25 सितंबर 2026 की स्थिति में Go पर भी GPT-Live-1 mini है (दिन में 3 घंटे तक), जबकि Plus और Pro पर ऊपर वाला GPT-Live-1। यह ChatGPT के iOS, Android और Web पर उपलब्ध है (चरणबद्ध रोलआउट)।

Q2. "फुल-डुप्लेक्स" ठीक-ठीक क्या है?

यह फोन की तरह सुनने और बोलने को एक साथ करने वाला तरीका है। पुरानी टर्न-प्रणाली (आपका बोलना खत्म होने का इंतज़ार करके जवाब) से अलग, यह बोलते समय हुंकारा भर सकता है, रुकावट को संभाल सकता है, और आपकी सोचने वाली खामोशी में बिना टोके इंतज़ार कर सकता है।

Q3. पुराने Advanced Voice Mode से सबसे बड़ा अंतर क्या है?

बोलना खत्म होने का पता लगाने का तरीका। पहले यह खामोशी (मौन) के आधार पर होता था, इसलिए सोचने के ठहराव को "खत्म हो गया" समझकर बीच में टोक देता था। GPT-Live साफ़ ठहराव का इंतज़ार नहीं करता; सुनते हुए ठहराव, रुकावट और बोलने की गति के बदलाव पर नज़र रखता है और हर सेकंड कई बार तय करता है कि जवाब दे या सुनता रहे (OpenAI का सिस्टम कार्ड), इसलिए यह कम टोकता है और अधिक स्वाभाविक है। इंसानी मूल्यांकन में भी इसे स्पष्ट रूप से अधिक पसंद किया गया।

Q4. क्या यह मुश्किल सवालों के भी जवाब दे सकता है?

हाँ। बातचीत की फुर्ती GPT-Live संभालता है, और जब वेब सर्च या गहरे तर्क की ज़रूरत हो, तो यह प्रोसेसिंग पीछे चल रहे मॉडल को सौंप देता है और नतीजे बातचीत में वापस लाता है। लॉन्च के समय वह मॉडल GPT-5.5 था; 9 सितंबर 2026 से GPT-5.6 या GPT-6 Astra इस्तेमाल होता है, और मॉडल व तर्क का स्तर टेक्स्ट चैट वाले कंट्रोल से ही चुने जाते हैं।

Q5. क्या वीडियो या स्क्रीन शेयर हो सकता है?

25 सितंबर 2026 की स्थिति में भी नहीं। Live वीडियो और स्क्रीन शेयरिंग सपोर्ट नहीं करता, इसलिए ज़रूरत हो तो iOS या Android ऐप में पुराने Advanced वॉइस पर जाएँ (OpenAI Help)। लॉन्च के समय OpenAI ने कहा था कि वह इन सुविधाओं को जोड़ने पर काम कर रहा है।

Q6. क्या इसे अपने ऐप में API से जोड़ सकते हैं?

हाँ। GPT-Live का API 10 सितंबर 2026 को आम तौर पर उपलब्ध हुआ; मॉडल ID gpt-live-1 है और वॉइस सेशन की कीमत $0.05 प्रति मिनट है (पीछे के मॉडल और टूल का शुल्क अलग)। अलग श्रृंखला GPT-Realtime-2.1 / mini भी है, इसलिए चुनाव इस पर करें कि आप बातचीत की स्वाभाविकता को प्राथमिकता देते हैं या मौजूदा Realtime API पर ही बनाना चाहते हैं।

Q7. Google के Gemini Live की तुलना में यह कैसा है?

Google का Gemini Live बात करते समय कैमरा या फ़ोन की स्क्रीन शेयर करने देता है (Gemini Live सहायता)। 25 सितंबर 2026 की स्थिति में GPT-Live वीडियो और स्क्रीन शेयरिंग सपोर्ट नहीं करता, इसलिए अगर आप जो देख रहे हैं वह दिखाना चाहते हैं, तो Gemini Live का पलड़ा भारी है। OpenAI GPT-Live की जो खासियत बताता है, वह है फुल-डुप्लेक्स बातचीत की स्वाभाविकता: आप बोल रहे हों तब भी यह सुनते हुए हामी भरता है, वाक्य के बीच में टोकने को संभाल लेता है, और आपके सोचने के दौरान चुप रहकर इंतज़ार करता है। OpenAI ने लेटेंसी के आँकड़े प्रकाशित नहीं किए हैं, इसलिए जवाब की गति की तुलना नहीं की जा सकती। विस्तार के लिए GPT-5.6 vs Gemini तुलना भी देखें।

संबंधित लेख

मौजूदा MP3 या M4A बातचीत में संलग्न करना चाहते हैं तो ChatGPT ऑडियो अपलोड गाइड पढ़ें। इसमें समर्थित फ़ॉर्मैट, सशुल्क प्लान, ट्रांसक्रिप्ट की जाँच, अलग API बिलिंग और संग्रहण संबंधी बातें दी गई हैं।