विषय-सूची
- 1. GPT-Live क्या है——"सुनते हुए बोलने वाला" फुल-डुप्लेक्स वॉइस
- 2. पुराने Advanced Voice Mode से क्या अलग है
- 3. यह कैसे काम करता है — हर सेकंड के फ़ैसले और पीछे चल रहे मॉडल को काम सौंपना
- 4. दो मॉडल और प्लान के अनुसार उपलब्धता
- 5. मुख्य सुधार
- 6. फिलहाल की सीमाएँ——ईमानदारी से समझ लें
- 7. कहाँ उपयोगी है
- 8. API की स्थिति और GPT-Realtime से अंतर
- सारांश
- FAQ
8 जुलाई 2026 को OpenAI ने ChatGPT की आवाज़ को नया रूप देने वाला नया मॉडल "GPT-Live" पूरी दुनिया में रिलीज़ किया (OpenAI की आधिकारिक घोषणा)। अगले दिन 9 जुलाई को GPT-5.6 के आम उपलब्ध होने से पहले की गई इस घोषणा की सबसे बड़ी खासियत है "सुनते हुए, साथ-साथ बोल सकने वाली" फुल-डुप्लेक्स आर्किटेक्चर।
अब तक की AI आवाज़ "आपका बोलना खत्म होने का इंतज़ार करके जवाब देती थी"——यानी टर्न-आधारित थी। GPT-Live इंसानी बातचीत की तरह हुंकारा भरता है, बीच में रोकने को संभालता है, और जब आप सोचते हुए चुप होते हैं तो बीच में नहीं टोकता। इस लेख में हम आधिकारिक घोषणा के आधार पर समझाएँगे कि GPT-Live क्या है, पुराने Advanced Voice Mode से यह कैसे अलग है, यह कैसे काम करता है, किस प्लान में उपलब्ध है, और अभी क्या-क्या नहीं कर सकता।
25 सितंबर 2026 की स्थिति में जोड़ा गया: प्रकाशन के बाद पीछे इस्तेमाल होने वाला मॉडल और वॉइस की उपयोग सीमा बदली (9 सितंबर), API आम तौर पर उपलब्ध हुआ (10 सितंबर), और ChatGPT Work में वॉइस आई (23 सितंबर)। हमने लॉन्च के समय की व्याख्या रखी है और जो हिस्से आज अलग हैं, उन्हें तारीख के साथ दोबारा लिखा है (स्रोत: OpenAI रिलीज़ नोट्स, ChatGPT Voice हेल्प लेख, API चेंजलॉग)।
टर्न-प्रणाली का अंत
— सुनते हुए बोलना, इंसानों जैसी बातचीत की ओर
1. GPT-Live क्या है——"सुनते हुए बोलने वाला" फुल-डुप्लेक्स वॉइस
GPT-Live, ChatGPT की वॉइस बातचीत को संभालने वाली नई वॉइस मॉडल श्रृंखला है। पुराने वॉइस फ़ीचर (Advanced Voice Mode) की जगह लेते हुए, यह 8 जुलाई 2026 से ChatGPT के iOS · Android · Web पर पूरी दुनिया में उपलब्ध कराया गया।
इसका मूल "फुल-डुप्लेक्स" डिज़ाइन में है। फोन की तरह यह इनपुट (आपकी आवाज़) को प्रोसेस करते हुए, साथ-साथ आउटपुट (AI की आवाज़) भी बनाता रहता है। इसीलिए——
- आपके बोलते समय ही, यह "हाँ-हाँ", "अच्छा" जैसा हुंकारा भर सकता है
- AI के बोलते समय आप बीच में टोकें, तो भी वह ध्यान से सुनकर दिशा बदल देता है
- आप सोचते हुए चुप हो जाएँ, तो वह इसे "बात खत्म" समझकर बीच में नहीं टोकता
संक्षेप में, GPT-Live "बारी के इंतज़ार" के बिना रीयल-टाइम बातचीत को साकार करता है।
2. पुराने Advanced Voice Mode से क्या अलग है
अब तक की AI आवाज़ (Advanced Voice Mode) टर्न-आधारित (हाफ-डुप्लेक्स) थी। अपनी बनावट के कारण इसमें ये कमज़ोरियाँ थीं।
| पहलू | पुराना: Advanced Voice Mode | नया: GPT-Live |
|---|---|---|
| मूल तरीका | टर्न-आधारित (हाफ-डुप्लेक्स)——बोलना खत्म होने का इंतज़ार | फुल-डुप्लेक्स——सुनते हुए साथ-साथ बोलना |
| बोलना खत्म होने का पता | खामोशी (मौन) के आधार पर | साफ़ ठहराव का इंतज़ार नहीं——सुनते हुए ठहराव, रुकावट और बोलने की गति के बदलाव पर नज़र रखकर उसी पल फैसला |
| सोचने वाली खामोशी | "खत्म हो गया" समझकर बीच में टोक देता है | बिना टोके इंतज़ार कर सकता है |
| हुंकारा | बुनियादी तौर पर नहीं | "mhmm", "yeah" आदि भरता है |
| रुकावट | कभी-कभी अटपटे तरीके से कट जाता है | संभालकर तालमेल बिठाता है |
| फैसले की बारंबारता | प्रति-टर्न | हर सेकंड कई बार (बोलना/सुनना/ठहरना/टोकना/टूल कॉल) |
OpenAI के अनुसार, 5–10 मिनट की एक जैसी परिस्थितियों वाली बातचीत का इंसानों द्वारा मूल्यांकन करने पर, GPT-Live-1 और GPT-Live-1 mini दोनों को Advanced Voice Mode की तुलना में स्पष्ट रूप से अधिक पसंद किया गया। इसके अलावा GPQA (विशेषज्ञ वैज्ञानिक तर्क) · BrowseComp (एजेंटिक वेब सर्च) · कस्टमर सपोर्ट संबंधी कार्यों में भी सुधार दर्ज किया गया है।
3. यह कैसे काम करता है — हर सेकंड के फ़ैसले और पीछे चल रहे मॉडल को काम सौंपना
GPT-Live वॉइस इनपुट को लगातार प्रोसेस करते हुए वॉइस आउटपुट बनाता है, और हर सेकंड कई बार "अब क्या करना है" का फैसला करता है——बोलना है, सुनते रहना है, ठहरना है, टोकना है, या टूल बुलाना है। यह उच्च-बारंबारता वाला निर्णय ही इंसानों जैसी लय पैदा करता है।
एक और अहम डिज़ाइन यह है कि "गहरी प्रोसेसिंग पर्दे के पीछे वाले मॉडल को सौंप दी जाती है"। बातचीत की तत्परता GPT-Live संभालता है, और जब वेब सर्च · गहरा तर्क · जटिल काम ज़रूरी हो, तो पर्दे के पीछे किसी बड़े मॉडल (लॉन्च के समय GPT-5.5) को काम सौंप देता है, और नतीजा आने पर बातचीत में लौट आता है। यह बातचीत को बिना टूटे "सोचने" के साथ जोड़े रखने वाली व्यवस्था है।
OpenAI ने घोषणा में लिखा था कि "जैसे-जैसे हम नए फ़्रंटियर मॉडल जारी करेंगे, GPT-Live जिस मॉडल का इस्तेमाल करता है उसे लगातार अपडेट करेंगे", और ऐसा ही हुआ: 9 सितंबर 2026 से वॉइस में GPT-5.6 या GPT-6 Astra इस्तेमाल होता है (OpenAI रिलीज़ नोट्स)। यानी पीछे वाले मॉडल का नाम आगे भी बदलता रहेगा। याद रखने लायक नाम नहीं, ढाँचा है: एक हिस्सा बातचीत चलाता है और दूसरा सोचने का काम करता है। जवाब कितने समझदार हैं, यह पीछे वाले मॉडल पर निर्भर है; बात करना कितना सहज है, यह GPT-Live पर।
4. दो मॉडल और प्लान के अनुसार उपलब्धता
| प्लान | लॉन्च के समय (8 जुलाई 2026) | 25 सितंबर 2026 की स्थिति (Chat में वॉइस, हर 24 घंटे) |
|---|---|---|
| Free (मुफ़्त) | GPT-Live-1 mini | GPT-Live-1 mini (सीमित; सीमा बदल सकती है) |
| Go | GPT-Live-1 | GPT-Live-1 mini के साथ 3 घंटे |
| Plus | GPT-Live-1 | GPT-Live-1 के साथ 3 घंटे |
| Pro | GPT-Live-1 | $100 प्लान पर 15 घंटे, $200 प्लान पर असीमित (GPT-Live-1) |
| Business / Enterprise / Edu | उपलब्ध नहीं | वर्कस्पेस सेटिंग्स के अनुसार उपलब्ध। Business Standard को 3 घंटे और Premium को 15 घंटे; अतिरिक्त उपयोग पर प्रति मिनट 1.25 क्रेडिट |
मुख्य बात यह है कि मुफ़्त प्लान पर भी GPT-Live का mini संस्करण इस्तेमाल किया जा सकता है। स्वाभाविक फुल-डुप्लेक्स बातचीत सिर्फ पेड प्लान तक सीमित नहीं है। लॉन्च के समय Go/Plus/Pro पर GPT-Live-1 डिफ़ॉल्ट था, लेकिन 9 सितंबर 2026 से Go पर GPT-Live-1 mini है, और Plus व Pro वॉइस सीमा पूरी होने पर अब mini पर नहीं जाते (OpenAI रिलीज़ नोट्स)। लॉन्च के समय बाहर रहे Business, Enterprise और Edu वर्कस्पेस भी अब अपनी सेटिंग्स के अनुसार इसे इस्तेमाल कर सकते हैं (OpenAI Help)। यह iOS, Android और ChatGPT.com पर ChatGPT में उपलब्ध है और दुनिया भर में चरणबद्ध तरीके से आया। सीमाएँ बदलती रहती हैं, इसलिए भरोसा करने से पहले OpenAI Help की तालिका देख लें।
5. मुख्य सुधार
आपके बोलते समय "हाँ-हाँ" जैसी प्रतिक्रिया। यह एहसास होता है कि वह सुन रहा है।
यह हर सेकंड कई बार तय करता है कि बोले या सुनता रहे, इसलिए बातचीत की लय बनी रहती है। OpenAI की घोषणा और मॉडल पेज, दोनों में लेटेंसी का कोई आंकड़ा नहीं दिया गया है।
बात के बीच में टोकें, तो भी सुनकर सामग्री को नए सिरे से दिशा देता है।
सोचने के ठहराव को "बात खत्म" गलत नहीं समझता, बल्कि इंतज़ार करता है।
6. फिलहाल की सीमाएँ——ईमानदारी से समझ लें
उम्मीदें असलियत से आगे निकल सकती हैं, इसलिए यह क्या नहीं कर सकता, इस पर भी ईमानदार रहना ज़रूरी है। नीचे लॉन्च के समय की सीमाओं को दो हिस्सों में बाँटा गया है — जो अब भी लागू हैं और जो दूर हो चुकी हैं (25 सितंबर 2026 की स्थिति)।
- 🟡 वीडियो और स्क्रीन शेयरिंग नहीं: लॉन्च की तरह अब भी Live वीडियो इनपुट और स्क्रीन शेयरिंग को नहीं संभालता (OpenAI Help)। ज़रूरत हो तो iOS या Android ऐप में पुराने Advanced वॉइस पर जाएँ।
- 🟡 सभी भाषाओं का पूरा समर्थन अभी बाकी है: लॉन्च के समय OpenAI ने लिखा था कि GPT-Live सबसे लोकप्रिय भाषाओं के लिए अनुकूलित है, और कुछ भाषाओं में उच्चारण गैर-देशी लग सकता है या प्रवाह में कमी हो सकती है।
- 🟡 आमने-सामने की बातचीत के लिए बना: एक साथ कई लोगों के बोलने के लिए यह अभी अनुकूलित नहीं है, और लोग आपस में बात करें तो भी यह जवाब दे सकता है (OpenAI Help)।
- 🟢 API अब उपलब्ध है: लॉन्च के समय यह "जल्द आ रहा है" था, और 10 सितंबर 2026 को आम तौर पर उपलब्ध हो गया (अध्याय 8 देखें)।
- 🟡 चरणबद्ध रोलआउट: कौन-सी सुविधा कब मिलेगी, यह प्लान, क्षेत्र, वर्कस्पेस सेटिंग्स और ऐप के संस्करण पर निर्भर है।
ये आगे के अपडेट में बढ़ने की उम्मीद है, पर "वीडियो और स्क्रीन भी अभी-अभी" वाली बात नहीं है——यह समझ लेना अच्छा रहेगा।
7. कहाँ उपयोगी है
- हैंड्स-फ्री सलाह · विचार-मंथन: चलते-फिरते या काम करते हुए, अपने विचारों को बोलकर व्यवस्थित करना। खामोशी में टोका नहीं जाता, इसलिए सोच की कड़ी टूटती नहीं।
- भाषा की बातचीत अभ्यास: हुंकारा और स्वाभाविक रुकावट होने से, असली बातचीत के करीब अभ्यास हो पाता है।
- आवाज़ से रिसर्च और सारांश: गहरी सर्च पीछे चल रहे मॉडल को सौंपी जाती है, इसलिए बात करते-करते जानकारी खोजी जा सकती है।
- बोलकर काम सौंपना: 23 सितंबर 2026 से web और फोन पर ChatGPT Work से भी आवाज़ में बात करके डॉक्युमेंट, स्लाइड और स्प्रेडशीट बनवाई जा सकती हैं। कॉल खत्म करते समय काम अधूरा हो तो वह टेक्स्ट में जारी रहता है (Voice और Work दोनों की पहुँच ज़रूरी; OpenAI रिलीज़ नोट्स)।
- सुगम्यता (एक्सेसिबिलिटी): जहाँ टाइप करना मुश्किल हो, वहाँ अच्छी लय वाला वॉइस इंटरफ़ेस काम आता है।
OpenAI Help में इसे बेहतर इस्तेमाल करने के ठोस सुझाव भी दिए गए हैं।
- सोचते हुए बोलना हो तो पहले बता दें: शुरुआत में कुछ ऐसा कहें — "जब तक मैं न कहूँ, जवाब मत देना" — तो यह रुका रहेगा। फिर भी लंबी चुप्पी या आसपास की आवाज़ से यह जवाब दे सकता है।
- बार-बार टोके तो माहौल बदलें: हेडफ़ोन लगाएँ, शांत जगह जाएँ या डिवाइस की आवाज़ बढ़ाएँ। iPhone पर कंट्रोल सेंटर खोलकर "माइक मोड" में "वॉइस आइसोलेशन" चालू करें।
- बोला हुआ टेक्स्ट चाहिए तो डिक्टेशन इस्तेमाल करें: वॉइस बातचीत का ट्रांसक्रिप्ट शब्दशः नहीं होता और कही गई बात से पूरी तरह मेल न खाए, ऐसा हो सकता है। भेजने से पहले अपनी बात जाँचनी और बदलनी हो तो बातचीत (Voice) के बजाय डिक्टेशन (Dictation) बेहतर है।
- रिकॉर्डिंग के साथ क्या होता है, यह जानें: ऑडियो क्लिप चैट के ट्रांसक्रिप्ट के साथ 30 दिन तक रखे जाते हैं। ट्रेनिंग में क्लिप तभी इस्तेमाल होते हैं जब आप खुद शेयरिंग चालू करें (Business, Enterprise और Edu में शेयर नहीं किए जा सकते)। ट्रांसक्रिप्ट आपकी "सभी के लिए मॉडल बेहतर करें" सेटिंग के अनुसार इस्तेमाल हो सकते हैं।
8. API की स्थिति और GPT-Realtime से अंतर
लॉन्च के समय GPT-Live का API "जल्द आ रहा है" था, और डेवलपर व कंपनियाँ सिर्फ सूचना के लिए नाम दर्ज करा सकती थीं। फिर 10 सितंबर 2026 को यह API में आम तौर पर उपलब्ध हो गया (OpenAI API चेंजलॉग)। 25 सितंबर 2026 की स्थिति में मॉडल पेज के अनुसार मॉडल ID gpt-live-1 है, यह अलग Live एंडपॉइंट (v1/live/sessions) पर चलता है, और वॉइस सेशन की कीमत $0.05 प्रति मिनट है (प्रति सेकंड बिलिंग)। पीछे के मॉडल और टूल का शुल्क अलग लगता है।
API में भी ChatGPT की तरह बातचीत चलाने वाले GPT-Live और सोचने वाले बैकएंड को अलग-अलग जोड़ा जाता है। बैकएंड का मॉडल OpenAI को चलाने दे सकते हैं, या अपना एजेंट या सेवा जोड़ सकते हैं (आधिकारिक गाइड)। अनुमतियों की जाँच और आपके अपने सिस्टम को छूने वाला काम आपकी ऐप्लिकेशन ही संभालती है।
सारांश
- GPT-Live, ChatGPT की आवाज़ को "टर्न-प्रणाली" से फुल-डुप्लेक्स (सुनते हुए बोलना) में बदलने वाला नया मॉडल है (8 जुलाई 2026, पूरी दुनिया में)।
- हुंकारा · रुकावट · खामोशी को सहना के साथ, इंसानों के करीब की बातचीत लय साकार करता है। Advanced Voice Mode की तुलना में स्पष्ट रूप से अधिक पसंद किया गया।
- बातचीत की फुर्ती GPT-Live संभालता है, जबकि गहरा तर्क और सर्च पीछे चल रहे मॉडल को सौंपे जाते हैं (लॉन्च पर GPT-5.5; 9 सितंबर 2026 से GPT-5.6 या GPT-6 Astra)।
- Free और Go पर GPT-Live-1 mini, Plus और Pro पर GPT-Live-1 (25 सितंबर 2026 की स्थिति)। Business, Enterprise और Edu भी सेटिंग्स के अनुसार इस्तेमाल कर सकते हैं। ChatGPT के iOS/Android/Web पर उपलब्ध।
- मौजूदा सीमाएँ: वीडियो और स्क्रीन शेयरिंग नहीं, और सभी भाषाओं का पूरा समर्थन अभी नहीं। API 10 सितंबर 2026 को आम तौर पर उपलब्ध हुआ ($0.05 प्रति मिनट)। GPT-Realtime-2.1 API के वॉइस मॉडलों की अलग श्रृंखला है।
FAQ
Q1. क्या GPT-Live मुफ़्त में भी उपयोग कर सकते हैं?
हाँ। मुफ़्त प्लान पर GPT-Live-1 mini सीमित रूप से इस्तेमाल किया जा सकता है। 25 सितंबर 2026 की स्थिति में Go पर भी GPT-Live-1 mini है (दिन में 3 घंटे तक), जबकि Plus और Pro पर ऊपर वाला GPT-Live-1। यह ChatGPT के iOS, Android और Web पर उपलब्ध है (चरणबद्ध रोलआउट)।
Q2. "फुल-डुप्लेक्स" ठीक-ठीक क्या है?
यह फोन की तरह सुनने और बोलने को एक साथ करने वाला तरीका है। पुरानी टर्न-प्रणाली (आपका बोलना खत्म होने का इंतज़ार करके जवाब) से अलग, यह बोलते समय हुंकारा भर सकता है, रुकावट को संभाल सकता है, और आपकी सोचने वाली खामोशी में बिना टोके इंतज़ार कर सकता है।
Q3. पुराने Advanced Voice Mode से सबसे बड़ा अंतर क्या है?
बोलना खत्म होने का पता लगाने का तरीका। पहले यह खामोशी (मौन) के आधार पर होता था, इसलिए सोचने के ठहराव को "खत्म हो गया" समझकर बीच में टोक देता था। GPT-Live साफ़ ठहराव का इंतज़ार नहीं करता; सुनते हुए ठहराव, रुकावट और बोलने की गति के बदलाव पर नज़र रखता है और हर सेकंड कई बार तय करता है कि जवाब दे या सुनता रहे (OpenAI का सिस्टम कार्ड), इसलिए यह कम टोकता है और अधिक स्वाभाविक है। इंसानी मूल्यांकन में भी इसे स्पष्ट रूप से अधिक पसंद किया गया।
Q4. क्या यह मुश्किल सवालों के भी जवाब दे सकता है?
हाँ। बातचीत की फुर्ती GPT-Live संभालता है, और जब वेब सर्च या गहरे तर्क की ज़रूरत हो, तो यह प्रोसेसिंग पीछे चल रहे मॉडल को सौंप देता है और नतीजे बातचीत में वापस लाता है। लॉन्च के समय वह मॉडल GPT-5.5 था; 9 सितंबर 2026 से GPT-5.6 या GPT-6 Astra इस्तेमाल होता है, और मॉडल व तर्क का स्तर टेक्स्ट चैट वाले कंट्रोल से ही चुने जाते हैं।
Q5. क्या वीडियो या स्क्रीन शेयर हो सकता है?
25 सितंबर 2026 की स्थिति में भी नहीं। Live वीडियो और स्क्रीन शेयरिंग सपोर्ट नहीं करता, इसलिए ज़रूरत हो तो iOS या Android ऐप में पुराने Advanced वॉइस पर जाएँ (OpenAI Help)। लॉन्च के समय OpenAI ने कहा था कि वह इन सुविधाओं को जोड़ने पर काम कर रहा है।
Q6. क्या इसे अपने ऐप में API से जोड़ सकते हैं?
हाँ। GPT-Live का API 10 सितंबर 2026 को आम तौर पर उपलब्ध हुआ; मॉडल ID gpt-live-1 है और वॉइस सेशन की कीमत $0.05 प्रति मिनट है (पीछे के मॉडल और टूल का शुल्क अलग)। अलग श्रृंखला GPT-Realtime-2.1 / mini भी है, इसलिए चुनाव इस पर करें कि आप बातचीत की स्वाभाविकता को प्राथमिकता देते हैं या मौजूदा Realtime API पर ही बनाना चाहते हैं।
Q7. Google के Gemini Live की तुलना में यह कैसा है?
Google का Gemini Live बात करते समय कैमरा या फ़ोन की स्क्रीन शेयर करने देता है (Gemini Live सहायता)। 25 सितंबर 2026 की स्थिति में GPT-Live वीडियो और स्क्रीन शेयरिंग सपोर्ट नहीं करता, इसलिए अगर आप जो देख रहे हैं वह दिखाना चाहते हैं, तो Gemini Live का पलड़ा भारी है। OpenAI GPT-Live की जो खासियत बताता है, वह है फुल-डुप्लेक्स बातचीत की स्वाभाविकता: आप बोल रहे हों तब भी यह सुनते हुए हामी भरता है, वाक्य के बीच में टोकने को संभाल लेता है, और आपके सोचने के दौरान चुप रहकर इंतज़ार करता है। OpenAI ने लेटेंसी के आँकड़े प्रकाशित नहीं किए हैं, इसलिए जवाब की गति की तुलना नहीं की जा सकती। विस्तार के लिए GPT-5.6 vs Gemini तुलना भी देखें।
संबंधित लेख
- GPT-5.6 रिलीज़ पूर्ण व्याख्या — उसी दौर के मुख्य मॉडल
- GPT-5.6 Sol vs Gemini — मल्टीमॉडल/वॉइस की तुलना
- Google Gemini क्या है — प्रतिस्पर्धी की मूल बातें
- ChatGPT Work क्या है? — डॉक्युमेंट, शीट और स्लाइड बनाने वाला वर्क एजेंट — अब इसे आवाज़ से भी काम सौंपा जा सकता है
मौजूदा MP3 या M4A बातचीत में संलग्न करना चाहते हैं तो ChatGPT ऑडियो अपलोड गाइड पढ़ें। इसमें समर्थित फ़ॉर्मैट, सशुल्क प्लान, ट्रांसक्रिप्ट की जाँच, अलग API बिलिंग और संग्रहण संबंधी बातें दी गई हैं।