सामग्री पर जाएँ
विषय

AI एजेंट्स और ऑटोमेशन: RAG, वर्कफ़्लो और गाइड

AI एजेंट्स, RAG और ऑटोमेशन वर्कफ़्लो को समझें। कॉन्सेप्ट से लेकर रियल-वर्ल्ड एप्लिकेशन तक।

50 लेख

लेखों को क्रमबद्ध करें

AI एजेंट्स और ऑटोमेशन के लेख

Jev क्या है? TypeSafe के निर्णय AI के उपयोग, कीमत और सीमाएँ

Jev क्या है? TypeSafe के निर्णय AI के उपयोग, कीमत और सीमाएँ

Jev, TypeSafe का AI मॉडल है जो टेक्स्ट लिखने के बजाय विकल्प, स्कोर और हाँ/नहीं की प्रायिकताएँ लौटाता है। Choice, Score और Noul का अंतर, confidence का अर्थ और सहायता अनुरोध को टीम तक भेजने वाली API की संरचना समझें। प्रकार की गारंटी सही निर्णय की गारंटी नहीं है। लेख में गणना, तारीख और भ्रामक इनपुट की ज्ञात कमियाँ, कीमत, इनपुट की दोनों सीमाएँ और हिंदी में उपयोग से पहले मूल्यांकन शामिल हैं। यह आधिकारिक स्रोतों पर आधारित है, API चलाकर किया गया प्रदर्शन परीक्षण नहीं।

Claude Code का Projects क्या है — Claude थ्रेड कैसे बाँटता है, किसे मिलेगा, GitHub की शर्त और टोकन लागत

Claude Code का Projects क्या है — Claude थ्रेड कैसे बाँटता है, किसे मिलेगा, GitHub की शर्त और टोकन लागत

Claude Code का Projects नए सिरे से बनाया गया है। अब तक प्रोजेक्ट का मतलब था बातचीत और संदर्भ सामग्री रखने वाला एक फ़ोल्डर; नया Projects एक अकेली बातचीत है। आप जो चाहिए वह लिखते हैं, Claude उसे थ्रेड में बाँट देता है, थ्रेड क्लाउड में समानांतर चलते हैं, और हर थ्रेड काम ख़त्म होते ही एक पुल रिक्वेस्ट खोलकर रिपोर्ट कर देता है। लैपटॉप बंद कर देने से वे रुकते नहीं। पर कूदने से पहले तीन बातें जाँच लेने लायक़ हैं: इसे चला सकने वाले अकाउंट अब भी सीमित हैं (Pro और Max का पब्लिक बीटा, जो पहले उन अकाउंट तक जा रहा है जिनके पास कोई मौजूदा प्रोजेक्ट नहीं है), व्यवहार में github.com और Claude GitHub App अनिवार्य हैं, और यह आपकी उपयोग-सीमा जिस रफ़्तार से खाता है वह किसी अकेले सेशन जैसी नहीं है। यह लेख आधिकारिक दस्तावेज़ और ब्लॉग के आधार पर देखता है कि रोलआउट आप तक पहुँचा या नहीं यह कैसे जाँचें, थ्रेड किस सामान के साथ शुरू होता है (उस जाल समेत, जिसमें प्रोजेक्ट में एक से ज़्यादा रिपॉज़िटरी आते ही अनुमति नियम और हुक लागू होना बंद कर देते हैं), टोकन की लागत कहाँ से आती है — डिफ़ॉल्ट Opus high एफर्ट सहित — और समानांतर काम के पाँच तरीक़ों में से चुनें कैसे: सबएजेंट, agent view, एजेंट टीम, डायनामिक वर्कफ़्लो और Projects।

क्या GPT-6 Astra का low सचमुच सस्ता है — GPT-5.6 Sol के high से टोकन खपत, लागत और रफ़्तार की मापी गई तुलना

क्या GPT-6 Astra का low सचमुच सस्ता है — GPT-5.6 Sol के high से टोकन खपत, लागत और रफ़्तार की मापी गई तुलना

नया मॉडल ज़्यादा समझदार होता है, पर महँगा भी — आम तौर पर यही सोच चलती है। फिर भी GPT-6 Astra और GPT-5.6 Sol की तुलना सिर्फ़ यूनिट कीमत पर करें तो कोई नतीजा नहीं निकलता, क्योंकि Astra वही काम कम टोकन में निपटा देता है। स्वतंत्र बेंचमार्किंग संस्था Artificial Analysis की माप में, Astra को उसकी सबसे कमज़ोर सेटिंग low पर चलाएँ तो एक टास्क की लागत लगभग उतनी ही बैठती है जितनी Sol की high पर ($0.82 बनाम $0.81), जबकि स्कोर ऊपर रहता है (46 बनाम 42), आउटपुट टोकन एक-तिहाई लगते हैं और जवाब शुरू होने तक का इंतज़ार एक-चौथाई रह जाता है। 18 सितंबर 2026 तक के आँकड़ों के आधार पर यह लेख हर रीज़निंग एफर्ट पर लागत, टोकन और रफ़्तार, वह ब्योरा जो बताता है कि 2.5 गुना यूनिट कीमत के बाद भी कुल रकम बराबर क्यों बैठती है, Sol की प्रचार कीमत ख़त्म होने पर बनने वाला हिसाब, कोडिंग एजेंट के काम में कीमत का फ़ासला किस तरह घटता है, और यह सब अपने काम पर ख़ुद नापने के क़दम — सब कवर करता है।

GPT-6 Astra रिलीज़ का पूरा विवरण — कीमत, किस प्लान में मिलेगा, माइग्रेशन के बदलाव और Claude से तुलना

GPT-6 Astra रिलीज़ का पूरा विवरण — कीमत, किस प्लान में मिलेगा, माइग्रेशन के बदलाव और Claude से तुलना

OpenAI ने 3 सितंबर 2026 को GPT-6 Astra जारी किया। API बिना किसी गेट के आम तौर पर उपलब्ध है, मॉडल ID gpt-6-astra है, कॉन्टेक्स्ट 1,050,000 टोकन का है, कीमत इनपुट $10 और आउटपुट $50 प्रति दस लाख टोकन है, और नॉलेज कटऑफ 30 अप्रैल 2026 है। लेकिन "जारी हो गया" और "आपके प्लान में इस्तेमाल हो सकता है" दो अलग बातें हैं: ChatGPT Plus की सामान्य चैट स्क्रीन पर यह दिखाई नहीं देता, और वहाँ रास्ता ChatGPT Work तथा Codex है। यह लेख प्लान के हिसाब से उपलब्धता, प्रति-यूनिट दर दोगुनी होने पर भी प्रति टास्क लागत के पलट जाने वाले गणित को देखने का तरीक़ा, OpenAI ने असल में जिन बेंचमार्क के नाम गिनाए वे, Preparedness Framework में पहली बार "Critical" तक पहुँची साइबर क्षमता और उसके चारों ओर खींची गई लकीर, माइग्रेशन में टूटने वाली चार चीज़ें (सैंपलिंग वाले आर्ग्युमेंट हटाना, Responses API, none वाली रीज़निंग एफर्ट का न होना, कैश सेटिंग का नया नाम), तथा Claude Opus 5, Fable 5.1 और Gemini 3.8 Flash से तुलना — सब कुछ सिर्फ़ उतना, जितना प्राथमिक स्रोतों पर पुष्ट किया जा सका। साथ ही यह भी लिखा है कि दूसरी जगहों पर घूम रही "Astra 74.1% बनाम Opus 5 96%" जैसी तुलना तालिका हमने क्यों नहीं दी।

Claude का Dispatch — फ़ोन से आपका अपना PC कैसे चलता है, और वह कितना सुरक्षित है

Claude का Dispatch — फ़ोन से आपका अपना PC कैसे चलता है, और वह कितना सुरक्षित है

Dispatch वह फ़ीचर है जिसमें आप अपने फ़ोन से निर्देश भेजते हैं और Claude वह काम आपके अपने कंप्यूटर पर करता है (बीटा, Pro और Max)। यह क्लाउड में नहीं चलता; आपकी असली मशीन चलती है, और इसी एक तथ्य से इसका फ़ायदा भी निकलता है और इसका ख़तरा भी। आधिकारिक हेल्प कहती है कि आप अपने फ़ोन से Claude को संदेश भेजकर उससे अपने डेस्कटॉप कंप्यूटर पर काम करवा सकते हैं, और वह इसके लिए वही connector, plugin और फ़ाइल-एक्सेस इस्तेमाल करता है जो आपने Cowork में पहले से सेट कर रखे हैं — Anthropic इसे एक लगातार चलती बातचीत बताता है जिस तक दोनों डिवाइस से पहुँचा जा सकता है। इसे चलाने के लिए PC का जगा होना और डेस्कटॉप ऐप का खुला होना ज़रूरी है, और कंप्यूटर उपयोग सिर्फ़ macOS तथा Windows पर समर्थित है, Linux पर कंप्यूटर उपयोग है ही नहीं। मशीनरी के लिहाज़ से यह प्राथमिकता की तीन सीढ़ियाँ उतरता है: connector अगर मौजूद हो, न हो तो ब्राउज़र चलाना, और आखिरी उपाय के तौर पर स्क्रीन से सीधा व्यवहार — बीच-बीच में वह स्क्रीन समझने के लिए स्क्रीनशॉट भी लेता है। असली आकलन इसके बाद शुरू होता है। जहाँ यह रुकता है, वे जगहें डिज़ाइन में रखी गई हैं: कंप्यूटर उपयोग डिफ़ॉल्ट रूप से बंद है और Settings, General के नीचे चालू होता है; हर नए ऐप के लिए अलग से permission माँगी जाती है; किसी फ़ाइल को स्थायी रूप से मिटाने के लिए साफ़ permission चाहिए; और निवेश तथा ट्रेडिंग प्लेटफ़ॉर्म एवं क्रिप्टोकरेंसी ऐप डिफ़ॉल्ट रूप से दायरे से बाहर हैं। पर कुछ जगहें ऐसी भी हैं जहाँ यह नहीं रुकता। पहले से मंज़ूर किए ऐप के भीतर की अलग-अलग कार्रवाइयों की पुष्टि आपसे नहीं ली जाती, और आधिकारिक शब्द यही हैं कि Claude आपकी स्क्रीन पर सीधे क्लिक करता है, टाइप करता है और नेविगेट करता है, उन permission जाँचों के बिना जो बाकी Cowork tool पर लगती हैं। दस्तावेज़ यह भी जोड़ते हैं कि Claude और आपकी स्क्रीन पर मौजूद चीज़ों के बीच कोई sandbox नहीं है, और एक ऐप में की गई कार्रवाइयाँ दूसरे ऐप पर असर डाल सकती हैं। सबसे बड़ा जोखिम prompt injection है, जिसे Anthropic अपने शब्दों में यूँ रखता है: वेब का कंटेंट prompt injection हमलों का एक प्रमुख रास्ता है, और कोई तोड़-मरोड़कर डाला गया निर्देश, कोई अप्रत्याशित कमांड, या आपके ब्राउज़र में खुला कोई फ़िशिंग लिंक ऐसी कार्रवाइयों की शृंखला में बदल सकता है जिन्हें पलटना मुश्किल या असंभव हो। Anthropic कहता है कि वह ऐसा व्यवहार पकड़ने के लिए मॉडल की भीतरी activations स्कैन करता है, पर इससे संभावना घटती है, आपकी अपनी रेखा खींचने की ज़रूरत खत्म नहीं होती, और मार्गदर्शन अब भी यही कहता है कि जब कोई काम संवेदनशील फ़ाइलों, खातों या साइटों को छूता हो तो मैनुअल मंज़ूरी पर चले जाइए। Anthropic सीमा नाम लेकर बताता है: संवेदनशील ऐप, जैसे बैंकिंग, स्वास्थ्य-सेवा और सरकारी, को कंप्यूटर उपयोग की permission मत दीजिए, और वित्तीय खातों, कानूनी दस्तावेज़ों, चिकित्सा जानकारी तथा निजी डेटा से बचिए। लेख फ़ोन वाली तरफ़ को भी उठाता है। हैंडसेट खोने पर जो रिसता है वह उसमें रखा डेटा नहीं, बल्कि आपके PC को आदेश देने की हैसियत है, और साथ में लगातार चलती बातचीत का सामान — और Dispatch की आधिकारिक हेल्प अनपेयर करने या खोए डिवाइस से निपटने का कोई ब्योरा नहीं देती, इसलिए उपाय खाते की तरफ़ से आते हैं: Settings, Account, Active sessions में जाकर उस एक session को खत्म करना, claude.ai से हर session का लॉगआउट करना (जो मोबाइल ऐप में उपलब्ध नहीं है और इसलिए वेब ब्राउज़र माँगता है), या फिर बस PC वाली तरफ़ काट देना, यानी डेस्कटॉप ऐप बंद कर देना या मशीन को स्लीप में जाने देना — दरअसल यही सबसे तेज़ है, क्योंकि Dispatch को PC का जगा होना और ऐप का खुला होना चाहिए। आखिर में लेख Dispatch और कंप्यूटर उपयोग को दो अलग स्विच के रूप में अलग करता है, दोनों को Claude Code के agent view से भी अलग करता है (जिसकी क्रिया को आधिकारिक दस्तावेज़ dispatch कहते हैं), और एक व्यावहारिक रेखा खींचता है: शुरुआत उस काम से कीजिए जिसे वापस लिया जा सके।

Claude Code का agent view — session समानांतर कैसे चलते हैं, और अलगाव कहाँ से रिसता है

Claude Code का agent view — session समानांतर कैसे चलते हैं, और अलगाव कहाँ से रिसता है

Claude Code का agent view, जो claude agents से खुलता है, वह फ़ीचर है जिससे आप एक के बाद एक स्वतंत्र बैकग्राउंड session शुरू करते हैं और उन सबको एक ही स्क्रीन से सँभालते हैं। आधिकारिक दस्तावेज़ वहाँ की जाने वाली क्रिया को dispatch कहते हैं, और यह नाम डेस्कटॉप ऐप के उसी नाम वाले बिलकुल अलग फ़ीचर से टकराता है, इसलिए पहला काम दोनों को अलग पहचानना है। दस्तावेज़ agent view को उस फ़ीचर की तरह बताते हैं जो एक ही स्क्रीन से बहुत सारे Claude Code session डिस्पैच करने और सँभालने देता है, और यह एक रिसर्च प्रीव्यू है जिसके लिए v2.1.139 या उससे नया बिल्ड चाहिए। यह लेख मशीनरी और सुरक्षा-मॉडल तक सीमित रहता है। पहला झटका यही लगता है कि इनपुट बॉक्स में टाइप किया गया हर prompt अपना नया session शुरू करता है: दूसरा टाइप कीजिए तो पहले के बगल में दूसरा session खड़ा हो जाएगा, न कि पहले में जुड़ा कोई अतिरिक्त निर्देश। आगे के निर्देश peek panel से जाते हैं, जो Space से खुलता है और पूरा ट्रांसक्रिप्ट नहीं, बल्कि ताज़ा आउटपुट या वह सवाल दिखाता है जिस पर session रुका है। सुरक्षा-मॉडल का दिल है worktree के ज़रिए अलगाव। कोई भी फ़ाइल बदलने से पहले बैकग्राउंड session .claude/worktrees/ के नीचे एक अलग-थलग git worktree में चला जाता है, इसलिए समानांतर session एक ही checkout पढ़ते हैं पर लिखता हर एक अपने में है — पढ़ना साझा, लिखना अलग। जो कुछ भी मुख्य checkout तक पहुँचता, वह तीन जाँचों से कट जाता है: Edit, Write और NotebookEdit के ज़रिए फ़ाइल-बदलाव; वे कमांड जिनकी वर्किंग डायरेक्टरी मुख्य checkout पर टिकती है या जिनके बारे में यह पक्का नहीं हो सकता कि वे बाहर ही रहेंगे; और git का रुख मोड़ने की कोशिशें, चाहे वे git -C, --git-dir, GIT_DIR, GIT_WORK_TREE से हों या git से पहले लगाए गए cd से। फ़ैसला जानबूझकर सुरक्षित पक्ष में लिया गया है, यानी जिसकी पुष्टि न हो सके वह चलता ही नहीं, और यही सुरक्षा session के खड़े किए हर सबएजेंट को विरासत में मिलती है। हालाँकि यह OS-स्तर की दीवार नहीं है: रिपॉज़िटरी के बाहर की फ़ाइलें और नेटवर्क दायरे से बाहर हैं, और PowerShell के कमांड पर सिर्फ़ वर्किंग-डायरेक्टरी वाली जाँच लगती है। permission भी डिस्पैच के वक़्त चुनी नहीं जाती; वह उस डायरेक्टरी के defaultMode से, या डिस्पैच किए गए सबएजेंट के frontmatter के permissionMode से विरासत में आती है, यानी आपका रोज़मर्रा का कॉन्फ़िगरेशन जितना ढीला होगा, एक साथ उतने ही ज़्यादा लावारिस और ढीली permission वाले session बनेंगे। इसके बाद तीन चीज़ें अलगाव से बाहर रिसती हैं। हाँ, आगे मत पूछना चुनने पर वह नियम मुख्य checkout की .claude/settings.local.json में सहेजा जाता है, इसलिए वह मुख्य checkout और हर दूसरे worktree में लागू होता है और जिस worktree में बना था उसके मिटने के बाद भी बचा रहता है। agent view में session डिलीट करने पर Claude का बनाया worktree भी साथ मिट जाता है, यानी बिना commit किया काम गायब हो जाता है — और Ctrl+X पहली बार में रोकता है, दूसरी बार में मिटाता है। और .worktreeinclude gitignore की गई फ़ाइलें, जैसे .env, हर नए worktree में कॉपी कर देती है, जिससे आपके क्रेडेंशियल उतनी ही बार गुणा होते हैं जितने session आप डिस्पैच करते हैं। इसके ऊपर, कोटा समानांतरता के अनुपात में घटता है (दस एजेंट उसे लगभग दस गुना तेज़ी से खर्च करते हैं), और session लोकल चलते हैं, स्लीप को पार कर जाते हैं पर मशीन बंद होते ही रुक जाते हैं। लेख के आखिर में agent view को समानांतरीकरण के चार आधिकारिक तरीकों के बीच रखा गया है, सबएजेंट, agent teams और डायनेमिक वर्कफ़्लो के साथ, और डिस्पैच से पहले, उसके दौरान तथा उसके बाद के लिए एक ठोस दिनचर्या दी गई है।

ChatGPT Work क्या है और कैसे इस्तेमाल करें? GPT-5.6 एजेंट

ChatGPT Work क्या है और कैसे इस्तेमाल करें? GPT-5.6 एजेंट

ChatGPT Work वह "काम के लिए बना AI एजेंट" है जिसे OpenAI ने 9 जुलाई 2026 को GPT-5.6 के साथ घोषित किया। सिर्फ जवाब देने वाली सामान्य चैट के विपरीत, यह आपके कनेक्ट किए गए ऐप्स और फाइलों से संदर्भ इकट्ठा करके तैयार डिलिवरेबल — डॉक्युमेंट, स्प्रेडशीट, स्लाइड्स और यहाँ तक कि वेब ऐप्स — बनाता है। इसका दिमाग नया फ्लैगशिप GPT-5.6 Sol (Codex पर बना) है, और यह किसी जटिल प्रोजेक्ट को कदमों में बाँटकर घंटों तक काम करता रह सकता है (Thurrott)। एकीकृत डेस्कटॉप ऐप के भीतर तीन मोड साथ रहते हैं — Work (डिलिवरेबल), Codex (तकनीकी, विवरण दिखाता है), और सामान्य चैट (बातचीत) — जिसमें Work वह "बिज़नेस संस्करण" है जो Codex के तकनीकी विवरण को छिपाता है (9to5Mac)। मॉडल आपके प्लान पर निर्भर करता है: Free/Go डिफ़ॉल्ट रूप से Terra पर, जबकि Plus/Pro/Business/Enterprise, Sol/Terra/Luna में से चुनते हैं (रिपोर्ट के मुताबिक)। इसकी ताकत Google Drive, SharePoint और Slack जैसे कनेक्टर्स तथा MCP के ज़रिए "आपका संदर्भ" अंदर खींचना है — और एंटरप्राइज़ के लिए, डेटा डिफ़ॉल्ट रूप से प्रशिक्षण में उपयोग नहीं होता। Axios, TechCrunch, 9to5Mac, Thurrott और OpenAI के आधार पर, यह लेख बताता है कि ChatGPT Work क्या है, यह सामान्य ChatGPT और Codex से कैसे अलग है, किन प्लान्स में उपलब्ध है, और किन ऐप्स से कनेक्ट होता है — जो अभी आधिकारिक नहीं है उस पर विश्वसनीयता लेबल के साथ।

GPT-5.6 Sol vs Gemini तुलना: एजेंट का Sol, मल्टीमॉडल का Gemini——कोडिंग/कीमत/उपयोग-अनुसार चुनाव

GPT-5.6 Sol vs Gemini तुलना: एजेंट का Sol, मल्टीमॉडल का Gemini——कोडिंग/कीमत/उपयोग-अनुसार चुनाव

OpenAI का GPT-5.6 "Sol" और Google का Gemini——इनके मज़बूत क्षेत्र लगभग नहीं टकराते। Sol टर्मिनल/एजेंट कोडिंग में जबरदस्त (Terminal-Bench 88.8%, SWE-bench Pro 64.6% अनुमानित), जबकि Gemini 3.1 Pro नेटिव मल्टीमॉडल (आवाज़/वीडियो), लंबे संदर्भ और लगभग आधी कीमत से मुकाबला करता है तथा MMLU/ARC-AGI-2/WebDev Arena में आगे है। ध्यान दें: असली प्रतिद्वंद्वी Gemini 3.5 Pro इस लेख के समय अनुपलब्ध है (जुलाई मध्य GA प्रस्तावित), इसलिए निष्पक्ष तुलना Gemini 3.1 Pro से की गई है। आधिकारिक घोषणाओं और स्वतंत्र बेंचमार्क के आधार पर, दोनों की क्षमता, कीमत, मल्टीमॉडल और उपयोग-अनुसार चुनाव का विस्तृत विश्लेषण।

GPT-5.6 vs GPT-5.5 विस्तृत तुलना — एक फ्लैगशिप से Luna/Terra/Sol के 3 मॉडल तक, किस पर जाएँ

GPT-5.6 vs GPT-5.5 विस्तृत तुलना — एक फ्लैगशिप से Luna/Terra/Sol के 3 मॉडल तक, किस पर जाएँ

GPT-5.5 के ढाई महीने बाद आया GPT-5.6 केवल प्रदर्शन-सुधार नहीं, बल्कि एक फ्लैगशिप से Luna/Terra/Sol के 3-मॉडल ढाँचे में पुनर्गठन है। सबसे असरदार बात — मध्य-स्तरीय Terra GPT-5.5 जैसी गुणवत्ता कहीं कम कीमत पर देता है: रिलीज़ के समय आधी, और 30 जुलाई 2026 की कटौती के बाद GPT-5.5 की 40% कीमत ($2/$12) पर। वहीं शीर्ष Sol उसी कीमत $5/$30 पर SWE-Bench Pro 58.6→64.6% (अनुमानित) तक बेहतर करता है। यह लेख बताता है कि क्या बदला, वास्तविक लागत कितनी घटती है, और आपके उपयोग के अनुसार किस मॉडल पर माइग्रेट करना चाहिए।

GPT-5.6 Sol vs Claude Fable 5 विस्तृत तुलना — आधी कीमत का सर्वगुणी बनाम शीर्ष स्तर का कारीगर

GPT-5.6 Sol vs Claude Fable 5 विस्तृत तुलना — आधी कीमत का सर्वगुणी बनाम शीर्ष स्तर का कारीगर

OpenAI का शीर्ष GPT-5.6 Sol बनाम Anthropic का सबसे शक्तिशाली Claude Fable 5। वास्तविक प्रोडक्शन-स्तर कोडिंग (SWE-Bench Pro 80.3% vs 64.6% अनुमानित) और अधिकतम 12 घंटे की दीर्घकालीन स्वायत्तता में Fable 5 आगे, जबकि TerminalBench (88.8%), एजेंट समग्र व्यापकता और आधी कीमत ($5/$30 vs $10/$50) में Sol आगे। बेंचमार्क, वास्तविक लागत और उपयोग के अनुसार दोनों को कैसे बाँटें, इसकी विस्तृत व्याख्या।

GPT-5.6 Sol vs Claude Opus 4.8: बेंचमार्क, कोडिंग, मूल्य और चयन की गहन तुलना

GPT-5.6 Sol vs Claude Opus 4.8: बेंचमार्क, कोडिंग, मूल्य और चयन की गहन तुलना

2026 के दो AI-कोडिंग दिग्गजों, Claude Opus 4.8 (28 मई) और GPT-5.6 के शीर्ष Sol (9 जुलाई) की गहन तुलना। इनकी ताकत लगभग विपरीत है: Sol टर्मिनल संचालन व समग्र एजेंट क्षमता में आगे (TerminalBench 2.1 88.8% vs Opus 78.9%, Agents' Last Exam 53.6, Coding Agent Index 80), जबकि Opus 4.8 प्रोडक्शन-स्तरीय कोडिंग, गणित व लंबे-संदर्भ में आगे (SWE-bench Pro 69.2% vs Sol 64.6%, USAMO 2026 96.7%, GraphWalks 1M 68.1%) और ईमानदारी को सामने रखता है (अति-आत्मविश्वास एक-दहाई तक, दोषपूर्ण परिणामों की बिना-आलोचना रिपोर्ट 0%)। OpenAI ने Sol के कई बेंचमार्क (SWE-bench Pro, GPQA, AIME, MMLU) अघोषित रखे हैं, इसलिए कोडिंग के असली किले में खुलासा किया हुआ Opus बढ़त पर है। हम स्पेक तालिका, बेंचमार्क विवरण, अघोषित-बेंचमार्क समस्या, वास्तविक लागत ($25 vs $30 यूनिट मूल्य बनाम +54% टोकन दक्षता), ताकत/कमज़ोरी नक्शा, उपयोग-केस चयन और डुअल-वेंडर रणनीति को कवर करते हैं।

GPT-5.6 रिलीज़ पूर्ण गाइड — Luna/Terra/Sol, बेंचमार्क, कीमत और Claude से तुलना

GPT-5.6 रिलीज़ पूर्ण गाइड — Luna/Terra/Sol, बेंचमार्क, कीमत और Claude से तुलना

OpenAI ने 9 जुलाई 2026 को GPT-5.6 आम तौर पर उपलब्ध कराया, जिसमें पुराने "बेसिक + Pro" ढाँचे की जगह तीन-मॉडल व्यवस्था आई: Luna (तेज़, कम लागत, $0.20/$1.20), Terra (संतुलित, $2/$12, GPT-5.5 समकक्ष को Sol की 40% यूनिट कीमत पर) और Sol (फ्लैगशिप, $5/$30) — कीमतें 30 जुलाई 2026 के संशोधन के बाद। Sol Agents' Last Exam (53.6) और Coding Agent Index (80) में पहले स्थान पर है, और TerminalBench 2.1 में इसका 88.8% Claude Fable 5 (86.0%) से थोड़ा आगे है — फिर भी प्रोडक्शन-स्तरीय SWE-Bench Pro में Claude Fable 5 का 80.0% Sol के 64.6% से स्पष्ट रूप से आगे है। यह लेख तीनों मॉडल का अंतर, कीमत, बेंचमार्क, नई सुविधाएँ (Programmatic Tool Calling, ChatGPT Work, फुल-डुप्लेक्स GPT-Live वॉइस मॉडल), ChatGPT प्लान के अनुसार उपलब्धता, Claude (Fable 5 / Opus 4.8) से तुलना और उपयोग के अनुसार चुनाव को कवर करता है — सब OpenAI की आधिकारिक घोषणा और स्वतंत्र बेंचमार्क पर आधारित।