25 सितंबर 2026 को जोड़ा गया: यह लेख जुलाई 2026 की स्थिति के अनुसार Claude Fable 5 और GPT-5.6 Sol की तुलना करता है। उसके बाद Anthropic ने Claude Opus 5 (24 जुलाई) और Fable 5 का उत्तराधिकारी Claude Fable 5.1 (1 सितंबर), तथा OpenAI ने GPT-6 Astra (3 सितंबर) जारी किए हैं। लागत के लिए Astra (low) और Sol (high) की मापी गई तुलना देखें। फिर 22 सितंबर को Anthropic ने Claude Opus 5.5 और OpenAI ने (अमेरिकी समय) GPT-5.6 Sol की अगली पीढ़ी GPT-6 Sol और GPT-6 Luna जारी किए। अब Anthropic की सलाह है कि कौन-सा मॉडल लें यह तय न हो, तो ज़्यादातर कामों के लिए Opus 5.5 से शुरू करें। Fable 5 अब भी API पर पुराने (Legacy) मॉडल के रूप में उपलब्ध है, और GPT-5.6 Sol संक्रमण अवधि के दौरान उपलब्ध रहेगा। नीचे के पाठ में "शीर्ष स्तर", "फ्लैगशिप", "आगे" जैसे शब्द और बेंचमार्क मान लेखन के समय के हैं। 22 सितंबर को हमने बेंचमार्क मानों को मूल स्रोतों से मिलाकर सुधारा। Fable 5 का TerminalBench 2.1 "86.0%" दोनों में से किसी भी कंपनी की तालिका में नहीं है, इसलिए उसे दोनों मॉडल वाली OpenAI की तालिका के मान (83.1%) से बदला, और जहाँ SWE-Bench Pro की तुलना Sol से होती है वहाँ अब उसी तालिका का 80.0% है। "अधिकतम 12 घंटे तक लगातार स्वायत्तता" Anthropic का कथन नहीं बल्कि एक उपयोगकर्ता की रिपोर्ट थी, इसलिए उसे Anthropic के अपने शब्दों में बदला।

OpenAI का उस समय का शीर्ष मॉडल GPT-5.6 "Sol" (9 जुलाई 2026 को सामान्य उपलब्धता) और Anthropic ने लॉन्च के समय जिसे "सामान्य रूप से उपलब्ध सबसे शक्तिशाली मॉडल" के रूप में प्रस्तुत किया था वह Claude Fable 5 (9 जून को रिलीज़)। जहाँ Opus 4.8 से तुलना "समान मूल्य श्रेणी की सीधी टक्कर" थी, वहीं यहाँ "आधी कीमत वाला सर्वगुणी Sol" बनाम "दोगुना महंगा लेकिन शीर्ष स्तर का Fable 5"——यानी लागत और क्षमता के बीच का संतुलन मुख्य विषय बनता है।

निष्कर्ष पहले ही कह दें तो——वास्तविक प्रोडक्शन-स्तर की कोडिंग और दीर्घकालीन स्वायत्तता में Fable 5 स्पष्ट रूप से आगे है, जबकि कीमत और एजेंट की समग्र व्यापकता में Sol आगे है। SWE-bench Pro का अंतर Opus 4.8 वाली लड़ाई से भी अधिक बढ़ जाता है। इस लेख में हम दोनों कंपनियों की आधिकारिक घोषणाओं और स्वतंत्र बेंचमार्क के आधार पर, इन असममित दो दिग्गजों का उपयोग कैसे बाँटें, इसे व्यवस्थित रूप से देखेंगे।

FLAGSHIP SHOWDOWN · 2026

आधी कीमत का सर्वगुणी vs शीर्ष स्तर का कारीगर

— कीमत में 2 गुना अंतर, पर SWE-bench Pro का अंतर उससे भी अधिक

ANTHROPIC · लॉन्च के समय शीर्ष स्तर
Claude Fable 5
9 जून 2026 को रिलीज़
SWE-bench Pro: 80.0%
TerminalBench 2.1: 83.1%
दीर्घकालीन स्वायत्तता: अब तक के Claude में सबसे लंबी
कीमत: $10 / $50 per MTok
VS
OPENAI · लॉन्च के समय फ्लैगशिप
GPT-5.6 Sol
9 जुलाई 2026 को सामान्य उपलब्धता शुरू
SWE-bench Pro: 64.6%
TerminalBench 2.1: 88.8%
टोकन दक्षता: +54% (कोडिंग)
कीमत: $5 / $30 per MTok

Fable 5: वास्तविक कोड समाधान · दीर्घकालीन स्वायत्तता में सबसे मज़बूत "पूरा करने की क्षमता"
Sol: टर्मिनल संचालन · व्यापकता · आधी कीमत की "कीमत-प्रदर्शन और समग्र क्षमता"

1. दोनों मॉडलों की स्थिति——"आधी कीमत का सर्वगुणी" vs "शीर्ष स्तर का कारीगर"

Claude Fable 5——"लंबी दौड़ को पूरा करने की क्षमता" पर पूरा ज़ोर

Fable 5 वह मॉडल है जिसने Anthropic के भीतर सबसे शक्तिशाली स्तर के frontier मॉडल "Mythos" स्तर की क्षमता को, सामान्य उपयोगकर्ताओं और डेवलपर्स के इस्तेमाल के लायक रूप में जारी किया है (अंदर से यह Mythos 5 के समान ही है, केवल सुरक्षा तंत्र अलग है)। इसका टैगलाइन है "लंबे और जटिल कामों के लिए बनाया गया"। वास्तविक GitHub रिपॉज़िटरी सुधार को मापने वाले SWE-Bench Pro में 80.0% दर्ज कर, यह Opus 4.8 (69.2%) और पिछली पीढ़ी के GPT-5.5 (58.6%) से काफ़ी आगे निकल जाता है (Anthropic के सिस्टम कार्ड के अनुसार; घोषणा की तालिका का 80.3% Mythos 5 के साथ साझा कॉलम में है और वह ऊँचा स्कोर Mythos 5 का है)। यह कई लाख टोकन तक ध्यान बनाए रखता है और पिछले किसी भी Claude मॉडल से अधिक समय तक स्वायत्त रूप से काम कर सकता है, और Stripe ने 5 करोड़ लाइन के Ruby कोड का माइग्रेशन एक दिन में पूरा किया, ऐसा उदाहरण भी है (स्रोत: Anthropic की आधिकारिक घोषणा)।

GPT-5.6 Sol——"आधी कीमत का सर्वगुणी"

Sol, GPT-5.6 (Luna/Terra/Sol) का शीर्ष मॉडल है। टर्मिनल को स्वायत्त रूप से संचालित करने वाले TerminalBench 2.1 में 88.8%, दीर्घकालीन व्यावहारिक कार्य के Agents' Last Exam में 53.6 के साथ एजेंट समग्र क्षमता में शीर्ष स्थान लेता है, और कोडिंग में टोकन दक्षता 54% बेहतर है। सबसे बढ़कर, Fable 5 की लगभग आधी कीमत ($5/$30 बनाम $10/$50) इसका सबसे बड़ा हथियार है। यह "सबसे शक्तिशाली नहीं, पर कीमत-प्रदर्शन से लड़ने वाली" स्थिति में है (स्रोत: OpenAI की आधिकारिक घोषणा · Vellum · Artificial Analysis)।

2. स्पेसिफिकेशन एक नज़र में

मदClaude Fable 5GPT-5.6 Sol
प्रदाताAnthropic (लॉन्च के समय शीर्ष स्तर · सामान्य उपलब्ध मॉडल) OpenAI (GPT-5.6 का शीर्ष मॉडल)
रिलीज़ तिथि9 जून 20269 जुलाई 2026 (सामान्य उपलब्धता)
मॉडल IDclaude-fable-5gpt-5.6-sol
कॉन्टेक्स्ट लंबाई1,000,000 tokens1,050,000 tokens
अधिकतम आउटपुट टोकन128,000 tokens128,000 tokens
ज्ञान कटऑफ2026 की पहली छमाही (चरणबद्ध घोषणा) 16 फरवरी 2026
API कीमत$10 / $50 per MTok$5 / $30 per MTok (Fable की लगभग आधी; 21 अगस्त 2026 से तीन महीने का प्रचार मूल्य: $4 / $20)
रीज़निंगहमेशा चालू (अनुकूली सोच, कच्ची विचार-प्रक्रिया वापस नहीं दी जाती) reasoning effort (none से max तक 6 स्तर)
ताकत का मूलSWE-Bench Pro 80.0% (Anthropic का आँकड़ा), Claude में सबसे लंबी स्वायत्तता, लंबी दौड़ पूरी करने की क्षमताटर्मिनल संचालन · एजेंट समग्र क्षमता · टोकन दक्षता · आधी कीमत
सुरक्षा डिज़ाइन3 क्लासिफायर के साथ जोखिम पहचानने पर ही Opus 4.8 पर फ़ॉलबैक (सक्रियता सत्र के 5% से कम में) "सबसे शक्तिशाली सुरक्षा मॉडल" का दावा · safety स्टैक मज़बूत
उपलब्धता चैनलClaude.ai, API, GitHub Copilot आदिChatGPT, ChatGPT Work, Codex, OpenAI API

* कीमत और स्पेसिफिकेशन प्रत्येक कंपनी की आधिकारिक घोषणा (Fable 5=9 जून 2026, GPT-5.6=9 जुलाई 2026) पर आधारित हैं। बेंचमार्क में मापन की शर्तें, समय और harness दोनों कंपनियों में भिन्न हैं, अतः यह एक ही मैदान पर की गई सख़्त तुलना नहीं है। दोनों मॉडलों के आमने-सामने के मान (SWE-Bench Pro 80.0% बनाम 64.6%, TerminalBench 2.1 83.1% बनाम 88.8%, Agents' Last Exam 40.5 बनाम 53.6, Coding Agent Index 77.2 बनाम 80) दोनों मॉडल वाली OpenAI की GPT-5.6 घोषणा की मूल्यांकन तालिका से हैं (Sol का Agents' Last Exam 53.6 घोषणा के पाठ का मान है, उसी पेज की तालिका में 52.7% है; Coding Agent Index, Artificial Analysis का सूचक है)। Anthropic की अपनी घोषणा की तालिका में Fable 5 का SWE-Bench Pro 80.3% और TerminalBench 2.1 88.0% है, लेकिन दोनों Mythos 5 के साथ साझा कॉलम में दोनों में से ऊँचा स्कोर हैं (सिस्टम कार्ड में अकेले Fable 5 के मान 80.0% और 84.3% हैं), और TerminalBench 2.1 पर Anthropic का नोट है कि सुरक्षा तंत्र द्वारा अनुरोध दूसरे मॉडल को भेजे जाने के कारण Fable 5 का प्रदर्शन Opus 4.8 (उसी तालिका में 82.7%) के क़रीब रहता है। 86.0% का मान दोनों में से किसी तालिका में नहीं है।

3. बेंचमार्क विस्तृत तुलना

न तो "Fable 5 सब में जीतता है" और न ही "Sol सब में जीतता है"। कोडिंग के प्रकार से यह साफ़-साफ़ बँट जाता है।

CODING & AGENT BENCHMARKS

वास्तविक कोड समाधान में Fable, टर्मिनल · व्यापकता में Sol

SWE-bench Pro (वास्तविक रिपॉज़िटरी सुधार) Fable 80.0% vs Sol 64.6%
Fable 5
Sol
TerminalBench 2.1 (टर्मिनल स्वायत्त संचालन) Sol 88.8% vs Fable 83.1%
Sol
Fable 5
Agents' Last Exam (दीर्घकालीन व्यावहारिक कार्य) Sol 53.6 vs Fable 40.5
Sol 53.6
Fable 40.5
Coding Agent Index (Artificial Analysis) Sol 80 vs Fable 77.2
Sol 80
Fable 77.2

स्रोत: OpenAI की GPT-5.6 घोषणा की मूल्यांकन तालिका (Sol का Agents' Last Exam घोषणा के पाठ से, Coding Agent Index, Artificial Analysis का)

मुख्य बात "बेंचमार्क क्या माप रहा है" का अंतर है। SWE-bench Pro वास्तविक GitHub समस्याओं के लिए पैच बनाना=मौजूदा कोडबेस को सुधारने की क्षमता मापता है, और यहाँ Fable 5, 80.0% के साथ Sol के 64.6% से 15 अंक से अधिक आगे निकल जाता है। दूसरी ओर TerminalBench 2.1 कमांड-लाइन का स्वायत्त संचालन है, जहाँ Sol, 88.8% के साथ Fable 5 के 83.1% से आगे है। इसके अलावा एजेंट समग्रता के Agents' Last Exam · Coding Agent Index में Sol बढ़त पर है। "वास्तविक कोड को पूरी तरह ठीक करने की गहराई=Fable, टर्मिनल संचालन और एजेंट की व्यापकता=Sol" ऐसा साफ़-सुथरा बँटवारा बन जाता है।

4. "गैर-सार्वजनिक बेंच समस्या"——छिपाए गए बेंचमार्क और SWE-bench Pro पर सवाल

इस तुलना में भी सावधानी की ज़रूरत इस बात पर है कि OpenAI की मूल्यांकन तालिका में कुछ सूचक नहीं हैं। लॉन्च के तुरंत बाद स्वतंत्र विश्लेषण (Vellum) ने बताया था कि OpenAI ने SWE-bench Verified · GPQA Diamond · AIME · MMLU · ARC-AGI-2 · FrontierMath प्रकाशित नहीं किए। लेकिन 22 सितंबर 2026 को देखी गई OpenAI के घोषणा पेज की मूल्यांकन तालिका में GPQA Diamond (Sol 94.6%, Fable 5 92.6%) और FrontierMath (Tier 1-3: Sol 89%, Fable 5 87%; Tier 4: Sol 83%, Fable 5 87.8%) मौजूद हैं। तालिका में SWE-bench Verified · AIME · MMLU नहीं हैं, और Sol का ARC-AGI-2 मान (92.5%) पहली बार 3 सितंबर को GPT-6 Astra की घोषणा की तालिका में आया। इस लेख का SWE-bench Pro "64.6%" भी उसी मूल्यांकन तालिका से है जो OpenAI ने GPT-5.6 के साथ प्रकाशित की। हालाँकि OpenAI ने साथ ही एक विश्लेषण भी प्रकाशित किया जिसके अनुसार SWE-bench Pro के लगभग 30% कार्य त्रुटिपूर्ण हैं (जैसा Simon Willison ने बताया)।

THE BENCHMARK PROBLEM

व्यावहारिकता के सबसे निकट कोडिंग सूचक पर OpenAI का सवाल

🟡 Sol का मान 64.6%
OpenAI की अपनी मूल्यांकन तालिका का मान, पर साथ ही OpenAI ने विश्लेषण प्रकाशित किया कि लगभग 30% कार्य त्रुटिपूर्ण हैं
✅ Fable ने खुलासा किया
Anthropic ने SWE-Bench Pro 80.0% प्रकाशित किया (सिस्टम कार्ड का मान, OpenAI की तालिका जैसा ही; घोषणा की तालिका का 80.3% Mythos 5 का स्कोर है)
🔴 कुछ सूचक तालिका में नहीं
Sol के SWE-bench Verified · AIME · MMLU के मान नहीं हैं (GPQA Diamond तालिका में है: Sol 94.6% बनाम Fable 5 92.6%)

* यदि वास्तविक प्रोडक्शन-स्तर की कोडिंग को महत्व देते हैं, तो दोनों कंपनियों की तालिकाओं में SWE-bench Pro लगभग 80% वाला Fable 5 मज़बूत विकल्प है। केवल भड़कीले एजेंट आँकड़ों से निर्णय न लें।

5. दीर्घकालीन स्वायत्तता——Fable 5 का असली दम

Fable 5 की असली कीमत बेंच के स्कोर से बढ़कर "लंबी दौड़ को पूरा करने की क्षमता" में है। Anthropic बताता है कि यह कई लाख टोकन तक ध्यान बनाए रखता है और पिछले किसी भी Claude मॉडल से अधिक समय तक स्वायत्त रूप से काम कर सकता है (घंटों में कोई ऊपरी सीमा नहीं बताई गई)। उदाहरण के रूप में यह Stripe ने 5 करोड़ लाइन के Ruby कोड का माइग्रेशन एक दिन में पूरा किया (हाथ से करने पर 2 महीने से अधिक के बराबर) वाला मामला देता है। लॉन्च के तुरंत बाद एक उपयोगकर्ता ने Ten Past Tomorrow ब्लॉग पर यह भी बताया कि एक ही निर्देश पर मॉडल 12 घंटे से अधिक समय तक अपने आप काम करता रहा। दीर्घकालीन विश्लेषण बेंच Hex में इतिहास में पहली बार 90% से अधिक भी रिपोर्ट किया गया।

अब तक सबसे लंबा
Claude में सबसे लंबा स्वायत्त संचालन

कई लाख टोकन तक ध्यान बनाए रखकर, लंबे समय की कोडिंग · जाँच स्वयं चलाता है (Anthropic के अनुसार)।

5 करोड़ लाइन / 1 दिन
Stripe का बड़े पैमाने का माइग्रेशन

हाथ से करने पर 2 महीने से अधिक के Ruby माइग्रेशन को एक दिन में पूरा किया, यह वास्तविक उदाहरण।

SWE-Bench Pro 80.0%
वास्तविक कोड सुधार में शीर्ष स्तर

OpenAI की तालिका में Opus 4.8 (69.2%) और Sol (64.6%) से काफ़ी आगे (Anthropic के सिस्टम कार्ड में भी 80.0%)।

Sol भी दीर्घकालीन व्यावहारिक कार्य के Agents' Last Exam में शीर्ष पर है (53.6), पर यह "व्यापक कार्य-वर्कफ़्लो" मापने वाला बेंच है। एकल विशाल कोडबेस को अंत तक पूरी तरह ठीक करने की "गहरी पूर्णता क्षमता" में Fable 5 का पलड़ा भारी है——यही दोनों का गुणात्मक अंतर है। बड़े पैमाने के माइग्रेशन · दीर्घकालीन जाँच · स्वायत्त कोडिंग एजेंट के मुख्य कार्य के लिए Fable 5 उपयुक्त है।

6. वास्तविक लागत——दोगुनी दर को कैसे देखें

दर Fable 5 के लिए $10/$50, Sol के लिए $5/$30 है। इनपुट में 2 गुना, आउटपुट में 1.67 गुना, यानी Fable 5, Sol से लगभग 2 गुना महंगा है (Sol पर 21 अगस्त 2026 से तीन महीने का प्रचार मूल्य $4/$20 लागू रहने तक लगभग 2.5 गुना)। यहीं चुनाव का मोड़ आता है।

  • Sol की लागत बढ़त: दर आधी होने के साथ-साथ, कोडिंग में टोकन दक्षता 54% बेहतर। एक ही काम में खपत होने वाले टोकन भी घटते हैं, इसलिए "मात्रा निपटाने" वाले उपयोगों में कुल लागत Fable 5 से काफ़ी कम रहती है।
  • Fable 5 का मूल्य: दर ऊँची है, पर एक बार में सही ढंग से पूरा ठीक करने की सफलता दर (SWE-bench Pro दोनों कंपनियों की तालिकाओं में लगभग 80%) ऊँची है। दोबारा करना · समीक्षा · मानवीय पुनःकार्य की लागत तक शामिल करें तो, कठिन कार्यों में "महंगा पर अंततः सस्ता" हो सकता है। यदि 5 करोड़ लाइन एक दिन में माइग्रेट हो सकती हैं, तो श्रम-लागत के हिसाब से यह बेहद किफ़ायती है।

यानी "टोकन दर" से नहीं बल्कि "प्रति कार्य पूर्णता की लागत" से देखना चाहिए। रोज़मर्रा के बड़ी मात्रा वाले कार्य · टर्मिनल संचालन के लिए Sol (और अधिक लागत-केंद्रित हों तो GPT-5.6 Terra या Luna), जहाँ विफलता महंगी पड़े वैसे बड़े पैमाने · दीर्घकालीन कार्यों के लिए Fable 5——यह बँटवारा लागत-अनुकूलन के नज़रिये से भी तर्कसंगत है।

* दोनों कंपनियों ने समान शर्तों पर आउटपुट टोकन की तुलना प्रकाशित नहीं की है, इसलिए ठोस "वास्तविक लागत गुणक" निश्चित रूप से नहीं कहा जा सकता। अपने प्रतिनिधि कार्य में सफलता दर और आउटपुट टोकन स्वयं मापकर, पुनःकार्य की लागत तक शामिल कर तुलना करने की सिफ़ारिश की जाती है।

7. ताकत · कमज़ोरी मानचित्र

STRENGTHS & WEAKNESSES

शीर्ष स्तर की पूर्णता क्षमता vs आधी कीमत की समग्र क्षमता

CLAUDE FABLE 5
◯ ताकत
  • · SWE-Bench Pro लगभग 80% (दोनों तालिकाएँ) के साथ वास्तविक कोडिंग में शीर्ष स्तर
  • · Claude में सबसे लंबी स्वायत्तता · पूर्णता क्षमता
  • · बड़े पैमाने के माइग्रेशन का रिकॉर्ड (Stripe 5 करोड़ लाइन/1 दिन)
  • · OpenAI की तालिका में भी FrontierMath Tier 4 पर Sol से आगे (87.8% बनाम 83%)
  • · 3 क्लासिफायर का नया सुरक्षा डिज़ाइन (केवल खतरनाक क्षेत्र में रोक)
△ कमज़ोरी
  • · दर ऊँची ($10/$50=Sol की लगभग 2 गुना; Sol के प्रचार मूल्य की अवधि में लगभग 2.5 गुना)
  • · टर्मिनल संचालन · एजेंट समग्रता की व्यापकता में Sol से पीछे
  • · हल्के बड़ी मात्रा वाले कार्यों के लिए ज़रूरत से ज़्यादा सक्षम
  • · कच्ची विचार-प्रक्रिया वापस नहीं दी जाती
GPT-5.6 SOL
◯ ताकत
  • · TerminalBench 88.8% · टर्मिनल संचालन में शीर्ष
  • · Agents' Last Exam · Coding Agent Index में शीर्ष
  • · दर आधी + टोकन दक्षता +54% के साथ कीमत-प्रदर्शन में सर्वश्रेष्ठ
  • · Luna/Terra/Sol तीन मॉडलों से उपयोग-अनुकूलन
  • · ChatGPT Work / Codex / GPT-Live एकीकरण
△ कमज़ोरी
  • · SWE-bench Pro में 15pt से अधिक बड़े अंतर से हार
  • · AIME · MMLU आदि मूल्यांकन तालिका में नहीं
  • · एकल विशाल कोड की "गहरी पूर्णता क्षमता" में Fable से पीछे
  • · दीर्घकालीन स्वायत्तता के रिकॉर्ड प्रस्तुत करने में Fable आगे

8. उपयोग के अनुसार चुनाव

उपयोगअनुशंसित मॉडलकारण
बड़े पैमाने का कोड माइग्रेशन · लेगेसी नवीनीकरणFable 5दीर्घकालीन स्वायत्तता + Stripe 5 करोड़ लाइन/1 दिन की पूर्णता क्षमता
वास्तविक रिपॉज़िटरी के कठिन बग सुधार · बड़े PRFable 5SWE-Bench Pro लगभग 80% (दोनों तालिकाएँ) के साथ सफलता दर ऊँची
दीर्घकालीन स्वायत्त जाँच · विश्लेषण एजेंटFable 5कई लाख टोकन पर ध्यान · पूर्णता क्षमता के लिए अनुकूलित
विफलता की पुनःकार्य लागत बड़ी हो ऐसे अहम कार्यFable 5एक बार में सही ढंग से पूरा ठीक करने की निश्चितता ऊँची
CLI · टर्मिनल को स्वायत्त संचालित करने वाला एजेंटSolTerminalBench 2.1 88.8% के साथ शीर्ष
व्यापक कार्य-वर्कफ़्लो स्वचालनSolAgents' Last Exam 53.6 के साथ शीर्ष
लागत-केंद्रित बड़ी मात्रा वाले कार्यSolआधी कीमत + टोकन दक्षता +54%। हल्के काम के लिए Terra/Luna भी
ChatGPT/Codex/वॉइस सहित एकीकृत संचालनSolChatGPT Work · GPT-Live · Codex के साथ एकीकृत

सारांश

  • Claude Fable 5: वास्तविक कोड सुधार (SWE-Bench Pro लगभग 80%) और दीर्घकालीन स्वायत्तता में शीर्ष स्तर। बड़े पैमाने के माइग्रेशन · कठिन कार्यों की "पूर्णता क्षमता" इसका असली दम है। लेकिन दर Sol की लगभग 2 गुना है।
  • GPT-5.6 Sol: टर्मिनल संचालन (TerminalBench 88.8%) · एजेंट समग्र क्षमता में शीर्ष, आधी कीमत + टोकन दक्षता +54% के साथ कीमत-प्रदर्शन में सर्वश्रेष्ठ। तीन मॉडलों से उपयोग-अनुकूलन आसान।
  • SWE-bench Pro का अंतर Opus 4.8 वाली लड़ाई से बढ़ा है (OpenAI की तालिका में 80.0 vs 64.6 · 15pt से अधिक)। पर ध्यान दें कि OpenAI ने एक विश्लेषण भी प्रकाशित किया है जिसके अनुसार SWE-bench Pro के लगभग 30% कार्य त्रुटिपूर्ण हैं।
  • लागत को "टोकन दर" से नहीं बल्कि "प्रति कार्य पूर्णता" से देखें। बड़ी मात्रा · टर्मिनल के लिए Sol, जहाँ विफलता महंगी पड़े वैसे बड़े पैमाने · दीर्घकालीन के लिए Fable 5।
  • व्यावहारिक हल दोहरा संचालन है। रोज़मर्रा के लिए Sol (या Terra), निर्णायक बड़े कार्यों के लिए Fable 5, इस तरह बाँटना सर्वोत्तम।

FAQ

Q1. GPT-5.6 Sol और Claude Fable 5, कोडिंग में कौन मज़बूत है?

सूचक पर निर्भर करता है। वास्तविक रिपॉज़िटरी के बग सुधार मापने वाले SWE-Bench Pro में Fable 5, 80.0% के साथ Sol के 64.6% से 15pt से अधिक आगे है। दूसरी ओर, टर्मिनल स्वायत्त संचालन के TerminalBench 2.1 में Sol, 88.8% के साथ Fable 5 के 83.1% से आगे है (दोनों मान OpenAI की मूल्यांकन तालिका के हैं; Anthropic के सिस्टम कार्ड में भी Fable 5 का SWE-Bench Pro 80.0% है)। "वास्तविक कोड को पूरी तरह ठीक करना हो तो Fable, टर्मिनल संचालन · एजेंट की व्यापकता हो तो Sol" यह व्यावहारिक बँटवारा है।

Q2. 2 गुना कीमत अंतर चुकाना उचित है?

कार्य पर निर्भर। रोज़मर्रा की बड़ी मात्रा · टर्मिनल संचालन के लिए आधी कीमत का Sol (और हल्के काम के लिए Terra/Luna) पर्याप्त है। लेकिन बड़े पैमाने के माइग्रेशन या कठिन बग सुधार जैसे "जहाँ विफलता की पुनःकार्य लागत महंगी पड़े" वैसे कार्यों में, ऊँची सफलता दर वाला Fable 5 अंततः सस्ता पड़ता है। टोकन दर से नहीं बल्कि "प्रति कार्य पूर्णता की लागत" से निर्णय लें।

Q3. क्या Sol का SWE-bench Pro "64.6%" आधिकारिक मान है?

हाँ, यह वह मान है जो OpenAI ने GPT-5.6 के साथ प्रकाशित मूल्यांकन तालिका में दिया। साथ ही OpenAI ने एक विश्लेषण भी प्रकाशित किया जिसके अनुसार SWE-bench Pro के लगभग 30% कार्य त्रुटिपूर्ण हैं, यानी इस बेंचमार्क पर ही सवाल उठाया। लॉन्च के तुरंत बाद Vellum ने जिन GPQA Diamond और FrontierMath को अप्रकाशित बताया था, वे 22 सितंबर 2026 को देखी गई मूल्यांकन तालिका में मौजूद हैं (GPQA: Sol 94.6%, Fable 5 92.6%)। तालिका में SWE-bench Verified · AIME · MMLU नहीं हैं।

Q4. दीर्घकालीन स्वायत्त कार्यों के लिए कौन उपयुक्त है?

Fable 5। यह कई लाख टोकन तक ध्यान बनाए रखता है और Anthropic के अनुसार पिछले किसी भी Claude मॉडल से अधिक समय तक स्वायत्त रूप से काम कर सकता है, और Stripe ने 5 करोड़ लाइन का Ruby माइग्रेशन एक दिन में पूरा किया, ऐसा रिकॉर्ड है। एकल विशाल कोडबेस को अंत तक पूरी तरह ठीक करने की "पूर्णता क्षमता" Fable 5 का असली दम है।

Q5. Fable 5 और Mythos 5 में क्या अंतर है?

अंदर से (क्षमता) समान है, केवल सुरक्षा तंत्र अलग है। सामान्य रूप से उपलब्ध होने वाला Fable 5 है, और Fable 5 में जोखिम पहचानने पर ही Opus 4.8 पर फ़ॉलबैक करने वाला 3-क्लासिफायर सुरक्षा डिज़ाइन है (सक्रियता सत्र के 5% से कम में, 95% से अधिक स्वयं चलता है)।

Q6. GPT-5.6 का "Terra" इस तुलना में कैसे जुड़ता है?

GPT-5.6, Luna/Terra/Sol तीन मॉडल हैं। इस लेख में लेखन के समय के फ्लैगशिप बनाम फ्लैगशिप के रूप में Sol को लिया गया, पर लागत-केंद्रित हों तो Terra ($2/$12) GPT-5.5 के बराबर को Sol की 40% यूनिट कीमत में देता है (30 जुलाई 2026 की कीमत कटौती के बाद)। "Fable 5 से कठिन कार्य, Terra से बड़ी मात्रा" ऐसा संयोजन भी व्यवहार में सशक्त है। विवरण के लिए GPT-5.6 रिलीज़ पूर्ण व्याख्या देखें।

Q7. Opus 4.8 और Fable 5, Sol से तुलना करें तो कौन?

उपयोग और बजट से चुनें। Opus 4.8 ($5/$25) Sol के समान मूल्य श्रेणी में है, और SWE-bench Pro 69.2% के साथ किफ़ायती कोडिंग देता है। Fable 5 ($10/$50) उस समय शीर्ष स्तर पर था और 80.0% के साथ पूर्णता क्षमता में बेजोड़ है पर महंगा। रोज़मर्रा के लिए Opus 4.8/Sol, निर्णायक मौकों के लिए Fable 5, यह तीन-स्तरीय उपयोग व्यावहारिक है। Sol vs Opus 4.8 तुलना भी देखें।

संबंधित लेख