25 सितंबर 2026 को जोड़ा गया: यह लेख जुलाई 2026 की स्थिति के अनुसार Claude Fable 5 और GPT-5.6 Sol की तुलना करता है। उसके बाद Anthropic ने Claude Opus 5 (24 जुलाई) और Fable 5 का उत्तराधिकारी Claude Fable 5.1 (1 सितंबर), तथा OpenAI ने GPT-6 Astra (3 सितंबर) जारी किए हैं। लागत के लिए Astra (low) और Sol (high) की मापी गई तुलना देखें। फिर 22 सितंबर को Anthropic ने Claude Opus 5.5 और OpenAI ने (अमेरिकी समय) GPT-5.6 Sol की अगली पीढ़ी GPT-6 Sol और GPT-6 Luna जारी किए। अब Anthropic की सलाह है कि कौन-सा मॉडल लें यह तय न हो, तो ज़्यादातर कामों के लिए Opus 5.5 से शुरू करें। Fable 5 अब भी API पर पुराने (Legacy) मॉडल के रूप में उपलब्ध है, और GPT-5.6 Sol संक्रमण अवधि के दौरान उपलब्ध रहेगा। नीचे के पाठ में "शीर्ष स्तर", "फ्लैगशिप", "आगे" जैसे शब्द और बेंचमार्क मान लेखन के समय के हैं। 22 सितंबर को हमने बेंचमार्क मानों को मूल स्रोतों से मिलाकर सुधारा। Fable 5 का TerminalBench 2.1 "86.0%" दोनों में से किसी भी कंपनी की तालिका में नहीं है, इसलिए उसे दोनों मॉडल वाली OpenAI की तालिका के मान (83.1%) से बदला, और जहाँ SWE-Bench Pro की तुलना Sol से होती है वहाँ अब उसी तालिका का 80.0% है। "अधिकतम 12 घंटे तक लगातार स्वायत्तता" Anthropic का कथन नहीं बल्कि एक उपयोगकर्ता की रिपोर्ट थी, इसलिए उसे Anthropic के अपने शब्दों में बदला।
विषय-सूची
- 1. दोनों मॉडलों की स्थिति——"आधी कीमत का सर्वगुणी" vs "शीर्ष स्तर का कारीगर"
- 2. स्पेसिफिकेशन एक नज़र में
- 3. बेंचमार्क विस्तृत तुलना
- 4. "गैर-सार्वजनिक बेंच समस्या"——छिपाए गए बेंचमार्क और SWE-bench Pro पर सवाल
- 5. दीर्घकालीन स्वायत्तता——Fable 5 का असली दम
- 6. वास्तविक लागत——दोगुनी दर को कैसे देखें
- 7. ताकत · कमज़ोरी मानचित्र
- 8. उपयोग के अनुसार चुनाव
- सारांश
- FAQ
OpenAI का उस समय का शीर्ष मॉडल GPT-5.6 "Sol" (9 जुलाई 2026 को सामान्य उपलब्धता) और Anthropic ने लॉन्च के समय जिसे "सामान्य रूप से उपलब्ध सबसे शक्तिशाली मॉडल" के रूप में प्रस्तुत किया था वह Claude Fable 5 (9 जून को रिलीज़)। जहाँ Opus 4.8 से तुलना "समान मूल्य श्रेणी की सीधी टक्कर" थी, वहीं यहाँ "आधी कीमत वाला सर्वगुणी Sol" बनाम "दोगुना महंगा लेकिन शीर्ष स्तर का Fable 5"——यानी लागत और क्षमता के बीच का संतुलन मुख्य विषय बनता है।
निष्कर्ष पहले ही कह दें तो——वास्तविक प्रोडक्शन-स्तर की कोडिंग और दीर्घकालीन स्वायत्तता में Fable 5 स्पष्ट रूप से आगे है, जबकि कीमत और एजेंट की समग्र व्यापकता में Sol आगे है। SWE-bench Pro का अंतर Opus 4.8 वाली लड़ाई से भी अधिक बढ़ जाता है। इस लेख में हम दोनों कंपनियों की आधिकारिक घोषणाओं और स्वतंत्र बेंचमार्क के आधार पर, इन असममित दो दिग्गजों का उपयोग कैसे बाँटें, इसे व्यवस्थित रूप से देखेंगे।
आधी कीमत का सर्वगुणी vs शीर्ष स्तर का कारीगर
— कीमत में 2 गुना अंतर, पर SWE-bench Pro का अंतर उससे भी अधिक
Fable 5: वास्तविक कोड समाधान · दीर्घकालीन स्वायत्तता में सबसे मज़बूत "पूरा करने की क्षमता"
Sol: टर्मिनल संचालन · व्यापकता · आधी कीमत की "कीमत-प्रदर्शन और समग्र क्षमता"
1. दोनों मॉडलों की स्थिति——"आधी कीमत का सर्वगुणी" vs "शीर्ष स्तर का कारीगर"
Claude Fable 5——"लंबी दौड़ को पूरा करने की क्षमता" पर पूरा ज़ोर
Fable 5 वह मॉडल है जिसने Anthropic के भीतर सबसे शक्तिशाली स्तर के frontier मॉडल "Mythos" स्तर की क्षमता को, सामान्य उपयोगकर्ताओं और डेवलपर्स के इस्तेमाल के लायक रूप में जारी किया है (अंदर से यह Mythos 5 के समान ही है, केवल सुरक्षा तंत्र अलग है)। इसका टैगलाइन है "लंबे और जटिल कामों के लिए बनाया गया"। वास्तविक GitHub रिपॉज़िटरी सुधार को मापने वाले SWE-Bench Pro में 80.0% दर्ज कर, यह Opus 4.8 (69.2%) और पिछली पीढ़ी के GPT-5.5 (58.6%) से काफ़ी आगे निकल जाता है (Anthropic के सिस्टम कार्ड के अनुसार; घोषणा की तालिका का 80.3% Mythos 5 के साथ साझा कॉलम में है और वह ऊँचा स्कोर Mythos 5 का है)। यह कई लाख टोकन तक ध्यान बनाए रखता है और पिछले किसी भी Claude मॉडल से अधिक समय तक स्वायत्त रूप से काम कर सकता है, और Stripe ने 5 करोड़ लाइन के Ruby कोड का माइग्रेशन एक दिन में पूरा किया, ऐसा उदाहरण भी है (स्रोत: Anthropic की आधिकारिक घोषणा)।
GPT-5.6 Sol——"आधी कीमत का सर्वगुणी"
Sol, GPT-5.6 (Luna/Terra/Sol) का शीर्ष मॉडल है। टर्मिनल को स्वायत्त रूप से संचालित करने वाले TerminalBench 2.1 में 88.8%, दीर्घकालीन व्यावहारिक कार्य के Agents' Last Exam में 53.6 के साथ एजेंट समग्र क्षमता में शीर्ष स्थान लेता है, और कोडिंग में टोकन दक्षता 54% बेहतर है। सबसे बढ़कर, Fable 5 की लगभग आधी कीमत ($5/$30 बनाम $10/$50) इसका सबसे बड़ा हथियार है। यह "सबसे शक्तिशाली नहीं, पर कीमत-प्रदर्शन से लड़ने वाली" स्थिति में है (स्रोत: OpenAI की आधिकारिक घोषणा · Vellum · Artificial Analysis)।
2. स्पेसिफिकेशन एक नज़र में
| मद | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|
| प्रदाता | Anthropic (लॉन्च के समय शीर्ष स्तर · सामान्य उपलब्ध मॉडल) | OpenAI (GPT-5.6 का शीर्ष मॉडल) |
| रिलीज़ तिथि | 9 जून 2026 | 9 जुलाई 2026 (सामान्य उपलब्धता) |
| मॉडल ID | claude-fable-5 | gpt-5.6-sol |
| कॉन्टेक्स्ट लंबाई | 1,000,000 tokens | 1,050,000 tokens |
| अधिकतम आउटपुट टोकन | 128,000 tokens | 128,000 tokens |
| ज्ञान कटऑफ | 2026 की पहली छमाही (चरणबद्ध घोषणा) | 16 फरवरी 2026 |
| API कीमत | $10 / $50 per MTok | $5 / $30 per MTok (Fable की लगभग आधी; 21 अगस्त 2026 से तीन महीने का प्रचार मूल्य: $4 / $20) |
| रीज़निंग | हमेशा चालू (अनुकूली सोच, कच्ची विचार-प्रक्रिया वापस नहीं दी जाती) | reasoning effort (none से max तक 6 स्तर) |
| ताकत का मूल | SWE-Bench Pro 80.0% (Anthropic का आँकड़ा), Claude में सबसे लंबी स्वायत्तता, लंबी दौड़ पूरी करने की क्षमता | टर्मिनल संचालन · एजेंट समग्र क्षमता · टोकन दक्षता · आधी कीमत |
| सुरक्षा डिज़ाइन | 3 क्लासिफायर के साथ जोखिम पहचानने पर ही Opus 4.8 पर फ़ॉलबैक (सक्रियता सत्र के 5% से कम में) | "सबसे शक्तिशाली सुरक्षा मॉडल" का दावा · safety स्टैक मज़बूत |
| उपलब्धता चैनल | Claude.ai, API, GitHub Copilot आदि | ChatGPT, ChatGPT Work, Codex, OpenAI API |
* कीमत और स्पेसिफिकेशन प्रत्येक कंपनी की आधिकारिक घोषणा (Fable 5=9 जून 2026, GPT-5.6=9 जुलाई 2026) पर आधारित हैं। बेंचमार्क में मापन की शर्तें, समय और harness दोनों कंपनियों में भिन्न हैं, अतः यह एक ही मैदान पर की गई सख़्त तुलना नहीं है। दोनों मॉडलों के आमने-सामने के मान (SWE-Bench Pro 80.0% बनाम 64.6%, TerminalBench 2.1 83.1% बनाम 88.8%, Agents' Last Exam 40.5 बनाम 53.6, Coding Agent Index 77.2 बनाम 80) दोनों मॉडल वाली OpenAI की GPT-5.6 घोषणा की मूल्यांकन तालिका से हैं (Sol का Agents' Last Exam 53.6 घोषणा के पाठ का मान है, उसी पेज की तालिका में 52.7% है; Coding Agent Index, Artificial Analysis का सूचक है)। Anthropic की अपनी घोषणा की तालिका में Fable 5 का SWE-Bench Pro 80.3% और TerminalBench 2.1 88.0% है, लेकिन दोनों Mythos 5 के साथ साझा कॉलम में दोनों में से ऊँचा स्कोर हैं (सिस्टम कार्ड में अकेले Fable 5 के मान 80.0% और 84.3% हैं), और TerminalBench 2.1 पर Anthropic का नोट है कि सुरक्षा तंत्र द्वारा अनुरोध दूसरे मॉडल को भेजे जाने के कारण Fable 5 का प्रदर्शन Opus 4.8 (उसी तालिका में 82.7%) के क़रीब रहता है। 86.0% का मान दोनों में से किसी तालिका में नहीं है।
3. बेंचमार्क विस्तृत तुलना
न तो "Fable 5 सब में जीतता है" और न ही "Sol सब में जीतता है"। कोडिंग के प्रकार से यह साफ़-साफ़ बँट जाता है।
वास्तविक कोड समाधान में Fable, टर्मिनल · व्यापकता में Sol
स्रोत: OpenAI की GPT-5.6 घोषणा की मूल्यांकन तालिका (Sol का Agents' Last Exam घोषणा के पाठ से, Coding Agent Index, Artificial Analysis का)
मुख्य बात "बेंचमार्क क्या माप रहा है" का अंतर है। SWE-bench Pro वास्तविक GitHub समस्याओं के लिए पैच बनाना=मौजूदा कोडबेस को सुधारने की क्षमता मापता है, और यहाँ Fable 5, 80.0% के साथ Sol के 64.6% से 15 अंक से अधिक आगे निकल जाता है। दूसरी ओर TerminalBench 2.1 कमांड-लाइन का स्वायत्त संचालन है, जहाँ Sol, 88.8% के साथ Fable 5 के 83.1% से आगे है। इसके अलावा एजेंट समग्रता के Agents' Last Exam · Coding Agent Index में Sol बढ़त पर है। "वास्तविक कोड को पूरी तरह ठीक करने की गहराई=Fable, टर्मिनल संचालन और एजेंट की व्यापकता=Sol" ऐसा साफ़-सुथरा बँटवारा बन जाता है।
4. "गैर-सार्वजनिक बेंच समस्या"——छिपाए गए बेंचमार्क और SWE-bench Pro पर सवाल
इस तुलना में भी सावधानी की ज़रूरत इस बात पर है कि OpenAI की मूल्यांकन तालिका में कुछ सूचक नहीं हैं। लॉन्च के तुरंत बाद स्वतंत्र विश्लेषण (Vellum) ने बताया था कि OpenAI ने SWE-bench Verified · GPQA Diamond · AIME · MMLU · ARC-AGI-2 · FrontierMath प्रकाशित नहीं किए। लेकिन 22 सितंबर 2026 को देखी गई OpenAI के घोषणा पेज की मूल्यांकन तालिका में GPQA Diamond (Sol 94.6%, Fable 5 92.6%) और FrontierMath (Tier 1-3: Sol 89%, Fable 5 87%; Tier 4: Sol 83%, Fable 5 87.8%) मौजूद हैं। तालिका में SWE-bench Verified · AIME · MMLU नहीं हैं, और Sol का ARC-AGI-2 मान (92.5%) पहली बार 3 सितंबर को GPT-6 Astra की घोषणा की तालिका में आया। इस लेख का SWE-bench Pro "64.6%" भी उसी मूल्यांकन तालिका से है जो OpenAI ने GPT-5.6 के साथ प्रकाशित की। हालाँकि OpenAI ने साथ ही एक विश्लेषण भी प्रकाशित किया जिसके अनुसार SWE-bench Pro के लगभग 30% कार्य त्रुटिपूर्ण हैं (जैसा Simon Willison ने बताया)।
व्यावहारिकता के सबसे निकट कोडिंग सूचक पर OpenAI का सवाल
* यदि वास्तविक प्रोडक्शन-स्तर की कोडिंग को महत्व देते हैं, तो दोनों कंपनियों की तालिकाओं में SWE-bench Pro लगभग 80% वाला Fable 5 मज़बूत विकल्प है। केवल भड़कीले एजेंट आँकड़ों से निर्णय न लें।
5. दीर्घकालीन स्वायत्तता——Fable 5 का असली दम
Fable 5 की असली कीमत बेंच के स्कोर से बढ़कर "लंबी दौड़ को पूरा करने की क्षमता" में है। Anthropic बताता है कि यह कई लाख टोकन तक ध्यान बनाए रखता है और पिछले किसी भी Claude मॉडल से अधिक समय तक स्वायत्त रूप से काम कर सकता है (घंटों में कोई ऊपरी सीमा नहीं बताई गई)। उदाहरण के रूप में यह Stripe ने 5 करोड़ लाइन के Ruby कोड का माइग्रेशन एक दिन में पूरा किया (हाथ से करने पर 2 महीने से अधिक के बराबर) वाला मामला देता है। लॉन्च के तुरंत बाद एक उपयोगकर्ता ने Ten Past Tomorrow ब्लॉग पर यह भी बताया कि एक ही निर्देश पर मॉडल 12 घंटे से अधिक समय तक अपने आप काम करता रहा। दीर्घकालीन विश्लेषण बेंच Hex में इतिहास में पहली बार 90% से अधिक भी रिपोर्ट किया गया।
कई लाख टोकन तक ध्यान बनाए रखकर, लंबे समय की कोडिंग · जाँच स्वयं चलाता है (Anthropic के अनुसार)।
हाथ से करने पर 2 महीने से अधिक के Ruby माइग्रेशन को एक दिन में पूरा किया, यह वास्तविक उदाहरण।
OpenAI की तालिका में Opus 4.8 (69.2%) और Sol (64.6%) से काफ़ी आगे (Anthropic के सिस्टम कार्ड में भी 80.0%)।
Sol भी दीर्घकालीन व्यावहारिक कार्य के Agents' Last Exam में शीर्ष पर है (53.6), पर यह "व्यापक कार्य-वर्कफ़्लो" मापने वाला बेंच है। एकल विशाल कोडबेस को अंत तक पूरी तरह ठीक करने की "गहरी पूर्णता क्षमता" में Fable 5 का पलड़ा भारी है——यही दोनों का गुणात्मक अंतर है। बड़े पैमाने के माइग्रेशन · दीर्घकालीन जाँच · स्वायत्त कोडिंग एजेंट के मुख्य कार्य के लिए Fable 5 उपयुक्त है।
6. वास्तविक लागत——दोगुनी दर को कैसे देखें
दर Fable 5 के लिए $10/$50, Sol के लिए $5/$30 है। इनपुट में 2 गुना, आउटपुट में 1.67 गुना, यानी Fable 5, Sol से लगभग 2 गुना महंगा है (Sol पर 21 अगस्त 2026 से तीन महीने का प्रचार मूल्य $4/$20 लागू रहने तक लगभग 2.5 गुना)। यहीं चुनाव का मोड़ आता है।
- Sol की लागत बढ़त: दर आधी होने के साथ-साथ, कोडिंग में टोकन दक्षता 54% बेहतर। एक ही काम में खपत होने वाले टोकन भी घटते हैं, इसलिए "मात्रा निपटाने" वाले उपयोगों में कुल लागत Fable 5 से काफ़ी कम रहती है।
- Fable 5 का मूल्य: दर ऊँची है, पर एक बार में सही ढंग से पूरा ठीक करने की सफलता दर (SWE-bench Pro दोनों कंपनियों की तालिकाओं में लगभग 80%) ऊँची है। दोबारा करना · समीक्षा · मानवीय पुनःकार्य की लागत तक शामिल करें तो, कठिन कार्यों में "महंगा पर अंततः सस्ता" हो सकता है। यदि 5 करोड़ लाइन एक दिन में माइग्रेट हो सकती हैं, तो श्रम-लागत के हिसाब से यह बेहद किफ़ायती है।
यानी "टोकन दर" से नहीं बल्कि "प्रति कार्य पूर्णता की लागत" से देखना चाहिए। रोज़मर्रा के बड़ी मात्रा वाले कार्य · टर्मिनल संचालन के लिए Sol (और अधिक लागत-केंद्रित हों तो GPT-5.6 Terra या Luna), जहाँ विफलता महंगी पड़े वैसे बड़े पैमाने · दीर्घकालीन कार्यों के लिए Fable 5——यह बँटवारा लागत-अनुकूलन के नज़रिये से भी तर्कसंगत है।
* दोनों कंपनियों ने समान शर्तों पर आउटपुट टोकन की तुलना प्रकाशित नहीं की है, इसलिए ठोस "वास्तविक लागत गुणक" निश्चित रूप से नहीं कहा जा सकता। अपने प्रतिनिधि कार्य में सफलता दर और आउटपुट टोकन स्वयं मापकर, पुनःकार्य की लागत तक शामिल कर तुलना करने की सिफ़ारिश की जाती है।
7. ताकत · कमज़ोरी मानचित्र
शीर्ष स्तर की पूर्णता क्षमता vs आधी कीमत की समग्र क्षमता
- · SWE-Bench Pro लगभग 80% (दोनों तालिकाएँ) के साथ वास्तविक कोडिंग में शीर्ष स्तर
- · Claude में सबसे लंबी स्वायत्तता · पूर्णता क्षमता
- · बड़े पैमाने के माइग्रेशन का रिकॉर्ड (Stripe 5 करोड़ लाइन/1 दिन)
- · OpenAI की तालिका में भी FrontierMath Tier 4 पर Sol से आगे (87.8% बनाम 83%)
- · 3 क्लासिफायर का नया सुरक्षा डिज़ाइन (केवल खतरनाक क्षेत्र में रोक)
- · दर ऊँची ($10/$50=Sol की लगभग 2 गुना; Sol के प्रचार मूल्य की अवधि में लगभग 2.5 गुना)
- · टर्मिनल संचालन · एजेंट समग्रता की व्यापकता में Sol से पीछे
- · हल्के बड़ी मात्रा वाले कार्यों के लिए ज़रूरत से ज़्यादा सक्षम
- · कच्ची विचार-प्रक्रिया वापस नहीं दी जाती
- · TerminalBench 88.8% · टर्मिनल संचालन में शीर्ष
- · Agents' Last Exam · Coding Agent Index में शीर्ष
- · दर आधी + टोकन दक्षता +54% के साथ कीमत-प्रदर्शन में सर्वश्रेष्ठ
- · Luna/Terra/Sol तीन मॉडलों से उपयोग-अनुकूलन
- · ChatGPT Work / Codex / GPT-Live एकीकरण
- · SWE-bench Pro में 15pt से अधिक बड़े अंतर से हार
- · AIME · MMLU आदि मूल्यांकन तालिका में नहीं
- · एकल विशाल कोड की "गहरी पूर्णता क्षमता" में Fable से पीछे
- · दीर्घकालीन स्वायत्तता के रिकॉर्ड प्रस्तुत करने में Fable आगे
8. उपयोग के अनुसार चुनाव
| उपयोग | अनुशंसित मॉडल | कारण |
|---|---|---|
| बड़े पैमाने का कोड माइग्रेशन · लेगेसी नवीनीकरण | Fable 5 | दीर्घकालीन स्वायत्तता + Stripe 5 करोड़ लाइन/1 दिन की पूर्णता क्षमता |
| वास्तविक रिपॉज़िटरी के कठिन बग सुधार · बड़े PR | Fable 5 | SWE-Bench Pro लगभग 80% (दोनों तालिकाएँ) के साथ सफलता दर ऊँची |
| दीर्घकालीन स्वायत्त जाँच · विश्लेषण एजेंट | Fable 5 | कई लाख टोकन पर ध्यान · पूर्णता क्षमता के लिए अनुकूलित |
| विफलता की पुनःकार्य लागत बड़ी हो ऐसे अहम कार्य | Fable 5 | एक बार में सही ढंग से पूरा ठीक करने की निश्चितता ऊँची |
| CLI · टर्मिनल को स्वायत्त संचालित करने वाला एजेंट | Sol | TerminalBench 2.1 88.8% के साथ शीर्ष |
| व्यापक कार्य-वर्कफ़्लो स्वचालन | Sol | Agents' Last Exam 53.6 के साथ शीर्ष |
| लागत-केंद्रित बड़ी मात्रा वाले कार्य | Sol | आधी कीमत + टोकन दक्षता +54%। हल्के काम के लिए Terra/Luna भी |
| ChatGPT/Codex/वॉइस सहित एकीकृत संचालन | Sol | ChatGPT Work · GPT-Live · Codex के साथ एकीकृत |
सारांश
- Claude Fable 5: वास्तविक कोड सुधार (SWE-Bench Pro लगभग 80%) और दीर्घकालीन स्वायत्तता में शीर्ष स्तर। बड़े पैमाने के माइग्रेशन · कठिन कार्यों की "पूर्णता क्षमता" इसका असली दम है। लेकिन दर Sol की लगभग 2 गुना है।
- GPT-5.6 Sol: टर्मिनल संचालन (TerminalBench 88.8%) · एजेंट समग्र क्षमता में शीर्ष, आधी कीमत + टोकन दक्षता +54% के साथ कीमत-प्रदर्शन में सर्वश्रेष्ठ। तीन मॉडलों से उपयोग-अनुकूलन आसान।
- SWE-bench Pro का अंतर Opus 4.8 वाली लड़ाई से बढ़ा है (OpenAI की तालिका में 80.0 vs 64.6 · 15pt से अधिक)। पर ध्यान दें कि OpenAI ने एक विश्लेषण भी प्रकाशित किया है जिसके अनुसार SWE-bench Pro के लगभग 30% कार्य त्रुटिपूर्ण हैं।
- लागत को "टोकन दर" से नहीं बल्कि "प्रति कार्य पूर्णता" से देखें। बड़ी मात्रा · टर्मिनल के लिए Sol, जहाँ विफलता महंगी पड़े वैसे बड़े पैमाने · दीर्घकालीन के लिए Fable 5।
- व्यावहारिक हल दोहरा संचालन है। रोज़मर्रा के लिए Sol (या Terra), निर्णायक बड़े कार्यों के लिए Fable 5, इस तरह बाँटना सर्वोत्तम।
FAQ
Q1. GPT-5.6 Sol और Claude Fable 5, कोडिंग में कौन मज़बूत है?
सूचक पर निर्भर करता है। वास्तविक रिपॉज़िटरी के बग सुधार मापने वाले SWE-Bench Pro में Fable 5, 80.0% के साथ Sol के 64.6% से 15pt से अधिक आगे है। दूसरी ओर, टर्मिनल स्वायत्त संचालन के TerminalBench 2.1 में Sol, 88.8% के साथ Fable 5 के 83.1% से आगे है (दोनों मान OpenAI की मूल्यांकन तालिका के हैं; Anthropic के सिस्टम कार्ड में भी Fable 5 का SWE-Bench Pro 80.0% है)। "वास्तविक कोड को पूरी तरह ठीक करना हो तो Fable, टर्मिनल संचालन · एजेंट की व्यापकता हो तो Sol" यह व्यावहारिक बँटवारा है।
Q2. 2 गुना कीमत अंतर चुकाना उचित है?
कार्य पर निर्भर। रोज़मर्रा की बड़ी मात्रा · टर्मिनल संचालन के लिए आधी कीमत का Sol (और हल्के काम के लिए Terra/Luna) पर्याप्त है। लेकिन बड़े पैमाने के माइग्रेशन या कठिन बग सुधार जैसे "जहाँ विफलता की पुनःकार्य लागत महंगी पड़े" वैसे कार्यों में, ऊँची सफलता दर वाला Fable 5 अंततः सस्ता पड़ता है। टोकन दर से नहीं बल्कि "प्रति कार्य पूर्णता की लागत" से निर्णय लें।
Q3. क्या Sol का SWE-bench Pro "64.6%" आधिकारिक मान है?
हाँ, यह वह मान है जो OpenAI ने GPT-5.6 के साथ प्रकाशित मूल्यांकन तालिका में दिया। साथ ही OpenAI ने एक विश्लेषण भी प्रकाशित किया जिसके अनुसार SWE-bench Pro के लगभग 30% कार्य त्रुटिपूर्ण हैं, यानी इस बेंचमार्क पर ही सवाल उठाया। लॉन्च के तुरंत बाद Vellum ने जिन GPQA Diamond और FrontierMath को अप्रकाशित बताया था, वे 22 सितंबर 2026 को देखी गई मूल्यांकन तालिका में मौजूद हैं (GPQA: Sol 94.6%, Fable 5 92.6%)। तालिका में SWE-bench Verified · AIME · MMLU नहीं हैं।
Q4. दीर्घकालीन स्वायत्त कार्यों के लिए कौन उपयुक्त है?
Fable 5। यह कई लाख टोकन तक ध्यान बनाए रखता है और Anthropic के अनुसार पिछले किसी भी Claude मॉडल से अधिक समय तक स्वायत्त रूप से काम कर सकता है, और Stripe ने 5 करोड़ लाइन का Ruby माइग्रेशन एक दिन में पूरा किया, ऐसा रिकॉर्ड है। एकल विशाल कोडबेस को अंत तक पूरी तरह ठीक करने की "पूर्णता क्षमता" Fable 5 का असली दम है।
Q5. Fable 5 और Mythos 5 में क्या अंतर है?
अंदर से (क्षमता) समान है, केवल सुरक्षा तंत्र अलग है। सामान्य रूप से उपलब्ध होने वाला Fable 5 है, और Fable 5 में जोखिम पहचानने पर ही Opus 4.8 पर फ़ॉलबैक करने वाला 3-क्लासिफायर सुरक्षा डिज़ाइन है (सक्रियता सत्र के 5% से कम में, 95% से अधिक स्वयं चलता है)।
Q6. GPT-5.6 का "Terra" इस तुलना में कैसे जुड़ता है?
GPT-5.6, Luna/Terra/Sol तीन मॉडल हैं। इस लेख में लेखन के समय के फ्लैगशिप बनाम फ्लैगशिप के रूप में Sol को लिया गया, पर लागत-केंद्रित हों तो Terra ($2/$12) GPT-5.5 के बराबर को Sol की 40% यूनिट कीमत में देता है (30 जुलाई 2026 की कीमत कटौती के बाद)। "Fable 5 से कठिन कार्य, Terra से बड़ी मात्रा" ऐसा संयोजन भी व्यवहार में सशक्त है। विवरण के लिए GPT-5.6 रिलीज़ पूर्ण व्याख्या देखें।
Q7. Opus 4.8 और Fable 5, Sol से तुलना करें तो कौन?
उपयोग और बजट से चुनें। Opus 4.8 ($5/$25) Sol के समान मूल्य श्रेणी में है, और SWE-bench Pro 69.2% के साथ किफ़ायती कोडिंग देता है। Fable 5 ($10/$50) उस समय शीर्ष स्तर पर था और 80.0% के साथ पूर्णता क्षमता में बेजोड़ है पर महंगा। रोज़मर्रा के लिए Opus 4.8/Sol, निर्णायक मौकों के लिए Fable 5, यह तीन-स्तरीय उपयोग व्यावहारिक है। Sol vs Opus 4.8 तुलना भी देखें।
संबंधित लेख
- GPT-5.6 Sol vs Claude Opus 4.8 विस्तृत तुलना — समान मूल्य श्रेणी की सीधी टक्कर
- Claude Fable 5 रिलीज़ विस्तृत व्याख्या — लॉन्च के समय के शीर्ष मॉडल का विवरण
- GPT-5.6 रिलीज़ पूर्ण व्याख्या — Luna/Terra/Sol तीन मॉडल
- Claude Opus 4.8 रिलीज़ पूर्ण व्याख्या — किफ़ायती श्रेणी का व्यावहारिक मॉडल
- AI डेवलपमेंट प्रयास कितना घटाता है? एजेंटिक डेटा — एजेंटिक युग का डेटा कि AI विकास प्रयास कितना घटाता है