coding के लिए Claude Fable 5: benchmark, Opus 4.8 के मुकाबले कब इस्तेमाल करें, और लागत की हकीकत
9 जून 2026 को Anthropic के पहले सार्वजनिक "Mythos-class" model के रूप में जारी Claude Fable 5 की यहां सिर्फ़ coding के लिए पड़ताल की गई है (पूरी रिलीज़ अलग से कवर है)। संक्षेप में: coding जितनी कठिन, Fable 5 उतना आगे निकलता है। यह SWE-bench Verified पर 95.0% और कठिन SWE-bench Pro पर 80.3% देता है (Opus 4.8 69.2% और GPT-5.5 58.6% के मुकाबले), तथा कठिनतम FrontierCode Diamond पर 29.3% (Opus 13.4% और GPT-5.5 5.7% के मुकाबले, GPT से ~5 गुना), जबकि Terminal-Bench 2.1 पर 84.3% की कांटे की टक्कर है। लेख में तीन-बिंदु डेवलपर सारांश, side-by-side benchmark टेबल और उसे पढ़ने का तरीका, effort-scaling गुण (low 11.5% से max 30.9%, जबकि GPT-5.5 5-6% पर ठहर जाता है), यह असल में किसमें अच्छा है (बड़े multi-file refactor, लंबे autonomous agent run, screenshot से front-end, API डिज़ाइन + tests + docs; Simon Willison ने output को "कई दिनों जितना" आंका पर 5.5 घंटे में $110 से अधिक के साथ इसे धीमा और महंगा कहा), कमज़ोरियां ($10/$50, 500k-1M token session, कब रुकना है गलत आंकता है, review सटीकता में पीछे, Terminal-Bench के लगभग 20% trials में Opus 4.8 पर fallback), routing मार्गदर्शन (डिफ़ॉल्ट Opus 4.8, कठिन 10-20% Fable 5 को, terminal काम GPT-5.5 को), और कहां इस्तेमाल करें (Claude Code, GitHub Copilot, AWS Bedrock, Azure Foundry, Databricks, Anthropic API) कीमत, 1M-token context, 128k max output और June 9-22 मुफ़्त अवधि के साथ शामिल हैं। भारी एकमुश्त काम के लिए Fable 5, रोज़मर्रा के अधिकांश के लिए Opus 4.8। आंकड़े दिशासूचक और scaffold-निर्भर हैं।