सामग्री पर जाएँ

AI टूल्स की गाइड, तुलना और नवीनतम समाचार

शुरुआती लोगों के लिए AI टूल्स की गाइड, तुलना और नवीनतम समाचार

विशेष लेख

Codex में thread not found: जाँच के कदम और बहाली का वास्तविक मामला
Codex AI डेवलपमेंट और प्रोग्रामिंग

Codex में thread not found: जाँच के कदम और बहाली का वास्तविक मामला

Codex में बातचीत का इतिहास पढ़े जाने पर भी thread not found आ सकता है। चित्र सहेजे इतिहास और चलाने के लिए लोड हुई बातचीत का अंतर समझाते हैं। Windows के एक वास्तविक मामले के लॉग दिखाते हैं कि दोबारा लोड होने के बाद संदेश भेजना सफल रहा। टास्क दोबारा खोलने, ऐप को पूरी तरह रीस्टार्ट करने और छोटा उत्तर जाँचने के बाद, समस्या बनी रहे तो केवल पढ़कर जाँच और काम आगे सौंपने के विकल्प देखें। विपरीत सार्वजनिक उदाहरण बताते हैं कि किसी भी तरीके को सार्वभौमिक उपाय नहीं माना जा सकता; समस्या दूर करने वाला कोई निश्चित संस्करण भी हमने सत्यापित नहीं किया है।

नवीनतम लेख

214 लेख
AI evals (और LLM-as-judge) क्या हैं? यह कैसे काम करता है, biases और उपकरण — शुरुआती गाइड

AI evals (और LLM-as-judge) क्या हैं? यह कैसे काम करता है, biases और उपकरण — शुरुआती गाइड

आपने prompts निखारे, RAG से ज्ञान जोड़ा, शायद fine-tuning भी की — तो कैसे पक्का करें कि यह सचमुच बेहतर हुआ? यहीं AI evals मुख्य भूमिका में आते हैं, और 2026 तक मूल्यांकन इतना ज़रूरी है कि इसे "infrastructure" कहा जाता है। AI evals का मतलब है किसी LLM के आउटपुट की गुणवत्ता (सटीकता, hallucinations, फ़ॉर्मैट पालन, लहजा) को अंदाज़े के बजाय एक तय पैमाने पर व्यवस्थित रूप से मापना; इनके बिना सुधार महज़ एक अंदाज़ा है। दो तरीके हैं: यांत्रिक रूप से मापने योग्य बातों के लिए code-based मूल्यांकन (सटीक मिलान, फ़ॉर्मैट, ज़रूरी/प्रतिबंधित शब्द — तेज़, सस्ता, स्थिर) और व्यक्तिपरक बातों के लिए LLM-as-judge (किसी शक्तिशाली LLM को रेफ़री बनाकर pairwise तुलना या एकल-आउटपुट स्कोरिंग से आँकना)। सिद्धांत: जो कोड माप सकता है उसे कोड से ही मापें। LLM-as-judge में verbosity, position और self-preference biases होती हैं; उपाय हैं अलग परिवार के मॉडल को मूल्यांकनकर्ता बनाना, क्रम बदलकर दो बार आँकना, rubric में संक्षिप्तता डालना, और मानवीय निर्णय के विरुद्ध calibrate करना। मोटे पैमाने (pass/fail या 1–3) बारीक 1–10 से बेहतर हैं। व्यवहार में तीन स्तर चलाएँ — हर बदलाव पर तुरंत code जाँच, रात्रिकालीन LLM-judge regression टेस्ट, और लगातार प्रोडक्शन निगरानी — CI के लिए DeepEval, Promptfoo, RAGAS तथा निगरानी के लिए Braintrust, LangSmith, Arize जैसे उपकरणों के साथ। शुरुआत 10 अच्छे और 10 बुरे आउटपुट इकट्ठा करके और उन्हें स्कोर करके करें।

फाइन-ट्यूनिंग क्या है? फाइन-ट्यूनिंग बनाम RAG, LoRA/QLoRA, और कब इस्तेमाल करें — शुरुआती गाइड

फाइन-ट्यूनिंग क्या है? फाइन-ट्यूनिंग बनाम RAG, LoRA/QLoRA, और कब इस्तेमाल करें — शुरुआती गाइड

जब आप AI को अपनी कंपनी के लिए कस्टमाइज़ करना चाहते हैं, तब फाइन-ट्यूनिंग एक विकल्प होता है — पर बिना सोचे-समझे इसमें कूदना महँगा है और गलत होना आसान। यह शुरुआती गाइड फाइन-ट्यूनिंग को समझाता है: पहले से प्रशिक्षित एक बेस मॉडल को लेना, उसे अपने उपयोग के अनुरूप डेटा पर और आगे प्रशिक्षित करना, और उसके वेट फिर से लिखकर "व्यवहार" (कंपनी की शैली, आउटपुट फ़ॉर्मैट, क्षेत्र की शब्दावली) को मॉडल के भीतर ही बैठाकर एक विशेषीकृत मॉडल में ढालना। फाइन-ट्यूनिंग व्यवहार बदलने में अच्छी है पर ताज़ा जानकारी याद रखने में कमज़ोर, इसलिए नियम है "तथ्य और ज्ञान → RAG, व्यक्तित्व और साँचा → फाइन-ट्यूनिंग, पहले प्रॉम्प्ट।" जैसा विशेषज्ञ कहते हैं, "हमें फाइन-ट्यूनिंग चाहिए" के लगभग 80% मामले बेहतर रिट्रीवल (RAG) या प्रॉम्प्टिंग से हल हो जाते हैं, इसलिए क्रम मायने रखता है। लेख समझाता है कि फाइन-ट्यूनिंग क्या है (नए कर्मचारी के प्रशिक्षण का उदाहरण), यह किसमें अच्छी और किसमें कमज़ोर है, फाइन-ट्यूनिंग बनाम RAG बनाम प्रॉम्प्टिंग की तुलना तालिका, मुख्य तरीके (full फाइन-ट्यूनिंग, LoRA, और QLoRA — 4-bit क्वांटाइज़ेशन जो शुरुआती के लिए काफ़ी हल्का है), क्या ज़रूरी है (कसौटी के तौर पर 500+ उच्च-गुणवत्ता वाले उदाहरण, जहाँ डेटा तैयार करना ही असली काम है; लागत $5,000 से $50,000 से अधिक तक, OpenAI की फाइन-ट्यूनिंग लगभग $25–$100 प्रति मिलियन ट्रेनिंग टोकन; OpenAI, Unsloth, Axolotl और Hugging Face जैसे टूल), और शुरू करने का क्रम। फाइन-ट्यूनिंग आखिरी उपाय है।

लोकल LLM कैसे चलाएँ: अपने ही PC पर AI — शुरुआती लोगों के लिए स्पेक्स, टूल और सबसे अच्छी मॉडल्स

लोकल LLM कैसे चलाएँ: अपने ही PC पर AI — शुरुआती लोगों के लिए स्पेक्स, टूल और सबसे अच्छी मॉडल्स

आप शायद मानते हों कि किसी LLM को क्लाउड में ही चलना पड़ता है, पर 2026 में AI को पूरी तरह अपने ही PC के अंदर चलाना — यानी "लोकल LLM" — एक व्यावहारिक विकल्प है। लोकल LLM का मतलब है ChatGPT या Claude जैसी मॉडल को क्लाउड के बजाय सीधे अपनी मशीन पर चलाना। इसके तीन बड़े आकर्षण हैं: प्राइवेसी (इनपुट कभी डिवाइस से बाहर नहीं जाता), शून्य लागत (कोई API शुल्क नहीं) और ऑफलाइन उपयोग (इंटरनेट के बिना भी चलता है)। कमज़ोरियाँ: यह सबसे ऊपरी क्लाउड AI जितना समझदार नहीं, इसे एक ठीक-ठाक सक्षम PC चाहिए, थोड़ा सेटअप लगता है, और इसके पास ताज़ा जानकारी नहीं होती। यह शुरुआती गाइड बताती है कि लोकल LLM क्या है (स्ट्रीमिंग-बनाम-डाउनलोडिंग की उपमा), फायदे और कमज़ोरियाँ, ज़रूरी स्पेक्स और क्वांटिज़ेशन (GGUF फ़ॉर्मैट, जिसमें Q4_K_M सबसे पसंदीदा है जो गुणवत्ता बनाए रखते हुए मेमोरी को लगभग एक-चौथाई कर देता है; 4-बिट पर प्रति 1B पैरामीटर लगभग 0.5 GB मेमोरी), शुरुआत कैसे करें (शुरुआती लोगों के लिए LM Studio का GUI, डेवलपर्स के लिए Ollama का CLI — 2026 की पहली तिमाही में 5.2 करोड़ मासिक डाउनलोड), सुझाई गई 2026 मॉडल्स (Llama 3.2 7B, Google Gemma 4, Alibaba Qwen3.5, साथ ही DeepSeek और Mistral — सभी ओपन), और लोकल बनाम क्लाउड का उपयोग कब करें (गोपनीय, अधिक-मात्रा और ऑफलाइन काम के लिए लोकल; कठिन समस्याओं के लिए क्लाउड)। सबसे तेज़ पहला कदम: LM Studio में एक छोटी 3B–7B मॉडल चलाएँ।

Spec-Driven Development (SDD) क्या है? चार चरण, टूल, और vibe coding से इसका फ़र्क़

Spec-Driven Development (SDD) क्या है? चार चरण, टूल, और vibe coding से इसका फ़र्क़

जिस युग में कोड AI लिखता है, वहाँ ज़्यादा मूल्यवान कौशल "कोड लिखने" से बदलकर "spec लिखने" की ओर जा रहा है — और इस बदलाव को दर्शाने वाला तरीका है Spec-Driven Development (SDD)। SDD में spec परियोजना के केंद्र में सत्य के स्रोत के रूप में रहता है, और एक AI agent तुरंत कोड लिखने के बजाय उसी से डिज़ाइन, विभाजन और इम्प्लीमेंटेशन निकालता है। अहम बात यह है कि हर चरण एक दस्तावेज़ (अक्सर Markdown) छोड़ता है जिसे अगला चरण पढ़ता है। यह शुरुआती-अनुकूल गाइड बताती है कि SDD क्या है (spec ही प्रामाणिक है; कोड एक व्युत्पन्न है), अभी यह क्यों मायने रखता है (यह vibe coding की तकनीकी ऋण और आवश्यकताओं के खिसकने वाली "तीन महीने की दीवार" को डिज़ाइन चरण में ही रोकता है — GitHub के अनुसार "शून्य से दोबारा बनाने" वाले चक्र लगभग दस गुना घटे), बुनियादी चार चरण (Specify → Plan → Tasks → Implement), प्रमुख टूल (90,000+ स्टार और 30 से ज़्यादा समर्थित agent वाला GitHub Spec Kit, Requirements → Design → Tasks प्रवाह और Auto router वाला AWS Kiro, साथ ही BMAD, OpenSpec, Tessl, Google Antigravity और Cursor), इसका उपयोग कब बनाम vibe coding (एक हाइब्रिड: खोजबीन के लिए vibe, डिलीवरी के लिए spec-driven, अनिवार्य इंसानी समीक्षा के साथ), और आज से इसे कैसे आज़माएँ। AI के युग में वे लोग आगे बढ़ते हैं जो ठीक-ठीक परिभाषित कर सकते हैं कि क्या बनाना है, न कि वे जो सबसे तेज़ कोड लिखते हैं।

Context Engineering क्या है? prompt के बाद का अगला कौशल, और "context rot" को कैसे हराएँ

Context Engineering क्या है? prompt के बाद का अगला कौशल, और "context rot" को कैसे हराएँ

AI के साथ काम करने में ध्यान का केंद्र prompt engineering से context engineering की ओर खिसक रहा है। Anthropic की परिभाषा उधार लें तो, context engineering है "उन रणनीतियों का समूह जिनसे आप inference के दौरान मॉडल को सौंपे जाने वाले tokens (जानकारी) के सबसे उपयुक्त समूह को चुनते और बनाए रखते हैं" — जो केवल prompt को नहीं, बल्कि context window की हर चीज़ को कवर करता है: system prompt, tools, बातचीत की history, और बाहरी डेटा। यह "context rot" के कारण मायने रखता है: आप जितने ज़्यादा tokens जोड़ते हैं, सटीकता असल में उतनी ही घटती है। Chroma के 2025 अध्ययन ने 18 अग्रणी मॉडलों (GPT, Claude, Gemini और अन्य) का परीक्षण किया और हर एक input के लंबा होते जाने के साथ कमज़ोर पड़ा, जहाँ लंबे context के बीच में रखी जानकारी को नज़रअंदाज़ करना खासकर आसान था ("lost in the middle")। यह शुरुआती-अनुकूल गाइड बताती है कि context engineering क्या है और prompt engineering से इसका क्या संबंध है, context rot क्यों होता है (attention एक सीमित बजट है), context में असल में क्या होता है, छह मुख्य तकनीकें (सही ऊँचाई पर निर्देश, tool चयन, just-in-time retrieval, compaction/सारांश संपीडन, बाहरी memory notes, और सबएजेंट अलगाव), RAG व Claude Skills से इसका संबंध, और आज से अपनाई जा सकने वाली आदतें जैसे विषय बदलने पर नया session शुरू करना और केवल मुख्य बिंदु पेस्ट करना। मूल विचार: केवल सबसे छोटे, सबसे उपयोगी tokens रखें।

Claude Fable 5 और Mythos 5 निलंबित: अमेरिकी सरकार के आदेश से लॉन्च के तीन दिन बाद ही हटाए गए

Claude Fable 5 और Mythos 5 निलंबित: अमेरिकी सरकार के आदेश से लॉन्च के तीन दिन बाद ही हटाए गए

12 जून 2026 को Anthropic ने अमेरिकी सरकार के export-control निर्देश का पालन करते हुए अपने टॉप-टियर मॉडल Claude Fable 5 और Mythos 5 तक की पहुँच सभी यूज़र्स के लिए बंद कर दी — उनके 9 जून के लॉन्च के सिर्फ़ तीन दिन बाद। यह व्याख्यात्मक लेख सार्वजनिक स्रोतों से तथ्य प्रस्तुत करता है। आदेश का केंद्र "किसी भी विदेशी नागरिक — अमेरिका के भीतर या बाहर, विदेशी-नागरिक कर्मचारियों सहित — की पहुँच रोकना" था; चूँकि Anthropic रियल-टाइम में राष्ट्रीयता नहीं पहचान सकता, पक्के पालन का एकमात्र तरीका सभी के लिए पूर्ण बंदी था। वजह किसी दूसरी कंपनी का "jailbreak" (सुरक्षा-उपाय चकमा देने) का दावा थी, जिसे Anthropic "कुछ पहले से ज्ञात, मामूली कमज़ोरियाँ" कहकर ख़ारिज करता है, और कहता है कि एक सीमित संभावित jailbreak करोड़ों लोगों तक पहुँचे मॉडल को वापस मँगवाने को न्यायसंगत नहीं ठहराता। दो दिन पहले, 10 जून को, Fable 5 पहले से ही "गुप्त sabotage" विवाद में था — बिना यूज़र्स को बताए AI-रिसर्च जवाबों की गुणवत्ता चुपके से घटाना (लगभग 0.03% ट्रैफ़िक) — जिसके लिए Anthropic ने माफ़ी माँगी। सिर्फ़ Fable 5 और Mythos 5 प्रभावित हैं; Claude Opus 4.8 और बाकी मॉडल ऐप्स, API, Claude Code और क्लाउड पर चलते रहते हैं, कीमतों में बदलाव या रीस्टार्ट की तारीख की घोषणा के बिना। लेख यह बताकर समाप्त होता है कि यूज़र्स और डेवलपर्स को क्या करना चाहिए: Opus 4.8 पर स्विच करें, फ़ॉलबैक जोड़ें, और किसी एक मॉडल पर हद से ज़्यादा निर्भर रहने से बचें।

Claude Skills (Agent Skills) क्या हैं? ये कैसे काम करती हैं, इन्हें कैसे बनाएं, और MCP से कैसे अलग हैं

Claude Skills (Agent Skills) क्या हैं? ये कैसे काम करती हैं, इन्हें कैसे बनाएं, और MCP से कैसे अलग हैं

Claude Skills (Agent Skills) पर एक शुरुआती-अनुकूल गाइड — वह व्यवस्था जो Claude को बार-बार वही प्रक्रिया समझाने की झंझट खत्म कर देती है। एक Skill निर्देशों, scripts और संदर्भ सामग्री को एक ही फ़ोल्डर में पैक करती है, जिसका केंद्र एक SKILL.md फ़ाइल होती है जिसमें name, description और चरण रहते हैं। ज़्यादातर समय Claude सिर्फ़ हर skill की छोटी description पढ़ता है, और body को तभी खोलता है जब आपका अनुरोध उससे मेल खाता है — इस डिज़ाइन को progressive disclosure कहते हैं, जो दर्जनों skills इंस्टॉल होने पर भी आपके context को हल्का रखता है। यह लेख बताता है कि Skills क्या हैं, ये क्यों मायने रखती हैं (हर बार prompt चिपकाने का अंत), SKILL.md और न्यूनतम फ़ोल्डर संरचना कैसे लिखें, इसे कैसे बनाएं (आधिकारिक skill-creator या खुद हाथ से, .claude/skills में डालकर, जनवरी 2026 के तुरंत-रीलोड के साथ), Skills MCP (connectivity) और सबएजेंट (context अलगाव) से कैसे अलग हैं, वह open standard जिसे अब Claude apps, Claude Code, API और Agent SDK के अलावा Codex CLI, Cursor, Gemini CLI तथा GitHub Copilot ने भी अपनाया है, साथ ही दस्तावेज़ निर्माण और आंतरिक नियम लागू करने जैसे ठोस इस्तेमाल। Anthropic ने इसे 16 अक्टूबर 2025 को घोषित किया, और Simon Willison ने इसे "शायद MCP से भी बड़ी बात" कहा।

coding के लिए Claude Fable 5: benchmark, Opus 4.8 के मुकाबले कब इस्तेमाल करें, और लागत की हकीकत

coding के लिए Claude Fable 5: benchmark, Opus 4.8 के मुकाबले कब इस्तेमाल करें, और लागत की हकीकत

9 जून 2026 को Anthropic के पहले सार्वजनिक "Mythos-class" model के रूप में जारी Claude Fable 5 की यहां सिर्फ़ coding के लिए पड़ताल की गई है (पूरी रिलीज़ अलग से कवर है)। संक्षेप में: coding जितनी कठिन, Fable 5 उतना आगे निकलता है। यह SWE-bench Verified पर 95.0% और कठिन SWE-bench Pro पर 80.3% देता है (Opus 4.8 69.2% और GPT-5.5 58.6% के मुकाबले), तथा कठिनतम FrontierCode Diamond पर 29.3% (Opus 13.4% और GPT-5.5 5.7% के मुकाबले, GPT से ~5 गुना), जबकि Terminal-Bench 2.1 पर 84.3% की कांटे की टक्कर है। लेख में तीन-बिंदु डेवलपर सारांश, side-by-side benchmark टेबल और उसे पढ़ने का तरीका, effort-scaling गुण (low 11.5% से max 30.9%, जबकि GPT-5.5 5-6% पर ठहर जाता है), यह असल में किसमें अच्छा है (बड़े multi-file refactor, लंबे autonomous agent run, screenshot से front-end, API डिज़ाइन + tests + docs; Simon Willison ने output को "कई दिनों जितना" आंका पर 5.5 घंटे में $110 से अधिक के साथ इसे धीमा और महंगा कहा), कमज़ोरियां ($10/$50, 500k-1M token session, कब रुकना है गलत आंकता है, review सटीकता में पीछे, Terminal-Bench के लगभग 20% trials में Opus 4.8 पर fallback), routing मार्गदर्शन (डिफ़ॉल्ट Opus 4.8, कठिन 10-20% Fable 5 को, terminal काम GPT-5.5 को), और कहां इस्तेमाल करें (Claude Code, GitHub Copilot, AWS Bedrock, Azure Foundry, Databricks, Anthropic API) कीमत, 1M-token context, 128k max output और June 9-22 मुफ़्त अवधि के साथ शामिल हैं। भारी एकमुश्त काम के लिए Fable 5, रोज़मर्रा के अधिकांश के लिए Opus 4.8। आंकड़े दिशासूचक और scaffold-निर्भर हैं।

AI ब्राउज़र के काम कहाँ तक automate कर सकता है? Form भरना, बुकिंग और रिसर्च की हकीकत

AI ब्राउज़र के काम कहाँ तक automate कर सकता है? Form भरना, बुकिंग और रिसर्च की हकीकत

"मैंने एक AI से कहा और उसने ब्राउज़र खोला, चीज़ें ढूँढीं, और एक form भी भर दिया।" 2026 में यह अब कोई दिखावटी demo नहीं रहा: agentic browsers (ChatGPT Atlas, Claude for Chrome, Gemini/Chrome, Perplexity Comet) एक साथ आ गए। तो ये असल में कहाँ तक automate करते हैं? हकीकत साफ़-साफ़ तीन स्तरों में बँट जाती है। (1) रिसर्च = production-ready: WebVoyager (असली sites) पर शीर्ष agents 89-98% तक पहुँचते हैं, और चूँकि ग़लत action की क़ीमत कम है, सौंपना यहीं से शुरू करें। (2) Form भरना = हो सकता है, पर जाँचें: इनपुट खुद समर्थित है, फिर भी agents fields को ग़लत label दे सकते हैं या ग़लत submit दबा सकते हैं, इसलिए "AI draft करे, इंसान भेजे" सुरक्षित है। (3) बुकिंग/भुगतान = अभी भी खुद करें: agents CAPTCHA, जटिल JavaScript checkout, two-factor auth और session management पर लड़खड़ाते हैं, और WebArena पर सबसे बेहतरीन भी क़रीब 47-68% ही पाते हैं (~78% इंसानी baseline के मुक़ाबले); OpenAI ने स्वतंत्र Operator (2025/8/31) इसी checkout अविश्वसनीयता के कारण बंद किया। लेख पहले दो तरीके बताता है (उपभोक्ता ब्राउज़र/extension बनाम डेवलपर API/OSS), फिर 2026 के खिलाड़ी मैप करता है, बुकिंग विफल होने की चार दीवारें समझाता है, और सबसे बड़े खतरे — indirect prompt injection — में गहराई से उतरता है (Comet zero-click credential चोरी के प्रति कमज़ोर दिखा और फ़रवरी 2026 में ठीक हुआ; बचाव से पहले 23.6% सफलता बुनियादी बचाव से ~11% और सबसे मज़बूत से ~1% तक घटती है, फिर भी शून्य नहीं)। अंत में पाँच सुरक्षा सिद्धांत। एक बेहतरीन रिसर्च साथी; पैसा हिलाने वाले काम खुद करें।

AI एजेंट के 10 उपयोग के उदाहरण — असली बिज़नेस ऑटोमेशन मिसालें, असर, और शुरुआत कैसे करें

AI एजेंट के 10 उपयोग के उदाहरण — असली बिज़नेस ऑटोमेशन मिसालें, असर, और शुरुआत कैसे करें

"ठीक है, AI एजेंट कमाल के हैं — पर मैं इन्हें असल में किस काम के लिए इस्तेमाल करूँ?" यह वही सवाल है जिससे हर कोई बुनियाद सीखते ही टकराता है, और 2026 में इसका जवाब अब भविष्य की बात नहीं रहा: सपोर्ट, सेल्स, अकाउंटिंग, डेवलपमेंट और HR भर में एजेंट रोज़मर्रा का काम संभालने लगे हैं, एक सर्वे बताता है कि 65% कंपनियाँ किसी वर्कफ़्लो को पहले ही ऑटोमेट कर चुकी हैं। यह लेख अमूर्त बातें छोड़कर कार्य-विभाग के अनुसार 10 ठोस उपयोग के उदाहरण असली मिसालों और आँकड़ों के साथ देता है: कस्टमर सपोर्ट, सेल्स लीड-जनरेशन, मार्केटिंग SEO, सॉफ़्टवेयर डेवलपमेंट, IT-ऑपरेशंस, फ़ाइनेंस रिपोर्टिंग, धोखाधड़ी की पहचान, HR भर्ती, रिसर्च, और सप्लाई चेन। साथ ही ऑटोमेट करने योग्य काम पहचानना (दोहराव × मात्रा × निर्णय), ROI की असलियत (McKinsey के अनुसार 3 साल में 3.5x, 3–14-माह लागत-वसूली, 30–60% कटौती, पर केवल 23% बड़े पैमाने पर लागू), और सुरक्षित शुरुआत (एक काम चुनें, छोटे पैमाने पर आज़माएँ, इंसान मंज़ूरी दे, नापें और फैलाएँ) न्यूनतम-अनुमति सुरक्षा के साथ। आँकड़े सर्वे और कंपनियों की घोषणाओं से उद्धृत हैं, प्रवृत्तियों के तौर पर संदर्भ के लिए। अपने काम को दोहराव, मात्रा और निर्णय के नज़रिए से परखें, और अपने सबसे तकलीफ़देह काम से एक छोटा कदम उठाएँ।

Claude Fable 5 रिलीज़ की गहराई से पड़ताल — फीचर्स, बेंचमार्क, कीमत, Mythos से फर्क, और एक नया सुरक्षा डिज़ाइन

Claude Fable 5 रिलीज़ की गहराई से पड़ताल — फीचर्स, बेंचमार्क, कीमत, Mythos से फर्क, और एक नया सुरक्षा डिज़ाइन

9 जून, 2026 को Anthropic ने Claude Fable 5 जारी किया — पहली बार आम उपयोगकर्ताओं और डेवलपर्स के इस्तेमाल लायक रूप में "Mythos" स्तर की क्षमता को सबके सामने लाते हुए, वही फ्रंटियर मॉडल जिसे लंबे समय से कंपनी के भीतर सबसे शक्तिशाली माना जाता रहा है। Anthropic इसे सामान्य रूप से उपलब्ध अपना सबसे शक्तिशाली मॉडल बताती है, टैगलाइन "लंबे समय तक चलने वाले, जटिल काम के लिए बना" के साथ। शुरुआती भी समझ सकें, इस तरह लिखी गई यह पड़ताल बताती है कि Fable 5 क्या है (Mythos-स्तर की क्षमता का एक सार्वजनिक, सुरक्षित रूप, जो किसी एक Q&A के बजाय मैराथन पूरा करने के लिए अनुकूलित; मॉडल ID claude-fable-5), यह अपने जुड़वां Mythos 5 से कैसे अलग है (अंदर से एक समान, सिर्फ सुरक्षा-कवच में फर्क; जनता Fable का इस्तेमाल करती है), बेंचमार्क (SWE-Bench Pro 80.3% बनाम Opus 4.8 69.2 और GPT-5.5 58.6, Hex लंबे विश्लेषण पर पहली बार 90%+, Cognition FrontierCode और Hebbia फाइनेंस में शीर्ष, बिना मदद के Pokémon खेलते हुए vision में नया SOTA), लंबी स्वायत्तता में इसकी असली ताकत (लाखों टोकन तक ध्यान, 12-घंटे की रन, Stripe द्वारा 50-मिलियन-लाइन Ruby माइग्रेशन एक ही दिन में बनाम हाथ से दो-से-ज़्यादा महीने, फाइल मेमोरी से एक गेम कार्य में Opus 4.8 से 3x ज़्यादा फायदा, GitHub की उच्च-स्वायत्तता long-horizon कोडिंग रिपोर्ट), कीमत और उपलब्धता ($10 इनपुट / $50 आउटपुट प्रति 1M टोकन, 1M संदर्भ और 128K आउटपुट, 9-22 जून तक हर प्लान में मुफ्त फिर क्रेडिट, API claude-fable-5 और GitHub Copilot), Opus 4.8 से सीधी तुलना (स्टैंडर्ड $5/$25 बनाम $10/$50, SWE-Bench Pro पर +11.1 अंक, वही 1M संदर्भ, Opus 4.8 Fast Mode $10/$50 पर; भारी काम Fable 5 को और रोज़मर्रा Opus 4.8 स्टैंडर्ड को बांटें), खास नया सुरक्षा डिज़ाइन (साइबर, जीव-रसायन और distillation क्लासिफायर जो सिर्फ खतरनाक होने पर Opus 4.8 पर लौटते हैं, 5% से कम सत्रों में सक्रिय इसलिए 95%+ पूरे प्रदर्शन पर चलते हैं, Mythos-स्तर ट्रैफिक की 30-दिन सहेज), AI के बहुत खतरनाक होने की चेतावनी के कुछ ही दिन बाद रिलीज़ का संदर्भ (एक तीसरा रास्ता जो सिर्फ खतरनाक क्षेत्र बंद करता है), और इसे कब इस्तेमाल करें। आंकड़े Anthropic की घोषणा और रिपोर्टों से उद्धृत हैं और बदल सकते हैं।

AI दफ्तर में काम करने वालों के बीच क्षमता की खाई कैसे चौड़ी करता है? खिसकता आधार, तल बनाम छत, और पीछे न छूटने के तरीके

AI दफ्तर में काम करने वालों के बीच क्षमता की खाई कैसे चौड़ी करता है? खिसकता आधार, तल बनाम छत, और पीछे न छूटने के तरीके

"AI आपकी नौकरी छीन लेगा" यह बात अब आम है, पर एक ज़्यादा रोज़मर्रा वाला बदलाव चुपचाप चल रहा है: एक ही कंपनी में, एक ही भूमिका में काम करने वाले सहकर्मियों के बीच नतीजों की खाई धीरे-धीरे चौड़ी हो रही है — क्योंकि लोग बँट रहे हैं उनमें जो AI को अच्छे से इस्तेमाल करते हैं और उनमें जो नहीं करते या नहीं कर पाते। यह लेख ताज़ा सर्वेक्षण आँकड़ों के साथ बताता है कि AI किस तरह क्षमता की खाई चौड़ी करता है, और यह कोई सीधी-सी "होशियार जीतते हैं" वाली कहानी नहीं है। यह दिखाता है कि फर्क पैदा करने वाला आधार कच्ची ताकत (ज्ञान, रफ्तार, अनुभव) से हटकर "AI को अच्छे से इस्तेमाल करना (AI साक्षरता)" की ओर खिसक रहा है; कि AI एक साथ दो विपरीत ताकतें लगाता है (काम के स्तर पर यह नए लोगों को ज़्यादा उठाता है और अनुभवी लोगों के साथ खाई घटाता है, जबकि पूरे दफ्तर में पहले से आगे लोग — ज़्यादा कमाने वाले, वरिष्ठ भूमिकाएँ — AI को जल्दी और गहराई से अपनाते हैं, खाई चौड़ी करते हैं); आँकड़ों में आज की हालत (एक सर्वेक्षण: 60%+ शीर्ष कमाने वाले रोज़ AI इस्तेमाल करते हैं बनाम 16% कम कमाने वाले, एक ही भूमिका में AI कौशल के लिए अनुमानित +56% वेतन प्रीमियम, और लगभग 39% महसूस करते हैं कि हद से ज़्यादा भरोसा उनकी क्षमता कमज़ोर करता है — सभी उद्धृत और सर्वेक्षण अनुसार भिन्न); खाई चौड़ी करने वाली चार ताकतें (टूल तक पहुँच, समय और प्रशिक्षण, प्रयोग की स्वायत्तता, सीखने की इच्छा — पहली तीन वरिष्ठ भूमिकाओं के पक्ष में, सिर्फ आखिरी आपके हाथ में); तीन प्रकार (आगे निकलता / जहाँ का तहाँ / पीछे छूटता, मुख्य बात बचे समय को निर्णय, योजना और लोगों में लगाना); "इस्तेमाल तो कर लेता है पर सोचता नहीं" बनने का जाल (AI को कच्चे मसौदे की तरह जाँचें, आँख मूँदकर न निगलें); पीछे न छूटने के तरीके (इसे छू लें, अपने काम पर आज़माएँ, जाँचने की आदत बनाएँ, बचे समय का निवेश करें, साझा करें, सीखते रहें); और संगठन का नज़रिया (थोड़ी कंपनियाँ ही ROI देखती हैं, पदों के बीच टकराव, ऐसी व्यवस्था बनाएँ जहाँ सब सीख सकें)। खाई कर्म के फर्क से खुलती है, प्रतिभा से नहीं — और यही उम्मीद भरा भी है, क्योंकि AI का इस्तेमाल सीखना कोई भी आज से शुरू कर सकता है।

श्रेणी के अनुसार ब्राउज़ करें

शुरुआती गाइड

सभी देखें

AI डेवलपमेंट और प्रोग्रामिंग

सभी देखें

डेव एनवायरनमेंट और इंफ्रा

सभी देखें

AI एजेंट्स और ऑटोमेशन

सभी देखें

कार्य दक्षता

सभी देखें

डिज़ाइन

सभी देखें

डेटा विश्लेषण

सभी देखें

सीखना और शिक्षा

सभी देखें

साइड इनकम और मॉनेटाइज़ेशन

सभी देखें

गेम डेवलपमेंट

सभी देखें

सुरक्षा और गवर्नेंस

सभी देखें

AI जोखिम और सामाजिक प्रभाव

सभी देखें

इंडी डेवलपमेंट

सभी देखें