26 सितंबर 2026 को अपडेट किया गया: शीर्षक और शुरुआती ग्राफ़िक के आँकड़े — "बिना अनुकूलन वाली लागत के 20-30% तक", "cache से 60 से 90% बचत", "$30K/माह से $6-9K तक", "दस में से आठ काम सस्ते मॉडल पर ठीक हो जाते हैं" — हटा दिए गए हैं, क्योंकि इनका स्रोत हम नहीं बता सके। उनकी जगह अब ऐसे उदाहरण हैं जिन्हें Anthropic और OpenAI के आधिकारिक pricing पेजों की इकाई क़ीमतों और गुणकों से गिना जा सकता है, सूत्र के साथ। साथ ही cache का break-even (5-मिनट cache पर 1 read, 1-घंटे cache पर 2 reads) और output की क़ीमत (input की 5 गुना) ठीक की गई है, और batch processing पर एक नया अध्याय जोड़ा गया है। क्या बदला, इसका सार लेख के अंत में है।

जब आप ChatGPT Plus ($20 प्रति माह) जैसे निश्चित प्लान से प्रति-token बिलिंग पर जाते हैं — API key के साथ Claude Code, या अपना बनाया AI ऐप — तो उपयोग के तरीके के हिसाब से बिल एक पूरे परिमाण तक बदल सकता है। उपयोग-आधारित बिलिंग की कोई ऊपरी सीमा नहीं होती।

अच्छी खबर यह है कि सबसे असरदार उपाय तीन हैं: prompt caching, मॉडल चयन और output बजट। हर एक का असर आधिकारिक मूल्य-सूचियों में छपे गुणकों से तय होता है, इसलिए आप इसे अपने उपयोग पर गिन सकते हैं। यह लेख Anthropic और OpenAI के आधिकारिक दस्तावेज़ों के आधार पर वे गुणक और गणना का तरीका बताता है।

3 लीवर

बचत आधिकारिक क़ीमतों से गिनी जा सकती है

— 26 सितंबर 2026 की Anthropic और OpenAI की आधिकारिक मूल्य-सूचियों के अनुसार

लीवर 1 कैश
0.1 गुना
Cache से पढ़े गए input की क़ीमत मूल क़ीमत की 0.1 गुना है (Claude Opus 5.5 पर 0.05 गुना)। Write 5-मिनट cache पर 1.25 गुना और 1-घंटे cache पर 2 गुना है (Anthropic, आधिकारिक)।
लीवर 2 मॉडल चयन
एक-चौथाई
Opus 5.5 से Haiku 4.5 पर जाने से input $4 से $1 और output $20 से $5 हो जाता है (प्रति 10 लाख tokens, Anthropic, आधिकारिक)। Sonnet 5 पर आधा।
लीवर 3 आउटपुट बजट
5 गुना
Output की क़ीमत input की 5 गुना है (सभी मौजूदा Claude मॉडलों और GPT-6 के तीनों मॉडलों पर)। कम किया गया हर output token पाँच input tokens के बराबर है।

उदाहरण: Opus 5.5 को एक ही 1 लाख token का prefix 5 मिनट से कम के अंतराल पर दस बार भेजें, तो input की लागत बिना cache के $4.00 से घटकर 5-मिनट cache के साथ $0.68 रह जाती है (एक write $0.50, और नौ reads $0.18)।
जो काम रुक सकता है, वह batch API से input और output दोनों पर आधी क़ीमत में होता है, और cache के गुणक उस पर भी लागू होते हैं।
स्रोत: Claude Platform Docs, Pricing और OpenAI API Pricing (26 सितंबर 2026 को जाँचा गया; गणना इस लेख की)

1. आपका AI बिल चुपचाप क्यों फूलता है

AI tools दो बिलिंग ट्रैक में आते हैं: व्यक्तिगत प्लान (फ्लैट दर) और API बिलिंग (उपयोग-आधारित)। जो बिल फटता है, वह मुख्यतः उत्तरार्द्ध है।

  • व्यक्तिगत प्लान: ChatGPT Plus $20/माह, Claude Pro $20/माह (सालाना भुगतान पर $17/माह), Max $100/माह से। निश्चित लागत, इसलिए भारी उपयोग की भी एक सीमा होती है (उपयोग सीमाओं के साथ)।
  • API बिलिंग: प्रति-token, उपयोग-आधारित। API key के साथ Claude Code और आपके खुद बनाए AI ऐप यहाँ आते हैं। उपयोग के तरीके के हिसाब से महीने का कुल बिल बहुत ऊपर-नीचे हो सकता है।

उपयोग-आधारित बिल इसलिए फूलता है क्योंकि (1) output tokens की क़ीमत input की 5 गुना है, (2) context जितना लंबा होता है, हर request में उतना ज़्यादा पूरा दोबारा भेजा जाता है, (3) सबएजेंट पर्दे के पीछे बार-बार बुलाए जाते हैं, और (4) कोई चीज़ लूप में फँसे तो रुकती नहीं — ये मिलकर बढ़ते हैं। एक बार तंत्र समझ में आ जाए, तो हर एक ठीक किया जा सकता है।

2. लागत विवरण — input, output, cache, batch

उदाहरण के लिए Claude Opus (सितंबर 2026 तक Opus 5.5; यह सबसे ऊँचे Fable से नीचे का स्तर है, जिसे Anthropic शुरुआत के लिए सुझाता है) का API मूल्य निर्धारण लेते हुए देखें कि पैसा कहाँ जाता है।

मदइकाई मूल्य (प्रति 10 लाख tokens)विवरण
Input tokens$4आप क्या भेजते हैं: prompt + वार्तालाप इतिहास + फ़ाइलें, आदि।
Output tokens$20AI क्या लौटाता है। Input की 5 गुना।
Cache write (5 मिनट)$5 (input का 1.25 गुना)Prefix को cache में रखना। 5 मिनट के भीतर हर read इसे बिना अतिरिक्त शुल्क के आगे बढ़ाता है।
Cache write (1 घंटा)$8 (input का 2 गुना)5 मिनट से लंबे अंतराल में भी बना रहता है, बदले में write महँगी है।
Cache read$0.20 (input का 0.05 गुना)ज़्यादातर मॉडलों पर 0.1 गुना, Opus 5.5 पर 0.05 गुना। यह बचत शो का सितारा है।
Batch processinginput $2, output $10 (आधी क़ीमत)जो requests रुक सकते हैं, उन्हें asynchronous रूप से एक साथ चलाना। Cache के गुणकों के साथ जुड़ता है।
Tool callsinput में गिने जाते हैंTool परिभाषाएँ context का हिस्सा हैं। कोई भी tool देने पर एक tool-use system prompt भी जुड़ता है (Opus 5.5 पर 286 tokens)।

संक्षेप में, cache में रखा prefix input क़ीमत के दसवें हिस्से या उससे कम में पढ़ा जाता है। Write के गुणक (5 मिनट पर 1.25 गुना, 1 घंटे पर 2 गुना) और "output = input का 5 गुना" का संबंध सभी मौजूदा Claude मॉडलों पर एक-सा है; सिर्फ़ read का गुणक मॉडल के हिसाब से बदलता है (Fable 5.1 पर 0.025 गुना)। यह भी ध्यान रखें कि Claude Opus 4.7 और उसके बाद के मॉडल नया tokenizer इस्तेमाल करते हैं, जो Anthropic के अनुसार उसी पाठ के लिए लगभग 30% ज़्यादा tokens बनाता है — पीढ़ियों के बीच क़ीमतों की तुलना करते समय यह मायने रखता है। स्रोत: Claude Platform Docs, Pricing (26 सितंबर 2026 को जाँचा गया)।

3. प्लान चयन और बचत पर इसका प्रभाव

जिस क्षण आप अनुमान लगा सकें कि आप इसे कैसे उपयोग करेंगे, पहले सही प्लान पर शिफ्ट हो जाएँ।

उपयोगअनुशंसित प्लानमासिक लक्ष्यचेतावनियाँ
शौक, सीखना, सप्ताह में कुछ बारClaude Free / ChatGPT Free$0उपयोग सीमाएँ; कार्य डेटा के लिए नहीं।
व्यक्तिगत, दैनिक कुछ घंटेClaude Pro / ChatGPT Plus$20व्यक्तिगत प्लान; कार्य डेटा के लिए नहीं।
भारी व्यक्तिगत उपयोगClaude Max$100 सेPro से 5 गुना या 20 गुना उपयोग; घंटों Claude Code चलाने वालों के लिए।
टीम कार्यClaude Team / ChatGPT BusinessClaude Team की मानक सीट $20 (सालाना) से $25/उपयोगकर्ताकार्य डेटा के लिए ठीक; डेटा प्रशिक्षण के लिए उपयोग नहीं।
बड़ा संगठनEnterpriseबिक्री उद्धरणSSO, audit logs, SLA।
AI-एम्बेडेड विकासप्रत्यक्ष API (Anthropic / OpenAI)उपयोग-आधारितCaching और batch का उपयोग करें।

स्रोत: Claude का pricing पेज और OpenAI Help, "What is ChatGPT Plus?" (26 सितंबर 2026 को जाँचा गया)।

अगर आप रोज़ घंटों Claude Code चलाते हैं और बार-बार Pro की सीमा से टकराते हैं, तो Max प्लान पर विचार करें। यह निश्चित शुल्क है, इसलिए बिल API key की तरह बेकाबू नहीं हो सकता। Cursor का व्यक्तिगत Pro प्लान $20 प्रति माह से शुरू होता है, और उसके ऊपर Pro+ और Ultra हैं।

4. Prompt caching — सबसे ज़्यादा असर वाला लीवर

अगर आप सीधे API बुलाते हैं और एक ही prefix बार-बार भेजते हैं, तो prompt caching न इस्तेमाल करने का लगभग कोई कारण नहीं है। Cache से पढ़े गए हिस्से का बिल मूल input मूल्य के एक छोटे अंश पर बनता है।

यह कैसे काम करता है

जब आप कई अनुरोधों में एक ही system prompt या एक ही दस्तावेज़ का पुन: उपयोग करते हैं, तो पहली कॉल उन्हें cache में write करती है (5-मिनट cache पर input का 1.25 गुना)। हर बाद की कॉल cache से input के 0.1 गुना पर पढ़ती है (Opus 5.5 पर 0.05 गुना, Fable 5.1 पर 0.025 गुना)। पर बहुत छोटा prefix cache नहीं होता: न्यूनतम सीमा Opus 5.5 पर 512 tokens, Sonnet 5 पर 1,024 और Haiku 4.5 पर 4,096 है (Claude Platform Docs, "Prompt caching")।

Break-even — 5-मिनट cache पर 1 read, 1-घंटे cache पर 2 reads

Input क़ीमत को 1 मानकर, एक ही prefix भेजने की लागत की तुलना करें (Anthropic के आधिकारिक गुणकों से गणना):

  • 5-मिनट cache: write 1.25 + एक read 0.1 = 1.35। बिना cache के दो बार भेजने पर 2 लगता है, इसलिए एक ही read में write की लागत वसूल हो जाती है
  • 1-घंटा cache: write 2 + दो reads 0.2 = 2.2। बिना cache के तीन बार भेजने पर 3 लगता है, इसलिए दो reads में वसूल हो जाती है (केवल एक read पर यह 2.1 है, जो बिना cache के 2 से थोड़ा ज़्यादा है)

Anthropic का pricing पेज भी यही कहता है: 5-मिनट अवधि पर एक read के बाद और 1-घंटे अवधि पर दो reads के बाद caching फ़ायदेमंद हो जाती है। Opus 5.5 पर read 0.05 गुना है, इसलिए उतने ही reads में अंतर और बढ़ जाता है।

उदाहरण — 1 लाख token का prefix 10 बार भेजना

मॉडलबिना cache5-मिनट cacheअंतर
Claude Opus 5.5 (input $4, write $5, read $0.20)0.1 × $4 × 10 = $4.000.1 × $5 + 0.1 × $0.20 × 9 = $0.68लगभग 83% कम
Claude Sonnet 5 (input $2, write $2.50, read $0.20)0.1 × $2 × 10 = $2.000.1 × $2.50 + 0.1 × $0.20 × 9 = $0.43लगभग 79% कम

यहाँ सिर्फ़ prefix (system prompt, संदर्भ दस्तावेज़ आदि) के input की गणना है; 1 लाख tokens = 0.1 (10 लाख की इकाई में)। मान लिया गया है कि सभी दस requests 5 मिनट से कम के अंतराल पर आते हैं, पहला cache लिखता है और बाकी नौ उसे पढ़ते हैं। क़ीमतें Claude Platform Docs, Pricing से (26 सितंबर 2026 को जाँचा गया)। Output और हर request का बदलने वाला हिस्सा शामिल नहीं है।

OpenAI के GPT-6 मॉडल भी लगभग इसी तरह काम करते हैं। Cached input 0.1 गुना और write 1.25 गुना है, और OpenAI की गाइड भी यही हिसाब देती है: एक बार लिखकर एक बार दोबारा इस्तेमाल करने पर 1.35 गुना, जबकि बिना cache के दो बार process करने पर 2 गुना। Cache आख़िरी उपयोग के बाद 30 मिनट तक रहता है और समर्थित मॉडलों पर डिफ़ॉल्ट रूप से चालू है (OpenAI, "Prompt caching")।

डिफ़ॉल्ट अवधि 5 मिनट है

Anthropic के API में prompt cache की अवधि (TTL) डिफ़ॉल्ट रूप से 5 मिनट है। हर read इसे बिना अतिरिक्त शुल्क के आगे बढ़ा देता है, लेकिन 5 मिनट से लंबा अंतराल होने पर यह समाप्त हो जाता है और अगला request इसे फिर से लिखता है (input का 1.25 गुना)। आप 1 घंटे की अवधि चुन सकते हैं, पर तब write की लागत input की 2 गुना होती है (स्रोत: Claude Platform Docs, "Prompt caching")।

Claude Code भी इसी व्यवस्था पर चलता है। Claude subscription के शामिल उपयोग के भीतर मुख्य बातचीत को 1 घंटे की अवधि मिलती है, लेकिन API key से उपयोग करने पर, या प्लान की सीमा पार करके usage credits पर जाने पर, यह 5 मिनट हो जाती है। v2.1.242 से आप promptCacheTtl सेटिंग से खुद 5m या 1h चुन सकते हैं (स्रोत: Claude Code Docs, "Prompt caching", 26 सितंबर 2026 को जाँचा गया)। यदि आप बीच-बीच में विराम लेकर काम करते हैं, तो दोनों में से कौन-सी लागू है, इससे cache के दोबारा लिखे जाने की संख्या बदलती है।

5 मिनट या 1 घंटा — कैसे चुनें

आधिकारिक दस्तावेज़ का मार्गदर्शन:

  • जो prefix हर 5 मिनट से पहले दोबारा इस्तेमाल होता है: 5-मिनट cache ही रखें। हर read इसे मुफ़्त में आगे बढ़ाता है, इसलिए महँगी 1-घंटे की write की ज़रूरत नहीं
  • जो prefix 5 मिनट से 1 घंटे के अंतराल पर इस्तेमाल होता है (उपयोगकर्ता के जवाब का इंतज़ार, 5 मिनट से लंबे काम के बाद आने वाली कॉल): 1-घंटे cache उपयुक्त है
  • दोनों को मिलाते समय: 1-घंटे cache को 5-मिनट cache से पहले रखें — यह वही क्रम है जैसे न बदलने वाले system prompt और tool परिभाषाओं को शुरुआत में रखना

Cache काम कर रहा है या नहीं, यह response के usage में cache_read_input_tokens (read) और cache_creation_input_tokens (write) से देखें। अगर read हमेशा 0 रहे, तो prefix हर request में कहीं बदल रहा है या न्यूनतम token सीमा तक नहीं पहुँच रहा।

5. Context प्रबंधन — /compact और बँटवारा

Claude Code या Cursor का कुछ देर उपयोग करें, और लंबी वार्तालाप के बीच में आप पाएँगे कि हर turn में पिछली बातचीत का बड़ा हिस्सा दोबारा भेजा जा रहा है। फूलता output नहीं, बल्कि input (= पिछली वार्तालाप) है।

रणनीति 1: सक्रिय रूप से /compact का उपयोग करें

Claude Code में एक /compact कमांड है। यह अब तक की बातचीत का सार बनाकर context में जगह खाली करता है (Claude Code Docs, "Commands"), और आप बता सकते हैं कि सार में क्या रखना है। इसे काम के स्वाभाविक पड़ावों पर इस्तेमाल करें।

रणनीति 2: प्रति कार्य sessions को विभाजित करें

"Feature A लागू करें," "Bug B ठीक करें," और "Doc C बनाएँ" को एक लंबी वार्तालाप में न करें — नए sessions शुरू करें। हर कार्य के समाप्त होते ही session बंद करें। यदि आपको दीर्घकालिक स्मृति चाहिए, तो उसे एक memory फ़ाइल में लिखें।

रणनीति 3: Hooks के साथ शोर को छाँटें

Claude Agent SDK / Claude Code Hooks प्रदान करते हैं, जो आपको tool output को AI तक पहुँचने से पहले रूपांतरित करने देते हैं। उदाहरण: एक लंबे npm install log को Hook के माध्यम से केवल "सफलता/विफलता" तक संपीड़ित करें। Log जितना लंबा, हर turn का input उतना हल्का।

6. मॉडल चयन — कार्य-आधारित routing

"हमेशा Opus" करोड़पति की रणनीति है। वर्गीकरण और निष्कर्षण जैसे नियमित काम अक्सर Sonnet या Haiku से हो जाते हैं। क़ीमत मॉडल के स्तर (ऊँचा, मध्य, हल्का) से तय होती है; 26 सितंबर 2026 तक की आधिकारिक क़ीमतें (प्रति 10 लाख टोकन) नीचे हैं। संस्करण बदलते रहे, पर यह संबंध नहीं बदला — स्तर जितना ऊँचा उतना महँगा, और हल्का स्तर ऊँचे का एक छोटा हिस्सा।

मॉडलInputOutputसर्वश्रेष्ठ
Claude Opus 5.5 (ऊँचा)$4$20जटिल डिज़ाइन, तर्क, लंबे स्वायत्त कार्य
Claude Sonnet 5 (मध्य)$2$10दैनिक कोडिंग, विश्लेषण, सारांश
Claude Haiku 4.5 (हल्का)$1$5वर्गीकरण, निष्कर्षण, छोटा रूपांतरण, रीयल-टाइम प्रतिक्रिया
GPT-6 Sol (OpenAI का संतुलित मॉडल)$2$10जटिल कोडिंग और एजेंटिक काम
GPT-6 Luna (OpenAI का कम लागत वाला मॉडल)$0.10$0.50सीमित दायरे का बड़ी मात्रा में हल्का काम

स्रोत: Claude Platform Docs, Pricing और OpenAI API Pricing (26 सितंबर 2026 को जाँचा गया; OpenAI की क़ीमतें छोटे context के लिए)। इनके ऊपर Anthropic का Fable 5.1 ($10 / $50) और OpenAI का फ़्लैगशिप GPT-6 Astra ($10 / $50) है। हर कंपनी के मौजूदा मॉडल मौजूदा मॉडल और नॉलेज कटऑफ़ की सूची में देखें।

ऊँचे स्तर के Opus से हल्के Haiku पर जाने से प्रति-टोकन क़ीमत एक-चौथाई रह जाती है (सितंबर 2026 तक)। मान लीजिए एक वर्गीकरण का काम रोज़ 20 लाख input और 2 लाख output tokens लेता है, तो आधिकारिक क़ीमतों से:

  • Opus 5.5: 2 × $4 + 0.2 × $20 = $12
  • Sonnet 5: 2 × $2 + 0.2 × $10 = $6
  • Haiku 4.5: 2 × $1 + 0.2 × $5 = $3
  • Haiku 4.5 batch में: $3 × 0.5 = $1.50 (अध्याय 8)

गुणवत्ता पर्याप्त है या नहीं, यह काम पर निर्भर है, इसलिए सस्ते मॉडल पर जाने से पहले एक ही input पर परिणामों की तुलना करें (FAQ का Q4)। मार्गदर्शक मानदंड:

  • Opus का उपयोग करें: जटिल refactors, कई फ़ाइलों में फैले डिज़ाइन, गहरा तर्क, अपरिचित डोमेन की खोज के लिए
  • Sonnet का उपयोग करें: दैनिक कोडिंग, विश्लेषण, सारांश, समीक्षा, tests जोड़ने के लिए
  • Haiku का उपयोग करें: वर्गीकरण, निष्कर्षण, format रूपांतरण, रीयल-टाइम सुझाव, commit संदेश बनाने के लिए

7. अपने output बजट का प्रबंधन

Output tokens की क़ीमत input की 5 गुना है — मौजूदा Claude मॉडलों पर भी और GPT-6 Astra, Sol और Luna पर भी। Opus 5.5 पर 2,000 input और 1,000 output tokens वाला एक जवाब $0.008 + $0.020 = $0.028 का होता है। Output को 500 tokens तक सीमित करें तो यह $0.018 रह जाता है, यानी लगभग 36% कम (आधिकारिक क़ीमतों से गणना)।

तीन दृष्टिकोण

  • max_tokens को काम के अनुसार रखें: Anthropic के Messages API में max_tokens अनिवार्य parameter है, और उसमें लिखी संख्या ही output की ऊपरी सीमा होती है (API reference, "Messages")। बड़ा मान यूँ ही न छोड़ें; उपयोग के अनुरूप मान रखें, जैसे max_tokens: 1000।
  • अपने prompt में "संक्षेप में उत्तर दें" या "पाँच bullet" जोड़ें: AI सुनता है। अनावश्यक परिचय, सारांश और हस्ताक्षर दबाएँ।
  • संरचित output (JSON mode): JSON गद्य से छोटा है। यदि आपका ऐप परिणाम का उपभोग करता है, तो यही रास्ता है।

उन स्थितियों में जहाँ आपको "लंबा, सुंदर उत्तर" नहीं चाहिए (वर्गीकरण, निष्कर्षण, निर्णय), कठोरता से काटना अधिक लागत-कुशल साबित होता है।

8. Batch processing — जो काम रुक सकता है, वह आधी क़ीमत पर

जिस काम का जवाब तुरंत नहीं चाहिए — रात में बड़े पैमाने पर वर्गीकरण, थोक में सारांश, evaluation runs — वह batch API से input और output दोनों पर आधी क़ीमत में होता है। Anthropic का Message Batches API एक batch में 1 लाख तक requests लेता है; ज़्यादातर एक घंटे से कम में पूरे हो जाते हैं, पर एक batch में 24 घंटे तक लग सकते हैं (Claude Platform Docs, "Batch processing")। OpenAI का Batch API भी 50% छूट देता है, और पूरा होने की समय-सीमा 24 घंटे है (OpenAI, "Batch API")।

Anthropic के pricing पेज के अनुसार cache के गुणक batch की छूट के साथ जुड़ते हैं। उदाहरण के लिए, batch के भीतर Haiku 4.5 पर cache read की लागत $1 × 0.1 × 0.5 = $0.05 प्रति 10 लाख tokens है।

9. Multi-agent जाल — 15 गुना tokens

2026 की प्रवृत्ति, multi-agent setups (orchestrator + समानांतर सबएजेंट), शक्तिशाली है, लेकिन Anthropic ने अपनी Research सुविधा के आँकड़े प्रकाशित किए हैं: agents सामान्य chat से लगभग 4 गुना tokens खर्च करते हैं, और multi-agent systems लगभग 15 गुना (Anthropic, "How we built our multi-agent research system", जून 2025)। 15 गुना की तुलना chat से है, एकल agent से नहीं।

बचत के लिए निर्णय मानदंड

  • स्पष्ट, क्रमिक कार्य (एकल फ़ाइल संपादन, सारांश, code review) → एकल agent पर्याप्त
  • समानांतरता जो अर्थपूर्ण रूप से wall-clock समय कम करती है → multi-agent उचित है
  • "डिफ़ॉल्ट रूप से multi-agent" आर्थिक रूप से गलत है। एकल agent से शुरू करें और केवल उन bottlenecks को विभाजित करें जिन्हें आप वास्तव में देख सकते हैं।

विवरण: देखें Multi-agent क्या है?

10. निगरानी और बिलिंग अलर्ट

उपयोग-आधारित बिल आपको चौंकाए नहीं, इसके लिए नियमित निगरानी + अलर्ट ज़रूरी हैं।

API उपयोगकर्ता

  • Claude Console / OpenAI Dashboard में दैनिक token खपत जाँचें
  • उपयोग सीमा सेट करें: जैसे $200/माह से अधिक होने पर रोक। कोई सीमा नहीं = खतरा।
  • बिलिंग अलर्ट: $50 पर email, $100 पर Slack — चरणबद्ध थ्रेशोल्ड।

Claude Code उपयोगकर्ता

  • वर्तमान session की लागत और प्लान के उपयोग की जाँच के लिए /usage का उपयोग करें (/cost अब /usage का उपनाम है)
  • हर दिन के अंत में /usage जाँचने को आदत बनाएँ

संगठन प्रशासक

  • प्रति-उपयोगकर्ता उपयोग रिपोर्ट (Anthropic Team / Enterprise admin console)
  • विसंगति का पता लगाना (जो सामान्य से बहुत ज़्यादा खर्च कर रहे हैं उन्हें flag करें)
  • "बर्बादी पैटर्न" का त्रैमासिक कंपनी-व्यापी साझा करना

11. सात आम बर्बादी पैटर्न

पैटर्नक्या गलत हैसमाधान
हर turn में सभी फ़ाइलें फिर से जोड़नाCache सक्रिय नहीं होता; input फूलता हैअपरिवर्तनीय दस्तावेज़ prefix में रखें और cache करें
ChatGPT और Claude दोनों में एक ही प्रश्न पूछनाअलग प्लानों पर एक ही input के लिए दो बार भुगतानएक चुनें
/compact के बिना लंबी वार्तालाप जारी रखनाहर turn में पूरा इतिहास भेजा जाता हैकाम के स्वाभाविक पड़ाव पर /compact
सरल वर्गीकरण या निष्कर्षण के लिए Opus का उपयोगउसी परिणाम के लिए Haiku से 4 गुना भुगतानमॉडल को कार्य से मिलाएँ
"अधिक परिष्कृत" / "थोड़ा लंबा" दोहरानाOutput tokens जमा होते हैंशुरू में ही वांछित लंबाई बताएँ
कई अनावश्यक tools परिभाषित करनाTool परिभाषाएँ context में सवारी करती हैंकेवल वही परिभाषित करें जो आप उपयोग करेंगे
Multi-agent को आसानी से अपनानाchat से लगभग 15 गुना tokens (एकल agent लगभग 4 गुना)केवल जब स्पष्ट आवश्यकता हो

सारांश

  • AI लागत अनुकूलन के तीन लीवर: prompt caching, मॉडल चयन, output बजट। हर एक का असर आधिकारिक गुणकों से तय होता है, और ये गुणक आपस में गुणा होते हैं।
  • Cache read = input का 0.1 गुना (Opus 5.5 पर 0.05 गुना)। 5-मिनट cache एक read में और 1-घंटे cache दो reads में वसूल हो जाता है। 1 लाख token का prefix Opus 5.5 को दस बार भेजने पर लागत $4.00 से $0.68 हो जाती है।
  • मॉडल चयन: Opus 5.5 से Haiku 4.5 पर प्रति-टोकन क़ीमत एक-चौथाई, Sonnet 5 पर आधी (सितंबर 2026 तक)।
  • Output बजट: output की क़ीमत input की 5 गुना है। max_tokens स्पष्ट रूप से सेट करें और "संक्षिप्त" माँगें।
  • Batch processing: जो काम रुक सकता है, वह input और output दोनों पर आधी क़ीमत में होता है, और cache की छूट के साथ जुड़ता है।
  • Context प्रबंधन: काम के स्वाभाविक पड़ाव पर /compact, प्रति कार्य विभाजित करें, Hooks से output संपीड़ित करें।
  • Multi-agent जाल: chat से लगभग 15 गुना tokens। केवल स्पष्ट आवश्यकता के साथ उपयोग करें।
  • निगरानी: उपयोग सीमाएँ, बिलिंग अलर्ट, और एक /usage जाँच — सभी आदत होनी चाहिए।

FAQ

Q1. मैं Claude Code दैनिक उपयोग करता हूँ — क्या Pro ($20) या Max बेहतर सौदा है?

अगर आप बार-बार Pro की सीमा से टकराते हैं, तो Max पर विचार करें। Anthropic का help center सलाह देता है कि जो Pro उपयोगकर्ता बार-बार सीमा से टकराते हैं और बड़े repositories के लिए अधिक क्षमता चाहते हैं, वे Max 5x पर जाने पर विचार करें (Claude Help Center, "Using Claude Code with your Pro or Max plan")। अगर सीमा तक नहीं पहुँचते, तो Pro ही रखें।

Q2. क्या prompt caching का उपयोग करने के लिए विशेष कॉन्फ़िगरेशन चाहिए?

Anthropic के API पर cache_control बताना ज़रूरी है — या तो request के सबसे ऊपरी स्तर पर एक बार (स्वचालित caching), या अलग-अलग blocks पर (स्पष्ट breakpoints)। OpenAI पर समर्थित मॉडलों में यह डिफ़ॉल्ट रूप से चालू है। Claude Code cache का उपयोग अपने-आप करता है। विवरण के लिए Anthropic का आधिकारिक दस्तावेज़ देखें।

Q3. ChatGPT बनाम Claude — कौन अधिक लागत-कुशल है?

उपयोग के मामले पर निर्भर करता है। सिर्फ़ इकाई क़ीमत देखें तो मध्य स्तर का Claude Sonnet 5 और GPT-6 Sol बराबर हैं: input $2 और output $10। छोटे Q&A और बड़ी मात्रा के नियमित काम के लिए OpenAI का कम लागत वाला मॉडल (सितंबर 2026 तक GPT-6 Luna, input $0.10) Haiku 4.5 (input $1) का दसवाँ हिस्सा है। एक ही prefix बार-बार भेजने वाले लंबे कामों में cache reads का असर बड़ा होता है, इसलिए Opus 5.5 (0.05 गुना) भी विकल्प बन जाता है। "दोनों की सदस्यता लें और सही उपकरण चुनें" भी व्यावहारिक है।

Q4. मैं कैसे तय करूँ कि "Haiku पर्याप्त है"?

तीन-चरणीय प्रयोग चलाएँ। (1) इसे Opus पर काम करवाएँ। (2) वही prompt Sonnet को भेजें और गुणवत्ता की तुलना करें। (3) यदि Sonnet तुलनीय दिखता है, तो Haiku भी आज़माएँ। काम जितना नियमित होता है, अंतर आमतौर पर उतना कम होता है। उन मामलों के लिए Opus आरक्षित रखें जिन्हें वास्तव में गहरे निर्णय या तर्क की आवश्यकता है।

Q5. क्या व्यक्तिगत उपयोगकर्ताओं को सीधे API का उपयोग करना चाहिए?

यह निर्भर करता है। अगर आपका काम मुख्यतः इंटरैक्टिव कोडिंग है, तो Max प्लान बिल को निश्चित रखता है और ज़्यादा सुविधाजनक है। अपने ऐप में AI एम्बेड करने, batch प्रसंस्करण, या स्वचालन के लिए सीधा API चाहिए। बहुत से लोग दोनों करते हैं।

Q6. बिलिंग अलर्ट के लिए मुझे क्या थ्रेशोल्ड सेट करना चाहिए?

कोई एक सही उत्तर नहीं है, पर चरण तय करने का एक तरीका है: पहला अलर्ट आपके सामान्य मासिक खर्च के 1.5 गुना पर और रोक 3 गुना पर। अगर आप आमतौर पर $30/माह खर्च करते हैं, तो $50 पर अलर्ट और $100 पर रोक। शुरुआत में छोटे दैनिक अलर्ट रखें ताकि अपने खर्च का अंदाज़ा हो जाए, फिर उन्हें ढीला करें।

Q7. हमें बताया गया कि "कंपनी का AI बजट बहुत बड़ा हो गया है।" हमें पहले क्या करना चाहिए?

क्रम में तीन चीज़ें। (1) प्रति-उपयोगकर्ता उपयोग देखें और पता करें कि खपत कहाँ केंद्रित है। (2) सबसे ज़्यादा उपयोग करने वालों से उनके workflow पर बात करें और बर्बादी पैटर्न पहचानें। (3) "caching, मॉडल चयन, output बजट" पर एक आंतरिक गाइड कंपनी-व्यापी वितरित करें और प्रगति पर मासिक रिपोर्ट करें।

पिछले संस्करण में सुधार

26 सितंबर 2026 को हमने ये सुधार किए।

पिछला संस्करणअब
तीन लीवर लागत को बिना अनुकूलन वाली लागत के 20-30% तक ले आते हैं (शीर्षक, शुरुआत, चित्र)स्रोत न बता पाने के कारण हटाया गया। इसकी जगह आधिकारिक क़ीमतों और गुणकों से गिने गए उदाहरण।
Cache से -60 से 90%, मॉडल चयन से -50 से 80%, output बजट से -30 से 60%, $30K/माह से $6-9Kवही। इसकी जगह "1 लाख token का prefix दस बार भेजना: $4.00 → $0.68" जैसे उदाहरण।
दस में से आठ काम सस्ते मॉडल पर ठीक हो जाते हैंस्रोत नहीं होने से हटाया गया।
5-मिनट cache दो reads में break-even होता हैएक read में वसूल हो जाता है (write 1.25 + read 0.1 = 1.35 < 2)।
1-घंटे cache पाँच reads में break-even होता हैदो reads में वसूल हो जाता है (2 + 0.2 = 2.2 < 3)।
Output tokens, input से 5-6 गुना महंगे हैं5 गुना (सभी मौजूदा Claude मॉडलों और GPT-6 के तीनों मॉडलों पर)।
Cache hit दर 60% से कम हो तो गुंजाइश है; production में 80%+ का लक्ष्यस्रोत नहीं होने से हटाया गया। इसकी जगह usage में read और write tokens की जाँच।
/compact से 200k tokens को 5,000 तक सिकोड़ा जा सकता हैस्रोत नहीं होने से आँकड़े हटाए गए।