विषय-सूची
- 1. एक LLM बस "अगला शब्द" अनुमान लगाता रहता है
- 2. "वेट्स" क्या हैं? — एक खरब नॉब्स बुद्धिमत्ता बनाते हैं
- 3. सीखने के दो चरण — प्री-ट्रेनिंग और पोस्ट-ट्रेनिंग (RLHF)
- 4. इन्फरेंस — वह क्षण जब आपका प्रश्न बिजली बन जाता है
- 5. बिजली — एक LLM कितनी बिजली खाता है?
- 6. क्या "विकास पैसे की लड़ाई है" सच है?
- 7. लेकिन सिर्फ पैसे से जीत नहीं होती — दक्षता का उल्टा प्रवाह
- 8. आगे क्या — पैसे के बाद "बिजली और भौतिकी" की दीवार
- सारांश
- अक्सर पूछे जाने वाले प्रश्न
2023 में जारी GPT-4 की ट्रेनिंग में लगा कंप्यूट, शोध संस्था Epoch AI के अनुमान के अनुसार लगभग 2.1×10²⁵ फ़्लोटिंग-पॉइंट ऑपरेशन (FLOP) था, और Stanford HAI ने उस कंप्यूट की लागत लगभग 7.8 करोड़ डॉलर आँकी। पुराने GPT-3 की ट्रेनिंग में ही लगभग 1,287 MWh बिजली लगी (Google के शोधकर्ताओं का 2021 का अनुमान) — एक औसत घर की सौ साल से ज़्यादा की बिजली, सिर्फ़ एक मॉडल बनाने के लिए। हम जो सहज "अरे, इसका सारांश दो" टाइप करते हैं, उसके पीछे भौतिकी और नोटों की गड्डियों की दुनिया है।
यह लेख "एक LLM (बड़ा भाषा मॉडल) वास्तव में कैसे काम करता है" को तीन दिशाओं से गहराई से खंगालता है: तंत्र, बिजली, और पैसा। विशेष रूप से — (1) एक LLM "वेट्स (पैरामीटर)" नामक नॉब्स के संग्रह से भाषा क्यों उत्पन्न कर सकता है, (2) एक प्रश्न या एक ट्रेनिंग रन कितनी बिजली खपत करता है, और (3) क्या यह दावा कि "फ्रंटियर LLM विकास पैसे की लड़ाई है" सच है? तीसरे का संक्षिप्त उत्तर: "बिल्कुल फ्रंटियर के लिए, यह मूलतः सच है — लेकिन एक उल्टा प्रवाह जहां 'सिर्फ पैसे से जीत नहीं होती' 2026 में मजबूत हुआ है।" यही सटीक तस्वीर है।
मेरा रुख पहले ही स्पष्ट कर दूं: एक LLM की "बुद्धिमत्ता" न तो जादू है न चेतना — यह एक विशाल संभाव्यता-पूर्वानुमान मशीन को बिजली से पीट-पीटकर आकार देने का परिणाम है। तंत्र को समझने से अत्यधिक प्रचार और अत्यधिक भय दोनों घुल जाते हैं। यह लेख मध्यवर्ती-स्तर की गहराई में जाता है। अगर आप "LLM आखिर है क्या" से शुरू कर रहे हैं, तो पहले LLM क्या है (प्राइमर) पढ़ें; कॉन्टेक्स्ट लंबाई के लिए कॉन्टेक्स्ट विंडो देखें; मूल्य निर्धारण के लिए शुरुआती लोगों के लिए AI API देखें।
एक LLM का तीन दिशाओं से विश्लेषण
— बुद्धिमत्ता किससे बनी है, जो बिजली यह जलाता है, जो पैसा इसकी लागत है
एक LLM की चतुराई कोई जादू नहीं है। यह एक विशाल संभाव्यता मशीन को बिजली और पैसे से पीट-पीटकर आकार देने का परिणाम है।
तंत्र को जानिए, और प्रचार व भय दोनों घुल जाते हैं।
1. एक LLM बस "अगला शब्द" अनुमान लगाता रहता है
यह चौंकाने वाला लग सकता है, लेकिन ChatGPT, Claude, और Gemini सभी मूलतः एक ही काम करते हैं। "अब तक के टेक्स्ट को देखते हुए, सबसे संभावित अगले शब्द (अधिक सटीक रूप से, 'टोकन') की निरंतरता के रूप में संभाव्यता गणना करो, एक चुनो, और उन्हें कतार में लगाओ।" बस इतना ही। इसे "the cat is on the ___" दो और यह "mat," "couch," "floor" जैसे उम्मीदवारों को संभाव्यताएं देता है और सबसे ऊंची वाली (या संभाव्यता के अनुसार चुनी गई एक) निकालता है। यह इसे एक बार में एक टोकन दोहराता है जब तक टेक्स्ट समाप्त न हो जाए।
यहां वह प्रश्न है जो कई लोगों को उलझा देता है। "एक मात्र शब्द-अनुमान वाला खेल पेपरों का सारांश कैसे बना सकता है या कोड कैसे लिख सकता है?" उत्तर: "अगले शब्द का सही-सही अनुमान लगाने के लिए, इसके पास दुनिया की संरचना को कुछ हद तक 'समझने' के अलावा कोई चारा नहीं है।" "the capital of Japan is ___" का अनुमान लगाने के लिए भूगोल चाहिए; "3 + 5 = ___" के लिए अंकगणित; "the cause of this bug is ___" के लिए आंतरिक रूप से रखा प्रोग्रामिंग ज्ञान चाहिए। विशाल टेक्स्ट पर "अगले-शब्द-अनुमान" को चरम तक प्रशिक्षित करने के उपोत्पाद के रूप में, ज्ञान और तर्क उभर आते हैं। यही LLM की विचित्र और आवश्यक प्रकृति है।
तो वह "अगले-शब्द की संभाव्यता" क्या गणना कर रहा है? जैसा संकेत दिया गया, मुख्य अभिनेता है संख्याओं का एक चौंका देने वाला ढेर जिसे "वेट्स (पैरामीटर)" कहते हैं। अगला अध्याय बताता है कि वे क्या हैं।
2. "वेट्स" क्या हैं? — एक खरब नॉब्स बुद्धिमत्ता बनाते हैं
एक LLM के भीतरी हिस्से को एक उपमा में रखें तो: "सैकड़ों अरब से एक खरब से अधिक 'नॉब्स' वाला एक विशाल गणना उपकरण।" प्रत्येक नॉब एक "वेट (पैरामीटर)" है, और जब किसी इनपुट शब्द का सिग्नल अगली परत में जाता है, तो यह तय करता है कि "किन सिग्नलों को मजबूत या कमजोर करना है, और कितना।" GPT-3 में लगभग 175 अरब थे; नवीनतम फ्रंटियर मॉडल एक खरब से अधिक कहे जाते हैं। इन विशाल नॉब्स की सेटिंग ही ठीक-ठीक वह है जो मॉडल का सीखा हुआ "ज्ञान" है।
"वेट्स" कैसे भाषा में बदलते हैं
"सीखना" है इन एक खरब नॉब्स को थोड़ा-थोड़ा सही उत्तर की ओर घुमाने का काम।
तैयार नॉब सेटिंग्स (वेट्स) = मॉडल का "ज्ञान" स्वयं।
2017 में सामने आया Transformer, आधुनिक LLM की नींव है। इसका हृदय है "Attention" तंत्र, जो वेट्स द्वारा गतिशील रूप से तय करता है कि "वाक्य में कौन-सा शब्द वर्तमान शब्द के लिए मायने रखता है।" "saw the river in front of the bank" में "bank" का अर्थ वित्तीय संस्थान है या नदी का किनारा, यह संदर्भ में अन्य शब्दों के साथ इसके संबंध को वेट देकर तय होता है — और यह "संदर्भ-निर्भर वेटिंग" ठीक वही कारण है कि एक LLM लंबे अंशों पर भी सुसंगत प्रतिक्रियाएं दे सकता है। जब लोग कहते हैं "कुछ वेटिंग के बारे में," तो उनका मतलब ठीक यही Attention और इसके पीछे की खरबों गुणाएं हैं।
महत्वपूर्ण बिंदु: ये वेट्स हाथ से सेट नहीं किए गए थे। शुरुआत में ये यादृच्छिक संख्याओं का एक ढेर होते हैं, अर्थहीन। अर्थ "सीखने" के माध्यम से डाला जाता है। तो वह सीखना कैसे होता है?
3. सीखने के दो चरण — प्री-ट्रेनिंग और पोस्ट-ट्रेनिंग (RLHF)
एक LLM का सीखना मोटे तौर पर दो चरणों में बंटता है — वह प्रक्रिया जिससे पिछले अध्याय के "यादृच्छिक नॉब्स" "बुद्धिमान नॉब्स" बन जाते हैं।
चरण 1: प्री-ट्रेनिंग। इसे इंटरनेट-स्केल का टेक्स्ट (किताबें, वेब, कोड) दें और इससे लगातार "अगले शब्द का अनुमान" लगवाएं। हर बार गलती करने पर, सभी पैरामीटर एक छोटी मात्रा में समायोजित किए जाते हैं उस दिशा में जो त्रुटि को कम करती है (यह समायोजन एल्गोरिदम प्रसिद्ध "बैकप्रोपेगेशन + ग्रेडिएंट डिसेंट" है)। इसे खरबों टोकन पर दोहराएं, और व्याकरण, ज्ञान, और तर्क की नींव नॉब्स में उकेरी जाती है। प्री-ट्रेनिंग अधिकांश गणना, अधिकांश बिजली, और अधिकांश पैसा खा जाती है। GPT-4-श्रेणी के मॉडल के खगोलीय ~2×10²⁵ FLOPs यहीं जलते हैं।
चरण 2: पोस्ट-ट्रेनिंग (Post-training)। केवल प्री-ट्रेन किया मॉडल "जानकार लेकिन बदतमीज़" होता है। इसलिए RLHF (मानव प्रतिक्रिया से रीइनफ़ोर्समेंट लर्निंग) जैसे तरीक़ों से उसे "उपयोगी, सुरक्षित तरीक़े से जवाब देना" सिखाया जाता है। लगभग 2025 से, लैब्स लंबे तर्क (ध्यान से सोचना), टूल उपयोग और एजेंटिक व्यवहार को निखारने वाली पोस्ट-ट्रेनिंग पर भी बहुत ज़ोर दे रही हैं। हाल के मॉडल जो "जवाब देने से पहले सोचते" दिखते हैं, वह इसी पोस्ट-ट्रेनिंग के विकास का नतीजा है। मल्टी-एजेंट जैसा व्यवहार भी यहीं डाला जाता है।
4. इन्फरेंस — वह क्षण जब आपका प्रश्न बिजली बन जाता है
अगर ट्रेनिंग "नॉब्स सेट करने का निर्माण कार्य" है, तो इन्फरेंस "तैयार नॉब्स का उपयोग करके वास्तव में उत्तर उत्पन्न करने का संचालन" है। हर बार जब आप ChatGPT में एक प्रश्न टाइप करते हैं, लगभग एक खरब नॉब्स से होकर खरबों गुणाएं चलती हैं, और टोकन एक-एक करके उत्पन्न होते हैं। हमने देखा है कि ट्रेनिंग कितनी भारी है — लेकिन समाज में कुल मिलाकर, यह इन्फरेंस है, ट्रेनिंग नहीं, जो बिजली खाती है।
कारण सरल है: ट्रेनिंग मूलतः प्रति मॉडल एक बार चलती है, लेकिन इन्फरेंस दुनिया भर में दिन में करोड़ों बार चलती है। एक मॉडल के पूरे जीवनकाल में, बिजली और गणना की मांग ट्रेनिंग की तुलना में इन्फरेंस पर कहीं अधिक जमा होती जाती है। "एक प्रश्न तो शायद ही कोई बिजली है" — सच, एक तो नगण्य है। लेकिन "नगण्य × करोड़ों × हर दिन" मिलकर एक राष्ट्र-स्केल बिजली समस्या बन जाता है। आगे ठोस संख्याएं देखते हैं।
5. बिजली — एक LLM कितनी बिजली खाता है?
"AI बिजली खाता है" अक्सर कहा जाता है, लेकिन वास्तव में कितनी? यहां 2026 तक प्रकाशित प्रतिनिधि आंकड़े हैं।
संख्याओं में LLM बिजली खपत
एक छोटा प्रश्न
सबसे कुशल का 65 गुना से ज़्यादा
(एक पुरानी पीढ़ी)
2024→2030 पूर्वानुमान
एक छोटी क्वेरी (0.42Wh) भी, 700M/दिन तक बढ़ाई जाए, तो ~35,000 अमेरिकी घरों की बिजली के बराबर है (तीसरे पक्ष का अनुमान)।
डेटा-सेंटर रैक औसतन 8kW से कम बिजली लेते हैं (Uptime Institute का 2024 सर्वे), जबकि AI के लिए NVIDIA DGX GB200 रैक लगभग 120kW लेता है (NVIDIA के दस्तावेज़); एक AI डेटा सेंटर साइट 50MW से कम से लेकर 1GW से ज़्यादा तक की होती है (Epoch AI का ट्रैकिंग डेटा)।
ध्यान देने वाली बात यह है कि "बिजली की खपत मॉडल और प्रॉम्प्ट की लंबाई के हिसाब से कई गुना अलग होती है"। तीसरे पक्ष के अनुमानों में (नीचे की तालिका देखें) कई मॉडल छोटे सवाल पर 0.5 Wh से कम लेते हैं, लेकिन सबसे ज़्यादा बिजली खाने वाले मॉडलों को लंबा प्रॉम्प्ट देने पर यह 29 Wh से ऊपर चला जाता है — सबसे कुशल मॉडलों का 65 गुना से ज़्यादा। जैसा टोकन खपत = काम की मात्रा वाले जाल में बताया गया, "सब कुछ सबसे बड़े मॉडल से कराना" बिजली और लागत दोनों में विलासिता है। हल्के काम हल्के मॉडल को देना धरती और जेब दोनों के लिए अच्छा है। अंतर्राष्ट्रीय ऊर्जा एजेंसी (IEA) के अनुमान के अनुसार 2024 में दुनिया के डेटा सेंटरों ने लगभग 415 TWh बिजली ली (दुनिया के कुल का लगभग 1.5%), और 2030 तक यह दोगुनी होकर लगभग 945 TWh होने का अनुमान है, जिसकी मुख्य वजह AI है।
"एक क्वेरी की बिजली" इस पर निर्भर है कि किसने और कैसे मापा
"प्रति क्वेरी X Wh" जैसे आँकड़े ख़ूब उद्धृत होते हैं, लेकिन स्रोत के हिसाब से वे बिल्कुल अलग तरीक़ों से निकाले गए हैं। कंपनियों के अपने माप और बाहरी अनुमानों को अलग-अलग पढ़ना चाहिए।
| आँकड़ा | किस पर लागू | स्रोत | कैसे निकाला गया |
|---|---|---|---|
| 0.24Wh | Gemini ऐप में एक टेक्स्ट प्रॉम्प्ट (माध्यिका) | Google (अगस्त 2025, अपना पेपर) | अपने डेटा सेंटरों में मापा गया, जिसमें निष्क्रिय मशीनें और डेटा सेंटर का अतिरिक्त ख़र्च भी शामिल है |
| ~0.34Wh | ChatGPT की एक क्वेरी (औसत) | OpenAI के CEO सैम ऑल्टमैन का ब्लॉग (जून 2025) | कंपनी का अपना आँकड़ा; मापने का तरीक़ा प्रकाशित नहीं |
| 0.42Wh | GPT-4o को एक छोटा प्रॉम्प्ट | Jegham आदि (तीसरा पक्ष, 2025) | सार्वजनिक API प्रदर्शन डेटा और अनुमानित हार्डवेयर कॉन्फ़िगरेशन से निकाला गया अनुमान |
| 29Wh+ | सबसे ज़्यादा बिजली खाने वाले मॉडलों को लंबा प्रॉम्प्ट | वही | वही; सबसे कुशल मॉडलों का 65 गुना से ज़्यादा |
कंपनियों के माप एक जैसी परिस्थितियों में होते हैं पर बाहर से जाँचे नहीं जा सकते; तीसरे पक्ष के अनुमान तुलना में आसान हैं पर ज़्यादा मान्यताओं पर टिके हैं। दोनों एक टेक्स्ट क्वेरी के मान हैं; लंबे दस्तावेज़ पढ़ना, इमेज या वीडियो बनाना और एजेंट के लंबे काम इससे ज़्यादा लेते हैं।
इसे अपने उपयोग पर लागू करें तो पैमाना समझ आता है। अगर आप रोज़ 50 छोटे सवाल पूछते हैं, तो 0.24–0.42 Wh × 50 से रोज़ लगभग 12–21 Wh बनता है — लगभग उतना जितना 10 W का LED बल्ब एक-दो घंटे जलने पर लेता है। वहीं किसी भारी मॉडल को एक लंबा प्रॉम्प्ट देना ही 29 Wh से ऊपर जा सकता है। बिजली की मात्रा सवालों की गिनती से ज़्यादा इस पर निर्भर है कि आप कौन-सा मॉडल इस्तेमाल करते हैं और उसे कितनी देर सोचने देते हैं।
6. क्या "विकास पैसे की लड़ाई है" सच है?
यहां वह प्रश्न है जिसके बारे में आप सबसे ज्यादा उत्सुक थे। "क्या फ्रंटियर LLM विकास पैसे की लड़ाई है?" सत्यापित निष्कर्ष पहले: "फ्रंटियर की प्री-ट्रेनिंग तक सीमित रहें तो, यह मूलतः सच है।" संख्याएं इसका समर्थन करती हैं।
फ्रंटियर ट्रेनिंग-लागत प्रक्षेपवक्र
फ्रंटियर ट्रेनिंग कंप्यूट प्रति वर्ष 4–5 गुना बढ़ रहा है (Epoch AI)।
ट्रेनिंग लागत भी प्रति वर्ष 2.4 गुना बढ़ रही है — सचमुच पैसों की लड़ाई।
ठोस रूप से, Stanford HAI के AI Index 2024 ने ट्रेनिंग में लगे कंप्यूट की लागत GPT-4 के लिए लगभग 7.8 करोड़ डॉलर और Google के Gemini Ultra के लिए लगभग 19.1 करोड़ डॉलर आँकी (AI Index 2024)। शोध संस्था Epoch AI का पेपर बताता है कि सबसे बड़े मॉडलों की ट्रेनिंग लागत 2016 से हर साल 2.4 गुना बढ़ी है और यह रुझान जारी रहा तो 2027 तक सबसे बड़ी ट्रेनिंग रन 1 अरब डॉलर से ज़्यादा की होगी (Cottier आदि)। और यह "एक सफल रन" की बात है — इसके पीछे असफल प्रयोग, डेटा तैयारी, वेतन और इनफ़रेंस इंफ्रास्ट्रक्चर भी जुड़ते हैं। ऊपर से हर GPU हज़ारों डॉलर का है; दसियों हज़ार को महीनों चलाने से बिजली का बिल आसमान छूता है। पैसों की एक दीवार, जिसे "अच्छा आइडिया" या "चतुर एल्गोरिद्म" अकेले कभी पार नहीं कर सकते, फ्रंटियर के दरवाज़े पर खड़ी है। इस अर्थ में "पैसों की लड़ाई" अतिशयोक्ति नहीं, तथ्य है। इसीलिए सबसे आगे केवल वे मुट्ठी भर खिलाड़ी लड़ पाते हैं जिन्होंने भारी पूँजी जुटाई — OpenAI, Google, Anthropic, Meta, xAI।
7. लेकिन सिर्फ पैसे से जीत नहीं होती — दक्षता का उल्टा प्रवाह
पिछले अध्याय ने कहा "पैसे की लड़ाई असली है।" लेकिन कहानी को वहीं खत्म करना 2026 की वास्तविकता को गलत पढ़ना है। यह किसी भी तरह सच नहीं कि "पर्याप्त पैसे से आप जीत जाते हैं" — अगर कुछ है तो, एक उल्टा प्रवाह मजबूत हुआ है। एक ईमानदार उत्तर के रूप में, मुझे यह दूसरा पक्ष भी लिखने दें।
प्रतीकात्मक उदाहरण वे क़दम हैं जिनमें चीन की DeepSeek ने अपेक्षाकृत छोटे बजट में फ्रंटियर के क़रीब पहुँचने वाले मॉडल जारी किए, और कहा गया कि उसने "लागत का फ़र्श रीसेट कर दिया"। वही प्रदर्शन कई गुना सस्ते में पाने की तकनीकें — कुशल आर्किटेक्चर, मिक्सचर ऑफ़ एक्सपर्ट्स (MoE), डिस्टिलेशन (बड़े मॉडल का ज्ञान छोटे मॉडल में डालना) और डेटा गुणवत्ता पर बारीक काम — एक के बाद एक साबित हुईं और "भारी पूँजी = जीत" के सूत्र में दरार डाल दी। उद्योग का ध्यान "बस और बड़ा" से आगे बढ़कर "वही प्रदर्शन सस्ते में और कम बिजली में कैसे दें" तक फैल रहा है।
तो सटीक तस्वीर यह है: "फ्रंटियर के 'शिखर प्रदर्शन' को अपडेट करने की दौड़ पैसे की लड़ाई है। लेकिन 'पर्याप्त-अच्छा प्रदर्शन' सस्ते में देने की दौड़ बुद्धि और दक्षता की प्रतियोगिता है।" अधिकांश मॉडल जो हम रोज़ाना उपयोग करते हैं, बाद वाले से लाभ उठाते हैं, साल-दर-साल सस्ते, तेज़, और अधिक बिजली-कुशल होते जाते हैं। जैसा मुफ्त टियर पर आप कितनी दूर जा सकते हैं में लिखा है, 2026 तक मुफ्त टियर भी एक व्यावहारिक स्तर तक पहुंच गए — दक्षता के उल्टे प्रवाह द्वारा उपयोगकर्ताओं को सौंपा गया फल।
8. आगे क्या — पैसे के बाद "बिजली और भौतिकी" की दीवार
तो क्या आप सिर्फ पैसे का ढेर लगाकर हमेशा के लिए स्केल कर सकते हैं? नहीं — और यही नई दीवार है जो 2026 में दिखाई देने लगी। Epoch AI के विश्लेषण (अगस्त 2024) के अनुसार 2030 तक लगभग 2×10²⁹ FLOP पैमाने की ट्रेनिंग संभवतः मुमकिन होगी, पर सबसे पहले बाधा बनने की संभावना बिजली की है, उसके बाद चिप बनाने की क्षमता की। बाधा अब सिर्फ़ "GPU खरीदने का बजट" नहीं रहती। इसके बजाय, जो रास्ता रोकता है वह है —
- बिजली: क्या आप एक स्थान पर गीगावाट-स्केल बिजली लगातार आपूर्ति कर सकते हैं? अब यह बिजली संयंत्रों और ग्रिडों की समस्या है
- इंटरकनेक्ट: दसियों से सैकड़ों हज़ार GPU को सिंक्रनाइज़ करने की बैंडविड्थ बिना विलंब के। एक विशाल ट्रेनिंग कार्य जो संभाल सकता है उसकी एक भौतिक सीमा है
- डेटा: उच्च-गुणवत्ता वाला ट्रेनिंग टेक्स्ट स्वयं सूख रहा है (मानवता ने कितना अच्छा लेखन उत्पन्न किया है उसकी एक सीमा है)
"पैसे की लड़ाई" के बाद जो आता है वह है "बिजली, भौतिकी, और बुद्धि की लड़ाई।" इसीलिए कंपनियां अब परमाणु ऊर्जा में निवेश, अपनी समर्पित चिप्स विकसित करने, सिंथेटिक डेटा का लाभ उठाने, और कुशल आर्किटेक्चर पर शोध की ओर खिसक रही हैं। वह युग जब आप पैसे फेंककर जीत सकते थे, विडंबना से, एक ऐसे युग में बदल रहा है जब आप अकेले पैसे से जीत नहीं सकते।
सारांश
एक LLM की असली प्रकृति है "एक विशाल पूर्वानुमान उपकरण जहां सैकड़ों अरब से एक खरब से अधिक 'वेट्स' अगले शब्द की संभाव्यता गणना करते रहते हैं।" Transformer का Attention "संदर्भ-निर्भर वेटिंग" संभालता है, और प्री-ट्रेनिंग (जो अधिकांश गणना, बिजली, और पैसा खाती है) साथ ही पोस्ट-ट्रेनिंग (RLHF, तर्क प्रशिक्षण) नॉब्स को बुद्धिमान बनाते हैं। बुद्धिमत्ता कोई जादू नहीं — यह विशाल टेक्स्ट पर "अगले-शब्द-अनुमान" को चरम तक अभ्यास कराने का उपोत्पाद है।
बिजली के मामले में: Google के अपने माप से एक क्वेरी 0.24 Wh (माध्यिका), तीसरे पक्ष के अनुमान से छोटी क्वेरी 0.42 Wh, और सबसे भारी मॉडलों को लंबा प्रॉम्प्ट 29 Wh से ज़्यादा (सबसे कुशल का 65 गुना से अधिक); अकेले GPT-3 की ट्रेनिंग में 1,287 MWh लगे। पूरे समाज के स्तर पर इनफ़रेंस की ओर की खपत जमा होती जाती है, और IEA के अनुसार दुनिया के डेटा सेंटरों की बिजली 2030 तक दोगुनी होकर लगभग 945 TWh हो जाएगी। "सब कुछ सबसे बड़े मॉडल से" बिजली और लागत दोनों में विलासिता है; समझदारी काम के वज़न के हिसाब से मॉडल चुनने में है।
और मुख्य सवाल — "क्या LLM विकास पैसों की लड़ाई है?" जवाब है "फ्रंटियर की प्री-ट्रेनिंग तक सीमित रखें तो मूल रूप से सच" (GPT-4 का कंप्यूट लगभग $78M; 2027 तक प्रति रन $1B से ज़्यादा का अनुमान)। लेकिन "सिर्फ़ पैसे से नहीं जीतते" वाली उलटी धारा भी मज़बूत है (DeepSeek का floor reset, दक्षता, डिस्टिलेशन)। शीर्ष प्रदर्शन आगे बढ़ाना पैसों की लड़ाई है; व्यावहारिक प्रदर्शन सस्ते में पहुँचाना बुद्धि की लड़ाई — यही दो-परत वाला ढाँचा 2026 की हक़ीक़त है। और आगे आती है बिजली, इंटरकनेक्ट और डेटा की कमी की भौतिक दीवार। LLM को "जादुई डिब्बा" नहीं, बल्कि "बिजली से चलने वाली संभावना मशीन" समझें, तो न ज़्यादा उम्मीद बहा ले जाएगी, न ज़्यादा डर। और जानने के लिए LLM क्या है (परिचय), कॉन्टेक्स्ट विंडो और फ़्री टियर तुलना देखें।
अक्सर पूछे जाने वाले प्रश्न
प्रश्न. क्या अधिक पैरामीटर (वेट्स) हमेशा अधिक बुद्धिमान होते हैं?
उत्तर. "बड़ा अधिक बुद्धिमान था" कभी लगभग सार्वभौमिक रूप से सच था, लेकिन 2026 में यह इतना सरल नहीं। समान पैरामीटर संख्या पर भी, प्रदर्शन डेटा गुणवत्ता, पोस्ट-ट्रेनिंग, और आर्किटेक्चरल चतुराई के साथ बहुत भिन्न होता है। छोटे-पर-बुद्धिमान मॉडल (डिस्टिलेशन और कुशल डिज़ाइन के उत्पाद) कई गुना बढ़ गए हैं, और "पैरामीटर संख्या = बुद्धिमत्ता" अब टिकता नहीं। हम "कितने" से अधिक "कैसे प्रशिक्षित किया गया" के युग में प्रवेश कर चुके हैं।
प्रश्न. क्या एक LLM वास्तव में "समझता" है, या यह रटी हुई याददाश्त है?
उत्तर. विशेषज्ञ भी असहमत हैं — यह एक कठिन प्रश्न है। जो निश्चित है वह यह है कि "यह ऐसा सामान्यीकरण दिखाता है जिसे रटी याददाश्त समझा नहीं सकती" (यह उन समस्याओं को हल करता है जो इसकी ट्रेनिंग में नहीं थीं)। क्या वह "मनुष्यों जैसी ही अर्थ-समझ" है, यह एक अलग प्रश्न है जिसका कोई स्पष्ट उत्तर नहीं। व्यावहारिक रूप से, इसे "एक अत्यंत उन्नत पूर्वानुमान उपकरण जो ऐसे व्यवहार करता है मानो समझता हो" मानें। यही ठीक कारण है कि यह इतने आत्मविश्वास से गलती करता है (हैलुसिनेशन)।
प्रश्न. क्या मैं अपना खुद का LLM बना सकता हूं?
उत्तर. "फ्रंटियर-श्रेणी" एक व्यक्ति के लिए असंभव है (इसके लिए सैकड़ों मिलियन डॉलर और दसियों हज़ार GPU चाहिए)। लेकिन एक छोटा मॉडल प्रशिक्षित करना, या एक मौजूदा ओपन मॉडल को फाइन-ट्यून करना, व्यक्तियों के लिए भी संभव है। इसके अलावा, अधिकांश व्यावहारिक ज़रूरतें मौजूदा मॉडलों को API के माध्यम से उपयोग करके पूरी हो जाती हैं। "सब कुछ खुद बनाने" की लगभग कोई ज़रूरत नहीं है।
प्रश्न. क्या AI की बिजली खपत ग्रह के लिए एक गंभीर समस्या है?
उत्तर. यह एक तथ्य है कि पैमाना नज़रअंदाज़-न-किए-जा-सकने योग्य होता जा रहा है (डेटा-सेंटर बिजली दुनिया की लगभग 1.5% है, 2030 तक दोगुनी होने का अनुमान) (IEA)। लेकिन दक्षता भी समानांतर में तीव्रता से आगे बढ़ रही है; "प्रति टोकन बिजली" साल-दर-साल गिर रही है। समस्या "एक क्वेरी की दक्षता" से कम बल्कि "कुल मात्रा × आवृत्ति की विस्फोटक वृद्धि" है। नवीकरणीय ऊर्जा, परमाणु, और समर्पित चिप्स इसे कितना भरपाई कर सकते हैं, यही भविष्य का फोकस है।
प्रश्न. आखिर में, एक उपयोगकर्ता के रूप में क्या जानना मूल्यवान है?
उत्तर. तीन बातें। (1) मॉडल एक "संभाव्यता पूर्वानुमानकर्ता" है, इसलिए यह आत्मविश्वासी लहजे में भी गलती करता है (महत्वपूर्ण जानकारी सत्यापित करें)। (2) भारी प्रश्न बिजली और पैसे में महंगे हैं, इसलिए कार्य के वजन के अनुसार मॉडल चुनें (हल्के काम हल्के मॉडल को)। (3) "शिखर प्रदर्शन" पैसे की लड़ाई है, लेकिन "व्यावहारिक प्रदर्शन" हर साल सस्ता और अधिक बिजली-कुशल होता है (मुफ्त/सस्ते मॉडलों के विकसित होने का इंतज़ार करना भी समझदारी है)। आप तंत्र को जितना अधिक जानते हैं, उतना ही सस्ते और चतुराई से AI का उपयोग कर सकते हैं।