16 जुलाई 2026 को चीन की Moonshot AI ने Kimi K3 जारी किया। कुल 2.8 ट्रिलियन पैरामीटर के साथ इसे अब तक का सबसे बड़ा ओपन मॉडल बताया जा रहा है, और लॉन्च के कुछ ही दिनों में अमेरिकी सेमीकंडक्टर शेयर बिकने लगे तथा व्हाइट हाउस के एक अधिकारी ने सार्वजनिक रूप से कंपनी पर Anthropic के मॉडलों को डिस्टिल करने का आरोप लगा दिया।

दिक्कत यह है कि आँकड़े ही नहीं, नाम तक इस बात पर निर्भर करते हैं कि रिपोर्ट कौन कर रहा है। यह लेख बेंचमार्क प्रकाशित करने वालों, वित्तीय प्रेस, Moonshot की अपनी घोषणाओं और असली Hugging Face पेज को आमने-सामने रखकर जाँचता है, और साथ-साथ बताता चलता है कि कौन-सा आँकड़ा किसने दिया

मुख्य बातें
प्रदर्शन
कुल मिलाकर तीसरा, coding में पहला

लॉन्च के समय Artificial Analysis पर 57 अंक, तीसरा स्थान। Arena.ai के Frontend Code Arena में पहला। पर कुल मिलाकर यह Fable 5 या GPT-5.6 Sol तक नहीं पहुँचता।

कीमत
तुलना बदलते ही नतीजा पलट जाता है

इनपुट $3 और आउटपुट $15 पर यह Opus 4.8 या GPT-5.6 Sol से साफ़ तौर पर सस्ता है। फिर भी यह चीनी मॉडलों में सबसे महँगा है — GLM-5.2 से तीन गुना।

वेट्स का प्रकाशन
Open weights, पर अभी जारी नहीं

प्रकाशन 27 जुलाई को तय है। लिखे जाने तक Hugging Face पर अब भी काउंटडाउन दिख रहा है और लाइसेंस भी घोषित नहीं हुआ है।

1. Kimi K3 है क्या — बुनियादी स्पेसिफिकेशन और कंपनी

Kimi K3 Moonshot AI का फ़्लैगशिप मॉडल है, और इसका API 16 जुलाई 2026 को लाइव हुआ (ITmedia NEWS, OpenRouter और अन्य स्रोतों में यह एक जैसा है)। कंपनी की स्थापना 2023 में हुई थी, Alibaba और Tencent इसमें निवेशक हैं, और Forbes के अनुसार ताज़ा फ़ंडिंग राउंड में इसका मूल्यांकन 20 अरब डॉलर से ऊपर पहुँच गया (पहले 4.3 अरब, फिर 10 अरब डॉलर था), और अप्रैल 2026 तक ARR 200 मिलियन डॉलर था।

2.8T
कुल पैरामीटर। लॉन्च के समय इसे सार्वजनिक रूप से जारी होने वाला अब तक का सबसे बड़ा मॉडल बताया गया
16 / 896
MoE एक्सपर्ट्स। 896 में से हर टोकन पर सिर्फ़ 16 सक्रिय होते हैं (2% से कम एक्टिवेशन)
1M
कॉन्टेक्स्ट लंबाई (ठीक-ठीक कहें तो 1,048,576 टोकन)
~1.4TB
4-bit (MXFP4) पर वेट्स का असली डिस्क साइज़। Moonshot 64 या उससे ज़्यादा एक्सेलेरेटर की सलाह देता है

स्रोत: Moonshot AI की घोषणा (जैसा ITmedia NEWS ने npaka के विश्लेषण के हवाले से बताया) और Northflank का हैंड्स-ऑन लेख। कॉन्टेक्स्ट लंबाई और वेट साइज़ Northflank के मापे हुए आँकड़े हैं।

आर्किटेक्चर में दो नई चीज़ों के अपने नाम हैं। Kimi Delta Attention (KDA) दस लाख टोकन वाली कॉन्टेक्स्ट लंबाई पर डिकोडिंग तेज़ करता है; AINews इसे 6.3 गुना तक तेज़ बताता है। और Attention Residuals (AttnRes) पिछली लेयर्स से ज़रूरी रिप्रेज़ेंटेशन चुन-चुनकर निकालता है; उसी लेख के अनुसार इससे 2% से कम अतिरिक्त लागत पर ट्रेनिंग दक्षता लगभग 25% बेहतर होती है। वेट्स MXFP4 में हैं और एक्टिवेशन MXFP8 में, और क्वांटाइज़ेशन को बाद में जोड़ने के बजाय SFT चरण से आगे की ट्रेनिंग ही क्वांटाइज़ेशन को मानकर चलाई गई।

🟡 एक्टिव पैरामीटर का कोई आधिकारिक आँकड़ा नहीं है। “2.8T-A50B” (यानी लगभग 50 अरब एक्टिव) वाला लेखन चल पड़ा है, लेकिन यह 16/896 अनुपात से निकाला गया अनुमान है, Moonshot का प्रकाशित आँकड़ा नहीं — Northflank साफ़ लिखता है कि Moonshot ने एक्टिव पैरामीटर की संख्या कभी बताई ही नहीं। यह भी याद रखने लायक है कि OpenAI और Anthropic, दोनों में से कोई अपने मॉडलों की पैरामीटर संख्या नहीं बताता, इसलिए “2.8 ट्रिलियन, दुनिया का सबसे बड़ा” सिर्फ़ उन्हीं मॉडलों के बीच सही है जिनका आकार सार्वजनिक है

2. “तीसरा स्थान” का असल मतलब — किस रैंकिंग में, और कब का

यह कहना कि यह “OpenAI और Anthropic के नए मॉडलों के बाद तीसरे स्थान पर है” मोटे तौर पर सही है। पर स्रोत तय किए बिना आगे चलकर आँकड़े मेल खाना बंद कर देते हैं।

आधार है Artificial Analysis का Intelligence Index। 17 जुलाई 2026 के अपने विश्लेषण में इस फ़र्म ने Kimi K3 को 57 अंक दिए, इसे Claude Fable 5 और GPT-5.6 Sol के पीछे तीसरे स्थान पर रखा, और इसकी बुद्धिमत्ता को Opus 4.8 तथा GPT-5.5 के बराबर आँका। तुलना के लिए, उसी इंडेक्स पर GLM-5.2 को 51 और DeepSeek v4 Pro को 44 अंक मिले हैं।

⚠️ वही 57 अंक कहीं तीसरे, कहीं चौथे और कहीं सातवें स्थान के रूप में दर्ज हैं

Artificial Analysis की अपनी घोषणा तीसरा कहती है, Northflank की गिनती 189 मॉडलों में चौथा, और उसी फ़र्म का लाइव पेज 190 में सातवाँ दिखाता है। स्कोर (57) कभी बदला ही नहीं, इसलिए यह फ़र्क इस बात से आता है कि तुलना में क्या-क्या शामिल किया गया — अलग-अलग reasoning effort वाले वेरिएंट अलग गिने गए या नहीं — और गिनती कब की गई। रैंकिंग रोज़ बदलती है, और “तीसरा” को 17 जुलाई 2026 के स्नैपशॉट के रूप में पढ़ना ही सही है

असली काम के ज़्यादा नज़दीक वाले पैमानों पर क्रम और साफ़ हो जाता है। नीचे Artificial Analysis का GDPval-AA v2 है, जो व्यावहारिक टास्क को Elo पैमाने पर आँकता है और इंसानी बेसलाइन 1,000 पर रखता है।

मॉडलGDPval-AA v2 (Elo)कहाँ ठहरता है
Claude Fable 51760पहला
Kimi K31668Fable 5 और Sol के पीछे
Claude Opus 4.81600K3 इससे आगे है
GLM-5.21514पिछली चीनी पीढ़ी में सबसे बेहतर
GPT-5.51494
Kimi K2.6 (पिछली पीढ़ी)1190K3 478 अंक ऊपर है

स्रोत: Artificial Analysis (फ़र्म का 17 जुलाई 2026 को प्रकाशित लेख)। इसके निजी एजेंटिक मूल्यांकन AA-Briefcase पर भी K3 Elo 1547 के साथ Fable 5 के पीछे दूसरे स्थान पर है, जो पिछली पीढ़ी के K2.6 से 732 अंक ऊपर है। AutomationBench-AA पर यह 53% के साथ पहले स्थान पर है।

असल में मायने रखने वाला आँकड़ा “तीसरा” नहीं, बल्कि पिछली पीढ़ी से लगी छलाँग का आकार है। GDPval-AA v2 पर 1190 से 1668, और AA-Briefcase पर +732 अंक। बाज़ार को जिसने हिलाया वह यह तथ्य था कि एक चीनी ओपन मॉडल एक ही पीढ़ी में अमेरिकी फ्रंटियर की मार में आ गया

3. बेंचमार्क किसने मापे — वेंडर के आँकड़े और तीसरे पक्ष के आँकड़े अलग-अलग

बेंचमार्क के आँकड़ों का वज़न इस पर बहुत निर्भर करता है कि उन्हें Moonshot ने खुद मापा या किसी बाहरी पक्ष ने। ITmedia ने दोनों को अलग-अलग रिपोर्ट किया था, और यह लेख भी वही तरीका अपनाता है।

Moonshot का अपना माप (वेंडर-घोषित)
  • Program Bench: K3 77.8% (GPT-5.6 Sol 77.6%, Fable 5 76.8%)
  • SWE Marathon: K3 42.0% (दूसरा, Opus 4.8 40.0% पर)
  • BrowseComp: K3 91.2% (GPT-5.6 Sol 90.4%)

हर जीत मामूली अंतर की है, और सारी की सारी खुद वेंडर की टेस्टिंग से आई हैं — इसी नज़र से पढ़ें।

तीसरे पक्षों का माप
  • Frontend Code Arena (Arena.ai): K3 1679 के साथ पहला (Fable 5 1631, GPT-5.6 Sol 1618)। सात में से छह सबडोमेन में यह आगे है, और K2.6 के 18वें स्थान से 17 पायदान ऊपर आया है
  • GDPval-AA v2: K3 1668 के साथ तीसरा (Artificial Analysis)
  • FrontierSWE: Fable 5 86.6% > K3 81.2%यहाँ K3 हारता है
  • Vals Index: 74.70% (38 मॉडलों में दूसरा, Northflank की गिनती के अनुसार)

ध्यान देने लायक नतीजा यह है कि FrontierSWE पर यह Fable 5 से 5.4 अंक पीछे है। कुछ बेंचमार्क में शीर्ष पर होने वाली सुर्ख़ियाँ सही हैं, पर यह हर मोर्चे पर नहीं जीत रहा। Moonshot खुद मानता है कि कुल मिलाकर वह Fable 5 और GPT-5.6 Sol से पीछे है (इस पर आगे और बात)।

🟡 स्कोरिंग के तरीके पर आपत्ति उठी है। Program Bench के लेखक ने बताया कि Moonshot ने पूरी तरह चल गए प्रोग्रामों की संख्या के बजाय औसत इम्प्लीमेंटेशन दर का इस्तेमाल किया। AI उद्यमी Bindu Reddy ने अलग से तर्क दिया है कि LiveBench जैसे बिना दूषित निजी मूल्यांकनों पर सत्यापन ज़रूरी है। वेंडर द्वारा घोषित मामूली अंतर की जीतों को इसी हिसाब से कम करके पढ़ना चाहिए।

4. कीमत: नतीजा इस पर पलटता है कि आप इसकी तुलना किससे कर रहे हैं

Kimi K3 की कीमत प्रति दस लाख टोकन इनपुट $3.00 और आउटपुट $15.00 है (कैश किए गए इनपुट पर $0.30)। चूँकि तुलना बदलते ही आकलन पूरी तरह उलट जाता है, सिर्फ़ एक पहलू देखने से आप ग़लत नतीजे पर पहुँच जाएँगे।

पश्चिमी फ्रंटियर मॉडलों के मुक़ाबले → साफ़ तौर पर सस्ता
  • Kimi K3: $3 / $15
  • Claude Opus 4.8: $5 / $25
  • GPT-5.6 Sol: $5 / $30

इनपुट पर करीब 40% और आउटपुट पर 40-50% सस्ता। पश्चिमी कीमतों से नीचे फ्रंटियर-स्तर का प्रदर्शन — यही Kimi की लगातार चली आ रही पेशकश रही है, और इस बिंदु पर बात टिकती है

चीनी प्रतिद्वंद्वियों के मुक़ाबले → सबसे महँगा
  • Kimi K3: $3 / $15
  • GLM-5.2: प्रति टास्क लागत K3 की लगभग एक तिहाई
  • DeepSeek V4 Pro: प्रति टास्क लागत K3 की लगभग एक बटा तेईस

Simon Willison इसे कंपनी के पुराने मॉडलों की तुलना में तीखी बढ़ोतरी बताते हुए किसी भी चीनी AI लैब द्वारा जारी सबसे महँगा मॉडल कहते हैं।

एक बात साफ़ रहनी चाहिए: यह दूसरा DeepSeek झटका नहीं है। जनवरी 2025 में DeepSeek इसलिए चौंकाने वाला था कि उसकी कीमत पश्चिम से एक पूरे क्रम नीचे थी। K3 पश्चिमी मॉडलों से 40-50% सस्ता है, पर उसी क्रम में। यह कीमत का विध्वंस नहीं है; यह प्रदर्शन का पकड़ लेना है, थोड़ी छूट के साथ

और आप असल में जो चुकाते हैं वह अकेले प्रति-टोकन दर से तय नहीं होता। Artificial Analysis ने अपना Intelligence Index चलाते समय एक टास्क पूरा करने की असली लागत मापी।

Artificial Analysis का मापा हुआ प्रति टास्क खर्च (इसके Intelligence Index रन के दौरान)

$0.94
Kimi K3
$1.04
GPT-5.6 Sol
$1.80
Claude Opus 4.8
$0.32
GLM-5.2
$0.04
DeepSeek V4 Pro

स्रोत: Artificial Analysis। इसके मापन में Kimi K3 को Intelligence Index पूरा करने के लिए लगभग 13.2 करोड़ आउटपुट टोकन चाहिए थे, जो पिछली पीढ़ी के K2.6 द्वारा खपाए गए करीब 16.6 करोड़ से कम है। दर ऊँची है, पर कम बातूनी reasoning कुल रकम नीचे ले आती है।

सूची कीमत और मापी गई लागत, दोनों में Opus 4.8 से सस्ता, और चीनी मॉडलों में सबसे महँगा — कीमत की पूरी तस्वीर यही है। “चीनी है, इसलिए बेहद सस्ता” वाला ढाँचा यहाँ लागू नहीं होता, और पश्चिम से तुलना करते ही इसे महँगा कहकर ख़ारिज करना भी उतना ही ग़लत है।

5. अभी कोई इसे डाउनलोड नहीं कर सकता — open weights की मौजूदा स्थिति

मीडिया इस पर भी एकमत नहीं कि इसे कहा क्या जाए। VentureBeat सुर्ख़ी में इसे अब तक का सबसे बड़ा “open-source” मॉडल कहता है और SCMP “दुनिया का सबसे बड़ा open-source AI मॉडल”, जबकि Reuters “open-weight” लिखता है। तकनीकी रूप से सही शब्द बाद वाला है, और वजह यह रही।

1. लिखे जाने तक जारी नहीं हुआ

Hugging Face पर moonshotai/Kimi-K3 रिपॉज़िटरी पर अब भी काउंटडाउन दिख रहा है, और एक भी safetensors फ़ाइल सूचीबद्ध नहीं है। Artificial Analysis का मॉडल पेज भी इसे proprietary बताता है। 27 जुलाई 2026 को जाँचा गया — यही वह तय प्रकाशन तारीख़ है, इसलिए आप जब यह पढ़ रहे होंगे तब तक स्थिति बहुत संभव है कि बदल चुकी हो। मौजूदा हालत देखने के लिए ऊपर दिया लिंक खोलें।

2. लाइसेंस भी घोषित नहीं हुआ

17 जुलाई तक Northflank साफ़ कहता है कि लाइसेंस घोषित नहीं है। Hugging Face की एक कम्युनिटी पोस्ट भी इसे वेट्स आने तक TBD बताती है। “Modified MIT” होने का दावा K2 पीढ़ी से निकाला गया दोयम दर्जे का अनुमान है और तय नहीं है।

3. यह मूलतः open source है ही नहीं

जिसका वादा किया गया है वह प्रशिक्षित वेट्स हैं, ट्रेनिंग डेटा या ट्रेनिंग कोड नहीं। इस व्यवस्था का सही नाम open weights है, जो OSI की परिभाषा वाले open source से अलग चीज़ है।

जारी हो जाने के बाद भी यह ऐसी चीज़ नहीं जिसे कोई व्यक्ति अकेले चला सके। 4-bit (MXFP4) पर अकेले वेट्स ही लगभग 1.4TB के होते हैं, और KV कैश तथा एक्टिवेशन की गुंजाइश जोड़ें तो Northflank का अनुमान है कि आपको 80GB GPU वाले आठ-आठ के आठ नोड जितना कुछ चाहिए, जबकि Moonshot 64 या उससे ज़्यादा एक्सेलेरेटर वाले सुपरनोड की सलाह देता है। यह किसी एक H100, H200 या B200 पर नहीं समाता, डिस्ट्रिब्यूटेड क्लस्टर अनिवार्य है, और प्रोडक्शन डिप्लॉयमेंट व्यवहार में सिर्फ़ Linux और NVIDIA तक सीमित है। यह लोकल LLM के लिए हार्डवेयर ज़रूरतों में बताए गए निजी सेटअप जैसा कुछ भी नहीं है।

फिर भी इसका महत्व बहुत बड़ा है। जब फ्रंटियर-स्तर के वेट्स ज़मीन पर उतर आते हैं, तो वे संगठन जो डेटा को अपनी दीवारों से बाहर नहीं जाने दे सकते — नियमन वाले उद्योग, सरकारी निकाय — उन्हें अपने यहाँ चला सकते हैं। बराबरी पर खड़े एक सार्वजनिक मॉडल का बस होना ही बंद APIs की मोलभाव की ताक़त बदल देता है। ओपन मॉडल कैसे चुनें — इसके पीछे की मान्यताओं को इस रिलीज़ के कारण अपडेट करना होगा।

6. अमेरिकी शेयर कितने गिरे — आँकड़े मीडिया के हिसाब से बदलते हैं

लॉन्च वाले हफ़्ते अमेरिकी सेमीकंडक्टर शेयर सचमुच बिके। पर गिरावट के प्रतिशत अलग-अलग मीडिया में मेल नहीं खाते, इसलिए उन्हें यहाँ तय तथ्य के बजाय दायरे के रूप में दिया गया है।

क्या हिलारिपोर्ट की गई हलचलस्रोत और टिप्पणी
Nasdaqशुक्रवार को -1.5% (हफ़्ते का सबसे बुरा सत्र)Yahoo Finance
ताइवान का बाज़ार-6% से ज़्यादावही
जापान का बाज़ार-4% पर बंदवही
सेमीकंडक्टर ETF (SMH)जून के आख़िरी उच्च स्तर से 20% से ज़्यादा नीचेवही
Philadelphia Semiconductor Index (SOX)हफ़्ते भर में -9% से -12.5%⚠️ आँकड़ा मीडिया के हिसाब से बदलता है (“12.5%, 15 महीनों का सबसे बुरा हफ़्ता”, “9% से ज़्यादा”, “करीब 10%, अप्रैल 2025 के बाद सबसे तीखी गिरावट”)
अलग-अलग शेयर (17 जुलाई)AMD -5%, Intel -4%, NVIDIA -3% (सभी इंट्राडे, बाद में सँभल गए)24/7 Wall St.
हांगकांग में सूचीबद्ध चीनी AI कंपनियाँZhipu -28.4%, MiniMax -15.6% (17 जुलाई)Forbes। चीनी कंपनियाँ ज़्यादा बिकीं

तुलना के लिए, जिस DeepSeek झटके का ज़िक्र सब करते हैं — जनवरी 2025 का — उसमें Yahoo Finance के अनुसार अकेले NVIDIA ने एक ही सत्र में करीब 590 अरब डॉलर का बाज़ार मूल्य गँवा दिया था। इस बार NVIDIA की गिरावट इंट्राडे 3% रही — पैमाना पूरी तरह अलग है।

🟡 गिरावट तब से वापस भर चुकी है

Yahoo Finance ने बाद में बताया कि गिरावट पर ख़रीदार आए और चिप शेयरों का नुक़सान घट गया, और Bank of America ने संयत राय दी कि यह महज़ गर्मियों का करेक्शन था। विश्लेषक भी बँटे हुए हैं। Bernstein के Robin Zhu ने K3 को पुष्टि करने वाला बताया — यानी चीनी लैब्स के अंतर पाटने की पहले से ज्ञात प्रवृत्ति का एक और डेटा पॉइंट। इसके उलट Morgan Stanley के Gary Yu ने कहा कि K3 को वैश्विक स्तर पर अच्छी प्रतिक्रिया मिली है और यह दिखाता है कि चीनी LLM मॉडल के आकार, प्रदर्शन और कीमत, तीनों में अमेरिकी अगुवों को पकड़ रहे हैं

यह आँकड़ा भी चल रहा है कि तीन दिनों में AI से जुड़ा 470 अरब डॉलर का मूल्य उड़ गया, लेकिन उसका सिरा एक क्रिप्टो मीडिया की फ़्लैश ख़बर तक जाता है और बड़े वित्तीय प्रेस में उसकी पुष्टि नहीं हो सकी, इसलिए यह लेख उसका इस्तेमाल नहीं करता।

7. डिस्टिलेशन का आरोप, और उसका जवाब

22-23 जुलाई को मामला तकनीक से भू-राजनीति की ओर चला गया। व्हाइट हाउस के विज्ञान एवं प्रौद्योगिकी नीति कार्यालय (OSTP) के निदेशक Michael Kratsios ने Moonshot के बारे में दो दावे किए, जैसा CNBC, The Hill, Yahoo News और अन्य ने बताया।

दावा 1: प्रतिबंधित चिप हासिल करना

कि Moonshot ने NVIDIA GB300 लगे सर्वर हासिल किए और थाईलैंड में भी GB300 तक उसकी पहुँच थी, और संभवतः उनसे अपने मॉडल प्रशिक्षित किए। GB300 Blackwell पीढ़ी का पुर्ज़ा है और इसे चीन में कानूनी रूप से नहीं बेचा जा सकता।

दावा 2: बड़े पैमाने पर डिस्टिलेशन

कि कंपनी ने Anthropic के Fable के ख़िलाफ़ औद्योगिक पैमाने पर गुप्त डिस्टिलेशन किया और पकड़े जाने से बचने के लिए एक समर्पित प्लेटफ़ॉर्म तक बनाया जो पहुँच के तरीके बदलता रहता था। उनके साथ मौजूद Jacob Helberg ने इसे बहुमूल्य अमेरिकी बौद्धिक संपदा की चोरी कहा।

जवाब: तारीख़ें मेल नहीं खातीं

Moonshot के कर्मचारी Randy Xian ने X पर व्यंग्य में जवाब दिया कि Fable 1 जुलाई को सार्वजनिक हुआ और K3 15 जुलाई को आया, यानी हमने 15 दिनों में एक फ्रंटियर मॉडल शून्य से प्रशिक्षित कर डाला — रिकॉर्ड बुक वाली बात है। AI शोधकर्ता Braden Hancock ने TechCrunch से कहा कि Fable 1 जुलाई से ही उपलब्ध था और इतना डेटा डिस्टिल करना, उस पर ट्रेनिंग करना और दो हफ़्तों में रिलीज़ कर देना असंभव है

🔴 कोई सबूत सार्वजनिक नहीं किया गया है। SCMP के अनुसार कई AI विशेषज्ञों ने इस आरोप को राजनीतिक और लापरवाह बताया, और यह भी कहा कि मॉडल के आउटपुट पर वैसे भी कॉपीराइट नहीं होता। Reuters ने राजनयिक केबलों के हवाले से बताया कि विदेश विभाग ने अप्रैल में ही दूतावासों को निर्देश दिया था कि वे मेज़बान सरकारों को चीनी AI कंपनियों द्वारा बौद्धिक संपदा उल्लंघन के बारे में बताएँ, और उनमें Moonshot का नाम भी था। यानी ये आरोप K3 की रिलीज़ से पहले के हैं, और K3 से जुड़ा कोई ख़ास सबूत पेश नहीं किया गया है।

अमेरिकी पक्ष भी इस पर एकजुट नहीं है। NVIDIA ने Anthropic की नाम लेकर आलोचना की, और निर्यात नियंत्रण की खामियों पर Anthropic के दावों के बारे में कहा कि अमेरिकी कंपनियों को मनगढ़ंत कहानियाँ सुनाने के बजाय नवाचार पर ध्यान देना चाहिए और चुनौती का सामना करना चाहिए

8. कमज़ोरियाँ — रफ़्तार, hallucination और Moonshot का अपना आकलन

प्रदर्शन की सुर्ख़ियों के पीछे तीन कमज़ोरियाँ छिप गई हैं जो असली काम में चुभती हैं।

🐢 धीमा (हालाँकि मापन आपस में नहीं मिलते)

Artificial Analysis के लाइव मापन 33 टोकन प्रति सेकंड (190 मॉडलों में 145वाँ) और पहले टोकन तक 177 सेकंड दिखाते हैं। वहीं Northflank 62 टोकन प्रति सेकंड और 1.99 सेकंड बताता है। इस फ़ासले का बड़ा हिस्सा ज़बरदस्त माँग से पैदा हुआ क्षमता का दबाव है — OpenRouter इस मॉडल पर चेतावनी देता है कि अपस्ट्रीम क्षमता सीमित है और 429 एरर बार-बार आ सकते हैं

🎭 Hallucination और बढ़ गया

Artificial Analysis बताता है कि सटीकता तो सुधरी, पर hallucination दर 39% से बढ़कर 51% हो गई। ऊँचा इंटेलिजेंस स्कोर तथ्यपरकता के बराबर नहीं है, और यह ऐसा मॉडल नहीं जिसे बिना जाँच के इस्तेमाल किया जा सके

📝 Moonshot खुद यह अंतर मानता है

कंपनी कहती है कि उसके मॉडल तथा Claude Fable 5 और GPT-5.6 Sol, दोनों के बीच यूज़र अनुभव में साफ़ फ़र्क है। उसका अपना पढ़ना यही है कि बेंचमार्क के मामूली अंतर और रोज़मर्रा के इस्तेमाल में मॉडल कैसा लगता है, ये दो अलग बातें हैं।

9. आज इसे आज़माने के तरीके

वेट्स आने से पहले इसे आज़माने के तीन रास्ते हैं।

रास्ताब्यौराकिनके लिए उपयुक्त
आधिकारिक Kimi ऐप / वेबkimi.com से। मुफ़्त टियर उपलब्ध हैजो बस गुणवत्ता परखना चाहते हैं
Moonshot APIइनपुट $3, आउटपुट $15, कैश हिट पर $0.30 (प्रति दस लाख टोकन)जो टीमें इसे अपने प्रोडक्ट में जोड़ रही हैं
OpenRouter के ज़रिएOpenRouter। वही एंडपॉइंट जिससे आप पहले से दूसरे मॉडल बुलाते हैंजो कई मॉडलों की तुलना कर रहे हैं
सेल्फ़-होस्टिंगवेट्स जारी होने के बाद (27 जुलाई को तय)। सलाह 64 या उससे ज़्यादा एक्सेलेरेटर की है, और vLLM, TensorRT-LLM या SGLang में MoE-समझने वाली शेड्यूलिंग चाहिएवे संगठन जिनका डेटा इमारत से बाहर नहीं जा सकता

पर ध्यान रहे कि जैसा ऊपर बताया गया, क्षमता पर दबाव है और 429 आम हैं। किसी प्रोडक्शन वर्कलोड को थोक में यहाँ ले जाने से पहले व्यावहारिक तरीका — वही सोच जो क्लाउड और लोकल के बीच चुनाव में है — यह है कि फ़ॉलबैक तैयार रखकर ट्रैफ़िक का एक हिस्सा इसकी ओर मोड़ा जाए

10. दावों को भरोसे के स्तर पर छाँटना

✅ प्राथमिक स्रोतों में पुष्ट
  • API 16 जुलाई 2026 को जारी; कुल 2.8 ट्रिलियन पैरामीटर; 896 में से 16 एक्सपर्ट सक्रिय; दस लाख टोकन
  • API कीमत इनपुट $3, आउटपुट $15, कैश $0.30
  • Artificial Analysis Intelligence Index पर 57 अंक
  • GDPval-AA v2 पर 1668 (Fable 5 = 1760, Opus 4.8 = 1600)
  • Frontend Code Arena पर 1679 के साथ पहला स्थान
  • प्रति टास्क लागत $0.94, जो Opus 4.8 के $1.80 से कम है
  • Hallucination दर 39% से बढ़कर 51%
🟡 स्रोत आपस में नहीं मिलते या मान बदलता रहता है
  • Intelligence Index पर इसका स्थान (तीसरा, चौथा और सातवाँ, तीनों चलन में हैं)
  • SOX की साप्ताहिक गिरावट (-9% से -12.5%)
  • आउटपुट रफ़्तार (33 tok/s बनाम 62 tok/s)
  • “लगभग 50 अरब” एक्टिव पैरामीटर (अनुमान है, आधिकारिक आँकड़ा नहीं)
  • “Modified MIT” लाइसेंस (K2 से निकाला गया अनुमान)
🔴 अनिश्चित, कोई सबूत नहीं
  • डिस्टिलेशन का आरोप — कोई सार्वजनिक सबूत नहीं, और शोधकर्ता समय-सीमा के आधार पर इसे ख़ारिज करते हैं
  • प्रतिबंधित चिप तक पहुँच — एक अमेरिकी अधिकारी का दावा; न Moonshot का औपचारिक जवाब सार्वजनिक है, न कोई सबूत
  • वेट्स और लाइसेंस — लिखे जाने तक जारी नहीं (27 जुलाई को तय)
  • “तीन दिनों में 470 अरब डॉलर का AI मूल्य ख़त्म” — बड़े वित्तीय प्रेस में इसकी पुष्टि नहीं हो सकी

संक्षेप में, Kimi K3 की असली कहानी यह तथ्य है कि एक चीनी ओपन मॉडल फ्रंटियर की पहुँच में आ गया है। यह वहाँ पश्चिमी फ्रंटियर कीमतों से 40-50% नीचे पहुँचा, हालाँकि एक पूरे क्रम की छूट के साथ नहीं; कुल मिलाकर यह Fable 5 और GPT-5.6 Sol से पीछे है; यह धीमा है; और यह पहले से ज़्यादा hallucinate करता है। इसके बावजूद इसने GDPval-AA v2 को एक ही पीढ़ी में 478 अंक ऊपर उठाया और अपने वेट्स प्रकाशित करने का वादा किया — और बाज़ार ने इसी पर प्रतिक्रिया दी।

FAQ

Q1. क्या Kimi K3 open source है?

नहीं। जिसकी योजना है वह प्रशिक्षित वेट्स का प्रकाशन है, यानी open weights, न कि ट्रेनिंग डेटा या ट्रेनिंग कोड का प्रकाशन। इसके ऊपर से, लिखे जाने तक वेट्स खुद भी अभी जारी नहीं हुए हैं — Hugging Face पर moonshotai/Kimi-K3 पेज अब भी काउंटडाउन दिखा रहा है और कोई लाइसेंस घोषित नहीं हुआ है। प्रकाशन 27 जुलाई 2026 को तय है।

Q2. क्या यह सचमुच बेंचमार्क में तीसरे स्थान पर है?

आधार है Artificial Analysis के Intelligence Index पर 57 अंक और तीसरा स्थान, Claude Fable 5 और GPT-5.6 Sol के पीछे, और 17 जुलाई 2026 तक यह पढ़ना सही है। पर उन्हीं 57 अंकों को चौथे और सातवें स्थान पर रखने वाली गिनतियाँ भी मौजूद हैं, क्योंकि नतीजा इस पर बदलता है कि तुलना का दायरा कैसे खींचा गया और गिनती कब की गई। “तीसरा” को एक स्नैपशॉट की तरह पढ़ें। coding पर केंद्रित Frontend Code Arena में यह पहले स्थान पर है, जबकि FrontierSWE पर यह Fable 5 से हार जाता है

Q3. क्या यह सचमुच सस्ता है?

तुलना बदलते ही यह पलट जाता है। प्रति दस लाख टोकन इनपुट $3 और आउटपुट $15 पर यह Claude Opus 4.8 ($5/$25) या GPT-5.6 Sol ($5/$30) के मुक़ाबले इनपुट पर करीब 40% और आउटपुट पर 40-50% सस्ता है, इसलिए पश्चिमी फ्रंटियर के सामने यह साफ़ तौर पर सस्ता है। मापी गई लागत भी यही कहती है: प्रति टास्क $0.94, जबकि Opus 4.8 के लिए $1.80 (Artificial Analysis)। लेकिन चीनी प्रतिद्वंद्वियों के सामने यह पूरे समूह में सबसे महँगा है — GLM-5.2 से लगभग तीन गुना और DeepSeek V4 Pro से 23 गुना। Simon Willison इसे किसी भी चीनी AI लैब द्वारा जारी सबसे महँगा मॉडल कहते हैं। यह DeepSeek झटके वाली पूरे क्रम की छूट नहीं है।

Q4. अमेरिकी शेयर क्यों गिरे?

इस चिंता के कारण कि सस्ते चीनी मॉडल महँगे कंप्यूट की माँग घटा देंगे। लॉन्च वाले हफ़्ते Nasdaq शुक्रवार को 1.5% गिरा, ताइवान 6% से ज़्यादा, जापान 4%, और सेमीकंडक्टर ETF (SMH) जून के आख़िरी उच्च स्तर से 20% से ज़्यादा नीचे था। फिर भी, चिप शेयरों का नुक़सान बाद में घट गया क्योंकि गिरावट पर ख़रीदार आ गए, और Bank of America ने इसे महज़ गर्मियों का करेक्शन कहा। पैमाना DeepSeek झटके से अलग है, जब जनवरी 2025 में अकेले NVIDIA ने एक ही दिन में करीब 590 अरब डॉलर गँवाए थे।

Q5. क्या यह सच है कि उन्होंने Anthropic का मॉडल चुराया?

कोई सबूत सार्वजनिक नहीं किया गया है। व्हाइट हाउस OSTP के निदेशक Michael Kratsios ने Anthropic के Fable के औद्योगिक पैमाने पर डिस्टिलेशन का आरोप लगाया, पर Moonshot इससे इनकार करता है और 1 जुलाई को Fable के सार्वजनिक होने तथा 15 जुलाई को K3 के लॉन्च के बीच के 15 दिनों की ओर इशारा करता है। AI शोधकर्ता Braden Hancock ने भी TechCrunch से कहा कि दो हफ़्तों में डिस्टिल करना, ट्रेनिंग करना और रिलीज़ कर देना असंभव है। SCMP के अनुसार कई विशेषज्ञों ने इस आरोप की राजनीतिक कहकर आलोचना की। इस समय कोई नतीजा निकालने लायक सामग्री मौजूद नहीं है।

Q6. क्या मैं इसे अपने PC पर चला सकता हूँ?

नहीं। 4-bit क्वांटाइज़ेशन (MXFP4) पर भी अकेले वेट्स ही करीब 1.4TB के हैं, जो किसी एक H100, H200 या B200 पर नहीं समाएँगे। Northflank का अनुमान 80GB GPU वाले आठ-आठ के आठ नोड जितना कुछ है, और Moonshot 64 या उससे ज़्यादा एक्सेलेरेटर की सलाह देता है। प्रोडक्शन इस्तेमाल के लिए macOS और Windows दायरे से बाहर हैं; मान्यता Linux और NVIDIA की है। यह खुद लोकल LLM चलाने से बिल्कुल अलग पैमाने की बात है।

Q7. क्या इसे प्रोडक्शन में इस्तेमाल करना चाहिए?

तुरंत पूरी तरह इस पर चले जाना ठीक नहीं, तीन वजहों से: (1) क्षमता पर दबाव है और 429 एरर बार-बार आ सकते हैं (यह OpenRouter की अपनी चेतावनी है); (2) hallucination दर 39% से बढ़कर 51% हो गई है; और (3) Moonshot खुद Fable 5 तथा GPT-5.6 Sol के मुक़ाबले यूज़र अनुभव का साफ़ अंतर मानता है। व्यावहारिक रास्ता यह है कि फ़ॉलबैक तैयार रखें और जिस क्षेत्र में यह बेहतर है वहाँ ट्रैफ़िक का एक हिस्सा इससे निकालें, जैसे फ्रंट-एंड कोड जनरेशन, और फिर तुलना करें।

Q8. पिछली पीढ़ी K2.6 से यह कितना बेहतर है?

छलाँग का आकार ही यहाँ असली कहानी है। Artificial Analysis के GDPval-AA v2 पर यह 1190 से 1668 पहुँचा, यानी 478 अंकों की बढ़त, और फ़र्म के निजी एजेंटिक मूल्यांकन AA-Briefcase पर इसने 732 अंक जोड़े। Arena.ai के Frontend Code Arena पर यह 18वें से पहले स्थान पर, यानी 17 पायदान ऊपर चढ़ा। बाज़ार ने निरपेक्ष रैंकिंग से कम और एक ही पीढ़ी में कितनी दूरी पाटी गई इस पर ज़्यादा प्रतिक्रिया दी।

संबंधित लेख