सामग्री पर जाएँ
AI टूल्स

अन्य AI टूल्स: रिव्यू और तुलना गाइड

उभरते AI टूल्स की खोज करें और तुलना करें। रिव्यू, फीचर्स और प्रैक्टिकल गाइड।

48 लेख

लेखों को क्रमबद्ध करें

Kimi K3 क्या है? 2.8T पैरामीटर वाला वह मॉडल जिस पर “तीसरे स्थान” का दावा है — कीमत, open weights और बाज़ार पर असर

Kimi K3 क्या है? 2.8T पैरामीटर वाला वह मॉडल जिस पर “तीसरे स्थान” का दावा है — कीमत, open weights और बाज़ार पर असर

16 जुलाई 2026 को Moonshot AI ने Kimi K3 जारी किया, जिसमें कुल 2.8 ट्रिलियन पैरामीटर हैं। अमेरिकी सेमीकंडक्टर शेयर बिके, और बात यहाँ तक बढ़ी कि व्हाइट हाउस के एक अधिकारी ने कंपनी पर नाम लेकर Anthropic के मॉडलों को डिस्टिल करने का आरोप लगाया। चूँकि आँकड़े और नाम तक स्रोत के हिसाब से बदल जाते हैं, यह लेख बेंचमार्क प्रकाशित करने वालों, वित्तीय प्रेस, Moonshot की अपनी घोषणाओं और असली Hugging Face पेज को आमने-सामने रखकर बताता है कि कौन-सा आँकड़ा किसने दिया। प्रदर्शन में इसे Artificial Analysis Intelligence Index पर 57 अंक और तीसरा स्थान मिला (17 जुलाई 2026 तक, हालाँकि उन्हीं 57 अंकों को चौथे और सातवें स्थान पर रखने वाली गिनतियाँ भी मौजूद हैं)। ज़्यादा व्यावहारिक पैमाने GDPval-AA v2 पर K3 1668 पर है, जबकि Fable 5 1760 और Opus 4.8 1600 पर — यह पिछली पीढ़ी के K2.6 के 1190 से 478 अंकों की छलाँग है, और बाज़ार को निरपेक्ष रैंक ने नहीं, इसी अंतर के पटने ने हिलाया। coding में इसने Arena.ai के Frontend Code Arena पर 1679 के साथ पहला स्थान लिया (Fable 5 1631 पर), फिर भी FrontierSWE पर यह 81.2% के साथ Fable 5 के 86.6% से हार जाता है। कीमत का नतीजा तुलना बदलते ही पलटता है: इनपुट $3 और आउटपुट $15, Claude Opus 4.8 ($5/$25) या GPT-5.6 Sol ($5/$30) के मुक़ाबले इनपुट पर करीब 40% और आउटपुट पर 40-50% सस्ता है, और प्रति टास्क मापी गई लागत $0.94 Opus 4.8 के $1.80 से कम बैठती है। पर चीनी प्रतिद्वंद्वियों के सामने यह पूरे समूह में सबसे महँगा है — GLM-5.2 से लगभग तीन गुना और DeepSeek V4 Pro से 23 गुना — इसलिए यह DeepSeek झटके वाली पूरे क्रम की छूट नहीं है। वेट्स को लेकर मीडिया “open source” (VentureBeat, SCMP) और Reuters के “open weight” में बँटा है, और सही शब्द बाद वाला है। वेट्स तय कार्यक्रम के मुताबिक 27 जुलाई 2026 को आ गए और Hugging Face से बिना किसी एक्सेस रिक्वेस्ट के खींचे जा सकते हैं (96 safetensors शार्ड)। उनके साथ प्रकाशित लाइसेंस Moonshot का अपना “Kimi K3 License” है: MIT-जैसे आधार पर दो शर्तें — 2 करोड़ डॉलर से ऊपर के राजस्व वाले Model as a Service कारोबार के लिए अलग करार, और 10 करोड़ से ज़्यादा मासिक सक्रिय यूज़र वाले प्रोडक्ट के UI में “Kimi K3” का प्रमुख उल्लेख। चूँकि इजाज़त इस्तेमाल करने वाले के आकार के साथ बदल जाती है, यह OSI परिभाषा के तहत open source नहीं है, और नाम को लेकर चली आ रही बहस अब लाइसेंस के पाठ से ही तय हो गई। बाज़ारों में Nasdaq शुक्रवार को 1.5% गिरा, ताइवान 6% से ज़्यादा, जापान 4%, और सेमीकंडक्टर ETF (SMH) जून के आख़िरी उच्च स्तर से 20% से ज़्यादा नीचे आया, पर SOX की साप्ताहिक गिरावट मीडिया के हिसाब से -9% से -12.5% तक कहीं भी बताई गई है, और बाद में गिरावट पर ख़रीदार आने से नुक़सान घट गया। डिस्टिलेशन के आरोप को शोधकर्ता समय-सीमा के आधार पर ख़ारिज करते हैं — 1 जुलाई को Fable के सार्वजनिक होने और 15 जुलाई को K3 के लॉन्च के बीच 15 दिन — और कोई सबूत सार्वजनिक नहीं हुआ है। रफ़्तार (मापन 33 से 62 टोकन प्रति सेकंड तक, और OpenRouter क्षमता के दबाव से बार-बार 429 आने की चेतावनी देता है), hallucination दर का 39% से 51% होना, और Moonshot द्वारा खुद माना गया यूज़र अनुभव का साफ़ अंतर — इन सबको भरोसे के स्पष्ट लेबल के साथ शामिल किया गया है।

Claude Opus 5: Opus 4.8 और Fable 5 से क्या अलग है

Claude Opus 5: Opus 4.8 और Fable 5 से क्या अलग है

Anthropic ने 24 जुलाई 2026 को Claude Opus 5 रिलीज़ किया, और उसका अपना डॉक्यूमेंटेशन इसे Opus 4.8 का क्रमिक सुधार नहीं बल्कि एक step-change बताता है — फिर भी कीमत टस से मस नहीं हुई: प्रति मिलियन टोकन $5 input / $25 output, यानी फ्लैगशिप Fable 5 ($10 / $50) से ठीक आधी। यह लेख आधिकारिक अनाउंसमेंट और डॉक्यूमेंटेशन को कई रिपोर्ट्स से मिलाकर जाँचता है और सामने रखता है: मुख्य स्पेसिफिकेशन (claude-opus-5, 1M context जो डिफ़ॉल्ट भी है और अधिकतम भी, 128K अधिकतम output, knowledge cutoff मई 2026), कीमत के साथ cache दरें और fast mode (2x कीमत पर करीब 2.5x रफ़्तार, सिर्फ़ Claude API), तथा बेंचमार्क (Anthropic अपने टेक्स्ट में खुद कहता है कि Frontier-Bench पर स्कोर Opus 4.8 से दोगुने से ज़्यादा है, CursorBench 3.2 पर यह Fable 5 के 0.5% के भीतर रहता है, ARC-AGI 3 पर दूसरे नंबर से तीन गुना है, और OSWorld 2.0 पर Fable 5 को करीब एक-तिहाई लागत में पीछे छोड़ता है; चार्ट से पढ़े गए मीडिया-स्रोत आँकड़ों में Frontier-Bench 43.3%, ARC-AGI-3 30.2%, GDPval-AA 1,861 और OSWorld 70.6% शामिल हैं)। साथ ही वे जगहें भी, जहाँ यह अब भी पीछे है (DeepSWE v1.1 पर 68.8% बनाम GPT-5.6 Sol का 72.7%, आक्रामक सुरक्षा और लंबी अवधि की बायोलॉजी रिसर्च जहाँ Mythos 5 आगे है, और वे सेटिंग्स जहाँ max effort का स्कोर नीची सेटिंग्स से कम रहा)। इसके बाद लेख API के दो breaking changes समझाता है (thinking अब डिफ़ॉल्ट रूप से ऑन है, इसलिए कसे हुए max_tokens बजट पर जवाब बीच में कट जाता है; thinking बंद करना सिर्फ़ effort high या उससे नीचे पर ही चलता है, xhigh या max पर 400 error मिलता है), पाँच effort लेवल में से चुनाव कैसे करें, नए फीचर जैसे बातचीत के बीच tool बदलना, 512 टोकन की नई cache न्यूनतम सीमा और default fallback मोड, और स्वभाव में आया बदलाव — लंबे जवाब, ज़्यादा टिप्पणी, ज़्यादा delegation और बिना कहे खुद जाँच — इस नियम के साथ कि माइग्रेशन में आप prompt का टेक्स्ट जोड़ते नहीं, हटाते हैं। अंत में यह बताता है कि किसे अभी माइग्रेट करना चाहिए, साथ में छह कदमों की माइग्रेशन चेकलिस्ट।

GPT-Live क्या है——ChatGPT का "सुनते हुए बोलने वाला" फुल-डुप्लेक्स वॉइस मॉडल पूरी व्याख्या

GPT-Live क्या है——ChatGPT का "सुनते हुए बोलने वाला" फुल-डुप्लेक्स वॉइस मॉडल पूरी व्याख्या

GPT-Live, OpenAI का वह नया वॉइस मॉडल है जो ChatGPT की आवाज़ को टर्न-प्रणाली से बदलकर फुल-डुप्लेक्स (सुनते हुए बोलना) बना देता है (8 जुलाई 2026, पूरी दुनिया में)। यह हुंकारा भरता है, बीच की रुकावट संभालता है, सोचने वाली खामोशी में नहीं टोकता और लेटेंसी <250ms रखता है; गहरा तर्क व सर्च पर्दे के पीछे GPT-5.5 को सौंपता है। Free में GPT-Live-1 mini और Go/Plus/Pro में GPT-Live-1 डिफ़ॉल्ट है। यह लेख इसकी बनावट, Advanced Voice Mode से अंतर, सीमाएँ और API की स्थिति समझाता है।

AI ड्रॉइंग के 10 मज़ेदार आइडिया: फ़ोटो और टेढ़ी लकीरों को मुफ़्त में कला बनाएँ (2026)

AI ड्रॉइंग के 10 मज़ेदार आइडिया: फ़ोटो और टेढ़ी लकीरों को मुफ़्त में कला बनाएँ (2026)

जिन लोगों ने "मुझसे तो बनता ही नहीं" कहकर ड्रॉइंग छोड़ दी थी, असल में AI ड्रॉइंग उन्हीं के लिए एक खेल का मैदान है। अपने दिमाग की तस्वीर को शब्दों में उतारिए और वह कला बन जाती है; फ़ोन की कोई फ़ोटो या बच्चे की टेढ़ी लकीरें पलक झपकते ही एक कलाकृति बन जाती हैं। यह न कोई टूल की तुलना है, न कोई गंभीर कोर्स — यह अकेले या परिवार के साथ मज़े के आइडिया की एक किताब है। शुरुआत के मुफ़्त टूल (ChatGPT, Google Gemini, Microsoft Copilot, Canva) से लेकर 10 आइडिया (① टेढ़ी लकीर से कला ② फ़ोटो को नए अंदाज़ में ③ अपना किरदार अलग-अलग दृश्यों में ④ बच्चे की ड्रॉइंग को कहानी-किताब का पन्ना ⑤ अपने इमोजी ⑥ चार-पैनल कॉमिक ⑦ अगर-तो वाले मेल ⑧ अपने रंग भरने के पन्ने ⑨ कमरे का मेकओवर ⑩ ड्रॉइंग मुक़ाबला), बेहतर तस्वीरें पाने की तरकीबें, और खेलने से पहले तीन बातें (दूसरों के चेहरे न इस्तेमाल करें, अधिकार और कमर्शियल इस्तेमाल जाँचें, AI-निर्मित होने का ठप्पा लगाएँ)।

Ollama संपूर्ण गाइड: लोकल LLM को आसानी से चलाएँ [2026]

Ollama संपूर्ण गाइड: लोकल LLM को आसानी से चलाएँ [2026]

लोकल LLM शुरू करने के लिए सबसे भरोसेमंद टूल Ollama है, जो झंझट भरी सेटअप खुद संभालकर सिर्फ़ एक कमांड से मॉडल डाउनलोड और चैट करने देता है। यह शुरुआती-अनुकूल गाइड इंस्टॉलेशन (Win/Mac/Linux), ज़रूरी कमांड, आकार के अनुसार मॉडल चुनना, Open WebUI जैसे GUI, लोकल API और OpenAI-संगत एंडपॉइंट से ऐप्स में एम्बेड करना, Modelfile व एनवायरनमेंट वेरिएबल से कस्टमाइज़ेशन, और आम समस्याओं के समाधान तक—शुरुआत से अंत तक सब कुछ समझाती है।

सबसे अच्छे लोकल LLM मॉडल की तुलना: कौन-सा चुनें? [2026]

सबसे अच्छे लोकल LLM मॉडल की तुलना: कौन-सा चुनें? [2026]

local LLM चलाने का माहौल तैयार होने के बाद सबसे बड़ा सवाल यही है कि कौन-सा मॉडल इंस्टॉल करें। यह लेख 2026 के मुख्य मॉडलों को डेवलपर, मूल देश, उपयोग, साइज़ और लाइसेंस के आधार पर व्यवस्थित करता है—Qwen, Llama, Gemma, DeepSeek, Mistral, Phi जैसी वैश्विक फैमिली से लेकर Sarvam/OpenHathi, Krutrim, BharatGPT और AI4Bharat के Airavata जैसे भारतीय/हिंदी मॉडल तक—ताकि आप अपने VRAM, भाषा और काम के अनुसार सही "पहला मॉडल" चुन सकें।

Local LLM के लिए हार्डवेयर: VRAM गाइड [2026]

Local LLM के लिए हार्डवेयर: VRAM गाइड [2026]

Local LLM शुरू करने पर पहली चिंता यही होती है कि क्या यह मेरे PC पर चलेगा, और इसका जवाब लगभग पूरी तरह VRAM पर निर्भर करता है। यह लेख मॉडल आकार (7B से 70B+ तक) के अनुसार ज़रूरी VRAM की त्वरित तालिका, "आकार × ~0.6" का आसान फ़ॉर्मूला, क्वांटाइज़ेशन (Q4/Q8/FP16) का असर, और कॉन्टेक्स्ट लंबाई से बढ़ने वाले KV cache के जाल को सरल भाषा में समझाता है। साथ ही RTX 3060, 4090, 5090 और Apple Mac पर वास्तविक गति, और एंट्री से लेकर गंभीर उपयोग तक तीन बजट टियर के सुझाए गए बिल्ड भी दिए गए हैं, ताकि एक शुरुआती भी आत्मविश्वास से सही मशीन चुन सके।

लोकल LLM बनाम क्लाउड LLM: अंतर और प्रदर्शन का फ़र्क़ [2026]

लोकल LLM बनाम क्लाउड LLM: अंतर और प्रदर्शन का फ़र्क़ [2026]

अपने PC पर चलने वाला लोकल LLM और Claude, ChatGPT, Gemini जैसे क्लाउड LLM — दोनों "LLM" हैं, पर प्रदर्शन, लागत, प्राइवेसी और मेहनत में इनका अंतर साफ़ है। यह लेख सात पहलुओं पर दोनों को आमने-सामने रखता है और ईमानदारी से बताता है कि 2026 तक "प्रदर्शन का अंतर" कितना घट चुका है (रोज़मर्रा के कामों में लोकल अब व्यवहारिक है, पर सबसे कठिन 10–20% में क्लाउड आगे है)। साथ ही लागत, हार्डवेयर ज़रूरतें और एक सरल निर्णय गाइड दी गई है — और बताया गया है कि ज़्यादातर लोगों के लिए हाइब्रिड ही सबसे अच्छा जवाब क्यों है।

LoRA क्या है? थोड़ी-सी अतिरिक्त ट्रेनिंग से AI को कस्टमाइज़ करना

LoRA क्या है? थोड़ी-सी अतिरिक्त ट्रेनिंग से AI को कस्टमाइज़ करना

किसी विशाल AI को शुरू से दोबारा ट्रेन करना बहुत महँगा है, पर आप इसे बस अपने लिए थोड़ा बदलना चाहते हैं; LoRA (Low-Rank Adaptation) मूल मॉडल को फ्रीज़ करके और सिर्फ़ एक छोटे adapter को ट्रेन करके यह इच्छा पूरी करती है, जिससे ट्रेन होने वाले parameters लगभग 90% घट जाते हैं। LoRA fine-tuning को नाटकीय रूप से सस्ता और तेज़ बनाती है, और Stable Diffusion जैसी इमेज जनरेशन में किरदार या स्टाइल जोड़ने वाली छोटी फ़ाइल के रूप में बेहद लोकप्रिय है। यह लेख इसे एक पैच की उपमा से समझाता है। LoRA, parameter-efficient fine-tuning (PEFT) की अग्रणी तकनीक है: विशाल मूल weights को frozen रखें, हर लेयर में एक छोटा matrix डालें, और सिर्फ़ उसी को ट्रेन करें (W = W0 + BA)। फ़ायदे: ~90% कम params (GPT-3 पैमाने पर 10,000x कम), कम GPU मेमोरी (~3x कम), तेज़ व सस्ती ट्रेनिंग, merge के बाद कोई inference latency नहीं, और कम overfitting। इसकी सबसे बड़ी ताक़त बदलने योग्य adapters हैं: एक साझा बेस रखें और हर उपयोग के लिए few-MB LoRA फ़ाइलें तुरंत बदलें। QLoRA, quantization को मिलाकर 4-bit बेस पर LoRA ट्रेन करती है, मानक LoRA से ~4x कम मेमोरी में, जिससे उपभोक्ता GPU पर भी विशाल मॉडल fine-tune होते हैं। बनाम full fine-tuning, LoRA अक्सर काफ़ी होती है। बेस बनाए रखें, उसे छोटे पैमाने पर स्वाद दें।

Quantization क्या है? AI Models को छोटा करके अपनी मशीन पर चलाना

Quantization क्या है? AI Models को छोटा करके अपनी मशीन पर चलाना

एक विशाल 70B model डेटा-सेंटर के GPU rack के बजाय घर के एक gaming PC पर चल सके, यह quantization से संभव होता है, जो model के weights की numerical precision घटाकर आकार और memory नाटकीय रूप से कम करता है। जहाँ model distillation ज्ञान को एक अलग छोटे model में ले जाती है, वहीं quantization उसी model को हल्का बनाता है। यह लेख इसे फोटो-compression की उपमा से समझाता है। quantization, FP16/FP32 दशमलव के रूप में संग्रहित weights को INT8 (8-bit) या INT4 (4-bit) integers से बदलता है, प्रति weight bytes घटाते हुए (FP32=4, INT8=1, INT4=0.5); RAW फोटो को JPEG में compress करने जैसा, आप थोड़ी precision की कुर्बानी देकर बड़ी कमी पाते हैं, और हैरानी इस बात की है कि आप कितना कम खोते हैं। memory पर, 4-bit, FP16 की लगभग एक-चौथाई लेता है: एक 70B model ~140GB से ~35GB तक गिरता है, और एक 8B model 4-bit पर ~4.5-5GB का होता है, जो midrange 8GB-VRAM GPU में लोकल उपयोग के लिए समाता है (LLMs का लोकतंत्रीकरण)। accuracy पर, INT8 लगभग बिना नुकसान है और INT4 सामान्य Q&A/सामान्य-ज्ञान tasks पर 4% से कम घटता है, पर गणित, code generation और कठिन reasoning के लिए नुकसान ज़्यादा साफ़ दिखता है (यह perplexity में थोड़ी वृद्धि के रूप में दिखता है), इसलिए task के लिए bit-width चुनें। मुख्य तरीके: GPTQ (सटीक 4-bit का अग्रदूत), AWQ (सबसे महत्वपूर्ण ~1% weights सुरक्षित रखता है, अक्सर 1-2% अधिक सटीक और तेज़), GGUF (llama.cpp/Ollama format, Q2_K-Q8_0, CPU+GPU hybrid, लोकल के लिए), और QLoRA (4-bit base साथ LoRA, consumer-GPU fine-tuning के लिए)। यह distillation (एक अलग छोटे model में जाना) और fine-tuning (task ज्ञान जोड़ना) से अलग है, और तीनों आमतौर पर मिलाए जाते हैं (एक distilled model को quantize करें; एक quantized base को fine-tune करें)। शुरू करने के लिए, एक command में Ollama के साथ एक GGUF model चलाएँ, VRAM के अनुसार Q4/Q8 चुनें, और code या सटीक गणित के लिए INT4 से बचें। अधिकांश प्रमुख model पहले से quantized आते हैं, इसलिए आप बस उन्हें download करके इस्तेमाल करते हैं। समझदारी बनाए रखें, सिर्फ़ वज़न घटाएँ। आँकड़े सार्वजनिक सामग्री से उद्धृत, दिशा-सूचक।

Model Distillation क्या है? बड़ी AI का ज्ञान छोटी AI में ले जाना

Model Distillation क्या है? बड़ी AI का ज्ञान छोटी AI में ले जाना

एक विशाल, उच्च-प्रदर्शन वाली AI स्मार्ट तो है पर भारी और महंगी; model distillation (knowledge distillation) इसे एक बड़े teacher model का ज्ञान छोटे student model में स्थानांतरित करके हल करता है, और teacher के प्रदर्शन का 95%+ उसके दसवें हिस्से के आकार और गति पर बनाए रखता है। यह लेख इसे teacher-student की उपमा से समझाता है। कुंजी soft labels हैं: साधारण प्रशिक्षण केवल "उत्तर बिल्ली है" सिखाता है (hard label), जबकि distillation teacher का पूरा संभाव्यता वितरण जैसे "90% बिल्ली, 8% कुत्ता, 2% लोमड़ी" सौंपता है, जिसकी झिझक की मात्रा समृद्ध जानकारी रखती है; एक temperature पैरामीटर संभावनाओं को नरम कर सूक्ष्म संबंध उजागर करता है (वास्तविक उदाहरण: GPT-4o mini, GPT-4o से distilled)। फायदे: तेज़ और सस्ता, ~10x ज़्यादा कॉम्पैक्ट, 95%+ प्रदर्शन बनाए रखते हुए, edge पर चलता है, विशेषीकरण में मज़बूत। दो तरीके: white-box (weights और आंतरिक प्रतिनिधित्वों तक पूरी पहुँच, गहरा स्थानांतरण; अपने या OSS models के लिए) और black-box (केवल आउटपुट/API responses दिखते हैं; किसी दूसरी कंपनी की API को teacher बनाना terms का उल्लंघन कर सकता है)। यह quantization (उसी model की weight precision संपीड़ित करना) और fine-tuning (मौजूदा model को किसी task के लिए आगे प्रशिक्षित करना) से अलग है — distillation ज्ञान को एक अलग छोटे model में ले जाता है, और तीनों को मिलाया जा सकता है। कानूनी/ToS हकीकत 2026 का बड़ा मुद्दा था: तकनीक वैध है, पर OpenAI, Anthropic, Mistral और xAI में anti-competitive distillation खंड हैं जो आउटपुट का उपयोग प्रतिस्पर्धी models बनाने के लिए करना प्रतिबंधित करते हैं, इसलिए किसी प्रतिबंधित API से प्रतिस्पर्धी distill करना terms का उल्लंघन कर सकता है। OpenAI बनाम DeepSeek विवाद (OpenAI ने आरोप लगाया कि DeepSeek से जुड़ी accounts ने प्रतिबंध दरकिनार कर distillation के लिए आउटपुट हासिल किए, जबकि DeepSeek की terms कथित तौर पर अपने आउटपुट distill करने की अनुमति देती हैं) दिखाता है कि आकलन इस पर निर्भर है कि किसकी API terms लागू होती हैं, और Claude Fable 5/Mythos 5 कथित तौर पर distillation-चिह्नित काम पर responses सीमित करते हैं। सुझाव: teacher के रूप में अपना या लाइसेंस प्राप्त OSS model इस्तेमाल करें, commercial API इस्तेमाल करने से पहले anti-distillation खंड जाँचें, और तय करें कि उपयोग "प्रतिस्पर्धी model विकसित करना" तो नहीं है। स्मार्टनेस बड़े model से, संचालन छोटे से — पर आप teacher किसे चुनते हैं यह तकनीकी और कानूनी रूप से परिणाम बदल देता है। आँकड़े सार्वजनिक सामग्री से उद्धृत, दिशात्मक।

फाइन-ट्यूनिंग क्या है? फाइन-ट्यूनिंग बनाम RAG, LoRA/QLoRA, और कब इस्तेमाल करें — शुरुआती गाइड

फाइन-ट्यूनिंग क्या है? फाइन-ट्यूनिंग बनाम RAG, LoRA/QLoRA, और कब इस्तेमाल करें — शुरुआती गाइड

जब आप AI को अपनी कंपनी के लिए कस्टमाइज़ करना चाहते हैं, तब फाइन-ट्यूनिंग एक विकल्प होता है — पर बिना सोचे-समझे इसमें कूदना महँगा है और गलत होना आसान। यह शुरुआती गाइड फाइन-ट्यूनिंग को समझाता है: पहले से प्रशिक्षित एक बेस मॉडल को लेना, उसे अपने उपयोग के अनुरूप डेटा पर और आगे प्रशिक्षित करना, और उसके वेट फिर से लिखकर "व्यवहार" (कंपनी की शैली, आउटपुट फ़ॉर्मैट, क्षेत्र की शब्दावली) को मॉडल के भीतर ही बैठाकर एक विशेषीकृत मॉडल में ढालना। फाइन-ट्यूनिंग व्यवहार बदलने में अच्छी है पर ताज़ा जानकारी याद रखने में कमज़ोर, इसलिए नियम है "तथ्य और ज्ञान → RAG, व्यक्तित्व और साँचा → फाइन-ट्यूनिंग, पहले प्रॉम्प्ट।" जैसा विशेषज्ञ कहते हैं, "हमें फाइन-ट्यूनिंग चाहिए" के लगभग 80% मामले बेहतर रिट्रीवल (RAG) या प्रॉम्प्टिंग से हल हो जाते हैं, इसलिए क्रम मायने रखता है। लेख समझाता है कि फाइन-ट्यूनिंग क्या है (नए कर्मचारी के प्रशिक्षण का उदाहरण), यह किसमें अच्छी और किसमें कमज़ोर है, फाइन-ट्यूनिंग बनाम RAG बनाम प्रॉम्प्टिंग की तुलना तालिका, मुख्य तरीके (full फाइन-ट्यूनिंग, LoRA, और QLoRA — 4-bit क्वांटाइज़ेशन जो शुरुआती के लिए काफ़ी हल्का है), क्या ज़रूरी है (कसौटी के तौर पर 500+ उच्च-गुणवत्ता वाले उदाहरण, जहाँ डेटा तैयार करना ही असली काम है; लागत $5,000 से $50,000 से अधिक तक, OpenAI की फाइन-ट्यूनिंग लगभग $25–$100 प्रति मिलियन ट्रेनिंग टोकन; OpenAI, Unsloth, Axolotl और Hugging Face जैसे टूल), और शुरू करने का क्रम। फाइन-ट्यूनिंग आखिरी उपाय है।