विषय-सूची
- 1. 2026 में AI केवल "टेक्स्ट" नहीं रहा — MMMU-Pro 80% पार
- 2. मल्टीमॉडल AI क्या है? — टेक्स्ट से आगे समझने वाला AI
- 3. Stitched बनाम Native — आर्किटेक्चर का विभाजन
- 4. हर मोडैलिटी की ताकत किससे तय होती है
- 5. महत्वपूर्ण बेंचमार्क — MMMU / Video-MMMU / OCR / Audio
- 6. उपयोग के अनुसार — किस आधार पर चुनें
- 7. कठोर सीमाएँ — उपयोग करें, आँख मूँदकर भरोसा न करें
- सारांश
- FAQ
मल्टीमॉडल-AI बेंचमार्क MMMU-Pro (छवियों, चार्ट और आरेखों में बहु-विषयक समझ) पर शीर्ष मॉडल अब 80% से ऊपर हैं। OpenAI ने अप्रैल 2026 में GPT-5.5 के लिए 81.2% (बिना टूल) बताया, और Google ने फ़रवरी में Gemini 3.1 Pro के लिए 80.5%। जब 2023 के अंत में मूल MMMU जारी हुआ, तब GPT-4V ने लगभग 56% पाया था। MMMU-Pro, MMMU का कठिन संस्करण है (सितंबर 2024 में जारी), इसलिए दोनों एक ही पैमाना नहीं हैं — फिर भी मॉडल अब कठिन संस्करण पर 80% पार कर रहे हैं। "केवल-टेक्स्ट" AI का युग वास्तव में समाप्त हो चुका है।
बदलाव सिर्फ़ स्कोर में नहीं आया। इन मॉडलों को बनाने का तरीका भी Stitched से Native की ओर खिसक रहा है। पहले आम बात थी कि अलग-अलग मॉडलों को जोड़कर काम चलाया जाए: एक आवाज़ को टेक्स्ट में बदले, दूसरा टेक्स्ट पर सोचे, तीसरा जवाब पढ़कर सुनाए (OpenAI बताता है कि GPT-4o से पहले ChatGPT का वॉइस मोड ठीक ऐसी ही तीन मॉडलों की कड़ी था)। आज ऐसे डिज़ाइन फैल गए हैं जिनमें एक ही मॉडल कई तरह के इनपुट सीधे लेता है, और Gemini तथा Qwen की Omni श्रृंखला टेक्स्ट, छवि, ऑडियो और वीडियो — चारों — एक ही मॉडल में संभालती हैं। लेकिन हर कंपनी ने यह रास्ता नहीं अपनाया: सितंबर 2026 तक OpenAI का फ़्लैगशिप मॉडल और Claude का API इनपुट में केवल टेक्स्ट और छवि लेते हैं, और OpenAI में आवाज़ का काम gpt-realtime जैसे अलग वॉइस मॉडल करते हैं (§4 की तालिका देखें)।
मेरा दृष्टिकोण पहले बता दूँ: मल्टीमॉडल "अच्छा होता तो" से बढ़कर "इसके बिना शुरुआत ही नहीं" बन गया है। एरर स्क्रीन की फोटो खींचकर AI से तुरंत हल करवाना, PDF का स्क्रीनशॉट लेकर मुख्य बिंदु निकालना, YouTube वीडियो को ट्रांसक्राइब और सारांशित करना — ये अब 2026 की AI दक्षता का आधार हैं। यह लेख परिभाषा, stitched और native मल्टीमॉडल का अंतर, हर मोडैलिटी की ताकत तकनीकी रूप से किससे तय होती है, उपयोग के अनुसार किस आधार पर चुनें, बेंचमार्क और सीमाओं को कवर करता है। इसका केंद्र किसी खास मॉडल की रैंकिंग नहीं, बल्कि फैसला लेने का तरीका है — इसलिए पीढ़ी बदलने पर भी यह काम आता रहेगा।
टेक्स्ट, छवि, ऑडियो और वीडियो संभालने वाला AI
— इनमें से कितना एक ही मॉडल ले सकता है, यह मॉडल पर निर्भर है
MMMU-Pro पर शीर्ष मॉडल अब 80% के दायरे में पहुँच गए हैं (कंपनियों के आँकड़े और स्रोत §1 में)।
"छवि बस एक बोनस" वाला दौर खत्म हो गया। लेकिन चारों इनपुट एक ही मॉडल में केवल कुछ मॉडल लेते हैं — जैसे Gemini और Qwen की Omni श्रृंखला; OpenAI का फ़्लैगशिप मॉडल और Claude का API छवि तक ही जाते हैं (सितंबर 2026 तक)।
1. 2026 में AI केवल "टेक्स्ट" नहीं रहा — MMMU-Pro 80% पार
"मल्टीमॉडल" 2024 में ट्रेंड बनना शुरू हुआ, लेकिन उससे ठीक पहले के मॉडल छवियों को केवल एक अतिरिक्त सुविधा के रूप में पढ़ सकते थे: 2023 के अंत में जब MMMU (बहु-विषयक मल्टीमॉडल समझ) जारी हुआ, तब सबसे आगे GPT-4V भी लगभग 56% पर था। विशेषज्ञ ज्ञान वाले छवि प्रश्नों पर माध्यिका मानव विशेषज्ञ (82.6%) बहुत दूर था।
2026 बिल्कुल अलग दिखता है। MMMU-Pro (MMMU का कठिन संस्करण) के प्रकाशित स्कोर:
- GPT-5.5: 81.2% (बिना टूल), 83.2% (टूल के साथ) — OpenAI की घोषणा, अप्रैल 2026
- Gemini 3.1 Pro: 80.5% (बिना टूल) — Google DeepMind का मूल्यांकन दस्तावेज़, फ़रवरी 2026
- Qwen3.5-Omni-Plus: 73.9% — Qwen टीम की तकनीकी रिपोर्ट, अप्रैल 2026
- संदर्भ के लिए: मानव विशेषज्ञ (माध्यिका) 80.8% — MMMU का आधिकारिक लीडरबोर्ड
"80% पार करने का मतलब है कि बेंचमार्क संतृप्त हो रहा है" — यही 2026 की वास्तविकता है। अंतर अब वीडियो समझ (Video-MMMU), OCR-घने दस्तावेज़ और संयुक्त ऑडियो-विज़ुअल तर्क में स्थानांतरित हो गया है — कठिन क्षेत्र। MMMU benchmark पर सार्वजनिक लीडरबोर्ड कोई भी तुलना कर सकता है।
2. मल्टीमॉडल AI क्या है? — टेक्स्ट से आगे समझने वाला AI
परिभाषा: "ऐसा AI मॉडल जो टेक्स्ट के अलावा दूसरे इनपुट (छवि, ऑडियो, वीडियो आदि) भी ले सके"। यह कितना आगे जाता है, यह मॉडल पर निर्भर है — टेक्स्ट और छवि तक से लेकर एक ही मॉडल में ऑडियो और वीडियो तक (नीचे का शब्दावली बॉक्स देखें)।
पारंपरिक AI सिंगल-मोडैलिटी था: GPT-3 टेक्स्ट संभालता था; Whisper केवल वाक्-से-टेक्स्ट; Stable Diffusion केवल टेक्स्ट-से-छवि। इन्हें मिलाने के लिए पाइपलाइन चाहिए थी जहाँ एक मॉडल का आउटपुट दूसरे को मिले, और हर पास पर जानकारी खोती थी।
मल्टीमॉडल AI में एक ही मॉडल एक साथ कई इनपुट देखकर जवाब देता है। जैसे: "इस स्क्रीनशॉट के एरर मैसेज (छवि) और मेरे सवाल (टेक्स्ट) को साथ देखकर कारण बताओ" — यह एक ही API कॉल में हो जाता है।
3. Stitched बनाम Native — आर्किटेक्चर का विभाजन
बनावट का फ़र्क समझ लें तो हर मॉडल की ताकत पढ़ना आसान हो जाता है। मोटे तौर पर इन्हें बनाने के दो तरीके हैं।
Stitched बनाम Native
- ट्रांसक्रिप्शन, सोचना और बोलना — अलग-अलग मॉडल करते हैं
- मॉडल आपस में टेक्स्ट के रूप में काम सौंपते हैं
- लहजा, कई वक्ता और पृष्ठभूमि की आवाज़ें रास्ते में छूट जाती हैं
- हर अतिरिक्त चरण देरी बढ़ाता है
- जैसे: GPT-4o से पहले ChatGPT का वॉइस मोड (तीन जुड़े हुए मॉडल)
- एक ही मॉडल कई इनपुट सीधे लेता है
- इनपुट से आउटपुट तक एक ही नेटवर्क में
- मॉडल लहजा और दृश्य-ध्वनि का मेल सीधे देख पाता है
- बीच के हस्तांतरण में जानकारी कम खोती है
- जैसे: GPT-4o (मई 2024), Google का Gemini, Qwen की Omni श्रृंखला
Native में "वीडियो की आवाज़ और दृश्य को साथ समझना" एक ही मॉडल के भीतर हो जाता है।
Stitched में बीच का पड़ाव आता है — जैसे पहले आवाज़ को टेक्स्ट में बदलना — और वहीं जानकारी छूट जाती है।
ठोस उदाहरण: "YouTube का खाना पकाने का वीडियो देखकर रेसिपी निकालो"। Stitched: ऑडियो → Whisper से टेक्स्ट → GPT से सारांश; वीडियो → फ्रेम निकालो → अलग से विश्लेषण। कई चरण। जो Native मॉडल वीडियो सीधे लेता है (जैसे Gemini), वह एक ही API कॉल में पूरी वीडियो फ़ाइल लेकर सीधे रेसिपी लौटा देता है, और बोले गए विवरण को दिख रही क्रिया से मॉडल के भीतर ही जोड़ लेता है।
4. हर मोडैलिटी की ताकत किससे तय होती है
कौन-सा मॉडल सबसे आगे है, यह हर पीढ़ी में बदल जाता है। वीडियो की अग्रता हो या आवाज़ का अनुभव — छह महीने में क्रम पलटता रहा है। इसलिए याद रखने लायक चीज़ क्रम नहीं, बल्कि यह है कि हर मोडैलिटी की ताकत तकनीकी रूप से किससे तय होती है। यह पकड़ में आ जाए तो नया मॉडल आने पर आप खुद फैसला कर सकेंगे।
①फ्रेम सैंपलिंग घनत्व (कितने सेकंड में एक फ्रेम) ②लंबी अवधि थाम सकने वाली कॉन्टेक्स्ट लंबाई ③समय-क्रम का कारण-तर्क। एक घंटे का वीडियो 1 fps पर भी 3,600 फ्रेम बनता है — टोकन में गिनें तो कुछ लाख। वीडियो क्षमता और कॉन्टेक्स्ट लंबाई आपस में बँधी हैं — इसीलिए वीडियो में मजबूत मॉडलों की विंडो बिना अपवाद बड़ी होती है।
①राउंड-ट्रिप विलंब ②फुल-डुप्लेक्स है या नहीं (जब वह बोल रहा हो, तब बीच में टोक सकते हैं या नहीं) ③स्वर-लय और भाव का बचा रहना। §3 वाला stitched बनाम native अंतर सबसे ज़्यादा यहीं दिखता है — आवाज़ को पहले टेक्स्ट में उतारकर फिर संसाधित करने वाली संरचना में विलंब और सूचना-क्षय संरचनात्मक रूप से अनिवार्य हैं।
①OCR सटीकता ②लेआउट का बचा रहना (तालिकाएँ, कॉलम, फुटनोट बिखरते तो नहीं) ③निर्देशांक लौटा सकता है या नहीं। ③ पर नज़र कम जाती है, पर स्क्रीन चलाने वाले एजेंट के लिए यही निर्णायक है। बटन है, इतना जानना काफ़ी नहीं — कहाँ है यह न बता सके तो क्लिक हो ही नहीं सकता।
①omnimodal है, या हर मोडैलिटी के अलग मॉडलों का जोड़ ②वेट की उपलब्धता और लाइसेंस। ओपन कहलाने के बावजूद व्यावसायिक उपयोग पर शर्तें लगाने वाले लाइसेंस असामान्य नहीं हैं। खुद चलाने का इरादा हो तो बेंचमार्क से पहले यही पढ़ें।
नीचे की तालिका मई 2026 तक हर कंपनी ने समर्थित इनपुट के बारे में जो प्रकाशित किया था, उसके आधार पर हमारा मोटा आकलन है — यह बेंचमार्क का माप नहीं है। क्रम बदलता रहता है, इसलिए आज कौन-से मॉडल चुने जा सकते हैं यह मौजूदा मॉडलों की सूची में, और सीधी तुलना GPT-5.6 Sol बनाम Gemini तुलना लेख या हर कंपनी के मॉडल कार्ड में देखें। यहाँ इसे इस उदाहरण की तरह पढ़ें कि ऊपर के चार अक्ष असल में अंतर बनकर कैसे दिखते हैं।
| मॉडल | टेक्स्ट | छवि | ऑडियो | वीडियो | ताकत |
|---|---|---|---|---|---|
| GPT-5.5 | ◎ | ◎ | × | × | टेक्स्ट + छवि पढ़ता है; API ऑडियो और वीडियो इनपुट नहीं लेता |
| Gemini 3.1 Pro | ◎ | ◎ | ◎ | ◎◎ | वीडियो समझ में मज़बूत, लंबे वीडियो भी संभालता है |
| Claude Opus 4.7 | ◎ | ◎ | × | × | UI/दस्तावेज़ पार्सिंग; एजेंट कार्यभार के लिए मजबूत |
| Qwen3.5-Omni | ◎ | ◎ | ◎ | ◎ | omnimodal: एक ही मॉडल चारों इनपुट लेता है। API से उपलब्ध (सितंबर 2026 तक वेट्स प्रकाशित नहीं) |
| DeepSeek V4-Pro | ◎ | × | × | × | केवल टेक्स्ट, सस्ता (छवि इनपुट अगस्त 2026 से Flash श्रृंखला में आया) |
× = वह API उस इनपुट को स्वीकार नहीं करता (ऐप की वॉइस चैट जैसी सुविधाएँ, जो अलग मॉडल या ट्रांसक्रिप्शन से होकर जाती हैं, नहीं गिनी गईं)। इनपुट का समर्थन प्राथमिक स्रोतों में जाँचा गया: OpenAI का GPT-5.5 मॉडल पेज, Google का Gemini 3.1 Pro मॉडल पेज, Anthropic का Claude Opus 4.7 मॉडल पेज, Qwen3.5-Omni की तकनीकी रिपोर्ट, DeepSeek का API परिवर्तन-लॉग (सितंबर 2026 में जाँचा)।
इस तालिका से जो पढ़ा जा सकता है वह यह है कि चारों अक्ष अलग-अलग काम कर रहे हैं:
- वीडियो में अंतर लंबाई से खुलता है: Video-MME 11 सेकंड से 1 घंटे तक के वीडियो को छोटे, मध्यम और लंबे — तीन वर्गों में अंक देता है, और इसके आधिकारिक लीडरबोर्ड पर हर मॉडल लंबे वर्ग में कम अंक पाता है। लंबी अवधि पर ऊपर वाला ① फ्रेम घनत्व और ② कॉन्टेक्स्ट लंबाई अड़चन बन जाते हैं। यदि आप केवल छोटे वीडियो संभालते हैं तो लंबे वीडियो का क्रम आपके लिए बेमानी है
- आवाज़ का फैसला आर्किटेक्चर करता है: तेज़ प्रतिक्रिया और भाव पढ़ना — दोनों एक साथ कहीं आसानी से तब बनते हैं जब आवाज़ को टेक्स्ट में उतारे बिना native रूप से संभाला जाए (बीच में ट्रांसक्रिप्शन अपना इंतज़ार जोड़ता है और लहजा मिटा देता है)। कैटलॉग की तालिका में ऑडियो ◎ की कतार लगी हो, फिर भी रास्ता ट्रांसक्रिप्शन से होकर जाता हो तो अनुभव बिल्कुल अलग निकलता है
- दस्तावेज़ पार्सिंग निर्देशांक पर बँटती है: PDF और UI स्क्रीनशॉट का पठन Cursor जैसे एजेंट कार्यभार में इसलिए सराहा जाता है क्योंकि वहाँ सटीकता से ज़्यादा स्थिति लौटा पाना काम आता है
- ओपन-वेट का मूल्य omnimodal होने पर बदलता है: जो एक ही मॉडल में सारी मोडैलिटी संभाल ले, उसका संचालन हर मोडैलिटी के लिए अलग मॉडल जोड़ने वाली संरचना से कहीं हल्का पड़ता है। वाणिज्यिक फ्रंटियर के करीब की गुणवत्ता अब नाटकीय रूप से कम लागत पर आ रही है
5. महत्वपूर्ण बेंचमार्क — MMMU / Video-MMMU / OCR / Audio
यदि आप नहीं जानते कि प्रत्येक बेंचमार्क वास्तव में क्या परखता है तो आप गलत मॉडल चुनेंगे। 2026 में जानने योग्य चार बेंचमार्क:
मल्टीमॉडल AI को हम किससे मापते हैं
"उच्च MMMU = हर चीज़ में अच्छा" गलत है।
वीडियो के लिए Video-MMMU देखें; दस्तावेज़ों के लिए DocVQA; ऑडियो के लिए AudioBench — अन्यथा चयन में चूक होगी।
6. उपयोग के अनुसार — किस आधार पर चुनें
हर उपयोग के लिए फैसले से पहले क्या जाँचें, यह पाँच पैटर्न में। यहाँ मॉडलों के नाम नहीं गिनाए — यह हिस्सा छह महीने में पुराना पड़ जाता। इसके बजाय इसे ऐसा रूप दिया है कि कोई भी नया मॉडल आए, परखने का तरीका वही रहे।
- ① फोन-फोटो Q&A / निदान (भोजन फोटो → पोषण, एरर स्क्रीन → फिक्स, उत्पाद फोटो → खोज)
→ लगभग कोई भी काफ़ी है। फ्री प्लान पर दो आज़माएँ और जिसके जवाब की बारीकी भाए, वही चुनें। इस उपयोग में मॉडलों का आपसी फ़र्क सबसे कम है, इसलिए चयन में समय लगाने का मोल नहीं - ② PDF / दस्तावेज़ पार्सिंग (रसीदें, अनुबंध, तकनीकी विनिर्देश, पेपर)
→ अपने असली दस्तावेज़ पर आज़माएँ। परखने के तीन बिंदु: तालिकाएँ बिखरती तो नहीं, कॉलम पढ़ने के क्रम में चलते हैं या नहीं, और खराब स्कैन वाले पन्ने पर टिकता है या नहीं। कैटलॉग की OCR सटीकता देखने से तेज़ है अपना सबसे गंदा पन्ना उसमें डाल देना - ③ वीडियो ट्रांसक्रिप्शन और सारांश (मीटिंग, व्याख्यान, YouTube)
→ वीडियो की लंबाई पर शाखा बनती है। दस मिनट तक फ़र्क कम है। एक घंटे का वीडियो पूरा डालना हो तो §4 का ① फ्रेम घनत्व और ② कॉन्टेक्स्ट लंबाई काम करने लगते हैं, इसलिए लंबे वीडियो का बेंचमार्क और विंडो का आकार जाँचें - ④ आवाज़ वार्तालाप / दुभाषिया / साक्षात्कार अभ्यास
→ पहले यह जाँचें कि प्रोसेसिंग native है या नहीं। ऑडियो समर्थन लिखा होने पर भी रास्ता ट्रांसक्रिप्शन से जाता हो तो विलंब और स्वर-लय की कमी सामने आएगी। परखना आसान है — जब वह बोल रहा हो, तभी बीच में टोककर देखें - ⑤ लागत-पहले / थोक प्रसंस्करण
→ केवल इकाई मूल्य नहीं, बैच छूट और खुद चलाना व्यावहारिक है या नहीं, यह देखें। ओपन-वेट चुनना हो तो प्रदर्शन से पहले लाइसेंस की व्यावसायिक शर्तें पढ़ें
7. कठोर सीमाएँ — उपयोग करें, आँख मूँदकर भरोसा न करें
मल्टीमॉडल AI मजबूत है, लेकिन यदि अनदेखा किया गया तो तीन सीमाएँ आपको नुकसान पहुँचाएँगी।
सीमा ①: फोटो-व्युत्पन्न "अनुमानों" को तथ्य के रूप में न पढ़ें
"इस रसीद की राशि का OCR करें" पूछना सरल लगता है, लेकिन यदि छवि कम-रिज़ॉल्यूशन, धुँधली या तिरछी है, तो AI विश्वसनीय दिखने वाले नंबर गढ़ देता है। MMMU-Pro पर 80% से ऊपर वाला मॉडल भी लगभग हर पाँच में से एक उत्तर गलत देता है। राशि, तिथियाँ, विशिष्ट संज्ञाएँ — हमेशा मनुष्य से दोबारा जाँच कराएँ। विशेषकर कानूनी, वित्तीय, स्वास्थ्य सेवा में।
सीमा ②: वीडियो की सटीकता बीच में गिर जाती है
वीडियो बेंचमार्क में सबसे आगे रहने वाले मॉडल के लिए भी, 1-घंटे के वीडियो के बीच से जानकारी निकालना कठिन है — कॉन्टेक्स्ट-विंडो समस्या जैसी ही "Lost in the Middle" समस्या। मुख्य खंडों के लिए, टाइमस्टैम्प निर्दिष्ट करें: "30:00–35:00 खंड का विशेष रूप से विश्लेषण करें" कहीं बेहतर परिणाम देता है।
सीमा ③: ऑडियो बोली और शब्दजाल में संघर्ष करता है
मानक अंग्रेज़ी / जापानी भाषण सटीक है, लेकिन क्षेत्रीय बोलियाँ, विशेषज्ञ शब्दावली, बहु-वक्ता क्रॉसटॉक और शोर वातावरण त्रुटियाँ बढ़ाते हैं। मीटिंग रिकॉर्ड और अन्य उच्च-दाँव उपयोग के लिए, विशेषज्ञ उपकरणों (Otter.ai, Notta आदि) के साथ जोड़ें, या AI को भेजने से पहले ऑडियो साफ करें।
सारांश
पुनरावलोकन:
- 2026: GPT-5.5 और Gemini 3.1 Pro ने MMMU-Pro पर 80% पार किया (कंपनियों के आँकड़े; मान और स्रोत §1 में)। मल्टीमॉडल AI "अच्छा होता तो" से बढ़कर "अवश्य चाहिए" बन गया है
- बनावट अलग-अलग मॉडलों की कड़ी (Stitched) से ऐसे Native मॉडलों की ओर खिसक रही है जो कई इनपुट सीधे लेते हैं। पर चारों इनपुट एक ही मॉडल में लेना Gemini, Qwen की Omni श्रृंखला और कुछ ही दूसरों तक सीमित है; OpenAI का फ़्लैगशिप मॉडल और Claude का API छवि तक ही जाते हैं (सितंबर 2026 तक)
- ताकत चार अक्षों से तय होती है: वीडियो = फ्रेम घनत्व और कॉन्टेक्स्ट लंबाई / ऑडियो = native प्रोसेसिंग या ट्रांसक्रिप्शन का रास्ता / दस्तावेज़ = निर्देशांक लौटा सकता है या नहीं / ओपन-वेट = omnimodal है या नहीं, और लाइसेंस। क्रम बदलता रहेगा, ये अक्ष नहीं
- बेंचमार्क: MMMU-Pro / Video-MMMU / DocVQA / AudioBench — चुनने से पहले चारों अक्षों की जाँच करें
- उपयोग के अनुसार चुनने का सबसे छोटा रास्ता है अपनी असली सामग्री पर आज़माना — खासकर PDF के लिए अपना सबसे गंदा पन्ना डाल देना किसी भी स्पेक शीट से तेज़ है। एक मुख्य + उसकी कमज़ोरी भरने वाला दूसरा — यही जोड़ी टिकाऊ रहती है
- तीन सीमाएँ: निम्न-गुणवत्ता छवि अनुमान / मध्य-वीडियो सटीकता गिरावट / बोली एवं शब्दजाल ऑडियो। महत्वपूर्ण आउटपुट दोबारा जाँचें
2026 में "सिर्फ़ टेक्स्ट" से पूरा होने वाला AI का काम तेज़ी से घट रहा है। फ़ोन की तस्वीरें, मीटिंग की रिकॉर्डिंग, YouTube वीडियो, PDF — इन्हें AI को सौंपना अब आम बात है (कोई एक मॉडल सब ले सकता है या नहीं, यह मॉडल पर निर्भर है)। मल्टीमॉडल का इस्तेमाल जानना अब "एक उपयोगी सुविधा" नहीं, बल्कि 2026 की AI साक्षरता की न्यूनतम रेखा है। आज अपने फ़ोन की एक तस्वीर AI को देकर शुरुआत करें — इतना काफ़ी है।
FAQ
हाँ। ChatGPT का मुफ्त प्लान (छवि इनपुट उपलब्ध), Google AI Studio (मुफ्त टियर, वीडियो शामिल), Claude.ai का मुफ्त प्लान (छवियाँ उपलब्ध) — सब आज़माने देते हैं। ध्यान दें: Google AI Studio और Gemini API के मुफ़्त स्तर में आपका भेजा गया इनपुट Google उत्पादों को बेहतर बनाने में इस्तेमाल होता है और मानव समीक्षक उसे पढ़ सकते हैं (Gemini API की शर्तें), इसलिए संवेदनशील छवियाँ और ऑडियो न डालें। लेकिन मुफ्त प्लान को मिलने वाले मॉडल हर पीढ़ी के साथ बदलते रहते हैं, इसलिए मॉडल के नाम याद रखने के बजाय हर सेवा की स्क्रीन पर देखें कि वह कौन-से इनपुट (छवि, ऑडियो, वीडियो) लेती है और रोज़ कितना उपयोग किया जा सकता है। वॉइस बातचीत और लंबे वीडियो की सीमा जैसी कुछ सुविधाएँ पेड टियर में बढ़ जाती हैं। देखें मुफ्त AI टूल्स गाइड।
अलग शब्द हैं। Midjourney और Stable Diffusion जैसे उपकरण टेक्स्ट से छवियाँ बनाने में विशेषज्ञ हैं — एकमार्गी टेक्स्ट→छवि प्रवाह। मल्टीमॉडल AI छवियों (और अन्य मोडैलिटी) को इनपुट के रूप में समझने को संदर्भित करता है। ChatGPT और Gemini जैसी कुछ सेवाएँ दोनों करती हैं, लेकिन समझना और बनाना अलग-अलग क्षमताएँ हैं — एक में अच्छा होना दूसरे में अच्छा होने की गारंटी नहीं, इसलिए अपने उपयोग के हिसाब से दोनों को अलग-अलग आज़माएँ। देखें छवि-निर्माण AI टूल्स तुलना।
Gemini API (ai.google.dev का डेवलपर API) वीडियो को सीधे इनपुट के रूप में लेता है। लंबे या बार-बार इस्तेमाल होने वाले वीडियो के लिए अनुशंसित तरीका है Files API से अपलोड करके फ़ाइल का संदर्भ देना; छोटे वीडियो सीधे अनुरोध में जोड़े जा सकते हैं। सार्वजनिक YouTube URL देना, या Cloud Storage की फ़ाइलों को Files API में रजिस्टर करना भी संभव है (Google के डेवलपर दस्तावेज़)। Google Cloud के Vertex AI से उपयोग करने पर fileData में Cloud Storage का gs:// URI दिया जाता है (Google Cloud दस्तावेज़)। 26 सितंबर 2026 तक OpenAI और Claude के API वीडियो सीधे नहीं लेते (OpenAI के GPT-6 Astra के मॉडल पेज पर Video "Not supported" है; Anthropic के अनुसार सभी मौजूदा मॉडल टेक्स्ट और छवि इनपुट लेते हैं)। दोनों में तरीका यही है कि वीडियो से फ्रेम निकालकर छवियों के रूप में भेजें — OpenAI की आधिकारिक Cookbook में इसका उदाहरण है। देखें AI API शुरुआती गाइड।
छवियाँ, ऑडियो और वीडियो अक्सर संवेदनशील डेटा रखते हैं। प्रशिक्षण में उपयोग व्यक्तिगत ऐप और API/व्यावसायिक योजनाओं में अलग-अलग है। व्यक्तिगत ऐप में ChatGPT आपकी बातचीत प्रशिक्षण में इस्तेमाल कर सकता है, और सेटिंग में "Improve the model for everyone" बंद करके इसे रोका जा सकता है (OpenAI सहायता केंद्र)। Claude (Free, Pro, Max) आपकी चैट तभी प्रशिक्षण में लेता है जब आप अनुमति दें (Anthropic प्राइवेसी सेंटर)। Gemini ऐप "Keep Activity" चालू रहने तक आपकी चैट को — मानवीय समीक्षा सहित — Google सेवाओं को बेहतर बनाने में इस्तेमाल करते हैं, और इसे बंद करने पर यह रुक जाता है (Gemini ऐप्स प्राइवेसी हब)। इसके उलट, OpenAI का API और ChatGPT Business/Enterprise, Anthropic का API और व्यावसायिक योजनाएँ, और Gemini API का सशुल्क स्तर डिफ़ॉल्ट रूप से प्रशिक्षण में इस्तेमाल नहीं होते (व्यवसायों के लिए Anthropic का विवरण, Gemini API की शर्तें)। अपवाद: Gemini API के मुफ़्त स्तर और Google AI Studio में आपके इनपुट Google उत्पादों को बेहतर बनाने में इस्तेमाल होते हैं। चेहरे, चिकित्सीय छवियाँ या आंतरिक दस्तावेज़ हों तो सशुल्क API या व्यावसायिक योजना चुनें। पूर्ण गोपनीयता के लिए, ओपन-वेट मॉडल को अपने ही हार्डवेयर पर चलाएँ (Qwen के सभी मोडैलिटी वाले मॉडलों में यह पिछली पीढ़ी का Qwen3-Omni है; नया Qwen3.5-Omni केवल API से उपलब्ध है और सितंबर 2026 तक उसके वेट्स प्रकाशित नहीं हुए)।
छवियों और वीडियो का बिल टोकन रूपांतरण से होता है। एक छवि ≈ कुछ सौ से ~1,000 टोकन (रिज़ॉल्यूशन और मॉडल पर निर्भर); वीडियो के लिए Gemini API डिफ़ॉल्ट सेटिंग पर लगभग 100 टोकन प्रति सेकंड और हाई रिज़ॉल्यूशन पर लगभग 300 गिनता है (Google के डेवलपर दस्तावेज़, सितंबर 2026 में जाँचा)। डिफ़ॉल्ट सेटिंग पर 1 घंटा = 100 × 3,600 सेकंड ≈ 3.6 लाख टोकन। AI Token Cost Saving की लागत तकनीकें (केवल-अंश भेजना, कैशिंग) वीडियो के लिए भी काम करती हैं।