على المعيار المرجعي للذكاء الاصطناعي متعدّد الوسائط MMMU-Pro (الفهم متعدّد التخصّصات عبر الصور والمخطّطات والأشكال)، تجاوزت النماذج الأولى حاجز 80%. أعلنت OpenAI في أبريل 2026 أنّ GPT-5.5 سجّل 81.2% (دون أدوات)، وأعلنت Google في فبراير أنّ Gemini 3.1 Pro سجّل 80.5%. وعندما أُطلق المعيار الأصلي MMMU في أواخر 2023، سجّل GPT-4V نحو 56%. وMMMU-Pro نسخة أصعب من MMMU (صدرت في سبتمبر 2024)، فهما ليسا المقياس نفسه — ومع ذلك تتجاوز النماذج الآن 80% على النسخة الأصعب. عصر الذكاء الاصطناعي «النصّي فقط» قد انتهى فعلاً.

لم تتغيّر الدرجات وحدها. طريقة بناء هذه النماذج أيضاً تنتقل من «المُلصَق» إلى «الأصيل». كان المعتاد سابقاً ربط نماذج منفصلة في سلسلة: نموذج يفرّغ الكلام نصّاً، وآخر يفكّر في النصّ، وثالث يقرأ الإجابة بصوت عالٍ (تصف OpenAI وضع الصوت في ChatGPT قبل GPT-4o بأنّه كان هذه السلسلة من ثلاثة نماذج). أمّا اليوم فقد انتشرت التصاميم التي يستقبل فيها نموذج واحد عدّة أنواع من المدخلات مباشرةً، ويعالج Gemini وسلسلة Qwen Omni الوسائط الأربع — النصّ والصورة والصوت والفيديو — في نموذج واحد. لكنّ الشركات لم تسلك جميعها هذا الطريق: حتى سبتمبر 2026، لا يقبل النموذج الرائد لدى OpenAI ولا واجهة Claude API إلا النصّ والصور كمدخلات، وتتولّى الصوتَ لدى OpenAI نماذجُ صوتية منفصلة مثل gpt-realtime (انظر جدول §4).

دعوني أُصرّح برأيي مبكّراً: انتقل تعدّد الوسائط من «ميزة لطيفة» إلى «عدم وجوده يعني عدم الانطلاق». التقاط صورة لشاشة خطأ ليحلّها الذكاء الاصطناعي على الفور، وأخذ لقطة من PDF لاستخراج النقاط الرئيسية، وتفريغ فيديو يوتيوب وتلخيصه — هذه باتت خط الأساس لكفاءة الذكاء الاصطناعي في 2026. تتناول هذه المقالة التعريف، والفرق بين تعدّد الوسائط المُلصَق والأصيل، وما الذي يُحدِّد تقنياً القوّة في كلّ وسيط، وعلى أيّ أساس تختار في كلّ حالة استخدام، والمعايير المرجعية، والحدود. المحور هنا هو طريقة الحكم لا ترتيب نموذج بعينه، ولذلك يبقى صالحاً مهما تبدّلت الأجيال.

MULTIMODAL AI · 2026

ذكاء اصطناعي يتعامل مع النصّ والصورة والصوت والفيديو

— كم يستقبل نموذج واحد من ذلك يختلف من نموذج لآخر

TEXT
نصّ
نثر، شيفرة، رموز
IMAGE
صورة
صور، مخطّطات، لقطات شاشة
AUDIO
صوت
كلام، موسيقى، أصوات محيطة
VIDEO
فيديو
زمن + مرئيات + صوت

على MMMU-Pro بلغت النماذج الرائدة نطاق 80% (أرقام الشركات ومصادرها في §1).
انتهى عصر «الصورة كميزة إضافية». لكنّ استقبال الأربعة في نموذج واحد يقتصر على بعض النماذج مثل Gemini وسلسلة Qwen Omni؛ أمّا النموذج الرائد لدى OpenAI وواجهة Claude API فيتوقّفان عند الصورة (حتى سبتمبر 2026).

1. في 2026، توقّف الذكاء الاصطناعي عن أن يكون «نصاً فقط» — MMMU-Pro يتجاوز 80%

بدأ مصطلح «متعدّد الوسائط» يَشيع في 2024، لكنّ النماذج التي سبقت ذلك بقليل لم تكن تقرأ الصور إلا كـأمر ثانوي: عندما أُطلق MMMU (الفهم متعدّد التخصّصات والوسائط) في أواخر 2023، لم يتجاوز أفضلها، GPT-4V، نحو 56%. وكان الخبير البشري الوسيط (82.6%) بعيد المنال في أسئلة الصور التي تتطلّب معرفة تخصّصية.

2026 يبدو مختلفاً تماماً. النتائج المُعلَنة على MMMU-Pro (النسخة الأصعب من MMMU):

«تجاوز 80% يعني أنّ المعيار يقترب من حدّ الإشباع» — هذا هو واقع 2026. انتقل التمايز إلى فهم الفيديو (Video-MMMU) ووثائق OCR الكثيفة والاستدلال المشترك صوت-بصر — أرض أصعب. لوحة المتصدِّرين العامّة على MMMU benchmark تتيح المقارنة للجميع.

2. ما هو الذكاء الاصطناعي متعدّد الوسائط؟ — ذكاء يفهم أكثر من النصّ

التعريف: «نموذج ذكاء اصطناعي يستقبل مدخلات غير النصّ (صور، صوت، فيديو، إلخ)». إلى أيّ حدّ يصل ذلك يختلف من نموذج لآخر: من النصّ مع الصور إلى الصوت والفيديو في نموذج واحد (انظر مربّع المصطلحات أدناه).

كان الذكاء الاصطناعي التقليدي أحادي الوسيط: GPT-3 يعالج النصّ؛ Whisper يحوّل الكلام إلى نصّ فقط؛ Stable Diffusion يحوّل النصّ إلى صورة فقط. كان دمجها يتطلّب خطّ إنتاج يُغذّي مخرج نموذج نموذجاً آخر، وتُفقَد المعلومات عند كلّ تسليم.

في الذكاء الاصطناعي متعدّد الوسائط ينظر نموذج واحد إلى عدّة مدخلات معاً ثم يجيب. مثلاً: «انظر إلى رسالة الخطأ في لقطة الشاشة هذه (صورة) مع سؤالي (نصّ) وأخبرني بالسبب» — يتمّ ذلك في استدعاء API واحد.

المصطلحات: LMM (نموذج متعدّد الوسائط ضخم) = نموذج ضخم بقدرة متعدّدة الوسائط. VLM (نموذج رؤية-لغة) = نصّ + صورة فقط. Omnimodal = الجيل الجديد من النماذج التي توحِّد 4 وسائط فأكثر. «دعم تعدّد الوسائط» ليس شيئاً واحداً: أن يكون النموذج omnimodal يختلف جذرياً عن أن يكون VLM (نصّ + صورة فقط). إن كنت تنوي التعامل مع الصوت أو الفيديو، فافحص هذا التصنيف بدل عدّ علامات ◎ في جدول التوافق — فالنماذج القائمة على VLM كثيراً ما يكون دعمها للصوت والفيديو محدوداً.

3. مُلصَق مقابل أصيل — الفجوة المعمارية

فهمُ الفرق في آلية العمل يسهّل قراءة نقاط قوّة كلّ نموذج. وهناك إجمالاً طريقتان لبنائها.

مقارنة البنى

مُلصَق مقابل أصيل

① مُلصَق
  • التفريغ والتفكير والنطق في نماذج منفصلة
  • تتبادل النماذج العمل على شكل نصّ
  • نبرة الصوت وتعدّد المتحدّثين والأصوات المحيطة تضيع في الطريق
  • كلّ مرحلة إضافية تزيد التأخير
  • مثال: وضع الصوت في ChatGPT قبل GPT-4o (ثلاثة نماذج متسلسلة)
VS
② أصيل
  • نموذج واحد يستقبل عدّة مدخلات مباشرةً
  • من المدخل إلى المخرج في الشبكة نفسها
  • يرى النموذج نبرة الصوت وتطابق الصورة مع الصوت مباشرةً
  • قليل من المعلومات يضيع في التسليم
  • مثال: GPT-4o (مايو 2024)، وGemini من Google، وسلسلة Qwen Omni

في الأصيل يتمّ «تفسير صوت الفيديو وصورته معاً» داخل نموذج واحد.
أمّا المُلصَق فيُدخل حلقة وسيطة — مثل تفريغ الكلام نصّاً أوّلاً — وهناك تضيع المعلومات.

مثال ملموس: «شاهد فيديو طبخ على يوتيوب واستخرج الوصفة». مُلصَق: صوت ← Whisper إلى نصّ ← GPT للتلخيص؛ فيديو ← استخراج إطارات ← تحليل منفصل. خطوات كثيرة. أمّا النموذج الأصيل الذي يقبل الفيديو مباشرةً (مثل Gemini) فيأخذ ملف الفيديو بكامله ويُعيد الوصفة في استدعاء API واحد، ويربط الشرح المنطوق بالفعل المرئي داخل النموذج نفسه.

4. ما الذي يُحدِّد القوّة في كلّ وسيط

«أيّ نموذج هو الأفضل؟» سؤال تتبدّل إجابته مع كلّ جيل؛ فصدارة الفيديو وتجربة الصوت تغيّرت ترتيباً كلّ ستّة أشهر. لذلك ما يستحقّ الحفظ ليس الترتيب نفسه، بل ما الذي يُحدِّد تقنياً قوّة كلّ وسيط. متى أتقنت هذا، صار بإمكانك أن تحكم بنفسك على أيّ نموذج جديد يظهر.

🎬 ما يُحدِّد فهم الفيديو

①كثافة أخذ عيّنات الإطارات (إطار واحد كلّ كم ثانية) ②سياق يتّسع لمدّة طويلة ③الاستدلال الزمني والسببي. فيديو مدّته ساعة يعطي 3,600 إطار حتى عند 1fps، أي مئات الآلاف من التوكنات. لذلك ترتبط قدرة الفيديو بطول السياق ارتباطاً مباشراً — و«النماذج القوية في الفيديو» لها نوافذ كبيرة بلا استثناء.

🎙 ما يُحدِّد المحادثة الصوتية

①زمن الاستجابة ذهاباً وإياباً ②هل هو ثنائي الاتجاه الكامل (هل تستطيع مقاطعته وهو يتكلّم) ③الحفاظ على النبر والانفعال. هنا تظهر فجوة §3 بين المُلصَق والأصيل بأوضح صورها: البنية التي تُفرِّغ الصوت إلى نصّ ثم تعالجه أبطأ وأكثر فقداناً للمعلومة من حيث المبدأ.

📄 ما يُحدِّد تحليل الوثائق والواجهات

①دقّة OCR ②الحفاظ على التخطيط (ألا تنهار الجداول والأعمدة والحواشي) ③هل يستطيع إعادة الإحداثيات. البند ③ يُغفَل كثيراً لكنّه حاسم في وكلاء تشغيل الشاشة: أن تعرف أنّ «هناك زرّاً» دون أن تعرف «أين هو» يعني أنّك لا تستطيع النقر عليه.

🔓 ما يُحدِّد النماذج مفتوحة الأوزان

①هل هو omnimodal أم تجميعة نماذج منفصلة لكلّ وسيط ②توفّر الأوزان والرخصة. كثير ممّا يُوصَف بـ«المفتوح» تأتي رخصته بشروط على الاستخدام التجاري. إن كنت تنوي تشغيله بنفسك، فاقرأ الرخصة قبل أن تقرأ النتائج.

الجدول التالي تقدير تقريبي من عندنا بتاريخ مايو 2026، مبنيّ على ما نشرته كلّ شركة عن أنواع المدخلات المدعومة، وليس قياسات من اختبارات معيارية. الترتيب يتبدّل، فراجِع قائمة النماذج الحالية لمعرفة ما يمكن اختياره اليوم، والمقارنة المباشرة في مقالة مقارنة GPT-5.6 Sol مقابل Gemini أو في بطاقات النماذج الرسمية. واقرأ الجدول هنا كمثال على كيف تظهر المحاور الأربعة أعلاه فعلياً كفروق.

النموذجنصّصورةصوتفيديونقطة القوّة
GPT-5.5◎◎××يقرأ النصّ والصور؛ الـ API لا يقبل الصوت ولا الفيديو كمدخلات
Gemini 3.1 Pro◎◎◎◎◎قوي في فهم الفيديو، بما فيه الفيديو الطويل
Claude Opus 4.7◎◎××تحليل واجهات المستخدم/الوثائق؛ قوي لأعمال الوكلاء
Qwen3.5-Omni◎◎◎◎omnimodal: نموذج واحد يستقبل المدخلات الأربعة. متاح عبر API (الأوزان غير منشورة حتى سبتمبر 2026)
DeepSeek V4-Pro◎×××نصّ فقط ورخيص (وصل إدخال الصور مع سلسلة Flash ابتداءً من أغسطس 2026)

× = لا يقبل الـ API هذا النوع من المدخلات (لا تُحتسب ميزات التطبيقات التي تمرّ عبر نموذج آخر أو عبر التفريغ النصّي، مثل المحادثة الصوتية). تحقّقنا من دعم المدخلات في المصادر الأولية: صفحة نموذج GPT-5.5 لدى OpenAI، صفحة نموذج Gemini 3.1 Pro لدى Google، صفحة نموذج Claude Opus 4.7 لدى Anthropic، التقرير التقني لـ Qwen3.5-Omni، سجلّ تغييرات API لدى DeepSeek (تحقّقنا منها في سبتمبر 2026).

ما يُقرأ من هذا الجدول هو أنّ المحاور الأربعة يعمل كلّ منها على حدة:

  • فجوة الفيديو تنفتح مع «الطول»: يقيّم Video-MME مقاطع تمتدّ من 11 ثانية إلى ساعة في ثلاث فئات (قصيرة ومتوسّطة وطويلة)، وكلّ النماذج على لوحته الرسمية تتراجع درجاتها في الفئة الطويلة. ففي المقاطع الطويلة يصير ① كثافة الإطارات و② طول السياق عنق الزجاجة. إن كنت تتعامل مع فيديوهات قصيرة فقط، فترتيب الفيديو الطويل لا يعنيك
  • الصوت تحسمه «البنية»: الجمع بين سرعة الاستجابة وقراءة الانفعال أسهل بكثير حين يُعالَج الصوت معالجة أصيلة دون إنزاله إلى نصّ (فالتفريغ النصّي يضيف انتظاره الخاص ويمحو نبرة الصوت). قد تصطفّ علامات «دعم صوتي ◎» في جداول التوافق، لكنّ التجربة تصير شيئاً آخر تماماً إذا كان الطريق يمرّ عبر التفريغ
  • تحليل الوثائق ينقسم على «الإحداثيات»: سبب تقدير قراءة ملفّات PDF ولقطات شاشات الواجهات في إعدادات الوكلاء مثل Cursor ليس الدقّة بحدّ ذاتها، بل القدرة على إعادة الموضع
  • قيمة النماذج المفتوحة تتغيّر بحسب «كونها omnimodal أم لا»: النموذج الواحد الذي يتولّى كلّ الوسائط أخفّ تشغيلاً بكثير من تركيبة نماذج منفصلة لكلّ وسيط. وقد صارت تظهر منها نماذج بجودة قريبة من الحدود الأمامية وبكلفة أقلّ بكثير

5. المعايير المرجعية المهمّة — MMMU / Video-MMMU / OCR / Audio

ستختار النموذج الخاطئ إذا لم تعرف ما الذي يقيسه فعلاً كلّ معيار. أربعة معايير يجب معرفتها في 2026:

المعايير × 4

بماذا نقيس الذكاء الاصطناعي متعدّد الوسائط

① MMMU-Pro
الفهم متعدّد التخصّصات من الصور + الأشكال + المخطّطات. النماذج الأولى فوق 80%، بمستوى الخبير البشري الوسيط (80.8%). ضعيف بالفعل كمميِّز.
② Video-MMMU
300 فيديو تخصّصي بأسلوب المحاضرات + 900 سؤال. يقيس هل يتعلّم النموذج من الفيديو ويطبّق ما تعلّمه، على ثلاث مراحل: الإدراك والفهم والتكيّف.
③ DocVQA / OCRBench
الوثائق + النصّ داخل الصورة. الفرق في قراءة الجداول والأعمدة والإحداثيات دون أن تتفكّك. لتحليل واجهات المستخدم والفواتير والنماذج، انظر إلى هذا المقياس لا إلى MMMU.
④ AudioBench
يقيس مدى فهم نماذج الصوت (AudioLLM) لما تسمعه: التعرّف على الكلام وترجمته، وفهم أصوات البيئة، والانفعال وسمات المتحدّث في الصوت (أكثر من 50 مجموعة بيانات في المستودع الرسمي). لا يقيس زمن الاستجابة ولا توليد الصوت، فتحقّق من سرعة المحادثة الصوتية على حدة.

«MMMU مرتفع = جيد في كل شيء» قول خاطئ.
للفيديو راجِع Video-MMMU؛ للوثائق DocVQA؛ للصوت AudioBench — وإلّا فاتك الاختيار الصحيح.

6. حسب حالة الاستخدام — على أيّ أساس تختار

خمسة أنماط شائعة، مع «ما الذي تتحقّق منه قبل أن تقرّر» في كلّ منها. لن أذكر أسماء نماذج بعينها — فقسم كهذا يتقادم خلال ستّة أشهر. بدلاً من ذلك صغتُه بحيث تحكم بالخطوات نفسها مهما ظهر من نماذج.

  • ① أسئلة/تشخيص بصور الهاتف (صورة وجبة ← تغذية، شاشة خطأ ← إصلاح، صورة منتج ← بحث)
    ← أيّ نموذج تقريباً يكفي. جرّب اثنين على خطّة مجّانية واختر ما يعجبك مستوى تفصيله. الفروق بين النماذج أصغر ما تكون في هذا الاستخدام، ولا يستحقّ إنفاق وقت طويل على الاختيار
  • ② تحليل PDF / الوثائق (إيصالات، عقود، مواصفات فنّية، أوراق بحثية)
    ← جرّب على موادّك الحقيقية. معايير الحكم ثلاثة: «هل تنهار الجداول؟»، «هل يتابع الأعمدة بترتيب القراءة الصحيح؟»، «هل يصمد أمام صفحة ممسوحة بجودة رديئة؟». وإرسال أوسخ صفحة لديك يكشف الحقيقة أسرع من أرقام دقّة OCR في الكتالوج
  • ③ تفريغ الفيديو وتلخيصه (اجتماعات، محاضرات، يوتيوب)
    ← يتفرّع القرار بحسب طول الفيديو الذي تتعامل معه. عند عشر دقائق تقريباً يكون الفرق ضئيلاً. أمّا إلقاء ساعة كاملة دفعةً واحدة فتحكمه ① كثافة الإطارات و② طول السياق من §4، فتحقّق من نتائج معايير الفيديو الطويل وحجم النافذة
  • ④ المحادثة الصوتية / الترجمة الفورية / تدريب المقابلات
    ← تحقّق أوّلاً هل المعالجة أصيلة. حتى مع كتابة «دعم صوتي»، إذا كان الطريق يمرّ عبر التفريغ فسيظهر التأخّر ويضيع النبر. والاختبار بسيط: حاوِل مقاطعته وهو يتكلّم
  • ⑤ الكلفة أوّلاً / المعالجة بالجملة
    ← لا تنظر إلى سعر الوحدة وحده، بل إلى خصومات المعالجة بالجملة وإلى واقعية التشغيل الذاتي. وإن اخترت نموذجاً مفتوح الأوزان، فاقرأ شروط الاستخدام التجاري في الرخصة قبل الأداء
كيف تفكّر في التركيب: بدل الاقتصار على نموذج واحد، يثبت أكثر أن يكون لديك واحد أساسي + واحد يسدّ نقاط ضعفه. الاشتراك في خطّتين من فئة 20$/شهرياً يكلّف 40$، وهو ليس بعيداً عمّا تدفعه لخطّة واحدة أعلى. أمّا الاستخدامات نادرة التكرار مثل الفيديو، فيكفي أن تُحوَّل عند الحاجة إلى طبقة مجّانية مثل Google AI Studio. ومنطق التوزيع هذا نفسه لا يتغيّر مهما تقدّمت أجيال النماذج.

7. حدود صارمة — استخدِم ولا تثق بشكل أعمى

الذكاء الاصطناعي متعدّد الوسائط قوي، لكنّ ثلاثة حدود ستلدغك إن تجاهلتها.

الحدّ ①: لا تقرأ «التخمينات» المستندة إلى الصور كحقائق

سؤال «طبّق OCR على المبلغ في هذا الإيصال» يبدو بسيطاً، لكن إذا كانت الصورة منخفضة الدقّة أو معتمة أو منحرفة، فإنّ الذكاء الاصطناعي يفبرك أرقاماً مقبولة الشكل. وحتى النموذج الذي يتجاوز 80% على MMMU-Pro يخطئ في قرابة إجابة من كلّ خمس. المبالغ والتواريخ وأسماء العَلَم — يجب دائماً أن يراجعها إنسان. خصوصاً في القانون والمال والرعاية الصحية.

الحدّ ②: تنخفض دقّة الفيديو في الوسط

حتى مع النموذج المتصدّر في مقاييس الفيديو، فإنّ استرجاع المعلومات من منتصف فيديو بساعة كاملة صعب — نفس مشكلة «الضياع في المنتصف» الموجودة في مشكلة نافذة السياق. للقطاعات المفصلية، حدِّد أختام الزمن: «حلِّل القطعة 30:00–35:00 تحديداً» يُعطي نتائج أفضل بكثير.

الحدّ ③: يكافح الصوت مع اللهجات والمصطلحات

الإنجليزية/اليابانية الفصحى المنطوقة دقيقة، لكنّ اللهجات الإقليمية والمفردات التخصّصية وتداخل عدّة متحدّثين والبيئات الصاخبة ترفع الأخطاء. لمحاضر الاجتماعات وغيرها من الاستخدامات العالية المخاطر، زاوِج مع أدوات متخصّصة (Otter.ai، Notta، إلخ)، أو نظِّف الصوت أوّلاً قبل إرساله إلى الذكاء الاصطناعي.

الخلاصة

استعادة سريعة:

  • في 2026: تجاوز GPT-5.5 وGemini 3.1 Pro حاجز 80% على MMMU-Pro (بحسب أرقام الشركتين؛ القيم والمصادر في §1). انتقل الذكاء الاصطناعي متعدّد الوسائط من «ميزة لطيفة» إلى «لا بدّ منها»
  • تنتقل البنية من سلاسل النماذج المنفصلة (المُلصَق) إلى نماذج أصيلة تستقبل عدّة مدخلات مباشرةً. لكنّ استقبال الأربعة في نموذج واحد يقتصر على Gemini وسلسلة Qwen Omni وقليل غيرهما؛ أمّا النموذج الرائد لدى OpenAI وواجهة Claude API فيتوقّفان عند الصورة (حتى سبتمبر 2026)
  • ما يُحدِّد القوّة أربعة محاور: الفيديو = كثافة الإطارات وطول السياق / الصوت = معالجة أصيلة أم عبر التفريغ / الوثائق = هل يُعيد الإحداثيات / المفتوح = هل هو omnimodal وما رخصته. الترتيب يتبدّل، وهذه المحاور لا تتبدّل
  • المعايير المرجعية: MMMU-Pro / Video-MMMU / DocVQA / AudioBench — افحص المحاور الأربعة قبل الاختيار
  • أقصر طريق للاختيار حسب حالة الاستخدام هو التجربة على موادّك الحقيقية؛ ومع ملفّات PDF خصوصاً، إلقاء أوسخ صفحة لديك أسرع من أيّ ورقة مواصفات. والتركيبة الثابتة هي واحد أساسي + واحد يسدّ ضعفه
  • ثلاثة حدود: تخمينات الصور منخفضة الجودة / تراجع الدقّة في منتصف الفيديو / اللهجات والمصطلحات في الصوت. راجِع المخرجات الحرجة جيّداً

في 2026، يتقلّص بسرعة عمل الذكاء الاصطناعي الذي يكتمل «بالنصّ وحده». صور الهاتف وتسجيلات الاجتماعات وفيديوهات يوتيوب وملفّات PDF — تسليمها للذكاء الاصطناعي صار أمراً معتاداً (أمّا هل يقبلها نموذج واحد كلّها فيختلف من نموذج لآخر). معرفة كيف تستخدم تعدّد الوسائط لم تَعُد «ميزة مفيدة»؛ بل هي الحدّ الأدنى لكفاءة الذكاء الاصطناعي في 2026. ابدأ اليوم بإعطاء الذكاء الاصطناعي صورة واحدة من هاتفك — هذا يكفي للبداية.

الأسئلة الشائعة

س1. هل أستطيع تجربة الذكاء الاصطناعي متعدّد الوسائط مجّاناً؟

نعم. الخطة المجّانية في ChatGPT (إدخال الصور متاح)، وGoogle AI Studio (طبقة مجّانية، يشمل الفيديو)، والخطة المجّانية في Claude.ai (الصور متاحة) كلّها تتيح التجربة. تنبيه: في Google AI Studio والمستوى المجاني من Gemini API تُستخدم المدخلات لتحسين منتجات Google وقد يقرؤها مراجعون بشريون (شروط Gemini API)، فلا ترفع صوراً أو تسجيلات صوتية حسّاسة. لكنّ النماذج المخصّصة للخطط المجّانية تتغيّر مع كلّ جيل، فبدلاً من حفظ أسماء النماذج تحقّق في واجهة كلّ خدمة من المدخلات التي تقبلها (صورة، صوت، فيديو) ومن حدّ الاستخدام اليومي. بعض الميزات، مثل حدود المحادثة الصوتية والفيديو الطويل، تتّسع في الطبقات المدفوعة. راجِع دليل أدوات الذكاء الاصطناعي المجّانية.

س2. كيف يختلف الذكاء الاصطناعي لتوليد الصور عن متعدّد الوسائط؟

مصطلحان مختلفان. أدوات مثل Midjourney وStable Diffusion متخصّصة في توليد الصور من النصّ — تدفّق أحادي الاتجاه نصّ←صورة. أمّا متعدّد الوسائط فيشير إلى فهم الصور (والوسائط الأخرى) كمدخلات. بعض الخدمات مثل ChatGPT وGemini تقوم بالأمرين، لكنّ الفهم والتوليد قدرتان منفصلتان؛ التفوّق في إحداهما لا يعني التفوّق في الأخرى، فجرّب كلّاً منهما على حدة بحسب استخدامك. راجِع مقارنة أدوات الذكاء الاصطناعي لتوليد الصور.

س3. كيف أُرسل فيديو عبر الـAPI؟

تقبل Gemini API (واجهة المطوّرين على ai.google.dev) الفيديو كما هو. للفيديوهات الطويلة أو التي ستُعاد استخدامها، الطريقة الموصى بها هي رفعها عبر Files API ثم تمرير مرجع الملف؛ أمّا الفيديوهات الصغيرة فيمكن تضمينها في الطلب نفسه. ويمكن أيضاً تمرير رابط YouTube عامّ، أو تسجيل ملفّات Cloud Storage في Files API (وثائق Google للمطوّرين). وعبر Vertex AI في Google Cloud، يُحدَّد في fileData عنوان Cloud Storage بصيغة gs:// (وثائق Google Cloud). واجهتا OpenAI وClaude لا تقبلان الفيديو مباشرةً حتى 26 سبتمبر 2026 (صفحة نموذج GPT-6 Astra لدى OpenAI تصف الفيديو بـ «Not supported»، وتذكر Anthropic أنّ جميع نماذجها الحالية تقبل النصّ والصور كمدخلات). والطريقة في الحالتين هي استخراج إطارات من الفيديو وإرسالها كصور، ولدى OpenAI مثال على ذلك في الـ Cookbook الرسمي. راجِع دليل المبتدئين لواجهات الذكاء الاصطناعي.

س4. هل الخصوصية على ما يرام؟

كثيراً ما تحتوي الصور والصوت والفيديو على بيانات حسّاسة. استخدامها في التدريب يختلف بين تطبيقات الأفراد وبين API والخطط المؤسّسية. في تطبيقات الأفراد، قد يستخدم ChatGPT محادثاتك في التدريب، ويمكنك إيقاف ذلك بتعطيل «Improve the model for everyone» في الإعدادات (مركز مساعدة OpenAI). ويستخدم Claude (Free وPro وMax) محادثاتك في التدريب إذا سمحتَ بذلك (مركز الخصوصية لدى Anthropic). أمّا تطبيقات Gemini فتستخدم محادثاتك — بما في ذلك عبر المراجعة البشرية — لتحسين خدمات Google ما دام «Keep Activity» مفعّلاً، وتعطيله يوقف ذلك (مركز خصوصية تطبيقات Gemini). في المقابل، لا تُستخدم افتراضياً في التدريب واجهةُ OpenAI API وChatGPT Business/Enterprise، ولا واجهة Anthropic API وخططها المؤسّسية، ولا المستوى المدفوع من Gemini API (شرح Anthropic للشركات، شروط Gemini API). الاستثناء: في المستوى المجاني من Gemini API وفي Google AI Studio تُستخدم مدخلاتك لتحسين منتجات Google. للوجوه والصور الطبّية والوثائق الداخلية، اختر API مدفوعاً أو خطة مؤسّسية. للسرّية الكاملة، شغِّل نموذجاً مفتوح الأوزان على جهازك (ضمن نماذج Qwen الشاملة لكلّ الوسائط، هذا هو الجيل السابق Qwen3-Omni؛ أمّا أحدث نموذج Qwen3.5-Omni فمتاح عبر API فقط، وأوزانه غير منشورة حتى سبتمبر 2026).

س5. هل متعدّد الوسائط أغلى من النصّ فقط؟

تُحتسب الصور والفيديوهات بتحويلها إلى توكنات. الصورة الواحدة ≈ بضع مئات إلى ~1000 توكن (بحسب الدقّة والنموذج)؛ وفي الفيديو تحتسب Gemini API نحو 100 توكن في الثانية بالإعداد الافتراضي ونحو 300 بالدقّة العالية (وثائق Google للمطوّرين، تحقّقنا منها في سبتمبر 2026). ساعة بالإعداد الافتراضي تساوي 100 × 3,600 ثانية ≈ 360 ألف توكن. تقنيات تخفيض الكلفة الواردة في توفير كلفة التوكنات للذكاء الاصطناعي (إرسال المقتطف فقط، التخزين المؤقّت) تنطبق أيضاً على الفيديو.