ما هو الذكاء الاصطناعي متعدّد الوسائط؟ — البنية الموحَّدة للنصّ/الصورة/الصوت/الفيديو ومعايير الاختيار
في أبريل 2026، بلغ المعيار المرجعي متعدّد الوسائط MMMU-Pro نسبة 81–83% عبر GPT-5.5 وClaude Opus 4.7 وGemini 3.1 Pro وQwen 3.5 Omni — فهم الصور أصبح فعلياً مُشبَعاً. هاجرت البنية من المُلصَقة (مُرمِّزات منفصلة + مُحوِّل) إلى omnimodal أصيلة (جميع الوسائط كتيّار توكنات مشترك). تتناول هذه المقالة ماهية الذكاء الاصطناعي متعدّد الوسائط (LMM/VLM/Omnimodal)، والفجوة المعمارية ولماذا تهمّ، وما الذي يُحدِّد القوّة تقنياً في كلّ وسيط (كثافة الإطارات وطول السياق، ومعالجة الصوت الأصيلة، وإعادة الإحداثيات، والترخيص) مع لقطة من مايو 2026، وأربعة معايير مرجعية يجب متابعتها (MMMU-Pro وVideo-MMMU وDocVQA وAudioBench)، وخمسة قرارات لحالات الاستخدام، والحدود الثلاثة الصارمة (تخمينات الصور منخفضة الجودة، دقّة منتصف الفيديو، صوت اللهجات والمصطلحات) — مدعومة بأبحاث حديثة واستخدام عملي.