استخراج النص من الصور بالذكاء الاصطناعي (OCR): الدليل الكامل
ملاحظة بخط اليد، إيصال ورقي، نص إنجليزي داخل لقطة شاشة، لافتة في صورة — إعادة الكتابة التي طالما أنجزتها يدويًّا لم تَعُد، في عام 2026، ضرورية تقريبًا بفضل الذكاء الاصطناعي. يبدأ هذا الدليل من كيفية اختلاف AI OCR عن الـ OCR التقليدي (قراءة حرف واحد في كل مرة مقابل فهم الصفحة كاملةً بالمعنى)، ثم يرتّب ثلاثة خيارات (ذكاء اصطناعي حواري عام / أدوات مخصصة مثل Google Lens / واجهات API ومفتوح المصدر مثل Mistral OCR وPaddleOCR-VL) بحسب حالة الاستخدام. يقارن بين ChatGPT (GPT-5.5) وGemini 3.1 Pro وClaude (Opus 4.8) من حيث نقاط القوة (خط اليد ← عائلة GPT، هيكلة الجداول ← عائلة Claude، الصفحات الكثيرة ← السياق الطويل لدى Gemini، الـ OCR الخام ← النماذج المتخصصة؛ لا بطل مطلق)، ويقدّم ثلاثة موجّهات جاهزة للنسخ (انسخ دون كسر، جدول إلى Markdown، إيصال إلى JSON، كلها مع قاعدة «لا اختلاق»)، والأنسب لكل حالة (خط اليد، الإيصالات، ملفات PDF، الجداول المعقدة، النص العمودي/القديم، المعادلات والشيفرة)، وست نصائح للدقة مع جودة الصورة باعتبارها 80٪ من النتيجة، ونقطة الضعف الأكبر والوحيدة لدى AI OCR — اختلاق ما لا يستطيع قراءته بشكل معقول (طابِق دائمًا المبالغ والتواريخ والأسماء مع الأصل) — إضافةً إلى تحذيرات الخصوصية حول إرسال السري وحقوق النشر والاستخدام في التدريب. ما يجوز أن تتركه للذكاء الاصطناعي هو «القراءة» فقط؛ أما التأكيد فهو للإنسان الذي رأى الأصل.