ربما تفترض أن نموذج اللغة الكبير (LLM) لا بد أن يعمل في السحابة. في الحقيقة، أصبح تشغيل الذكاء الاصطناعي بالكامل داخل جهاز الكمبيوتر الخاص بك — أي "نموذج LLM المحلي" — خيارًا واقعيًا اليوم. بياناتك لا تغادر الجهاز أبدًا، ولا توجد رسوم API، وهو يعمل دون اتصال بالإنترنت. في عام 2026، تطورت النماذج والأدوات إلى حدٍّ يجعل حتى الحاسوب المحمول العادي قابلًا للاستخدام فعلًا.

تشرح هذه المقالة للمبتدئين ما هو نموذج LLM المحلي، ومزاياه وعيوبه، والمواصفات التي تحتاجها، وكيفية البدء، والنماذج المُوصى بها، ومتى تستخدمه بدلًا من السحابة.

LOCAL LLM · ذكاء اصطناعي يعمل على جهازك الخاص

لا شيء يُرسَل إلى السحابة، ولا شيء يُحاسَب عليه

— بياناتك تبقى على الجهاز؛ ثبِّته مرة واحدة واستخدمه كما تشاء

🔒

الخصوصية

مدخلاتك لا تُرسَل أبدًا إلى خادم خارجي — آمن حتى للبيانات السرية.

💰

بلا تكلفة

لا رسوم API. ثبِّته مرة واحدة وهو مجاني مهما أكثرت من استخدامه.

✈️

دون اتصال

يعمل بلا إنترنت — على متن طائرة أو خارج المنزل، دون أي مشكلة.

1. ما هو نموذج LLM المحلي؟

نموذج LLM المحلي يعني تشغيل نموذج ذكاء اصطناعي مثل ChatGPT أو Claude مباشرةً على جهاز الكمبيوتر الخاص بك (أو هاتفك) بدلًا من السحابة. فالذكاء الاصطناعي الذي تستخدمه عادةً يرسل مدخلاتك إلى خادم بعيد، ويعالجها هناك، ثم يعيد إليك الإجابة — أما نموذج LLM المحلي فإنه يجري كل تلك المعالجة على الجهاز الماثل أمامك.

تخيّل الأمر كأنه "بث الموسيقى مقابل تنزيلها." فالذكاء الاصطناعي السحابي أشبه بالبث عبر الشبكة في كل مرة تريد فيها الاستماع؛ أما نموذج LLM المحلي فأشبه بتنزيل المقطوعة إلى جهازك لتتمكن من تشغيلها دون اتصال، في أي وقت. فبمجرد أن تضع نموذجًا — وهو ملف بحجم بضعة غيغابايت — على جهازك، يمكنك تشغيله بلا إنترنت ولا رسوم.

💡 في سطر واحد: نموذج LLM المحلي هو "ذكاء اصطناعي يعمل بالكامل على جهازك، دون إرسال أي شيء إلى الشبكة." إنه قوي في الخصوصية والتكلفة — لكنه ليس بذكاء الذكاء الاصطناعي السحابي من الطراز الأول. واستيعاب هذه المقايضة هو الخطوة الأولى.

2. لماذا محليًا؟ المزايا والعيوب

لنماذج LLM المحلية ثلاث مزايا كبرى: الخصوصية، والتكلفة، والاستخدام دون اتصال. فلأن المدخلات لا تغادر جهازك، يصبح التعامل مع البيانات السرية أيسر، ولا توجد رسوم API. بل وردت تقارير عن شركات خفّضت تكاليف الذكاء الاصطناعي بحدّة عبر نقل المهام كثيفة الحجم إلى النماذج المحلية (يُقال إن إحدى الشركات انتقلت من 47,000 دولار إلى 8,000 دولار شهريًا).

وهناك عيوب أيضًا. فلنكن صريحين بشأنها.

○ المزايا
  • البيانات لا تغادر جهازك أبدًا (الخصوصية)
  • استخدام غير محدود دون رسوم إضافية
  • يعمل بلا إنترنت
  • تخصيص النماذج والإعدادات بحرية
✕ العيوب
  • ليس بذكاء الذكاء الاصطناعي السحابي من الطراز الأول
  • يحتاج إلى جهاز كمبيوتر بقدرات معقولة
  • بعض الإعداد الأولي
  • لا معرفة محدّثة (تقتصر على تاريخ انتهاء تدريبه)

باختصار: "متأخر خطوة عن أحدث المستويات في الذكاء، لكنه فائز واضح في الخصوصية والتكلفة والعمل دون اتصال." وللاستخدامات التي يمكنك فيها قبول هذه المقايضة، يُعَدّ نموذج LLM المحلي خيارًا قويًا.

3. مواصفات الجهاز المطلوبة والكمّنة

"هل سيعمل على جهازي؟" هو السؤال الكبير. والمفتاحان هما الذاكرة (RAM، أو ذاكرة VRAM في كرت الرسوميات) والكمّنة.

الكمّنة (quantization) هي تقنية ضغط تُقلّص حجم النموذج تقليصًا هائلًا مقابل انخفاض طفيف في الدقة. والمعيار السائد هو صيغة GGUF، وداخلها يُعَدّ "Q4_K_M" هو التوازن المفضّل (إذ يحافظ على معظم الجودة بينما يقلّص الذاكرة إلى نحو ربع الحجم الأصلي). وتستضيف HuggingFace أكثر من 130,000 نموذج بصيغة GGUF.

القاعدة التقريبية للذاكرة، عند الكمّنة بدقة 4 بِت، هي "نحو 0.5 GB لكل مليار (1B) معامل." وفي جدول:

حجم النموذج الذاكرة التقريبية (4 بِت) الجهاز الأنسب
3B–7B ~4–8 GB حاسوب محمول اعتيادي (مثالي للبدء)
12B–14B ~8–16 GB جهاز كمبيوتر أو Mac بذاكرة 16 GB أو أكثر
30B–70B ~20–40 GB+ جهاز Mac بذاكرة عالية أو كرت رسوميات مخصّص

* دليل تقريبي فحسب؛ فالاحتياجات الفعلية تتفاوت بحسب النموذج، ومستوى الكمّنة، وطول السياق. وأجهزة Mac المزوّدة بـ Apple Silicon (سلسلة M)، بفضل "الذاكرة الموحّدة"، تتعامل مع النماذج الأكبر بسهولة أكبر. ويُقال إن مجاراة ذكاء نموذج سحابي من فئة GPT تتطلب كرت رسوميات بذاكرة 24 GB+ من VRAM (وهو كرت باهظ الثمن).

لمجرد التجربة، فإن فئة 3B–7B تكفي تمامًا. فالنماذج الصغيرة الحديثة قادرة على نحو لافت وتعمل حتى على جهاز بذاكرة نحو 8 GB.

4. كيف تبدأ — أداتان

للتعمّق في Ollama، راجع دليل Ollama الكامل (الأوامر وAPI والتخصيص).

لا حاجة إلى أوامر معقّدة. اختر فقط واحدة من أداتين أساسيتين بحسب نوعك.

LM Studio (للمبتدئين)

تطبيق سطح مكتب متقن. اختر نموذجًا من قائمة، ونزّله، وابدأ المحادثة على الفور. لا حاجة إلى برمجة — فهو يعمل في واجهة شبيهة بـ ChatGPT. ابدأ من هنا إن كنت تجرّب فحسب.

Ollama (للمطوّرين)

أداة خفيفة تعمل عبر سطر الأوامر (52 مليون تنزيل شهريًا في الربع الأول من 2026). تشغّلها بسطر واحد، ollama run llama3.2. كما توفّر واجهة API، وهو مثالي لربطه بتطبيقك الخاص.

كلاهما مجاني ويعمل على Windows وMac وLinux. وهناك أدوات أخرى أيضًا — Jan وOpen WebUI وllama.cpp. وللمبتدئين، فإن تثبيت LM Studio وتنزيل نموذج صغير واحد هو أسرع خطوة أولى.

5. النماذج المُوصى بها (2026)

إليك نماذج تمثيلية تعمل محليًا، بحسب حالة الاستخدام. وكلها نماذج مفتوحة (مجانية الاستخدام).

Llama 3.2 (7B)

الخيار المفضّل للبداية. يعمل على جهاز متوسط المواصفات ويردّ بطبيعية. عند التردد، ابدأ من هنا.

Google Gemma 4

تعمل نسخة 12B في ذاكرة 16 GB وتتعامل حتى مع الصوت. توازن بين الخفّة والأداء.

Alibaba Qwen3.5

قوي في المهام متعددة اللغات والبرمجة. وحتى النسخة الكبيرة مصمّمة للعمل على جهاز Mac بذاكرة 64 GB.

DeepSeek وMistral وغيرها

شائعة في الاستدلال وكفاءة التكلفة. مجموعة غنية من الخيارات للاختيار منها بحسب حالة الاستخدام.

تتجدد النماذج بسرعة. والحيلة هي التقدّم خطوة بخطوة: "جرّب أولًا نموذجًا من فئة 7B، وانتقل إلى نموذج أكبر إن قصُر عن حاجتك." وكما في مقارنة الذكاءات السحابية، فإن السبيل لمعرفة ما إذا كان نموذج ما يناسب استخدامك هو أن تجرّبه فعلًا.

6. المحلي مقابل السحابة: متى تستخدم كلًّا منهما

لتعمّق أكبر في الفروق وفجوة الأداء وكيفية الاختيار بين المحلي والسحابي، اطّلع على مقالنا حول LLM المحلي مقابل السحابي.

المحلي والسحابي ليسا خيارًا أحاديًا — فالخطوة الذكية في 2026 هي توزيعهما بحسب الدور.

  • المحلي يناسب: التعامل مع البيانات السرية، والمهام كثيفة الحجم أو المتكررة، والبيئات دون اتصال، والأعمال الروتينية التي تريد إبقاء تكلفتها منخفضة.
  • السحابي يناسب: المسائل الصعبة التي تتطلب أعلى دقة، والبحث الذي يحتاج إلى معلومات محدّثة، والبرمجة الثقيلة — حيث تتألق النماذج من الطراز الأول مثل ChatGPT وClaude وGemini.

على سبيل المثال، أسلوب "أنجِز المسودّات والتصنيف والتلخيص محليًا بالمجان، وأرسِل فقط اللمسة النهائية أو الأجزاء الصعبة إلى السحابة" يعمل جيدًا. فخفض التكلفة المؤسسي المذكور آنفًا اعتمد تحديدًا على هذا النوع من التوزيع.

الخلاصة

ثلاث خلاصات بشأن نماذج LLM المحلية.

  • ما هو: تشغيل نموذج ذكاء اصطناعي على جهازك الخاص. البيانات لا تغادر أبدًا، بلا رسوم API ولا قيود على العمل دون اتصال.
  • كيف تبدأ: LM Studio للمبتدئين، وOllama للمطوّرين. ابدأ بنموذج صغير من فئة 3B–7B. ووفّر الذاكرة عبر الكمّنة (Q4_K_M).
  • متى تستخدمه: السحابة أذكى. استخدم المحلي للأعمال السرية وكثيفة الحجم والتي تجري دون اتصال، والسحابة للمسائل الصعبة — والجمع بينهما هو الأفضل.

ابدأ بتثبيت LM Studio وتشغيل نموذج صغير واحد. فتجربة "ذكاء اصطناعي يحاورك بالكامل داخل جهازك الخاص" منعشة أكثر مما تتوقع. وإن أردت فهم آلية العمل، فاطّلع أيضًا على كيف تعمل نماذج LLM.

الأسئلة الشائعة

س. هل سيعمل على حاسوب محمول اعتيادي؟

ج. بذاكرة نحو 8 GB، سيعمل نموذج صغير من فئة 3B–7B. وبذاكرة 16 GB أو أكثر، تعمل نماذج فئة 12B بسلاسة أيضًا. والتوصية هي أن تبدأ صغيرًا وتزيد الحجم بما يلائم جهازك.

س. هل نموذج LLM المحلي أذكى من ChatGPT؟

ج. عند ذروة الدقة، تتقدّم الذكاءات السحابية من الطراز الأول (نماذج ChatGPT وClaude الأرقى). فقوة نموذج LLM المحلي ليست في الذكاء الخام بل في الخصوصية والتكلفة والعمل دون اتصال. وللغرض المناسب، فهو عملي تمامًا.

س. هل هو مجاني تمامًا؟

ج. الأدوات والنماذج المفتوحة مجانية، ولا توجد رسوم API. كل ما تدفعه هو الكهرباء، وعند الحاجة، التكلفة الأولية لجهاز كمبيوتر أو كرت رسوميات. وكلما أكثرت من استخدامه، صار كل تشغيل أرخص.

س. كم من الجودة تُفقَد بسبب الكمّنة؟

ج. مع Q4_K_M المفضّل، يكاد الفرق لا يُلحَظ في معظم الاستخدامات. فهو يحافظ على الجودة شبه كاملة بينما يقلّص الذاكرة إلى نحو الربع، لذا نادرًا ما يكون اختيار Q4_K_M أولًا خاطئًا.