المحتويات
- 1. ما الذي تغيّر — النماذج المفتوحة بلغت مرتبة الوكلاء
- 2. هناك نوعان من الأدوات — Continue و Cline ليسا الشيء نفسه
- 3. أول مطبّ — طول السياق تحدّده ذاكرة VRAM لديك
- 4. اختيار النموذج — الحل الواقعي بحسب VRAM
- 5. الإعداد — أقصر طريق
- 6. الفارق مع السحابة صار يصعب قياسه
- 7. هل المحلي مجاني حقًا؟
- 8. الخلاصة في متى تختار ماذا
- الخلاصة
- الأسئلة الشائعة
أن تجعل نموذجًا يعمل على حاسوبك أنت يكتب الشيفرة. هذا بحدّ ذاته ممكن منذ سنوات، لكن الممكن كان الإكمال فحسب: ملء بقية السطر الذي بدأت كتابته. أما الاستخدام الوكيلي، حيث يقرأ النموذج المستودع ويعدّل عدة ملفات ويشغّل الاختبارات، فكان أثقل من أن يعمل محليًا.
ثم بدأ ذلك يتحرّك من أواخر 2025 وعبر 2026. يرتّب هذا المقال إلى أين وصل الأمر فعليًا اليوم وأين تتعثّر، اعتمادًا على المصادر الأولية وحدها. والخلاصة مقدَّمًا: الأمر يعمل، لكن هناك بوابة واحدة، وإن لم تغيّر إعدادًا واحدًا فسينكسر عليك بصمت.
📌 عن الأرقام في هذا المقال: كل معيار قياس وكل مواصفة نموذج مأخوذة من إعلان المطوّر نفسه (Mistral AI الرسمي، وبطاقة نموذج Qwen الرسمية، وتوثيق Ollama الرسمي، وتوثيق Cline الرسمي، وAnthropic الرسمي). ولم يُنقل شيء بالواسطة عن مقالات التجميع، لأنني صادفت أثناء البحث عدة مقالات تجميع نسبت درجات نموذج بحجم معيّن إلى نموذج بحجم آخر.
1. ما الذي تغيّر — النماذج المفتوحة بلغت مرتبة الوكلاء
أوضح دليل على هذا التحوّل هو أن مطوّري النماذج أنفسهم صاروا يسوّقون نماذجهم للبرمجة الوكيلية.
تقول بطاقة نموذج Qwen الرسمية إن النموذج يدعم معظم المنصّات مثل Qwen Code و CLINE، ويملك صيغة استدعاء دوال مصمَّمة خصيصًا لذلك، أي أن امتدادات المحرّر مذكورة بالاسم صراحة (Qwen3-Coder-30B-A3B-Instruct model card). بعبارة أخرى، النموذج مبنيّ وفي الحسبان وكيل برمجة بعينه.
وMistral AI تسير في الاتجاه نفسه. فـ Devstral 2 الذي أُعلن في 9 ديسمبر 2025 هو نموذج مخصَّص يستهدف البرمجة الوكيلية صراحة، وقد أُطلق الأصغر منه Devstral Small 2 (24B) برخصة Apache 2.0 (Introducing: Devstral 2 and Mistral Vibe CLI).
حين كان الأمر إكمالًا فقط
إكمال السطر الذي تكتبه. نموذج صغير يكفي، والسياق يمكن أن يبقى قصيرًا. كان يعمل بلا عناء على العتاد المحلي
وحين يصير وكيليًا
تحتاج إلى استدعاءات أدوات تُخرَج بدقّة وإلى سياق طويل يُحفَظ باستقرار. وقد ظهرت نماذج مفتوحة تتخطّى هذا الحدّ
2. هناك نوعان من الأدوات — Continue و Cline ليسا الشيء نفسه
إن بدأت وأنت تخلط بينهما، فلن تتطابق توقّعاتك مع النتائج. كلاهما امتداد لـ VS Code، وكلاهما يتّصل بـ Ollama، لكن فلسفة التصميم مختلفة تمامًا.
| Continue | Cline | |
|---|---|---|
| الطبيعة | حزمة من الإكمال والمحادثة والتحرير | وكيل برمجة يعمل باستقلالية |
| كيفية توزيع الأدوار | نموذج منفصل لكل دور — chat / edit / apply / rerank / autocomplete |
نموذج واحد يخطّط وينفّذ حتى النهاية |
| متطلّبات العتاد | منخفضة. بضعة غيغابايت من النموذج تكفي للإكمال | مرتفعة. يحتاج إلى سياق طويل واستدعاءات أدوات دقيقة |
| ما يناسبه | تسريع يديك أنت وأنت تكتب | تسليم مهمة كاملة |
تصميم Continue القائم على نموذج لكل دور ينسجم جيدًا مع العتاد المحلي، لأنك تستطيع أن تمنح الإكمال نموذجًا صغيرًا سريعًا والمحادثة نموذجًا أكبر. ودليل Ollama الرسمي يذكر نماذج خفيفة بالاسم للإكمال، مثل qwen2.5-coder:1.5b و starcoder2:3b (Continue — Ollama guide).
⚠️ ومع ذلك، فالنماذج الموصى بها في التوثيق الرسمي قد تكون قديمة. فالدليل أعلاه يقترح llama3.1:8b و deepseek-r1:32b للمحادثة، وهذه متأخّرة بعدة أجيال عمّا يمكنك اختياره اليوم. الخطوات في التوثيق ما زالت صالحة، لكن لا تأخذ أسماء النماذج على علّاتها، وأعد اختيارها من القسم 4 «اختيار النموذج» أدناه.
3. أول مطبّ — طول السياق تحدّده ذاكرة VRAM لديك
هذا أهم قسم في المقال. إن فاتك، وقعت في الحالة التي ينجح فيها الإعداد ثم يبدأ الوكيل بالتصرّف على نحو غير مفهوم في منتصف الطريق. والأدهى أنه لا يظهر أي خطأ.
السبب هو طول السياق الافتراضي في Ollama. فهو ليس قيمة ثابتة، بل يُختار تلقائيًا بحسب مقدار VRAM لديك (Ollama — Context length).
| VRAM | طول السياق الافتراضي |
|---|---|
| أقل من 24 GiB | 4k |
| من 24 إلى 48 GiB | 32k |
| 48 GiB فأكثر | 256k |
حاسوب الألعاب المعتاد (من 8 إلى 16 غيغابايت VRAM) يقع في الصف الأول. أي 4k. والوكيل يتجاوز ذلك بسهولة بمجرد إضافة موجّه النظام ومحتويات الملفات وذهاب استدعاءات الأدوات وإيابها، فيُقتطع أول المحادثة بهدوء. ينسى التعليمات، ويكرّر العملية نفسها، ويفقد الهدف في منتصف الطريق: والسبب ليس غباء النموذج، بل أن السياق يُرمى عند الباب.
ولهذا الاستخدام بالتحديد، ينصّ توثيق Ollama على أن تضبط السياق على 64000 رمز على الأقل للأعمال الثقيلة كالبحث على الويب وأدوات البرمجة. ويجري الضبط عبر متغيّر بيئة عند تشغيل الخادم.
OLLAMA_CONTEXT_LENGTH=64000 ollama serve
وإن كنت تستخدم نسخة التطبيق، ففي شاشة الإعدادات شريط تمرير يفعل الشيء نفسه.
⚠️ لكن رفعه ليس نهاية القصة. فالتوثيق يحذّر من أن زيادة طول السياق تزيد مقدار الذاكرة التي يحتاجها النموذج ليعمل.
وحين لا يعود يتّسع داخل VRAM، يُدفع جزء من النموذج إلى المعالج فيصير كل شيء أبطأ بصورة هائلة. تحقّق من أن الإعداد يعمل فعلًا باستخدام ollama ps — وهذا ما يرشدك إليه التوثيق. فهناك ترى ما إذا كان النموذج محمَّلًا بالكامل على المعالج الرسومي.
ولدى Cline جوابه الخاص على المشكلة نفسها. فالتوثيق الرسمي يوصي بـ تفعيل Use Compact Prompt وبـ إبقاء المهام ضيّقة، لأن السياق الأصغر يستجيب أسرع (Cline — Running models locally). فموجّه النظام الخاص بالوكيل نفسه طويل، ولذلك وُضع إعداد مخصَّص لتقليصه.
4. اختيار النموذج — الحل الواقعي بحسب VRAM
لا تعتمد على توصيات مقالات التجميع. ففي ما اطّلعت عليه، أدرج بعضها نماذج من منتصف 2025 بوصفها «اختيار 2026»، وأحدها وضع درجة نموذج بحجم 480B في خانة نموذج بحجم 30B. وما يلي هو ما نشره المطوّرون أنفسهم فقط.
| النموذج | الحجم | السياق | الرخصة | SWE-bench Verified |
|---|---|---|---|---|
| Qwen3.6-35B-A3B | 35B (3B نشطة) | 262,144 (حتى 1,010,000) | Apache 2.0 | 73.4 |
| Devstral Small 2 | 24B | 256K | Apache 2.0 | 68.0% |
| Devstral 2 (للمقارنة، وهو أكبر من اللازم) | 123B | 256K | Modified MIT | 72.2% |
المصادر: بطاقة نموذج Qwen3.6-35B-A3B (Terminal-Bench 2.0 هي 51.5 و QwenClawBench هي 52.6) وإعلان Mistral AI الرسمي (9 ديسمبر 2025). وهذه الدرجات قاستها كل جهة على نماذجها بنفسها، لا جهة ثالثة تشغّلها جنبًا إلى جنب.
والرقم الجدير بالانتباه هو «3B نشطة» في Qwen3.6-35B-A3B. فمن أصل 35B، لا يعمل فعليًا في كل مرور إلا ما يعادل 3B، وهنا تُثبت بنية MoE (مزيج الخبراء) جدواها. إنها بنية تسعى إلى ذكاء النموذج الكبير وسرعة النموذج الصغير في آن واحد، وهو ما يجعلها مناسبة للاستخدام المحلي.
حجم التنزيل والمواصفات المطلوبة
في مكتبة Ollama، يقدّم qwen3.6 نسختَي 27b (18GB) و 35b (23GB) جنبًا إلى جنب. وهناك أيضًا وسوم -mlx لأجهزة Mac.
وإرشاد Cline الرسمي بشأن الذاكرة يقول: من 16 إلى 32GB للنماذج الصغيرة، ومن 32 إلى 64GB لنماذج البرمجة المتوسطة، و64GB فأكثر للنماذج الكبيرة مع سياق أوسع.
VRAM من 8 إلى 12GB
اقتصر على الإكمال مع Continue. إمّا أن تتخلّى عن المسار الوكيلي أو تجمعه مع السحابة
VRAM من 16 إلى 24GB
Devstral Small 2 (24B) في المتناول. والتكميم إلزامي لأنك تحتاج إلى فسحة لرفع السياق
VRAM 24GB فأكثر / ذاكرة موحّدة 32GB فأكثر
Qwen3.6 بحجم 27b أو 35b يصير واقعيًا. والسياق الافتراضي يرتفع أيضًا إلى 32k
وتكتب Mistral أن Devstral Small 2 يعمل على بطاقات المستهلك، بل وعلى تركيبات بالمعالج وحده. لكن يحسن أن تبقي في ذهنك أن «يعمل» و«يعمل بسرعة عملية كوكيل» أمران مختلفان.
5. الإعداد — أقصر طريق
1. ثبّت Ollama واضبط السياق
الترتيب مهمّ. حدّد طول السياق قبل أن تسحب نموذجًا.
OLLAMA_CONTEXT_LENGTH=64000 ollama serve
أما خطوات التثبيت نفسها فقد تناولناها في الدليل الكامل إلى Ollama، فارجع إليه.
2. اسحب نموذجًا
ollama pull qwen3.6:27b
وإن كانت VRAM ضيّقة، فاختر Devstral Small 2 بدلًا منه. وما يفصل كليهما عن نموذج محادثة عام هو أنهما بُنيا والاستخدام الوكيلي في الحسبان.
3. تأكّد أنه على المعالج الرسومي
ollama ps
لا تتخطَّ هذا الفحص. فإن كان جزء من النموذج قد دُفع إلى المعالج، صارت التجربة شيئًا آخر تمامًا. ومعظم أحكام «النماذج المحلية أبطأ من أن تُستخدم» يعود أصلها إلى هذا بالضبط.
4. اربط الامتداد
في Cline و Continue معًا، اختر Ollama مزوّدًا ووجّهه إلى http://localhost:11434. وتحذير Cline الرسمي بسيط: تأكّد من أن Ollama يعمل قبل أن ترسل موجّهًا، ولا حاجة إلى أي ضبط خاص.
وإن كنت تستخدم Cline، فـ فعّل Use Compact Prompt في الوقت نفسه.
6. الفارق مع السحابة صار يصعب قياسه
هنا أريد أن أكون صريحًا. فالمقارنة النظيفة من نوع «النماذج المحلية بلغت كذا بالمئة من السحابة» لا يمكن إنتاجها الآن. والسبب أن معايير القياس لم تعد تتطابق.
جانب النماذج المفتوحة ينشر SWE-bench Verified: 73.4 لـ Qwen3.6-35B-A3B، و68.0% لـ Devstral Small 2. أما جانب الطليعة فينجرف بعيدًا عن هذا المقياس.
وفعلًا، فإن إعلان Anthropic عن Claude Opus 5 لا يحمل أي رقم لـ SWE-bench Verified إطلاقًا. فما يورده هو Frontier-Bench v0.1 و CursorBench 3.2 و AA Coding Agent Index و FrontierCode 1.1، وكثير منه مصاغ بعبارات نسبية لا مطلقة (أكثر من ضعف أداء Opus 4.8، وضمن 0.5% من ذروة درجة Fable 5، وما شابه).
⚠️ ولذلك حين ترى ادّعاءً بأن المحلي بلغ نسبة ما من Claude، فالأولى أن تشكّ فيه. فالأرجح أن الطرفين لم يُقاسا بالمقياس نفسه، أو أن المقارنة مع Claude من أجيال عدّة مضت. فاليوم لا يكاد SWE-bench Verified يصفّ إلا النماذج المفتوحة بعضها إلى بعض.
ما يمكن قوله عن الفارق رغم ذلك
حتى بلا أرقام متطابقة، فإن المواضع التي يظهر فيها الفارق بنيويًا واضحة بما يكفي.
حيث يتفوّق المحلي
شيفرتك لا تغادر الجهاز، ولا فوترة بالاستهلاك (شغّله كما تشاء)، ويعمل دون اتصال، ولا حدود معدّل
حيث تتفوّق السحابة
الاستدلال الممتدّ عبر عدة ملفات، والثبات في التشغيل الذاتي الطويل، ولا استثمار مبدئي، والنموذج يتجدّد من تلقاء نفسه
وثمة سبب لظهور الفارق أوضح ما يكون في «الاستدلال الممتدّ عبر عدة ملفات». فذلك عمل يستهلك السياق بكثافة ويكدّس عشرات الأحكام بعضها فوق بعض. وفارق الدقّة في حكم واحد يتضاعف مع كل ذهاب وإياب. ففارق لا تلحظه وأنت ترمّم ملفًا واحدًا يصير محسوسًا على مقياس المستودع كلّه.
7. هل المحلي مجاني حقًا؟
صحيح أن فاتورة الـ API لا تصلك، لكنه ليس مجانيًا. فشكل التكلفة هو ما تغيّر لا غير.
| البند | محليًا | سحابيًا |
|---|---|---|
| التكلفة المبدئية | بطاقة رسومية بذاكرة VRAM كبيرة أو ذاكرة موحّدة وفيرة | لا شيء |
| التكلفة التي تكبر مع الاستخدام | الكهرباء فقط | فوترة بالرموز أو اشتراك ثابت |
| التكلفة التي يسهل إغفالها | جهد الإعداد والصيانة ومواكبة إصدارات النماذج | لا شيء (يتحمّلها المزوّد) |
ولذلك فإن «أيّهما أرخص» ينقلب بحسب ما تقارنه. فإن كنت تملك أصلًا بطاقة من فئة 24GB، فالمحلي يعمل بتكلفة إضافية تقارب الصفر. وإن لم تكن تملكها، فإن ثمن تلك البطاقة يشتري لك سنوات من الاشتراك. والأدقّ أن تعدّ الجواب متوقّفًا على أمرين: هل تشغّل الكثير يوميًا، وهل تملك العتاد أصلًا.
8. الخلاصة في متى تختار ماذا
أسباب وجيهة لاختيار المحلي
الشيفرة لا يجوز أن تغادر المؤسّسة (عقود أو لوائح داخلية)، والعتاد موجود لديك أصلًا، وترغب في التجريب دون عدّ الطلبات، أو تعمل دون اتصال
أسباب غير وجيهة
«لأنه مجاني» (لم تُحسَب كلفة العتاد)، و«لأنه يبدو سريعًا» (السحابة أسرع في الغالب)
وأكثر التركيبات واقعية هي استخدام الاثنين معًا. سلّم إكمال Continue إلى نموذج محلي صغير ودعه يعمل طوال الوقت، ثم مرّر الأعمال الكبيرة إلى وكيل سحابي. فالإكمال متكرّر وخفيف في كل نداء، وهذا يناسب المحلي؛ والوكيل نادر وثقيل في كل نداء، وهذا يناسب السحابة — شكل الحمل معكوس تمامًا بينهما.
الخلاصة
- النماذج المفتوحة بلغت البرمجة الوكيلية. فكلٌّ من Qwen و Mistral يطرح الآن نماذج مخصَّصة تذكر امتدادات المحرّر بالاسم
- أكبر بوابة هي طول السياق الافتراضي في Ollama. فتحت 24GiB من VRAM يكون 4k، وينكسر الوكيل بصمت. والتوصية الرسمية لأعمال البرمجة هي 64000 فأكثر
- وبعد أن ترفعه، تحقّق بـ
ollama psمن أن النموذج على المعالج الرسومي. فإن دُفع إلى المعالج المركزي صار بطئًا من نوع آخر - Continue و Cline أداتان مختلفتان. الأولى تسنِد نموذجًا لكل دور للإكمال، والثانية وكيل مستقلّ. ومتطلّبات العتاد تختلف بينهما
- مقارنات «كم بالمئة من السحابة» لم تعد تصمد. فجانب الطليعة ينجرف بعيدًا عن نشر SWE-bench Verified
- ليس «مجانيًا» بل التكلفة بشكل مختلف. والجواب ينقلب بحسب امتلاكك العتاد أصلًا
الأسئلة الشائعة
س1. هل أستطيع تشغيل النمط الوكيلي على بطاقة بذاكرة VRAM سعتها 8GB؟
الأمر عسير، لأنه حتى لو اتّسع النموذج نفسه، فلن تبقى فسحة لرفع السياق. فالقيمة الافتراضية في Ollama تهبط إلى 4k تحت 24GiB من VRAM، ودفعها إلى 64000 يزيد الذاكرة المطلوبة، وهو ما يصعب التوفيق بينه وبين 8GB. والخياران الواقعيان هما الاقتصار على الإكمال مع Continue، أو تشغيل الإكمال محليًا ووضع الوكيل في السحابة.
س2. Cline أم Continue، بأيّهما أبدأ؟
إن كانت هذه تجربتك الأولى مع نموذج محلي، فابدأ بـ Continue، لأن متطلّباته من العتاد أقل ولأن عزل المشكلات أسهل حين لا تسير الأمور. تأكّد أولًا من أن الإكمال يعمل بسلاسة قبل الانتقال إلى المسار الوكيلي، وعندها ستستطيع أن تميّز إن كانت المشكلة في النموذج أم في الضبط.
س3. هل يعمل على جهاز Mac؟
نعم. فالذاكرة الموحّدة تقوم مقام VRAM، ولذلك يسهل تحميل النماذج الكبيرة فعلًا. ومكتبة Ollama تقدّم أيضًا وسوم -mlx من qwen3.6 لمعالجات Apple Silicon. لكن انتبه إلى أن قاعدة اشتقاق طول السياق الافتراضي من حجم الذاكرة تسري هنا كذلك، فالتحقّق ما زال ضروريًا.
س4. أيّ نموذج هو «الأذكى»؟
بالدرجات المنشورة وحدها، الأعلى بين ما ورد هنا هو Qwen3.6-35B-A3B بدرجة 73.4 على SWE-bench Verified. لكن هذه قياسات كل جهة على نماذجها، لا مقارنة من طرف ثالث جنبًا إلى جنب. وعمليًا، فإن الرخصة (Devstral Small 2 و Qwen3.6 كلاهما Apache 2.0) وما إذا كان النموذج يتّسع في VRAM لديك أهمّ من ذلك.
س5. لماذا «ينكسر دون أن يظهر خطأ»؟
لأن كل ما يتجاوز طول السياق يُعالَج على أنه اقتطاع لا خطأ. فالنموذج يستجيب استجابة سليمة تمامًا للنطاق الذي سُلّم إليه. والنتيجة تظهر في صورة تعليمات منسيّة وعمليات مكرَّرة وهدف ضائع، ويبدو الأمر كأن النموذج ببساطة غير قادر. ومعرفتك بأن هذا العرض ينبغي أن يوجّه شكّك إلى الضبط تغيّر تمامًا سرعة تضييق دائرة البحث.
س6. أيّ تكميم ينبغي أن أختار؟
إن كنت متردّدًا، فالبدء عند Q4_K_M خيار آمن. والفروق بين الصيغ (GGUF / GPTQ / AWQ) وكيفية الاختيار مجموعة في الدليل الكامل إلى صيغ التكميم. وفي أعمال البرمجة، فإن «نموذجًا أصغر قليلًا بتكميم أخفّ» يميل إلى أن يكون أثبت من «نموذج أكبر بتكميم أشدّ»، لأن صيغة استدعاء الأدوات يجب أن تُتَّبع بدقّة.
س7. هل من الآمن استخدامه على شيفرة الشركة؟
ما دام كل شيء يبقى محليًا، فالشيفرة لا تغادر الجهاز، وهذه أكبر ميزة مفردة للنموذج المحلي. لكن افحص إعدادات الامتداد نفسه: فحتى مع توجيه المزوّد إلى Ollama، قد يظلّ القياس عن بُعد أو ميزة أخرى تتحدّث إلى الخارج. وما إذا كانت لوائحك تسمح بذلك مسألة منفصلة عن التقنية، فتحقّق من قواعد مؤسّستك أولًا.
مقالات ذات صلة
- الدليل الكامل إلى Ollama — التثبيت والأوامر الأساسية
- مقارنة أفضل النماذج المحلية — كيف تختار بحسب الاستخدام والحجم
- مواصفات الحاسوب اللازمة لنموذج محلي — مرجع سريع لـ VRAM والبطاقات
- الدليل الكامل إلى صيغ التكميم — الاختيار بين GGUF و GPTQ و AWQ
- النماذج المحلية مقابل السحابية — فجوة الأداء وكيفية الاختيار