تحديث بتاريخ 25 سبتمبر 2026: يقارن هذا المقال بين Claude Opus 4.8 وGPT-5.6 Sol كما كانا في يوليو 2026. ومنذ ذلك الحين أصدرت Anthropic نموذجَي Claude Opus 5 (24 يوليو) وClaude Fable 5.1 (1 سبتمبر)، وأصدرت OpenAI نموذج GPT-6 Astra (3 سبتمبر). وللمقارنة في التكلفة راجع مقالنا الذي يقيس Astra عند low مقابل Sol عند high. ثم في 22 سبتمبر أصدرت Anthropic نموذج Claude Opus 5.5، وأصدرت OpenAI (بتوقيت الولايات المتحدة) نموذجَي GPT-6 Sol وGPT-6 Luna، وهما الجيل التالي بعد GPT-5.6 Sol. وتنصح Anthropic الآن، إن لم تكن متأكدًا من النموذج المناسب، بالبدء بنموذج Opus 5.5 لمعظم الاستخدامات. ولا يزال Opus 4.8 متاحًا عبر API بصفته نموذجًا قديمًا (Legacy)، ويبقى GPT-5.6 Sol متاحًا خلال الفترة الانتقالية. أما عبارات مثل «الرائد» و«يتصدر» وقيم الاختبارات المعيارية في النص أدناه فهي بحسب وقت الكتابة. وفي 22 سبتمبر صحّحنا أيضًا قيم الاختبارات المعيارية بالرجوع إلى المصادر الأصلية. فاختبارا GPQA Diamond وFrontierMath، اللذان وصفناهما بأنهما غير معلنين، موجودان في جدول التقييم لدى OpenAI ويتقدّم فيهما Sol. وفي الجدول نفسه يتفوّق Sol (77.1%) على Opus 4.8 (68.1%) في GraphWalks 1M أيضًا، لذا صحّحنا القول بأن Opus يتصدّر في الرياضيات والسياق الطويل.

في يوليو 2026، اكتمل تنافس نموذجين على صدارة البرمجة بالذكاء الاصطناعي. Anthropic Claude Opus 4.8 (صدر في 28 مايو) والطراز الأعلى «Sol» من OpenAI GPT-5.6 (بدأ توفره العام في 9 يوليو). يأتي GPT-5.6 بمنظومة من ثلاثة نماذج Luna/Terra/Sol، وSol هو الأعلى فيها.

كلا النموذجين يرفع شعار «البنية التحتية للوكلاء من الجيل التالي» ويتصادمان وجهًا لوجه، لكن مجالات تفوقهما متعاكسة بشكل لافت. فـSol يتصدر في التحكم بالطرفية والقدرة الوكيلة الشاملة، بينما Opus 4.8 يتصدر في البرمجة على مستوى الإنتاج الحقيقي و«الصدق» — تقسيم أدوار واضح للغاية. في هذا المقال نُجري مقارنة معمقة استنادًا إلى الإعلانات الرسمية للشركتين والاختبارات المعيارية المستقلة (Vellum وArtificial Analysis وغيرهما)، ونرتّب من منظور عملي إجابة سؤال «أيهما يجب أن أستخدم وكيف في النهاية».

FRONTIER FACEOFF · 2026

القطبان المتنافسان على صدارة البرمجة

— مجالات التفوق متعاكسة تقريبًا

ANTHROPIC
Claude Opus 4.8
صدر في 28 مايو 2026
SWE-bench Pro: 69.2%
TerminalBench 2.1: 78.9%
السياق: 1M / الإخراج 128K
السعر: $5 / $25 لكل MTok
VS
OPENAI
GPT-5.6 Sol
بدأ توفره العام في 9 يوليو 2026
SWE-bench Pro: 64.6%
TerminalBench 2.1: 88.8%
السياق: 1.05M / الإخراج 128K
السعر: $5 / $30 لكل MTok

Opus 4.8: قوي في حل قواعد الشيفرة الحقيقية والموثوقية، «نموذج الحِرَفي»
Sol: قوي في التحكم بالطرفية والقدرة الوكيلة الشاملة، «نموذج الشامل متعدد المهام»

1. موقع كل نموذج والفرق في الفلسفة

عند الإطلاق كان كلاهما يهدف إلى أن يكون «بطل أحمال عمل الوكلاء»، لكن نقاط الجذب لديهما مختلفة بوضوح.

Claude Opus 4.8 — «حِرَفي يُنجز داخل قاعدة الشيفرة الحقيقية»

وضعت Anthropic محور Opus 4.8 لا في «تكديس أرقام الاختبارات» بل في «أن يكون أكثر صدقًا». فقد سجّل 69.2% في SWE-bench Pro الذي يقيس إصلاح مستودعات GitHub الحقيقية (بزيادة +4.9 نقطة عن 64.3% في الجيل السابق Opus 4.7)، محافظًا على الصدارة في البرمجة على مستوى الإنتاج الحقيقي. وإضافةً إلى ذلك، يُبرز مؤشرات الموثوقية والنزاهة: فبحسب إعلان Anthropic، صار يمرّر العيوب في الشيفرة التي كتبها دون أن يشير إليها بمعدل يقارب ربع ما كان عليه الجيل السابق، ويذكر Transparency Hub لدى Anthropic أنه لا يُغفل إبلاغ المستخدم بالإخفاقات المهمة في عمله (اختبارات لم تنجح، وميزات لم تُبنَ) إلا في 3.7% من الحالات.

GPT-5.6 Sol — «النموذج الشامل للوكيل الذي يتحكم بالطرفية»

طرحت OpenAI نموذج GPT-5.6 عبر ثلاثة نماذج (Luna/Terra/Sol) وجعلت Sol في القمة. فقد حقّق 88.8% في TerminalBench 2.1 الذي يقيس التحكم الذاتي بالطرفية، و53.6 في Agents' Last Exam الذي يقيس المهام العملية طويلة الأمد عبر 55 مجالًا، و80 في Artificial Analysis Coding Agent Index كمؤشر لوكلاء البرمجة، ليتصدّر في التخطيط والتحكم بالطرفية والقدرة الوكيلة الشاملة. كما تحسّنت كفاءة الرموز في البرمجة بنسبة 54%، وتصفه الشركة بأنه «أقوى نموذج للأمن السيبراني» (المصدر: الإعلان الرسمي لـOpenAI وCNBC وVellum).

DESIGN PHILOSOPHY

العمق والصدق مقابل الاتساع والكفاءة

OPUS 4.8 — DEPTH & HONESTY
  • · يُصلح قواعد الشيفرة الحقيقية بعمق ودقة
  • · يتفوّق على Sol في SWE-bench Pro (69.2% مقابل 64.6%)
  • · يمرّر عيوب شيفرته دون إشارة بنحو ربع معدل الجيل السابق
  • · سعر وحدة منخفض وثابت ($5/$25)
GPT-5.6 SOL — BREADTH & SPEED
  • · متصدّر في التحكم بالطرفية والقدرة الوكيلة الشاملة
  • · متصدّر TerminalBench / Agents' Last Exam
  • · كفاءة رموز +54% وتعزيز الأمان
  • · ثلاثة نماذج للاختيار حسب الاستخدام (Luna/Terra/Sol)

2. جدول المواصفات السريع

البندClaude Opus 4.8GPT-5.6 Sol
المزوّدAnthropicOpenAI
تاريخ الإصدار28 مايو 20269 يوليو 2026 (التوفر العام)
معرّف النموذجclaude-opus-4-8gpt-5.6-sol (الأعلى ضمن Luna/Terra/Sol)
طول السياق1,000,000 tokens1,050,000 tokens
أقصى رموز إخراج128,000 tokens128,000 tokens
حد المعرفةالنصف الأول من 2026 (إعلان تدريجي)16 فبراير 2026
سعر الـAPI$5 / $25 لكل MTok (ثابت)$5 / $30 لكل MTok (سعر ترويجي لمدة ثلاثة أشهر اعتبارًا من 21 أغسطس 2026: $4 / $20)
التحكم في الاستدلالمعامل effort (4 مستويات) + تفكير تكيّفيreasoning effort (none/low/medium/high/xhigh/max)
ميزات جديدة بارزةdynamic workflows (معاينة بحث بوكلاء فرعيين متوازيين)، مدخل system في Messages API، fast mode (أسرع بنحو 2.5 مرة)Programmatic Tool Calling (ربط الأدوات عبر توليد JS)، ChatGPT Work، صوت مزدوج الاتجاه GPT-Live
قنوات التوفرجميع خطط Claude.ai وAPI وAWS وVertex AI وMicrosoft FoundryChatGPT وChatGPT Work وCodex وOpenAI API

* الأسعار والمواصفات مبنية على الإعلانات الرسمية للشركتين (Opus 4.8 = 28 مايو 2026، GPT-5.6 = 9 يوليو 2026). يُرجى ملاحظة أن قيم الاختبارات المعيارية ليست مقارنة صارمة على أرضية واحدة، لأن شروط القياس وتوقيته وأدواته (harness) تختلف بين الشركتين. أما القيم المتقابلة للنموذجين (SWE-bench Pro وTerminalBench 2.1 وAgents' Last Exam وCoding Agent Index وGraphWalks وGPQA Diamond وFrontierMath) فمصدرها جدول التقييم في إعلان OpenAI عن GPT-5.6 الذي يضم النموذجين (وCoding Agent Index مؤشر من Artificial Analysis). وبعض قيم Opus 4.8 فيه لا تطابق ما نشرته Anthropic نفسها، فمثلًا TerminalBench 2.1 يبلغ 78.9% في جدول OpenAI و74.6% في جدول إعلان Anthropic.

3. مقارنة تفصيلية للاختبارات المعيارية

كثيرًا ما يُقال إن «النماذج العليا متقاربة في القدرة»، لكن هناك فروقًا واضحة في الاتجاهات حسب كل اختبار معياري. ويمكن القول إن مجالات التفوق متعاكسة تقريبًا.

3-1. البرمجة

CODING BENCHMARKS

حل الشيفرة الحقيقية لـ Opus، والتحكم بالطرفية لـ Sol

SWE-bench Pro (إصلاح مستودعات حقيقية)Opus 69.2% vs Sol 64.6%
Opus 4.8
Sol
TerminalBench 2.1 (تحكم ذاتي بالطرفية)Sol 88.8% vs Opus 78.9%
Sol
Opus 4.8
Coding Agent Index (Artificial Analysis)Sol 80 في الصدارة
Sol 80
* مؤشر شامل لوكلاء البرمجة من Artificial Analysis. كان Sol في القمة عند الإطلاق

المصدر: جدول التقييم في إعلان OpenAI عن GPT-5.6 (قيم Opus 4.8 من الجدول نفسه؛ وCoding Agent Index من Artificial Analysis)

النقطة الجوهرية هي أن «ما يقيسه كل اختبار معياري» مختلف. فـSWE-bench Pro يقيس توليد تصحيحات (patches) لمشكلات GitHub الحقيقية، أي القدرة على إصلاح قاعدة شيفرة قائمة. أما TerminalBench 2.1 فهو مجموعة مهام للتحكم الذاتي بالطرفية عبر سطر الأوامر، ويقيس أداء حلقة التخطيط والتنفيذ. Opus 4.8 يفوز في الأول، وSol في الثاني — وهذا يترجم مباشرةً إلى تقسيم أدوار عملي: «للتعامل مع طلبات السحب (PR) الكبيرة في مستودعات حقيقية اختر Opus، ولبناء شيء من الصفر عبر الـCLI أو الوكلاء اختر Sol».

3-2. الوكلاء والمهام طويلة الأمد

الاختبار المعياريما يقيسهClaude Opus 4.8GPT-5.6 Solالفائز
Agents' Last Examسير عمل عملي طويل الأمد عبر 55 مجالًا45.253.6Sol
Coding Agent Indexوكلاء البرمجة بشكل شامل72.580 (الصدارة)Sol
TerminalBench 2.1التحكم الذاتي بالطرفية78.9%88.8%Sol
SWE-bench Proإصلاح أخطاء المستودعات الحقيقية69.2%64.6%Opus 4.8
GraphWalks (F1 لسياق 1M طويل)تتبّع السياق الطويل وحل الإحالات68.1%77.1%Sol

المصدر: جدول التقييم في إعلان OpenAI عن GPT-5.6 (قيم Opus 4.8 من الجدول نفسه). وقيمة Sol البالغة 53.6 في Agents' Last Exam مأخوذة من نص الإعلان، بينما يذكر الجدول في الصفحة نفسها 52.7%.

في اتساع الوكلاء يتفوّق Sol بقوة وعرض أكبر. ويظهر الفرق في المجالات الأقرب إلى «التنفيذ الذاتي» مثل التحكم بالطرفية وسير العمل المركّب طويل الأمد. أما ما يتقدّم فيه Opus 4.8 فهو الإصلاح الدقيق لقواعد الشيفرة الحقيقية (SWE-bench Pro)، وفي تتبّع السياق الطويل يضع الجدول نفسه Sol في المقدمة في GraphWalks 1M (77.1% مقابل 68.1%). إنها معادلة «اتساع Sol، وإصلاح Opus للشيفرة الفعلية».

3-3. الاستدلال والرياضيات والموثوقية

REASONING · MATH · TRUST

في الرياضيات والسياق الطويل يتقدّم Sol في الجدول نفسه

FrontierMath T1–3
89%
Sol

رياضيات بمستوى البحث (Tier 1-3). وفي الجدول نفسه سجّل Opus 4.8 نسبة 80% (Tier 4: 83% مقابل 56.1%)

GraphWalks 1M
77.1%
Sol

درجة F1 لسياق طويل بمليون رمز. ويسجّل Opus 4.8 نسبة 68.1% في الجدول نفسه

GPQA DIAMOND
94.6%
Sol

علوم STEM بمستوى الدراسات العليا. ويسجّل Opus 4.8 نسبة 92% في الجدول نفسه

في جدول OpenAI الذي يضم النموذجين يتقدّم Sol في GPQA Diamond (94.6% مقابل 92% لـ Opus 4.8) وFrontierMath (Tier 1-3: 89% مقابل 80%؛ Tier 4: 83% مقابل 56.1%) وGraphWalks 1M (77.1% مقابل 68.1%)، فلا يمكن القول إن الرياضيات والسياق الطويل ساحة Opus الأساسية. أما Anthropic فتُبرز الموثوقية والنزاهة: فبحسب إعلانها صار Opus 4.8 يمرّر العيوب في الشيفرة التي كتبها دون أن يشير إليها بمعدل يقارب ربع ما كان عليه الجيل السابق، ويذكر Transparency Hub أن نسبة الحالات التي لا يُبلغ فيها المستخدم بالإخفاقات المهمة 3.7% (مقابل 27.6% لـ Mythos Preview، أي تحسّن بخمسة أضعاف). وهذا يؤتي ثماره في المهام التي يكون فيها ثمن الخطأ باهظًا كالطب والقانون والمالية. لكن لا توجد قيم تقارن Sol بالشروط نفسها في هذا الجانب.

4. التحقق من «مشكلة الاختبارات غير المعلنة» — ما يتضمنه الجدول وما يغيب عنه

مما يستحق الانتباه في هذه المقارنة أن التحليل المستقل (Vellum) أشار بُعيد الإطلاق إلى أن OpenAI لم تُعلن عن SWE-bench Verified وGPQA Diamond وAIME وMMLU وARC-AGI-2 وFrontierMath لـ GPT-5.6. غير أن جدول التقييم في صفحة إعلان OpenAI، الذي راجعناه في 22 سبتمبر 2026، يتضمن GPQA Diamond (Sol 94.6%، Opus 4.8 92%) وFrontierMath (Tier 1-3: Sol 89% وOpus 4.8 80%؛ Tier 4: Sol 83% وOpus 4.8 56.1%)، ويتقدّم Sol في كليهما. أما الغائب فهو SWE-bench Verified وAIME وMMLU، وقد ظهرت قيمة Sol في ARC-AGI-2 (92.5%) لأول مرة في جدول إعلان GPT-6 Astra في 3 سبتمبر.

THE BENCHMARK PROBLEM

قيمة SWE-bench Pro لـ Sol في جدول OpenAI نفسها: 64.6%

🟡 تشكيك في الاختبار نفسه
أدرجت OpenAI قيمة 64.6% في جدول تقييمها، لكنها نشرت بشكل منفصل تحليلًا يقدّر أن نحو 30% من مهام SWE-bench Pro معيبة
🔴 بعض المؤشرات غائبة
لا يتضمن الجدول SWE-bench Verified وAIME وMMLU (أما GPQA Diamond وFrontierMath فموجودان ويتقدّم فيهما Sol)
✅ قابل للمقارنة في جدول واحد
يضم جدول OpenAI قيم Opus 4.8 أيضًا (SWE-bench Pro 69.2% وGPQA 92% وGraphWalks 1M 68.1% وغيرها)

* يعكس جدول OpenAI مؤشرات وشروطًا اختارتها OpenAI، وبعض قيم Opus 4.8 فيه تختلف عمّا نشرته Anthropic نفسها (TerminalBench 2.1 يبلغ 78.9% في جدول OpenAI و74.6% في إعلان Anthropic). فلا تقارن إلا القيم الواردة في الجدول نفسه.

حتى في جدول التقييم الذي نشرته OpenAI مع GPT-5.6، تبلغ قيمة SWE-bench Pro لـ Sol 64.6%، وهي أدنى من 69.2% لـ Opus 4.8 (والقيمتان من جدول OpenAI نفسه). أي أنه في «أقرب مؤشر برمجي إلى العمل الفعلي» وهو إصلاح أخطاء المستودعات الحقيقية، تفوّق Opus 4.8. وفي الوقت نفسه نشرت OpenAI تحليلًا يقدّر أن نحو 30% من مهام SWE-bench Pro معيبة (كما أشار Simon Willison). فخلف درجات الوكلاء اللافتة، حافظ Claude على تفوّقه في صميم البرمجة — وهذه أكبر نقطة تفصل بين النموذجين.

5. التكلفة الفعلية — سعر الوحدة وكفاءة الرموز

من حيث سعر الوحدة، يبلغ سعر الإخراج $25/MTok لـ Opus 4.8 و$30/MTok لـ Sol، فاسميًا Opus أرخص بنحو 20%. أما الإدخال فهو $5 للطرفين بالتساوي (غير أنّ Sol على سعر ترويجي لمدة ثلاثة أشهر اعتبارًا من 21 أغسطس 2026، أي $4 للإدخال و$20 للإخراج، فخلال تلك المدة يكون Sol أرخص في الإدخال أيضًا). لكن المبلغ الفعلي للفاتورة يتغيّر حسب «عدد الرموز التي يُخرجها كل نموذج في المهمة الواحدة».

  • عامل تقدّم Sol: تقول OpenAI إن كفاءة الرموز في البرمجة تحسّنت بنسبة 54%، وإذا قلّ حجم الإخراج فقد يتقلّص فارق السعر ($30 مقابل $25) في التكلفة الفعلية أو حتى ينقلب.
  • عامل تكلفة Opus: سعر الوحدة القياسي ثابت ومنخفض، كما تتوفّر خيارات تشغيل مثل fast mode (أسرع بنحو 2.5 مرة). لكن ميله إلى «الشرح ثم الكتابة (narrate-then-code)» يميل إلى زيادة رموز الإخراج.

خلاصة القول، لا يُحسم الأمر بجدول أسعار الوحدة وحده. ففي البرمجة التي يغلب عليها الإخراج، الصواب هو تقدير الإجمالي عبر «سعر الوحدة × حجم الإخراج»، والمقارنة بقياس فعلي لكل حمل عمل. اسميًا Opus أرخص، وفي كفاءة الرموز يتحسّن Sol — إنها معادلة شدّ حبل.

* لا يمكن الجزم بـ«مضاعف التكلفة الفعلية» تحديدًا لأن الشركتين لم تُعلنا عن مقارنة لرموز الإخراج بشروط متطابقة. نوصي بقياس عدد رموز الإخراج لكلا النموذجين على مهامك التمثيلية، ثم ضربها بسعر الوحدة للمقارنة.

6. خريطة نقاط القوة والضعف

STRENGTHS & WEAKNESSES

رغم أنهما من النماذج العليا في الفترة نفسها، فطابعهما متعاكس

CLAUDE OPUS 4.8
◯ نقاط القوة
  • · صدارة البرمجة الفعلية بـ SWE-bench Pro 69.2%
  • · لا يُغفل الإبلاغ عن الإخفاقات المهمة إلا في 3.7% من الحالات (قيمة Anthropic؛ لا توجد قيمة لـ Sol)
  • · يمرّر عيوب شيفرته دون إشارة بنحو ربع معدل الجيل السابق
  • · سعر إخراج منخفض وثابت ($25)
  • · يتقدّم في Toolathlon حتى في جدول OpenAI (59.9% مقابل 58%)
△ نقاط الضعف
  • · أدنى من Sol في التحكم بالطرفية والقدرة الوكيلة الشاملة
  • · ميل السرد يزيد رموز الإخراج بسهولة
  • · في Terminal-Bench 2.1 يتأخر عن GPT-5.5 حتى في جدول Anthropic نفسها (74.6% مقابل 78.2%)
  • · لا يدعم الصوت والفيديو أصلًا
GPT-5.6 SOL
◯ نقاط القوة
  • · صدارة التحكم بالطرفية بـ TerminalBench 88.8%
  • · صدارة Agents' Last Exam وCoding Agent Index
  • · كفاءة رموز +54% وتعزيز الأمان
  • · تحسين حسب الاستخدام عبر ثلاثة نماذج Luna/Terra/Sol
  • · تكامل مع ChatGPT Work / Codex / GPT-Live
△ نقاط الضعف
  • · أدنى من Opus بنحو 4.6 نقطة في SWE-bench Pro
  • · غياب AIME وMMLU وغيرها عن جدول التقييم
  • · سعر الإخراج $30 أعلى من Opus
  • · لا توجد قيم مقارنة مباشرة للنزاهة

7. كيفية الاختيار حسب حالة الاستخدام

حالة الاستخدامالنموذج المُوصى بهالسبب
طلبات السحب وإصلاح الأخطاء وإعادة الهيكلة في المستودعات الحقيقيةOpus 4.8صدارة برمجة الإنتاج بـ SWE-bench Pro 69.2%
الرياضيات والبحث العلمي والاستدلال الدقيقSolفي جدول OpenAI يتقدّم Sol في FrontierMath (Tier 1-3: 89% مقابل 80%) وGPQA Diamond (94.6% مقابل 92%) معًا
تتبّع وحل الإحالات في وثائق طويلة بمستوى 1MSolفي GraphWalks 1M يسجّل Sol نسبة 77.1% في الجدول نفسه (Opus 4.8: 68.1%)
مهام يكون فيها ثمن الخطأ باهظًا كالطب والقانون والماليةOpus 4.8يمرّر عيوب شيفرته دون إشارة بنحو ربع معدل الجيل السابق، ولا يُبلغ عن الإخفاقات المهمة في 3.7% من الحالات (أرقام Anthropic؛ لا مقارنة مباشرة مع Sol)
وكلاء يتحكمون ذاتيًا بالـ CLI والطرفيةSolالصدارة بـ TerminalBench 2.1 88.8%
أتمتة سير عمل مركّب طويل الأمدSolالصدارة بـ Agents' Last Exam 53.6
تحليل الأمن السيبراني والفريق الأزرقSolتصنّفه OpenAI «أقوى نموذج أمني»
تشغيل متكامل يشمل ChatGPT/Codex/الصوتSolمتكامل مع ChatGPT Work وGPT-Live وCodex
معالجة ضخمة بأولوية للتكلفةحسب الاستخدامOpus أرخص سعرًا، وSol أفضل كفاءةً. قارن بقياس فعلي

8. استراتيجية الانتقال والاستخدام المشترك

الحل الواقعي هو أن «التوزيع حسب المهمة» أسهل في تحسين التكلفة والجودة معًا من «التوحيد على أحدهما».

النمط أ. تشغيل بمزوّدين مزدوجين (مُوصى به)

  • البرمجة الأساسية (طلبات السحب والإصلاح في المستودعات الحقيقية): Opus 4.8
  • أتمتة الـ CLI والطرفية: GPT-5.6 Sol
  • أتمتة سير العمل العملي طويل الأمد: Sol (أو Terra لأولوية التكلفة)
  • المهام عالية الموثوقية التي يكون فيها الخطأ مكلفًا: Opus 4.8
  • تحليل الأمان: Sol

النمط ب. أسلوب الموجّه (Router)

عبر OpenRouter / LiteLLM وغيرهما، صنّف نوع المهمة ووزّعها ديناميكيًا. بوضع قاعدة تقول: البرمجة الفعلية لـ Opus، والمهام الوكيلة لـ Sol، والأعمال الخفيفة بأولوية التكلفة لـ GPT-5.6 Terra — يمكنك تقليل التكلفة الفعلية مع كبح الارتباط بمزوّد واحد. وبتحوّل GPT-5.6 إلى منظومة من ثلاثة نماذج، صار من الأسهل أيضًا استخدام Luna/Terra/Sol بثلاث درجات من جانب OpenAI وحده.

النمط ج. تشغيل بمزوّد واحد

إذا تعذّر استخدام عدة مزوّدين لأسباب تتعلق بحوكمة البيانات، اختر حسب الاستخدام الرئيسي. فإذا كانت أصول الشيفرة الحقيقية كبيرة وجودة البرمجة والموثوقية أمرًا حيويًا فـ Opus 4.8، وإذا كان المحور أتمتة سير العمل العملي ووكلاء الطرفية فـ GPT-5.6 (بجعل Sol الأساس وضبط التكلفة عبر Terra/Luna) هو الخيار المباشر.

الخلاصة

  • Opus 4.8: قوي في إصلاح قواعد الشيفرة الحقيقية (SWE-bench Pro 69.2%، أعلى من 64.6% لـ Sol حتى في جدول OpenAI) وفي النزاهة. أما في الرياضيات (FrontierMath وGPQA Diamond) والسياق الطويل (GraphWalks 1M) فيتقدّم Sol في جدول OpenAI الذي يضم النموذجين. سعره أيضًا منخفض وثابت. نموذج الحِرَفي.
  • GPT-5.6 Sol: يتصدّر في التحكم بالطرفية (TerminalBench 88.8%) والقدرة الوكيلة الشاملة (Agents' Last Exam 53.6) وكفاءة الرموز والأمان. يسهل تحسينه حسب الاستخدام بثلاثة نماذج. نموذج الشامل متعدد المهام.
  • تنبيه: يتضمن جدول التقييم لدى OpenAI اختباري GPQA Diamond وFrontierMath ويتقدّم فيهما Sol (والغائب هو AIME وMMLU وSWE-bench Verified). وفي SWE-bench Pro يتقدّم Opus 4.8 حتى في جدول OpenAI نفسها، وقد شكّكت OpenAI في الاختبار ذاته.
  • معيار الاختيار ليس مجموع درجات الاختبارات، بل «أيّ اختبار أقرب إلى عملك». للإصلاح الفعلي للشيفرة والموثوقية اختر Opus، وللطرفية والوكلاء والاتساع اختر Sol.
  • الحل الواقعي هو التشغيل المزدوج. التوزيع حسب المهمة هو الأفضل في التكلفة والجودة معًا.

الأسئلة الشائعة

س1. أيهما أقوى في البرمجة، GPT-5.6 Sol أم Claude Opus 4.8؟

حسب المؤشر. في SWE-bench Pro الذي يقيس إصلاح أخطاء المستودعات الحقيقية، يتفوّق Opus 4.8 بـ 69.2% على Sol بـ 64.6%. في المقابل، في TerminalBench 2.1 للتحكم الذاتي بالطرفية، يتفوّق Sol بـ 88.8% على Opus بـ 78.9%. التقسيم العملي: «لإصلاح الشيفرة الحقيقية اختر Opus، وللبناء عبر الـCLI أو الوكلاء اختر Sol».

س2. أيهما أرخص سعرًا؟

اسميًا، سعر الإخراج $25 لـ Opus 4.8 و$30 لـ Sol، فـ Opus أرخص (والإدخال $5 للطرفين، غير أنّ Sol بـ $4 خلال فترة السعر الترويجي). لكن Sol حسّن كفاءة الرموز في البرمجة بنسبة 54%، فحسب حجم الإخراج قد تتقلّص التكلفة الفعلية أو تنقلب. الأضمن هو قياس رموز الإخراج على مهامك التمثيلية ومقارنة الإجمالي.

س3. هل قيمة SWE-bench Pro لـ Sol «64.6%» رسمية؟

نعم، إنها القيمة الواردة في جدول التقييم الذي نشرته OpenAI مع GPT-5.6. لكن OpenAI نشرت في الوقت نفسه تحليلًا يقدّر أن نحو 30% من مهام SWE-bench Pro معيبة، مشكّكةً بذلك في الاختبار ذاته. أما GPQA Diamond وFrontierMath، اللذان قال Vellum بُعيد الإطلاق إنهما غير معلنين، فيظهران في جدول التقييم الذي راجعناه في 22 سبتمبر 2026 ويتقدّم فيهما Sol (GPQA: Sol 94.6% وOpus 4.8 92%). والغائب عن الجدول هو SWE-bench Verified وAIME وMMLU.

س4. أيهما أنسب للمهام التي تكون الدقة فيها حيوية كالطب والقانون والمالية؟

Opus 4.8. فتصميمه يُولي أهمية للنزاهة: فبحسب إعلان Anthropic صار يمرّر العيوب في الشيفرة التي كتبها دون أن يشير إليها بمعدل يقارب ربع ما كان عليه الجيل السابق، ويذكر Transparency Hub أنه لا يُبلغ المستخدم بالإخفاقات المهمة في 3.7% من الحالات. وهذا يناسب المهام التي يكون ثمن الخطأ فيها باهظًا. أما حقن الأوامر، فتذكر Anthropic أن نسبة نجاح الهجمات بلغت 0.4% في مسابقة الهجوم العلنية التي نظّمتها Gray Swan لمدة أسبوع (مثل Opus 4.7؛ وبلغت لدى GPT-5.5 نسبة 1.6%). ومع ذلك تحتاج المسارات التي تتعامل مع مدخلات خارجية إلى حماية إضافية.

س5. كيف يرتبط بقية نماذج GPT-5.6 (Terra/Luna) بـ«Sol»؟

يضم GPT-5.6 ثلاثة نماذج: Luna (سريع ومنخفض التكلفة) / Terra (متوازن) / Sol (الأعلى). تناول هذا المقال Sol كمقارنة بين النماذج الرائدة وقت كتابته. ولأولوية التكلفة، يوفّر Terra ما يعادل GPT-5.5 بنصف السعر، فمقارنة Opus 4.8 بـ Terra أيضًا خيار قوي عمليًا. للتفاصيل راجع الشرح الكامل لإصدار GPT-5.6.

س6. هل الاستخدام المشترك (التشغيل المزدوج) واقعي؟

واقعي، بل مُوصى به. بتوزيع البرمجة الفعلية على Opus 4.8، وأتمتة الطرفية والوكلاء على Sol، والأعمال الخفيفة على Terra عبر موجّه، يمكنك الجمع بين التكلفة والجودة. كما أنه يتجنّب الارتباط بمزوّد واحد.

س7. كيف يختار المستخدم العادي (ChatGPT / Claude.ai)؟

الأبسط أن تحسم حسب الاستخدام الرئيسي. لإصلاح الشيفرة الدقيق اختر Claude.ai (Opus 4.8 وقت كتابة المقال)، ولوكلاء التحكم بالطرفية والصوت وتكامل منظومة ChatGPT اختر ChatGPT (GPT-5.6 وقت كتابة المقال). وإن لم تشترك في كليهما، فاختر الأقرب إلى العمل الذي تؤديه أكثر لتقليل عدم التطابق.

مقالات ذات صلة