تحديث بتاريخ 25 سبتمبر 2026: يقارن هذا المقال بين Claude Opus 4.8 وGPT-5.6 Sol كما كانا في يوليو 2026. ومنذ ذلك الحين أصدرت Anthropic نموذجَي Claude Opus 5 (24 يوليو) وClaude Fable 5.1 (1 سبتمبر)، وأصدرت OpenAI نموذج GPT-6 Astra (3 سبتمبر). وللمقارنة في التكلفة راجع مقالنا الذي يقيس Astra عند low مقابل Sol عند high. ثم في 22 سبتمبر أصدرت Anthropic نموذج Claude Opus 5.5، وأصدرت OpenAI (بتوقيت الولايات المتحدة) نموذجَي GPT-6 Sol وGPT-6 Luna، وهما الجيل التالي بعد GPT-5.6 Sol. وتنصح Anthropic الآن، إن لم تكن متأكدًا من النموذج المناسب، بالبدء بنموذج Opus 5.5 لمعظم الاستخدامات. ولا يزال Opus 4.8 متاحًا عبر API بصفته نموذجًا قديمًا (Legacy)، ويبقى GPT-5.6 Sol متاحًا خلال الفترة الانتقالية. أما عبارات مثل «الرائد» و«يتصدر» وقيم الاختبارات المعيارية في النص أدناه فهي بحسب وقت الكتابة. وفي 22 سبتمبر صحّحنا أيضًا قيم الاختبارات المعيارية بالرجوع إلى المصادر الأصلية. فاختبارا GPQA Diamond وFrontierMath، اللذان وصفناهما بأنهما غير معلنين، موجودان في جدول التقييم لدى OpenAI ويتقدّم فيهما Sol. وفي الجدول نفسه يتفوّق Sol (77.1%) على Opus 4.8 (68.1%) في GraphWalks 1M أيضًا، لذا صحّحنا القول بأن Opus يتصدّر في الرياضيات والسياق الطويل.
المحتويات
- 1. موقع كل نموذج والفرق في الفلسفة
- 2. جدول المواصفات السريع
- 3. مقارنة تفصيلية للاختبارات المعيارية
- 4. التحقق من «مشكلة الاختبارات غير المعلنة» — ما يتضمنه الجدول وما يغيب عنه
- 5. التكلفة الفعلية — سعر الوحدة وكفاءة الرموز
- 6. خريطة نقاط القوة والضعف
- 7. كيفية الاختيار حسب حالة الاستخدام
- 8. استراتيجية الانتقال والاستخدام المشترك
- الخلاصة
- الأسئلة الشائعة
في يوليو 2026، اكتمل تنافس نموذجين على صدارة البرمجة بالذكاء الاصطناعي. Anthropic Claude Opus 4.8 (صدر في 28 مايو) والطراز الأعلى «Sol» من OpenAI GPT-5.6 (بدأ توفره العام في 9 يوليو). يأتي GPT-5.6 بمنظومة من ثلاثة نماذج Luna/Terra/Sol، وSol هو الأعلى فيها.
كلا النموذجين يرفع شعار «البنية التحتية للوكلاء من الجيل التالي» ويتصادمان وجهًا لوجه، لكن مجالات تفوقهما متعاكسة بشكل لافت. فـSol يتصدر في التحكم بالطرفية والقدرة الوكيلة الشاملة، بينما Opus 4.8 يتصدر في البرمجة على مستوى الإنتاج الحقيقي و«الصدق» — تقسيم أدوار واضح للغاية. في هذا المقال نُجري مقارنة معمقة استنادًا إلى الإعلانات الرسمية للشركتين والاختبارات المعيارية المستقلة (Vellum وArtificial Analysis وغيرهما)، ونرتّب من منظور عملي إجابة سؤال «أيهما يجب أن أستخدم وكيف في النهاية».
القطبان المتنافسان على صدارة البرمجة
— مجالات التفوق متعاكسة تقريبًا
Opus 4.8: قوي في حل قواعد الشيفرة الحقيقية والموثوقية، «نموذج الحِرَفي»
Sol: قوي في التحكم بالطرفية والقدرة الوكيلة الشاملة، «نموذج الشامل متعدد المهام»
1. موقع كل نموذج والفرق في الفلسفة
عند الإطلاق كان كلاهما يهدف إلى أن يكون «بطل أحمال عمل الوكلاء»، لكن نقاط الجذب لديهما مختلفة بوضوح.
Claude Opus 4.8 — «حِرَفي يُنجز داخل قاعدة الشيفرة الحقيقية»
وضعت Anthropic محور Opus 4.8 لا في «تكديس أرقام الاختبارات» بل في «أن يكون أكثر صدقًا». فقد سجّل 69.2% في SWE-bench Pro الذي يقيس إصلاح مستودعات GitHub الحقيقية (بزيادة +4.9 نقطة عن 64.3% في الجيل السابق Opus 4.7)، محافظًا على الصدارة في البرمجة على مستوى الإنتاج الحقيقي. وإضافةً إلى ذلك، يُبرز مؤشرات الموثوقية والنزاهة: فبحسب إعلان Anthropic، صار يمرّر العيوب في الشيفرة التي كتبها دون أن يشير إليها بمعدل يقارب ربع ما كان عليه الجيل السابق، ويذكر Transparency Hub لدى Anthropic أنه لا يُغفل إبلاغ المستخدم بالإخفاقات المهمة في عمله (اختبارات لم تنجح، وميزات لم تُبنَ) إلا في 3.7% من الحالات.
GPT-5.6 Sol — «النموذج الشامل للوكيل الذي يتحكم بالطرفية»
طرحت OpenAI نموذج GPT-5.6 عبر ثلاثة نماذج (Luna/Terra/Sol) وجعلت Sol في القمة. فقد حقّق 88.8% في TerminalBench 2.1 الذي يقيس التحكم الذاتي بالطرفية، و53.6 في Agents' Last Exam الذي يقيس المهام العملية طويلة الأمد عبر 55 مجالًا، و80 في Artificial Analysis Coding Agent Index كمؤشر لوكلاء البرمجة، ليتصدّر في التخطيط والتحكم بالطرفية والقدرة الوكيلة الشاملة. كما تحسّنت كفاءة الرموز في البرمجة بنسبة 54%، وتصفه الشركة بأنه «أقوى نموذج للأمن السيبراني» (المصدر: الإعلان الرسمي لـOpenAI وCNBC وVellum).
العمق والصدق مقابل الاتساع والكفاءة
- · يُصلح قواعد الشيفرة الحقيقية بعمق ودقة
- · يتفوّق على Sol في SWE-bench Pro (69.2% مقابل 64.6%)
- · يمرّر عيوب شيفرته دون إشارة بنحو ربع معدل الجيل السابق
- · سعر وحدة منخفض وثابت ($5/$25)
- · متصدّر في التحكم بالطرفية والقدرة الوكيلة الشاملة
- · متصدّر TerminalBench / Agents' Last Exam
- · كفاءة رموز +54% وتعزيز الأمان
- · ثلاثة نماذج للاختيار حسب الاستخدام (Luna/Terra/Sol)
2. جدول المواصفات السريع
| البند | Claude Opus 4.8 | GPT-5.6 Sol |
|---|---|---|
| المزوّد | Anthropic | OpenAI |
| تاريخ الإصدار | 28 مايو 2026 | 9 يوليو 2026 (التوفر العام) |
| معرّف النموذج | claude-opus-4-8 | gpt-5.6-sol (الأعلى ضمن Luna/Terra/Sol) |
| طول السياق | 1,000,000 tokens | 1,050,000 tokens |
| أقصى رموز إخراج | 128,000 tokens | 128,000 tokens |
| حد المعرفة | النصف الأول من 2026 (إعلان تدريجي) | 16 فبراير 2026 |
| سعر الـAPI | $5 / $25 لكل MTok (ثابت) | $5 / $30 لكل MTok (سعر ترويجي لمدة ثلاثة أشهر اعتبارًا من 21 أغسطس 2026: $4 / $20) |
| التحكم في الاستدلال | معامل effort (4 مستويات) + تفكير تكيّفي | reasoning effort (none/low/medium/high/xhigh/max) |
| ميزات جديدة بارزة | dynamic workflows (معاينة بحث بوكلاء فرعيين متوازيين)، مدخل system في Messages API، fast mode (أسرع بنحو 2.5 مرة) | Programmatic Tool Calling (ربط الأدوات عبر توليد JS)، ChatGPT Work، صوت مزدوج الاتجاه GPT-Live |
| قنوات التوفر | جميع خطط Claude.ai وAPI وAWS وVertex AI وMicrosoft Foundry | ChatGPT وChatGPT Work وCodex وOpenAI API |
* الأسعار والمواصفات مبنية على الإعلانات الرسمية للشركتين (Opus 4.8 = 28 مايو 2026، GPT-5.6 = 9 يوليو 2026). يُرجى ملاحظة أن قيم الاختبارات المعيارية ليست مقارنة صارمة على أرضية واحدة، لأن شروط القياس وتوقيته وأدواته (harness) تختلف بين الشركتين. أما القيم المتقابلة للنموذجين (SWE-bench Pro وTerminalBench 2.1 وAgents' Last Exam وCoding Agent Index وGraphWalks وGPQA Diamond وFrontierMath) فمصدرها جدول التقييم في إعلان OpenAI عن GPT-5.6 الذي يضم النموذجين (وCoding Agent Index مؤشر من Artificial Analysis). وبعض قيم Opus 4.8 فيه لا تطابق ما نشرته Anthropic نفسها، فمثلًا TerminalBench 2.1 يبلغ 78.9% في جدول OpenAI و74.6% في جدول إعلان Anthropic.
3. مقارنة تفصيلية للاختبارات المعيارية
كثيرًا ما يُقال إن «النماذج العليا متقاربة في القدرة»، لكن هناك فروقًا واضحة في الاتجاهات حسب كل اختبار معياري. ويمكن القول إن مجالات التفوق متعاكسة تقريبًا.
3-1. البرمجة
حل الشيفرة الحقيقية لـ Opus، والتحكم بالطرفية لـ Sol
المصدر: جدول التقييم في إعلان OpenAI عن GPT-5.6 (قيم Opus 4.8 من الجدول نفسه؛ وCoding Agent Index من Artificial Analysis)
النقطة الجوهرية هي أن «ما يقيسه كل اختبار معياري» مختلف. فـSWE-bench Pro يقيس توليد تصحيحات (patches) لمشكلات GitHub الحقيقية، أي القدرة على إصلاح قاعدة شيفرة قائمة. أما TerminalBench 2.1 فهو مجموعة مهام للتحكم الذاتي بالطرفية عبر سطر الأوامر، ويقيس أداء حلقة التخطيط والتنفيذ. Opus 4.8 يفوز في الأول، وSol في الثاني — وهذا يترجم مباشرةً إلى تقسيم أدوار عملي: «للتعامل مع طلبات السحب (PR) الكبيرة في مستودعات حقيقية اختر Opus، ولبناء شيء من الصفر عبر الـCLI أو الوكلاء اختر Sol».
3-2. الوكلاء والمهام طويلة الأمد
| الاختبار المعياري | ما يقيسه | Claude Opus 4.8 | GPT-5.6 Sol | الفائز |
|---|---|---|---|---|
| Agents' Last Exam | سير عمل عملي طويل الأمد عبر 55 مجالًا | 45.2 | 53.6 | Sol |
| Coding Agent Index | وكلاء البرمجة بشكل شامل | 72.5 | 80 (الصدارة) | Sol |
| TerminalBench 2.1 | التحكم الذاتي بالطرفية | 78.9% | 88.8% | Sol |
| SWE-bench Pro | إصلاح أخطاء المستودعات الحقيقية | 69.2% | 64.6% | Opus 4.8 |
| GraphWalks (F1 لسياق 1M طويل) | تتبّع السياق الطويل وحل الإحالات | 68.1% | 77.1% | Sol |
المصدر: جدول التقييم في إعلان OpenAI عن GPT-5.6 (قيم Opus 4.8 من الجدول نفسه). وقيمة Sol البالغة 53.6 في Agents' Last Exam مأخوذة من نص الإعلان، بينما يذكر الجدول في الصفحة نفسها 52.7%.
في اتساع الوكلاء يتفوّق Sol بقوة وعرض أكبر. ويظهر الفرق في المجالات الأقرب إلى «التنفيذ الذاتي» مثل التحكم بالطرفية وسير العمل المركّب طويل الأمد. أما ما يتقدّم فيه Opus 4.8 فهو الإصلاح الدقيق لقواعد الشيفرة الحقيقية (SWE-bench Pro)، وفي تتبّع السياق الطويل يضع الجدول نفسه Sol في المقدمة في GraphWalks 1M (77.1% مقابل 68.1%). إنها معادلة «اتساع Sol، وإصلاح Opus للشيفرة الفعلية».
3-3. الاستدلال والرياضيات والموثوقية
في الرياضيات والسياق الطويل يتقدّم Sol في الجدول نفسه
رياضيات بمستوى البحث (Tier 1-3). وفي الجدول نفسه سجّل Opus 4.8 نسبة 80% (Tier 4: 83% مقابل 56.1%)
درجة F1 لسياق طويل بمليون رمز. ويسجّل Opus 4.8 نسبة 68.1% في الجدول نفسه
علوم STEM بمستوى الدراسات العليا. ويسجّل Opus 4.8 نسبة 92% في الجدول نفسه
في جدول OpenAI الذي يضم النموذجين يتقدّم Sol في GPQA Diamond (94.6% مقابل 92% لـ Opus 4.8) وFrontierMath (Tier 1-3: 89% مقابل 80%؛ Tier 4: 83% مقابل 56.1%) وGraphWalks 1M (77.1% مقابل 68.1%)، فلا يمكن القول إن الرياضيات والسياق الطويل ساحة Opus الأساسية. أما Anthropic فتُبرز الموثوقية والنزاهة: فبحسب إعلانها صار Opus 4.8 يمرّر العيوب في الشيفرة التي كتبها دون أن يشير إليها بمعدل يقارب ربع ما كان عليه الجيل السابق، ويذكر Transparency Hub أن نسبة الحالات التي لا يُبلغ فيها المستخدم بالإخفاقات المهمة 3.7% (مقابل 27.6% لـ Mythos Preview، أي تحسّن بخمسة أضعاف). وهذا يؤتي ثماره في المهام التي يكون فيها ثمن الخطأ باهظًا كالطب والقانون والمالية. لكن لا توجد قيم تقارن Sol بالشروط نفسها في هذا الجانب.
4. التحقق من «مشكلة الاختبارات غير المعلنة» — ما يتضمنه الجدول وما يغيب عنه
مما يستحق الانتباه في هذه المقارنة أن التحليل المستقل (Vellum) أشار بُعيد الإطلاق إلى أن OpenAI لم تُعلن عن SWE-bench Verified وGPQA Diamond وAIME وMMLU وARC-AGI-2 وFrontierMath لـ GPT-5.6. غير أن جدول التقييم في صفحة إعلان OpenAI، الذي راجعناه في 22 سبتمبر 2026، يتضمن GPQA Diamond (Sol 94.6%، Opus 4.8 92%) وFrontierMath (Tier 1-3: Sol 89% وOpus 4.8 80%؛ Tier 4: Sol 83% وOpus 4.8 56.1%)، ويتقدّم Sol في كليهما. أما الغائب فهو SWE-bench Verified وAIME وMMLU، وقد ظهرت قيمة Sol في ARC-AGI-2 (92.5%) لأول مرة في جدول إعلان GPT-6 Astra في 3 سبتمبر.
قيمة SWE-bench Pro لـ Sol في جدول OpenAI نفسها: 64.6%
* يعكس جدول OpenAI مؤشرات وشروطًا اختارتها OpenAI، وبعض قيم Opus 4.8 فيه تختلف عمّا نشرته Anthropic نفسها (TerminalBench 2.1 يبلغ 78.9% في جدول OpenAI و74.6% في إعلان Anthropic). فلا تقارن إلا القيم الواردة في الجدول نفسه.
حتى في جدول التقييم الذي نشرته OpenAI مع GPT-5.6، تبلغ قيمة SWE-bench Pro لـ Sol 64.6%، وهي أدنى من 69.2% لـ Opus 4.8 (والقيمتان من جدول OpenAI نفسه). أي أنه في «أقرب مؤشر برمجي إلى العمل الفعلي» وهو إصلاح أخطاء المستودعات الحقيقية، تفوّق Opus 4.8. وفي الوقت نفسه نشرت OpenAI تحليلًا يقدّر أن نحو 30% من مهام SWE-bench Pro معيبة (كما أشار Simon Willison). فخلف درجات الوكلاء اللافتة، حافظ Claude على تفوّقه في صميم البرمجة — وهذه أكبر نقطة تفصل بين النموذجين.
5. التكلفة الفعلية — سعر الوحدة وكفاءة الرموز
من حيث سعر الوحدة، يبلغ سعر الإخراج $25/MTok لـ Opus 4.8 و$30/MTok لـ Sol، فاسميًا Opus أرخص بنحو 20%. أما الإدخال فهو $5 للطرفين بالتساوي (غير أنّ Sol على سعر ترويجي لمدة ثلاثة أشهر اعتبارًا من 21 أغسطس 2026، أي $4 للإدخال و$20 للإخراج، فخلال تلك المدة يكون Sol أرخص في الإدخال أيضًا). لكن المبلغ الفعلي للفاتورة يتغيّر حسب «عدد الرموز التي يُخرجها كل نموذج في المهمة الواحدة».
- عامل تقدّم Sol: تقول OpenAI إن كفاءة الرموز في البرمجة تحسّنت بنسبة 54%، وإذا قلّ حجم الإخراج فقد يتقلّص فارق السعر ($30 مقابل $25) في التكلفة الفعلية أو حتى ينقلب.
- عامل تكلفة Opus: سعر الوحدة القياسي ثابت ومنخفض، كما تتوفّر خيارات تشغيل مثل fast mode (أسرع بنحو 2.5 مرة). لكن ميله إلى «الشرح ثم الكتابة (narrate-then-code)» يميل إلى زيادة رموز الإخراج.
خلاصة القول، لا يُحسم الأمر بجدول أسعار الوحدة وحده. ففي البرمجة التي يغلب عليها الإخراج، الصواب هو تقدير الإجمالي عبر «سعر الوحدة × حجم الإخراج»، والمقارنة بقياس فعلي لكل حمل عمل. اسميًا Opus أرخص، وفي كفاءة الرموز يتحسّن Sol — إنها معادلة شدّ حبل.
* لا يمكن الجزم بـ«مضاعف التكلفة الفعلية» تحديدًا لأن الشركتين لم تُعلنا عن مقارنة لرموز الإخراج بشروط متطابقة. نوصي بقياس عدد رموز الإخراج لكلا النموذجين على مهامك التمثيلية، ثم ضربها بسعر الوحدة للمقارنة.
6. خريطة نقاط القوة والضعف
رغم أنهما من النماذج العليا في الفترة نفسها، فطابعهما متعاكس
- · صدارة البرمجة الفعلية بـ SWE-bench Pro 69.2%
- · لا يُغفل الإبلاغ عن الإخفاقات المهمة إلا في 3.7% من الحالات (قيمة Anthropic؛ لا توجد قيمة لـ Sol)
- · يمرّر عيوب شيفرته دون إشارة بنحو ربع معدل الجيل السابق
- · سعر إخراج منخفض وثابت ($25)
- · يتقدّم في Toolathlon حتى في جدول OpenAI (59.9% مقابل 58%)
- · أدنى من Sol في التحكم بالطرفية والقدرة الوكيلة الشاملة
- · ميل السرد يزيد رموز الإخراج بسهولة
- · في Terminal-Bench 2.1 يتأخر عن GPT-5.5 حتى في جدول Anthropic نفسها (74.6% مقابل 78.2%)
- · لا يدعم الصوت والفيديو أصلًا
- · صدارة التحكم بالطرفية بـ TerminalBench 88.8%
- · صدارة Agents' Last Exam وCoding Agent Index
- · كفاءة رموز +54% وتعزيز الأمان
- · تحسين حسب الاستخدام عبر ثلاثة نماذج Luna/Terra/Sol
- · تكامل مع ChatGPT Work / Codex / GPT-Live
- · أدنى من Opus بنحو 4.6 نقطة في SWE-bench Pro
- · غياب AIME وMMLU وغيرها عن جدول التقييم
- · سعر الإخراج $30 أعلى من Opus
- · لا توجد قيم مقارنة مباشرة للنزاهة
7. كيفية الاختيار حسب حالة الاستخدام
| حالة الاستخدام | النموذج المُوصى به | السبب |
|---|---|---|
| طلبات السحب وإصلاح الأخطاء وإعادة الهيكلة في المستودعات الحقيقية | Opus 4.8 | صدارة برمجة الإنتاج بـ SWE-bench Pro 69.2% |
| الرياضيات والبحث العلمي والاستدلال الدقيق | Sol | في جدول OpenAI يتقدّم Sol في FrontierMath (Tier 1-3: 89% مقابل 80%) وGPQA Diamond (94.6% مقابل 92%) معًا |
| تتبّع وحل الإحالات في وثائق طويلة بمستوى 1M | Sol | في GraphWalks 1M يسجّل Sol نسبة 77.1% في الجدول نفسه (Opus 4.8: 68.1%) |
| مهام يكون فيها ثمن الخطأ باهظًا كالطب والقانون والمالية | Opus 4.8 | يمرّر عيوب شيفرته دون إشارة بنحو ربع معدل الجيل السابق، ولا يُبلغ عن الإخفاقات المهمة في 3.7% من الحالات (أرقام Anthropic؛ لا مقارنة مباشرة مع Sol) |
| وكلاء يتحكمون ذاتيًا بالـ CLI والطرفية | Sol | الصدارة بـ TerminalBench 2.1 88.8% |
| أتمتة سير عمل مركّب طويل الأمد | Sol | الصدارة بـ Agents' Last Exam 53.6 |
| تحليل الأمن السيبراني والفريق الأزرق | Sol | تصنّفه OpenAI «أقوى نموذج أمني» |
| تشغيل متكامل يشمل ChatGPT/Codex/الصوت | Sol | متكامل مع ChatGPT Work وGPT-Live وCodex |
| معالجة ضخمة بأولوية للتكلفة | حسب الاستخدام | Opus أرخص سعرًا، وSol أفضل كفاءةً. قارن بقياس فعلي |
8. استراتيجية الانتقال والاستخدام المشترك
الحل الواقعي هو أن «التوزيع حسب المهمة» أسهل في تحسين التكلفة والجودة معًا من «التوحيد على أحدهما».
النمط أ. تشغيل بمزوّدين مزدوجين (مُوصى به)
- البرمجة الأساسية (طلبات السحب والإصلاح في المستودعات الحقيقية): Opus 4.8
- أتمتة الـ CLI والطرفية: GPT-5.6 Sol
- أتمتة سير العمل العملي طويل الأمد: Sol (أو Terra لأولوية التكلفة)
- المهام عالية الموثوقية التي يكون فيها الخطأ مكلفًا: Opus 4.8
- تحليل الأمان: Sol
النمط ب. أسلوب الموجّه (Router)
عبر OpenRouter / LiteLLM وغيرهما، صنّف نوع المهمة ووزّعها ديناميكيًا. بوضع قاعدة تقول: البرمجة الفعلية لـ Opus، والمهام الوكيلة لـ Sol، والأعمال الخفيفة بأولوية التكلفة لـ GPT-5.6 Terra — يمكنك تقليل التكلفة الفعلية مع كبح الارتباط بمزوّد واحد. وبتحوّل GPT-5.6 إلى منظومة من ثلاثة نماذج، صار من الأسهل أيضًا استخدام Luna/Terra/Sol بثلاث درجات من جانب OpenAI وحده.
النمط ج. تشغيل بمزوّد واحد
إذا تعذّر استخدام عدة مزوّدين لأسباب تتعلق بحوكمة البيانات، اختر حسب الاستخدام الرئيسي. فإذا كانت أصول الشيفرة الحقيقية كبيرة وجودة البرمجة والموثوقية أمرًا حيويًا فـ Opus 4.8، وإذا كان المحور أتمتة سير العمل العملي ووكلاء الطرفية فـ GPT-5.6 (بجعل Sol الأساس وضبط التكلفة عبر Terra/Luna) هو الخيار المباشر.
الخلاصة
- Opus 4.8: قوي في إصلاح قواعد الشيفرة الحقيقية (SWE-bench Pro 69.2%، أعلى من 64.6% لـ Sol حتى في جدول OpenAI) وفي النزاهة. أما في الرياضيات (FrontierMath وGPQA Diamond) والسياق الطويل (GraphWalks 1M) فيتقدّم Sol في جدول OpenAI الذي يضم النموذجين. سعره أيضًا منخفض وثابت. نموذج الحِرَفي.
- GPT-5.6 Sol: يتصدّر في التحكم بالطرفية (TerminalBench 88.8%) والقدرة الوكيلة الشاملة (Agents' Last Exam 53.6) وكفاءة الرموز والأمان. يسهل تحسينه حسب الاستخدام بثلاثة نماذج. نموذج الشامل متعدد المهام.
- تنبيه: يتضمن جدول التقييم لدى OpenAI اختباري GPQA Diamond وFrontierMath ويتقدّم فيهما Sol (والغائب هو AIME وMMLU وSWE-bench Verified). وفي SWE-bench Pro يتقدّم Opus 4.8 حتى في جدول OpenAI نفسها، وقد شكّكت OpenAI في الاختبار ذاته.
- معيار الاختيار ليس مجموع درجات الاختبارات، بل «أيّ اختبار أقرب إلى عملك». للإصلاح الفعلي للشيفرة والموثوقية اختر Opus، وللطرفية والوكلاء والاتساع اختر Sol.
- الحل الواقعي هو التشغيل المزدوج. التوزيع حسب المهمة هو الأفضل في التكلفة والجودة معًا.
الأسئلة الشائعة
س1. أيهما أقوى في البرمجة، GPT-5.6 Sol أم Claude Opus 4.8؟
حسب المؤشر. في SWE-bench Pro الذي يقيس إصلاح أخطاء المستودعات الحقيقية، يتفوّق Opus 4.8 بـ 69.2% على Sol بـ 64.6%. في المقابل، في TerminalBench 2.1 للتحكم الذاتي بالطرفية، يتفوّق Sol بـ 88.8% على Opus بـ 78.9%. التقسيم العملي: «لإصلاح الشيفرة الحقيقية اختر Opus، وللبناء عبر الـCLI أو الوكلاء اختر Sol».
س2. أيهما أرخص سعرًا؟
اسميًا، سعر الإخراج $25 لـ Opus 4.8 و$30 لـ Sol، فـ Opus أرخص (والإدخال $5 للطرفين، غير أنّ Sol بـ $4 خلال فترة السعر الترويجي). لكن Sol حسّن كفاءة الرموز في البرمجة بنسبة 54%، فحسب حجم الإخراج قد تتقلّص التكلفة الفعلية أو تنقلب. الأضمن هو قياس رموز الإخراج على مهامك التمثيلية ومقارنة الإجمالي.
س3. هل قيمة SWE-bench Pro لـ Sol «64.6%» رسمية؟
نعم، إنها القيمة الواردة في جدول التقييم الذي نشرته OpenAI مع GPT-5.6. لكن OpenAI نشرت في الوقت نفسه تحليلًا يقدّر أن نحو 30% من مهام SWE-bench Pro معيبة، مشكّكةً بذلك في الاختبار ذاته. أما GPQA Diamond وFrontierMath، اللذان قال Vellum بُعيد الإطلاق إنهما غير معلنين، فيظهران في جدول التقييم الذي راجعناه في 22 سبتمبر 2026 ويتقدّم فيهما Sol (GPQA: Sol 94.6% وOpus 4.8 92%). والغائب عن الجدول هو SWE-bench Verified وAIME وMMLU.
س4. أيهما أنسب للمهام التي تكون الدقة فيها حيوية كالطب والقانون والمالية؟
Opus 4.8. فتصميمه يُولي أهمية للنزاهة: فبحسب إعلان Anthropic صار يمرّر العيوب في الشيفرة التي كتبها دون أن يشير إليها بمعدل يقارب ربع ما كان عليه الجيل السابق، ويذكر Transparency Hub أنه لا يُبلغ المستخدم بالإخفاقات المهمة في 3.7% من الحالات. وهذا يناسب المهام التي يكون ثمن الخطأ فيها باهظًا. أما حقن الأوامر، فتذكر Anthropic أن نسبة نجاح الهجمات بلغت 0.4% في مسابقة الهجوم العلنية التي نظّمتها Gray Swan لمدة أسبوع (مثل Opus 4.7؛ وبلغت لدى GPT-5.5 نسبة 1.6%). ومع ذلك تحتاج المسارات التي تتعامل مع مدخلات خارجية إلى حماية إضافية.
س5. كيف يرتبط بقية نماذج GPT-5.6 (Terra/Luna) بـ«Sol»؟
يضم GPT-5.6 ثلاثة نماذج: Luna (سريع ومنخفض التكلفة) / Terra (متوازن) / Sol (الأعلى). تناول هذا المقال Sol كمقارنة بين النماذج الرائدة وقت كتابته. ولأولوية التكلفة، يوفّر Terra ما يعادل GPT-5.5 بنصف السعر، فمقارنة Opus 4.8 بـ Terra أيضًا خيار قوي عمليًا. للتفاصيل راجع الشرح الكامل لإصدار GPT-5.6.
س6. هل الاستخدام المشترك (التشغيل المزدوج) واقعي؟
واقعي، بل مُوصى به. بتوزيع البرمجة الفعلية على Opus 4.8، وأتمتة الطرفية والوكلاء على Sol، والأعمال الخفيفة على Terra عبر موجّه، يمكنك الجمع بين التكلفة والجودة. كما أنه يتجنّب الارتباط بمزوّد واحد.
س7. كيف يختار المستخدم العادي (ChatGPT / Claude.ai)؟
الأبسط أن تحسم حسب الاستخدام الرئيسي. لإصلاح الشيفرة الدقيق اختر Claude.ai (Opus 4.8 وقت كتابة المقال)، ولوكلاء التحكم بالطرفية والصوت وتكامل منظومة ChatGPT اختر ChatGPT (GPT-5.6 وقت كتابة المقال). وإن لم تشترك في كليهما، فاختر الأقرب إلى العمل الذي تؤديه أكثر لتقليل عدم التطابق.
مقالات ذات صلة
- الشرح الكامل لإصدار GPT-5.6 — تفاصيل النماذج الثلاثة Luna/Terra/Sol
- الشرح الكامل لإصدار Claude Opus 4.8 — الميزات الجديدة والاختبارات والسعر
- مقارنة معمّقة GPT-5.5 vs Claude Opus 4.7 — مواجهة الجيل السابق
- مقارنة أسعار Claude vs ChatGPT — الفرق في بنية الخطط
- كم يقلّص الذكاء الاصطناعي جهد التطوير؟ — بيانات العصر الوكيلي حول تقليص جهد التطوير
- دليل إصدار Claude Opus 5 — الأداء والسعر وتغييران جذريان
- مقارنة GPT-5.6 vs GPT-5.5 — من نموذج واحد إلى 3 نماذج (Luna/Terra/Sol) وTerra بـ40% من السعر