تحديث بتاريخ 25 سبتمبر 2026: يقارن هذا المقال بين Claude Fable 5 وGPT-5.6 Sol كما كانا في يوليو 2026. ومنذ ذلك الحين أصدرت Anthropic نموذج Claude Opus 5 (24 يوليو) ونموذج Claude Fable 5.1 خلفًا لـ Fable 5 (1 سبتمبر)، وأصدرت OpenAI نموذج GPT-6 Astra (3 سبتمبر). وللمقارنة في التكلفة راجع مقالنا الذي يقيس Astra عند low مقابل Sol عند high. ثم في 22 سبتمبر أصدرت Anthropic نموذج Claude Opus 5.5، وأصدرت OpenAI (بتوقيت الولايات المتحدة) نموذجَي GPT-6 Sol وGPT-6 Luna، وهما الجيل التالي بعد GPT-5.6 Sol. وتنصح Anthropic الآن، إن لم تكن متأكدًا من النموذج المناسب، بالبدء بنموذج Opus 5.5 لمعظم الاستخدامات. ولا يزال Fable 5 متاحًا عبر API بصفته نموذجًا قديمًا (Legacy)، ويبقى GPT-5.6 Sol متاحًا خلال الفترة الانتقالية. أما عبارات مثل «الأعلى مستوى» و«الرائد» و«يتصدر» وقيم الاختبارات المعيارية في النص أدناه فهي بحسب وقت الكتابة. وفي 22 سبتمبر صحّحنا أيضًا قيم الاختبارات المعيارية بالرجوع إلى المصادر الأصلية. فنسبة «86.0%» لـ Fable 5 في TerminalBench 2.1 لا ترد في جدول أيٍّ من الشركتين، فاستبدلنا بها قيمة جدول OpenAI الذي يضم النموذجين (83.1%)، وحيثما يُقارَن SWE-Bench Pro مع Sol صرنا نستخدم 80.0% من الجدول نفسه. كما أعدنا صياغة «استقلالية متواصلة حتى 12 ساعة» بعبارات Anthropic نفسها، لأنها كانت رواية مستخدم واحد لا كلام Anthropic.

نموذج OpenAI الأعلى مستوى آنذاك GPT-5.6 «Sol» (طرح عام في 9 يوليو 2026)، ونموذج Anthropic الذي وصفته عند إطلاقه بأنه «الأقوى على الإطلاق ضمن ما تطرحه للعموم» Claude Fable 5 (صدر في 9 يونيو 2026). في حين كانت المقارنة مع Opus 4.8 «مواجهة مباشرة ضمن الفئة السعرية نفسها»، فإن هذه المقارنة موضوعها هو المفاضلة بين التكلفة والقدرة: «Sol المتعدّد الاستخدامات بنصف السعر» مقابل «Fable 5 الأعلى مستوى لكن بضِعف السعر».

لنقُل الخلاصة أولًا —— في البرمجة على مستوى الإنتاج الفعلي والاستقلالية طويلة الأمد يتفوّق Fable 5 بوضوح، أما في السعر واتساع القدرة الإجمالية للوكلاء فيتفوّق Sol. الفارق في SWE-bench Pro يتّسع أكثر مما كان عليه في مواجهة Opus 4.8. في هذه المقالة نرتّب، استنادًا إلى الإعلانات الرسمية للشركتين والاختبارات المستقلة، كيفية استخدام هذين القطبين غير المتماثلين كلٌّ في موضعه.

FLAGSHIP SHOWDOWN · 2026

المتعدّد بنصف السعر مقابل الحِرَفي الأعلى مستوى

— فارق سعري بمقدار الضِعف، لكن فارق SWE-bench Pro أكبر من ذلك

ANTHROPIC · الأعلى مستوى عند الإطلاق
Claude Fable 5
صدر في 9 يونيو 2026
SWE-bench Pro: 80.0%
TerminalBench 2.1: 83.1%
الاستقلالية طويلة الأمد: الأطول بين نماذج Claude
السعر: $10 / $50 per MTok
VS
OPENAI · النموذج الرائد عند الإطلاق
GPT-5.6 Sol
بدء الطرح العام في 9 يوليو 2026
SWE-bench Pro: 64.6%
TerminalBench 2.1: 88.8%
كفاءة الرموز: +54% (في البرمجة)
السعر: $5 / $30 per MTok

Fable 5: الأقوى في حلّ الشيفرة الفعلية والاستقلالية طويلة الأمد —— «قدرة على إتمام السباق»
Sol: تشغيل الطرفية والاتساع ونصف السعر —— «القيمة مقابل السعر والقدرة الإجمالية»

1. موقع كل نموذج —— «المتعدّد الاستخدامات بنصف السعر» مقابل «الحِرَفي الأعلى مستوى»

Claude Fable 5 —— كل تركيزه على «قدرة إتمام سباق المسافات الطويلة»

Fable 5 نموذج أطلقت به Anthropic قدرات من مستوى نموذجها الحدودي الأقوى داخليًا «Mythos»، في صورة يستطيع المستخدمون والمطوّرون العموميون استخدامها (الجوهر مطابق لـ Mythos 5، ولا تختلف عنه سوى آليات الأمان). شعاره «صُنِع للأعمال الطويلة والمعقّدة». سجّل 80.0% في SWE-Bench Pro الذي يقيس إصلاح مستودعات GitHub الفعلية، متجاوزًا Opus 4.8 (69.2%) والجيل السابق GPT-5.5 (58.6%) بفارق كبير (بحسب بطاقة النظام من Anthropic؛ أما نسبة 80.3% في جدول الإعلان فواردة في عمود مشترك مع Mythos 5 وهي نتيجة Mythos 5 الأعلى). يحافظ على تركيزه عبر ملايين الرموز ويستطيع العمل باستقلالية مدةً أطول من أي نموذج Claude سابق، ومن الأمثلة أن Stripe أنجزت ترحيل 50 مليون سطر من شيفرة Ruby في يوم واحد (المصدر: الإعلان الرسمي لـ Anthropic).

GPT-5.6 Sol —— «النموذج المتعدّد الاستخدامات بنصف السعر»

Sol هو الأعلى مستوى ضمن GPT-5.6 (Luna/Terra/Sol). يحقّق 88.8% في TerminalBench 2.1 الذي يقيس تشغيل الطرفية الذاتي، و53.6 في Agents' Last Exam للأعمال الطويلة، ليحتلّ الصدارة في القدرة الإجمالية للوكلاء، مع تحسّن كفاءة الرموز بنسبة 54% في البرمجة. وقبل كل شيء، سلاحه الأكبر سعره الذي يبلغ نحو نصف سعر Fable 5 ($5/$30 مقابل $10/$50). فهو في موقع «ليس الأقوى، لكنه يقاتل بالقيمة مقابل التكلفة» (المصدر: الإعلان الرسمي لـ OpenAI وVellum وArtificial Analysis).

2. جدول المواصفات السريع

البندClaude Fable 5GPT-5.6 Sol
المزوّدAnthropic (النموذج الأعلى المطروح للعموم عند الإطلاق)OpenAI (الأعلى ضمن GPT-5.6)
تاريخ الإصدار9 يونيو 20269 يوليو 2026 (طرح عام)
مُعرّف النموذجclaude-fable-5gpt-5.6-sol
طول السياق1,000,000 tokens1,050,000 tokens
أقصى رموز إخراج128,000 tokens128,000 tokens
حدّ المعرفةالنصف الأول من 2026 (إعلان تدريجي)16 فبراير 2026
سعر الـ API$10 / $50 per MTok$5 / $30 per MTok (نحو نصف سعر Fable؛ سعر ترويجي لمدة ثلاثة أشهر اعتبارًا من 21 أغسطس 2026: $4 / $20)
الاستدلالمُفعّل دائمًا (تفكير تكيّفي، ولا يُعاد إرجاع خام عملية التفكير)reasoning effort (6 مستويات من none حتى max)
جوهر القوةSWE-Bench Pro 80.0% (قيمة Anthropic)، أطول استقلالية بين نماذج Claude، قدرة إتمام سباق المسافات الطويلةتشغيل الطرفية، القدرة الإجمالية للوكلاء، كفاءة الرموز، نصف السعر
تصميم الأمان3 مُصنّفات تُرجِع إلى Opus 4.8 عند رصد خطر فقط (تعمل في أقل من 5% من الجلسات)يُروّج له كـ «أقوى نموذج أمني» مع تعزيز حزمة السلامة
قنوات التوفيرClaude.ai، API، GitHub Copilot وغيرهاChatGPT، ChatGPT Work، Codex، OpenAI API

* الأسعار والمواصفات مبنية على الإعلانات الرسمية للشركتين (Fable 5 = 9 يونيو 2026، GPT-5.6 = 9 يوليو 2026). تختلف ظروف القياس وتوقيته وأدوات التشغيل (harness) بين الشركتين، فليست مقارنة صارمة على أرضية واحدة. أما القيم المتقابلة للنموذجين (SWE-Bench Pro 80.0% مقابل 64.6%، وTerminalBench 2.1 83.1% مقابل 88.8%، وAgents' Last Exam 40.5 مقابل 53.6، وCoding Agent Index 77.2 مقابل 80) فمصدرها جدول التقييم في إعلان OpenAI عن GPT-5.6 الذي يضم النموذجين (قيمة Sol البالغة 53.6 في Agents' Last Exam مأخوذة من نص الإعلان، بينما يذكر الجدول في الصفحة نفسها 52.7%؛ وCoding Agent Index مؤشر من Artificial Analysis). وفي جدول إعلان Anthropic نفسه يظهر Fable 5 بنسبة 80.3% في SWE-Bench Pro و88.0% في TerminalBench 2.1، لكن القيمتين في عمود مشترك مع Mythos 5 وهما الأعلى بين النتيجتين (وتعطي بطاقة النظام Fable 5 وحده 80.0% و84.3%)، وتحمل قيمة TerminalBench 2.1 ملاحظة من Anthropic مفادها أن أداء Fable 5 أقرب إلى Opus 4.8 (82.7% في الجدول نفسه) بسبب تحويل الطلبات إلى نموذج آخر بفعل آليات الأمان. ولا ترد قيمة 86.0% في أيٍّ من الجدولين.

3. مقارنة تفصيلية للاختبارات المرجعية

ليست «Fable 5 يفوز بكل شيء» ولا «Sol يفوز بكل شيء». بل ينقسمان بوضوح حسب نوع البرمجة.

CODING & AGENT BENCHMARKS

حلّ الشيفرة الفعلية لـ Fable، والطرفية والاتساع لـ Sol

SWE-bench Pro (إصلاح مستودعات فعلية)Fable 80.0% vs Sol 64.6%
Fable 5
Sol
TerminalBench 2.1 (تشغيل الطرفية الذاتي)Sol 88.8% vs Fable 83.1%
Sol
Fable 5
Agents' Last Exam (أعمال طويلة الأمد)Sol 53.6 vs Fable 40.5
Sol 53.6
Fable 40.5
Coding Agent Index (Artificial Analysis)Sol 80 vs Fable 77.2
Sol 80
Fable 77.2

المصدر: جدول التقييم في إعلان OpenAI عن GPT-5.6 (قيمة Sol في Agents' Last Exam من نص الإعلان، وCoding Agent Index من Artificial Analysis)

النقطة الجوهرية هي اختلاف «ما الذي يقيسه الاختبار المرجعي». فـ SWE-bench Pro يقيس توليد رقعات لمسائل GitHub الفعلية أي قدرة إصلاح قواعد الشيفرة القائمة، وهنا يتقدّم Fable 5 بنسبة 80.0% متجاوزًا Sol البالغ 64.6% بأكثر من 15 نقطة. في المقابل، TerminalBench 2.1 يقيس التشغيل الذاتي لسطر الأوامر، حيث يتفوّق Sol بنسبة 88.8% على Fable 5 البالغ 83.1%. وأكثر من ذلك، يتقدّم Sol في Agents' Last Exam و Coding Agent Index الإجماليين للوكلاء. فينتج تقسيم واضح: «عمق إصلاح الشيفرة الفعلية حتى النهاية = Fable، واتساع تشغيل الطرفية والوكلاء = Sol».

4. «مشكلة الاختبارات غير المُعلنة» —— اختبارات محجوبة وتشكيك في SWE-bench Pro

ما يستوجب الانتباه في هذه المقارنة أيضًا هو أن بعض المؤشرات غائبة عن جدول التقييم لدى OpenAI. فبُعيد الإطلاق أشار التحليل المستقل (Vellum) إلى أن OpenAI لم تُعلن نتائج SWE-bench Verified و GPQA Diamond و AIME و MMLU و ARC-AGI-2 و FrontierMath. غير أن جدول التقييم في صفحة إعلان OpenAI، الذي راجعناه في 22 سبتمبر 2026، يتضمن GPQA Diamond (Sol 94.6%، Fable 5 92.6%) وFrontierMath (Tier 1-3: Sol 89% وFable 5 87%؛ Tier 4: Sol 83% وFable 5 87.8%). أما الغائب فهو SWE-bench Verified وAIME وMMLU، وقد ظهرت قيمة Sol في ARC-AGI-2 (92.5%) لأول مرة في جدول إعلان GPT-6 Astra في 3 سبتمبر. ورقم SWE-bench Pro «64.6%» في هذه المقالة مصدره كذلك جدول التقييم الذي نشرته OpenAI مع GPT-5.6. لكن OpenAI نشرت في الوقت نفسه تحليلًا يقدّر أن نحو 30% من مهام SWE-bench Pro معيبة (كما أشار Simon Willison).

THE BENCHMARK PROBLEM

OpenAI تشكّك في أقرب مؤشرات البرمجة إلى العمل الفعلي

🟡 قيمة Sol هي 64.6%
قيمة من جدول تقييم OpenAI نفسها، لكنها نشرت معها تحليلًا يرى أن نحو 30% من المهام معيبة
✅ Fable مُفصح عنه
Anthropic أعلنت SWE-Bench Pro 80.0% (قيمة بطاقة النظام، وتطابق جدول OpenAI؛ أما 80.3% في جدول الإعلان فهي نتيجة Mythos 5)
🔴 بعض المؤشرات غائبة
Sol ليست له قيم في SWE-bench Verified وAIME وMMLU (أما GPQA Diamond فموجود في الجدول: Sol 94.6% مقابل 92.6% لـ Fable 5)

* إذا كنت تولي الأهمية للبرمجة على مستوى الإنتاج الفعلي، فإن Fable 5، بنحو 80% في SWE-bench Pro في جدولي الشركتين، هو الخيار القوي. لا تحكم بالأرقام البرّاقة للوكلاء وحدها.

5. الاستقلالية طويلة الأمد —— مجال Fable 5 الحقيقي

قيمة Fable 5 الحقيقية تكمن في «قدرة إتمام سباق المسافات الطويلة» أكثر من درجات الاختبارات. تشرح Anthropic أنه يحافظ على تركيزه عبر ملايين الرموز ويستطيع العمل باستقلالية مدةً أطول من أي نموذج Claude سابق (دون أن تحدد سقفًا بالساعات). والمثال الفعلي الذي تذكره أن Stripe أنجزت ترحيل 50 مليون سطر من شيفرة Ruby في يوم واحد (ما يعادل أكثر من شهرين يدويًا). وبُعيد الإطلاق روى مستخدم أيضًا في مدوّنة Ten Past Tomorrow أن النموذج عمل وحده أكثر من 12 ساعة انطلاقًا من طلب واحد. كما أُبلغ عن تجاوزه 90% لأول مرة على الإطلاق في اختبار التحليل طويل الأمد Hex.

الأطول حتى الآن
أطول عمل مستقلّ بين نماذج Claude

يحافظ على تركيزه عبر ملايين الرموز ويؤدّي البرمجة والبحث الطويلين ذاتيًا (بحسب Anthropic).

50 مليون سطر / يوم
ترحيل Stripe واسع النطاق

مثال فعلي أنجز ترحيل Ruby الذي يستغرق أكثر من شهرين يدويًا في يوم واحد.

SWE-Bench Pro 80.0%
في الصدارة لإصلاح الشيفرة الفعلية

في جدول OpenAI يتجاوز Opus 4.8 (69.2%) و Sol (64.6%) بفارق كبير (وفي بطاقة نظام Anthropic أيضًا 80.0%).

يتصدّر Sol أيضًا Agents' Last Exam للأعمال الطويلة (53.6)، لكن هذا اختبار يقيس «تدفّقات عمل واسعة ومتنوّعة». أما في «قدرة الإتمام العميق» لإصلاح قاعدة شيفرة عملاقة واحدة حتى النهاية فالغلبة لـ Fable 5 —— هذا هو الفارق النوعي بينهما. Fable 5 هو الأنسب كنموذج رئيسي للترحيلات واسعة النطاق والبحث طويل الأمد ووكلاء البرمجة المستقلة.

6. التكلفة الفعلية —— كيف ننظر إلى ضِعف السعر

السعر Fable 5 بـ $10/$50 و Sol بـ $5/$30. أي الضِعف في الإدخال و1.67 مرة في الإخراج، فـ Fable 5 أغلى بنحو الضِعف من Sol (نحو 2.5 ضِعف ما دام Sol على سعره الترويجي $4/$20 لمدة ثلاثة أشهر اعتبارًا من 21 أغسطس 2026). وهنا مفترق الاختيار.

  • تفوّق Sol في التكلفة: سعره نصفي، وإلى جانب ذلك تحسّنت كفاءة الرموز 54% في البرمجة. وبما أن الرموز المستهلكة تقلّ للعمل نفسه، فإن التكلفة الإجمالية في استخدامات «إنجاز الكميات» تقلّ كثيرًا عن Fable 5.
  • قيمة Fable 5: سعره أغلى، لكن معدّل نجاح الإصلاح الصحيح من المرة الأولى (SWE-bench Pro نحو 80% في جدولي الشركتين) مرتفع. وعند احتساب تكاليف إعادة العمل والمراجعة والتصحيح اليدوي، قد يكون في المهام الصعبة «غاليًا لكنه أرخص في النهاية». وإذا أمكن ترحيل 50 مليون سطر في يوم، فهو زهيد جدًا بحساب تكلفة العمالة.

أي ينبغي النظر إلى «التكلفة لكل مهمة مكتملة» وليس «سعر الرمز». Sol لمهام الإنتاج اليومية وتشغيل الطرفية (وإن كانت التكلفة أهم، فـ GPT-5.6 Terra أو Luna)، وFable 5 للمهام واسعة النطاق طويلة الأمد التي يكون فشلها مكلفًا —— هذا التقسيم منطقي حتى من منظور التكلفة المثلى.

* لم تُعلن الشركتان مقارنة رموز إخراج بالظروف نفسها، لذا لا يمكن الجزم بـ «مضاعف التكلفة الفعلي» تحديدًا. نوصي بقياس معدّل النجاح ورموز الإخراج فعليًا على مهامك التمثيلية، والمقارنة بما في ذلك تكلفة إعادة العمل.

7. خريطة نقاط القوة والضعف

STRENGTHS & WEAKNESSES

قدرة الإتمام الأعلى مستوى مقابل القدرة الإجمالية بنصف السعر

CLAUDE FABLE 5
◯ نقاط القوة
  • · SWE-Bench Pro نحو 80% (في الجدولين) في صدارة البرمجة الفعلية
  • · أطول استقلالية بين نماذج Claude وقدرة إتمام
  • · سجلّ في الترحيل واسع النطاق (Stripe 50 مليون سطر/يوم)
  • · يتقدّم على Sol في FrontierMath Tier 4 حتى في جدول OpenAI (87.8% مقابل 83%)
  • · تصميم أمان جديد بـ 3 مُصنّفات (كبح المناطق الخطرة فقط)
△ نقاط الضعف
  • · السعر مرتفع ($10/$50 = نحو ضِعف Sol؛ نحو 2.5 ضِعف خلال فترة سعر Sol الترويجي)
  • · اتساع تشغيل الطرفية والوكلاء الإجمالي أقلّ من Sol
  • · مبالغ في المواصفات لمهام الإنتاج الخفيفة
  • · لا يُعاد إرجاع خام عملية التفكير
GPT-5.6 SOL
◯ نقاط القوة
  • · TerminalBench 88.8% في صدارة تشغيل الطرفية
  • · الصدارة في Agents' Last Exam و Coding Agent Index
  • · السعر نصفي + كفاءة رموز +54% لأفضل قيمة مقابل السعر
  • · تحسين حسب الاستخدام بثلاثة نماذج Luna/Terra/Sol
  • · تكامل مع ChatGPT Work / Codex / GPT-Live
△ نقاط الضعف
  • · خسارة بفارق كبير أكثر من 15 نقطة في SWE-bench Pro
  • · غياب AIME وMMLU وغيرها عن جدول التقييم
  • · أقلّ من Fable في «قدرة الإتمام العميق» لشيفرة عملاقة واحدة
  • · عرض سجلّ الاستقلالية طويلة الأمد أقوى لدى Fable

8. كيف تختار حسب حالة الاستخدام

حالة الاستخدامالنموذج المُوصى بهالسبب
ترحيل الشيفرة واسع النطاق وتجديد الأنظمة القديمةFable 5استقلالية طويلة الأمد + قدرة إتمام Stripe 50 مليون سطر/يوم
إصلاح أخطاء صعبة في مستودعات فعلية وطلبات دمج كبيرةFable 5معدّل نجاح مرتفع بـ SWE-Bench Pro نحو 80% (في الجدولين)
وكلاء البحث والتحليل المستقلة طويلة الأمدFable 5مُحسَّن للتركيز على ملايين الرموز وقدرة الإتمام
المهام المهمة التي تكون تكلفة إعادة عملها الفاشل كبيرةFable 5احتمالية عالية للإصلاح الصحيح من المرة الأولى
وكلاء تشغّل الـ CLI والطرفية ذاتيًاSolالصدارة بـ TerminalBench 2.1 88.8%
أتمتة تدفّقات عمل واسعة ومتنوّعةSolالصدارة بـ Agents' Last Exam 53.6
مهام الإنتاج التي تُعطي الأولوية للتكلفةSolنصف السعر + كفاءة رموز +54%. وللأعمال الخفيفة Terra/Luna أيضًا
التشغيل المتكامل مع ChatGPT/Codex/الصوتSolمتكامل مع ChatGPT Work و GPT-Live و Codex

الخلاصة

  • Claude Fable 5: في الصدارة لإصلاح الشيفرة الفعلية (SWE-Bench Pro نحو 80%) والاستقلالية طويلة الأمد. مجاله الحقيقي «قدرة الإتمام» للترحيلات واسعة النطاق والمهام الصعبة. لكن سعره نحو ضِعف Sol.
  • GPT-5.6 Sol: في الصدارة لتشغيل الطرفية (TerminalBench 88.8%) والقدرة الإجمالية للوكلاء، وأفضل قيمة مقابل السعر بـ نصف السعر + كفاءة رموز +54%. يسهُل تحسينه حسب الاستخدام بثلاثة نماذج.
  • فارق SWE-bench Pro أوسع من مواجهة Opus 4.8 (80.0 مقابل 64.6 في جدول OpenAI · أكثر من 15 نقطة). لكن انتبه إلى أن OpenAI نشرت أيضًا تحليلًا يقدّر أن نحو 30% من مهام SWE-bench Pro معيبة.
  • انظر إلى التكلفة بـ «لكل مهمة مكتملة» لا «سعر الرمز». Sol للإنتاج والطرفية، و Fable 5 للمهام واسعة النطاق طويلة الأمد التي يكون فشلها مكلفًا.
  • الحلّ الواقعي هو التشغيل المزدوج. Sol (أو Terra) للأعمال اليومية، و Fable 5 للمهام الكبيرة الحاسمة، هو الأمثل في التقسيم.

الأسئلة الشائعة

س1. GPT-5.6 Sol و Claude Fable 5، أيّهما أقوى في البرمجة؟

يعتمد على المؤشر. في SWE-Bench Pro الذي يقيس إصلاح أخطاء المستودعات الفعلية يتفوّق Fable 5 بـ 80.0% على Sol البالغ 64.6% بأكثر من 15 نقطة. في المقابل، في TerminalBench 2.1 لتشغيل الطرفية الذاتي يتفوّق Sol بـ 88.8% على Fable 5 البالغ 83.1% (والقيمتان من جدول التقييم لدى OpenAI؛ وبطاقة نظام Anthropic تعطي Fable 5 أيضًا 80.0% في SWE-Bench Pro). التقسيم العملي: «Fable لإصلاح الشيفرة الفعلية حتى النهاية، و Sol لاتساع تشغيل الطرفية والوكلاء».

س2. هل يستحقّ فارق السعر بمقدار الضِعف الدفع؟

حسب المهمة. للإنتاج اليومي وتشغيل الطرفية يكفي Sol بنصف السعر (وللأعمال الخفيفة Terra/Luna). لكن في «المهام التي تكون تكلفة إعادة عملها الفاشل كبيرة» كالترحيل واسع النطاق وإصلاح الأخطاء الصعبة، قد يكون Fable 5 ذو معدّل النجاح المرتفع أرخص في النهاية. احكم بـ «التكلفة لكل مهمة مكتملة» لا بسعر الرمز.

س3. هل قيمة SWE-bench Pro لـ Sol «64.6%» رسمية؟

نعم، إنها القيمة الواردة في جدول التقييم الذي نشرته OpenAI مع GPT-5.6. لكن OpenAI نشرت في الوقت نفسه تحليلًا يقدّر أن نحو 30% من مهام SWE-bench Pro معيبة، مشكّكةً بذلك في الاختبار ذاته. أما GPQA Diamond وFrontierMath، اللذان قال Vellum بُعيد الإطلاق إنهما غير مُعلنَين، فيظهران في جدول التقييم الذي راجعناه في 22 سبتمبر 2026 (GPQA: Sol 94.6% وFable 5 92.6%). والغائب عن الجدول هو SWE-bench Verified وAIME وMMLU.

س4. أيّهما الأنسب للمهام المستقلة طويلة الأمد؟

Fable 5. يحافظ على تركيزه عبر ملايين الرموز ويستطيع، بحسب Anthropic، العمل باستقلالية مدةً أطول من أي نموذج Claude سابق، وله سجلّ في إنجاز Stripe ترحيل 50 مليون سطر من Ruby في يوم واحد. «قدرة الإتمام» لإصلاح قاعدة شيفرة عملاقة واحدة حتى النهاية هي مجال Fable 5 الحقيقي.

س5. ما الفرق بين Fable 5 و Mythos 5؟

الجوهر (القدرة) مطابق، ولا تختلف سوى آليات الأمان. المطروح للعموم هو Fable 5، الذي يمتلك تصميم أمان بـ 3 مُصنّفات تُرجِع إلى Opus 4.8 عند رصد خطر فقط (تعمل في أقل من 5% من الجلسات، وأكثر من 95% ذاتي التشغيل).

س6. كيف يرتبط «Terra» من GPT-5.6 بهذه المقارنة؟

GPT-5.6 ثلاثة نماذج Luna/Terra/Sol. تناولت هذه المقالة Sol كنموذج رائد في مواجهة النماذج الرائدة وقت كتابتها، لكن إن كانت التكلفة أهم فإن Terra ($2/$12) يوفّر ما يعادل GPT-5.5 بـ40% من سعر وحدة Sol (بعد خفض الأسعار في 30 يوليو 2026). تركيبة «Fable 5 للمهام الصعبة و Terra للإنتاج» خيار قوي في العمل الفعلي أيضًا. للتفاصيل راجع الشرح الكامل لإصدار GPT-5.6.

س7. Opus 4.8 مقابل Fable 5 و Sol، أيّها نختار؟

اختر حسب الاستخدام والميزانية. Opus 4.8 ($5/$25) ضمن فئة سعر Sol نفسها، وبرمجة جيدة القيمة مقابل السعر بـ SWE-bench Pro 69.2%. أما Fable 5 ($10/$50) فكان الأعلى مستوى آنذاك بـ 80.0% وقدرة إتمام استثنائية لكنه غالٍ. الاستخدام الثلاثي واقعي: Opus 4.8/Sol للأعمال اليومية، و Fable 5 للمهام الحاسمة. راجع أيضًا مقارنة Sol مقابل Opus 4.8.

مقالات ذات صلة