في عام 2023، كانت نافذة سياق بحجم 32K رمز تبدو «فسيحة». أما اليوم فأصبحت نافذة من فئة المليون رمز (1M) أمرًا مفروغًا منه في النماذج العليا. وحتى سبتمبر 2026، تذكر Anthropic وOpenAI وGoogle جميعها في المواصفات الرسمية لنماذجها العليا حدًّا للإدخال يقارب مليون رمز. تتبدل أسماء النماذج وأرقامها مع كل إصدار، لذلك أتركها لـقائمة النماذج الحالية وتواريخ انقطاع المعرفة وللصفحات الرسمية لكل مزوّد، ويركّز هذا المقال على ما يبقى صالحًا عبر الأجيال: كيف تقرأ الأرقام، وكيف تتعامل معها.

«مليون رمز» تعني تقريبًا 8–10 كتب جيب بالإنجليزية، أو عشرات الآلاف من أسطر الشيفرة المصدرية. صار بإمكاننا الإبقاء على هذا الكم «أمام أعيننا» داخل جلسة واحدة. لكن أن تتسع الوثيقة داخل الوعاء لا يعني أن النموذج يقرؤها كاملة. فالنتائج التي تنشرها OpenAI لاختبارها متعدد الإبر للسياق الطويل (MRCR) تُظهر أن نتيجة النموذج نفسه تنخفض كلما طال الإدخال، وأن مقدار الانخفاض يختلف كثيرًا بين النماذج والأجيال (التفاصيل في §1 و§4).

دعني أصرّح برأيي مبكرًا: انتهى عصر اختيار النموذج بناءً على حجم الوعاء فقط. ما يهم هو ثلاثية «السياق الفعّال × التكلفة × طريقة التغذية». يستعرض هذا المقال ماهية السياق فعلًا، وكيف تقرأ ورقة المواصفات، ولماذا لا يكفي الحجم وحده، وكيف تقيس النطاق الفعّال لاستخدامك أنت، وكيف يقفز السعر مع المدخلات الطويلة، وخمسة أساليب للتوفير يمكن للمطورين الفرديين والفرق الصغيرة تطبيقها اليوم — مدعومة بالأرقام الرسمية ونتائج الاختبارات المرجعية المنشورة.

CONTEXT WINDOW · 2023→2026

في ثلاث سنوات تضخّم الوعاء 250 مرة

— خط زمني لتحوّل 1M من رفاهية إلى أمر مسلَّم به

2023
4K–200K
كان لدى GPT-3.5 وGPT-4 المبكر ما بين 4K و32K — ورقة بحثية واحدة تملؤها. وفي نوفمبر أطلق Claude 2.1 سعة 200K.
2024
128K–2M
صار GPT-4 Turbo (128K) وClaude 3 (200K) هما المعتاد. وفي يونيو فتح Gemini 1.5 Pro سعة 2M للمطورين.
2025
انتشار 1M
في أبريل دعم GPT-4.1 سعة 1M، وفي أغسطس تبعه Claude Sonnet 4 (نسخة تجريبية).
2026
1M = المعيار
النماذج العليا لدى Claude وGPT وGemini كلها في فئة المليون رمز (حتى سبتمبر).

لكن «الدعم» و«القراءة حتى النهاية» شيئان مختلفان. في اختبار السياق الطويل MRCR (ثماني إبر) من OpenAI، تنخفض نتيجة GPT-5.5 من 98.1% عند 4K–8K إلى 74.0% عند 512K–1M.
ويختلف حجم الانخفاض بين النماذج والأجيال (جدول التقييم في «Introducing GPT-5.5» من OpenAI، 23 أبريل 2026؛ التفاصيل في §1 و§4).

1. دعم 1M صار شائعًا — لكن «القراءة حتى النهاية» أمر آخر

انتشر دعم 1M بسرعة خلال العامين الماضيين. ففي أبريل 2025 صدر GPT-4.1 من OpenAI بنافذة تقارب 1.05 مليون رمز، وفي أغسطس 2025 بلغ Claude Sonnet 4 من Anthropic مليون رمز (في نسخة تجريبية)، وحتى سبتمبر 2026 تذكر النماذج العليا لدى Anthropic وOpenAI وGoogle جميعها قرابة مليون رمز في مواصفاتها الرسمية. في 2023 كانت 32K تبدو فسيحة — أي نمو يتجاوز 30 ضعفًا في ثلاث سنوات فقط. بدا أن سباق حجم الوعاء قد بلغ نهايته.

لكن إذا نظرت إلى نتائج السياق الطويل التي تنشرها الشركات نفسها، تصبح الصورة أعقد. الاختبار الذي تتوفر له نتائج كاملة حسب الطول هو MRCR v2 (ثماني إبر) من OpenAI. يُخفي هذا الاختبار ثمانية طلبات من النوع نفسه — مثل «اكتب قصيدة عن حيوان التابير» — داخل محادثة طويلة مع ذكاء اصطناعي، ثم يطلب إعادة واحد منها بعينه بدقة، مثل «أعد القصيدة الثانية». ولأن على النموذج أن يميّز بين عناصر شبه متطابقة حتى في ترتيبها، فهو اختبار needle-in-a-haystack متعدد الإبر. وتقيس الدرجة مدى تطابق النص المُعاد مع النص الصحيح. هذه هي النتائج حسب الطول:

  • GPT-5.5: 98.1% عند 4K–8K، و87.5% عند 128K–256K، و74.0% عند 512K–1M
  • GPT-5.4 (الجيل السابق في الجدول نفسه): 97.3% → 79.3% → 36.6% في النطاقات الثلاثة نفسها
  • Claude Opus 4.7 (قيم أدرجتها OpenAI في الجدول نفسه): 59.2% عند 128K–256K، و32.2% عند 512K–1M
  • GPT-6 Astra (أُعلن في سبتمبر 2026): 100.0% عند 256K–512K، و96.3% عند 512K–1M (وفي الجدول نفسه سجّل GPT-5.6 Sol 91.5% و73.8%)

المصادر (تم التحقق في 26 سبتمبر 2026): جداول التقييم في «Introducing GPT-5.5» (23 أبريل 2026) و«GPT-6 Astra» (3 سبتمبر 2026) من OpenAI. طريقة عمل الاختبار: وصف مجموعة بيانات OpenAI MRCR. أسماء النماذج كما كانت وقت كل إعلان.

يظهر أمران. الأول: نتيجة النموذج نفسه تنخفض كلما طال الإدخال. والثاني: حدّة الانخفاض تختلف كثيرًا بين النماذج والأجيال — ففي النطاق الأقرب إلى المليون هبط GPT-5.4 إلى ما دون 40%، بينما بقي GPT-6 Astra، الذي أُعلن في سبتمبر 2026، فوق 90%. يتبدل الترتيب مع كل جيل، لذا تتقادم هذه الأرقام بسرعة. أما الدرس الباقي فهو: الحد المعلن والنطاق الذي تصمد فيه الدقة فعلًا رقمان مختلفان.

لا تسئ الفهم؛ ليس المقصود أن «Claude أو GPT سيئان». حالات الاستخدام التي تحتاج فعلًا إلى المليون كاملًا أقل مما تظن. إذا قرأ النموذج بثبات حتى 300K (نحو 2–3 كتب)، فإن معظم مهام البرمجة والبحث والتلخيص تكتمل ضمنها. المشكلة هي الاختيار بناءً على رقم «يدعم 1M» وحده — فهكذا تنتهي بمعايير قرار خاطئة.

2. ما هو السياق؟ — افصل بين الوعاء ومحتواه

توضيح سريع للمصطلحات. ثلاث كلمات يخلط الناس بينها في هذا المجال.

ثلاثة مصطلحات

الرمز (Token)، النافذة (Window)، السياق (Context)

① TOKEN — وحدة النص
أصغر وحدة يعالج بها الذكاء الاصطناعي النص. حوالي 4 حروف إنجليزية لكل رمز (أو ~0.75 من كلمة)؛ أما لغات CJK فتبلغ تقريبًا 1–1.5 رمز لكل حرف.
② WINDOW — حجم الوعاء
الحد الأقصى لعدد الرموز التي يستطيع النموذج معالجتها في تبادل واحد، وهو مجموع الإدخال والإخراج (بما في ذلك التفكير). عبر الـ API، إذا تجاوز الإدخال وحده الحد تُعاد رسالة خطأ؛ أما تطبيقات الدردشة والوكلاء فعادةً ما تُفسح المجال بتلخيص الأجزاء الأقدم أو حذفها.
③ CONTEXT — المحتوى الفعلي
ما هو محمَّل حاليًا داخل النافذة. يشمل موجّه النظام، وسجل المحادثة، والمرفقات، ومخرجات الأدوات — كل ذلك.

باختصار: «النافذة = حجم الوعاء»، و«السياق = المحتوى»، و«الرمز = الوحدة».
وعاء كبير بمحتوى مشوش يعطيك إجابات مشوشة أيضًا.

كذلك: لا تخلط بين «السياق» و«الذاكرة». السياق يعيش داخل الجلسة — أغلق الدردشة فيختفي. أما ميزات مثل ChatGPT Memory أو Claude Memory فهي آلية احتفاظ منفصلة عبر الجلسات. تُحقن محتويات الذاكرة في النهاية داخل نافذة السياق، لكن من منظور المستخدم هي تخزين دائم مقابل مساحة عمل مؤقتة.

مفهوم خاطئ شائع: «نافذة سياق أكبر = ذكاء اصطناعي أذكى» مقولة خاطئة. حجم النافذة ليس سوى الحد الأعلى لما يمكن أن يكون في الأفق. أما القدرة الاستدلالية وعمق المعرفة ودقة اتباع التعليمات فتُقاس على حدة. كل إصدار جديد للنماذج يتصدّره عنوان «1M سياق!»، لكن هذا ليس سوى وجه واحد من أوجه القدرة.

3. اقرأ حجم الوعاء من ثلاثة أرقام

عند النظر إلى ورقة مواصفات أي نموذج، هناك ثلاثة أشياء فقط يجب التحقق منها فيما يخص السياق. أتقنها، وستتمكن من مقارنة أي نموذج بالطريقة نفسها.

① حد الإدخال

الرقم الأبرز في الكتالوج. لكنه «ما يمكن أن يدخل» لا «ما يمكن أن يُقرأ» — وكما نتناول في القسم التالي، القيمة الفعّالة أصغر من هذا الرقم بكثير.

② حد الإخراج

كثيرًا ما يُغفَل، لكنه أصغر من حد الإدخال بمرتبة عشرية كاملة. حتى في النماذج الرئيسية حتى سبتمبر 2026، يمكنك إدخال مليون رمز لكنك لا تستعيد سوى نحو 65K–128K. وفي مهام مثل «أعد كتابة هذه الوثيقة الطويلة كاملة» يكون هذا الحد أول ما تصطدم به.

③ نموذج التسعير

هل هو ثابت عبر النافذة كلها، أم أن سعر الوحدة يقفز فوق عتبة معينة؟ هذا أكثر ما يؤثر في التشغيل الفعلي، ومع ذلك يغيب غالبًا عن أوراق المواصفات. نحسبه بالأرقام في §5.

فيما يلي القيم الواردة في الصفحات الرسمية لكل مزوّد حتى 29 سبتمبر 2026. تتغير الأرقام مع كل جيل، فاقرأها مثالًا عمليًا على كيف تتحول المحاور الثلاثة أعلاه إلى فروق حقيقية. أما أسماء النماذج الحالية فراجعها في قائمة النماذج الحالية وتواريخ انقطاع المعرفة، والأرقام في الصفحات الرسمية لكل مزوّد.

العائلة (أمثلة حتى سبتمبر 2026)حد الإدخالحد الإخراجتسعير المدخلات الطويلة
Anthropic، الفئة العليا (Claude Fable 5.1 وOpus 5.5 وSonnet 5.5)1,000,000128,000السعر نفسه حتى الحد الأقصى
Anthropic، الفئة الخفيفة (Claude Haiku 4.5)200,00064,000—
OpenAI (GPT-6 Astra وSol)1,050,000128,000عند إدخال يتجاوز 272K يُحتسب الطلب كله بضعف سعر الإدخال و1.5 ضعف سعر الإخراج
Google (Gemini 3.1 Pro، معاينة)1,048,57665,536فوق 200K: الإدخال من $2 إلى $4، والإخراج من $12 إلى $18

المصادر (تم التحقق في 29 سبتمبر 2026): Anthropic Models overview وPricing / صفحات نماذج OpenAI لـGPT-6 Astra وGPT-6 Sol / Google Gemini 3.1 Pro Preview وGemini API pricing

يُظهر الجدول أن حدود الإدخال متقاربة جدًا لدى جميع المزوّدين، وأن الفروق تكمن في حدود الإخراج وشكل التسعير. وحين تتساوى الحدود، لا يعود حجم النافذة سببًا للاختيار. الفرق الحقيقي هو أن Anthropic تُبقي السعر نفسه حتى الحد الأقصى، بينما ترفع OpenAI وGoogle السعر بعد طول معين — أي أنه تحت ملصق «يدعم 1M» نفسه، تختلف حرية إرسال المدخلات الطويلة. وهذا ليس مجرد تفصيل في التسعير، بل يعكس مقاربات مختلفة لأحمال العمل ذات السياق الطويل. سنحسب ذلك في فصل التكلفة.

عمليًا، يكون الاختيار على هذا النحو. قرّر بناءً على حجم الوثائق التي تتعامل معها عادةً. إذا كانت تتسع ضمن نحو 200K، فاختر وفق ثبات الدقة في هذا النطاق ووفق بقائك تحت عتبة التسعير، لا وفق حجم النافذة. ولا يصبح اتساع النطاق الفعّال وسعر المدخلات الطويلة عاملًا حاسمًا إلا إذا كنت تتعامل باستمرار مع وثائق ضخمة تتجاوز 300K. لا تراهن على نموذج واحد — وزّع حسب حالة الاستخدام. وطريقة القرار هذه تبقى صالحة أيًّا كان الجيل الحالي.

أين تتحقق من الحدود

تحقق من الأرقام في الصفحات الرسمية لكل مزوّد، لا في مواقع التجميع ولا في جداول المقالات (بما فيها هذا المقال). أماكن البحث ثابتة إلى حد كبير:

  • Anthropic: في جدول المقارنة بصفحة نظرة عامة على النماذج صفّان بعنوان «Context window» و«Max output». أما تسعير المدخلات الطويلة ففي قسم «Long context pricing» بصفحة الأسعار
  • OpenAI: صفحة كل نموذج في توثيق الـ API تذكر «context window» و«max output tokens»، مع ملاحظة عن تسعير الموجّهات الطويلة
  • Google: صفحة النموذج في Gemini API تذكر «Input token limit» و«Output token limit»، وفي صفحة الأسعار شريحة «prompts > 200k tokens»

نقطة أخرى يسهل إغفالها: الحد نفسه يتسع لكمية مختلفة من النص بحسب النموذج. فالحدود تُحسب بالرموز، وحين يتغير المُرمِّز (الآلية التي تقسّم النص إلى رموز) يتغير عدد رموز الوثيقة نفسها أيضًا (انظر الملاحظة في §5). بعد تغيير النموذج، أعد العدّ باستخدام وثائقك للتأكد من بقاء هامش كافٍ.

4. ثلاثة أسباب تجعل مقولة «الأكبر أفضل» غير صحيحة

جدول الفصل السابق يُظهر فقط الحجم المادي للوعاء. فهل يستخدم النموذج فعلًا الوعاء الذي يعلن عنه؟ الخلاصة أولًا: لا تفترض أنه يقرأ بالدقة نفسها حتى الحد الأقصى. وهناك ثلاثة أسباب لذلك.

السبب ①: Lost in the Middle

هذه الظاهرة وثّقها باحثون من جامعة ستانفورد ومؤسسات أخرى (Liu وزملاؤه) عام 2023 في ورقة «Lost in the Middle». ففي مهام مثل البحث عن إجابة بين عدة وثائق، كانت النماذج تجيب بأفضل شكل حين تقع الإجابة في بداية الإدخال أو نهايته، وتفقد قدرًا كبيرًا من الدقة حين تقع في المنتصف — وظهر النمط نفسه حتى في النماذج المصممة للسياق الطويل.

عمليًا يبدو الأمر هكذا: «تلصق ملف PDF طويلًا كاملًا، وتسأل "ما رقم كذا؟"، فيخلط النموذج رقمًا يقع في منتصف الوثيقة تمامًا». هذا هو Lost in the Middle. تختلف شدته من نموذج لآخر، لكن الأسلم أن تفترض أن المعلومات الموضوعة في منتصف الوثيقة أسهل ضياعًا، وأن تعدّل طريقة تقديمها على هذا الأساس.

السبب ②: Context Rot

كلما طالت المحادثة، بهتت التعليمات الأولى. طلبت في البداية نبرة رسمية، وبعد 20 جولة عاد النموذج إلى النبرة العفوية — هذا هو Context Rot.

هناك سببان. ① تُعامَل التعليمات الأولى داخل سجل المحادثة على أنها قديمة وخفيفة نسبيًا. ② يشتّت السجل الطويل الانتباه، فيصعب الرجوع إلى رموز بعينها. وتسمّي Anthropic في توثيقها للمطورين تراجع الدقة والاسترجاع مع تزايد عدد الرموز «context rot»، وتكتب أن اختيار ما يدخل السياق لا يقل أهمية عن مقدار ما يتسع له. وفي سبتمبر 2025 عرضت التعامل مع هذه المشكلة بوصفه مهارة واعية في مقال تقني بعنوان «Effective context engineering for AI agents».

السبب ③: السياق المُعلن ≠ السياق الفعّال

إذا أخذنا من قيم §1 النطاق الأقرب إلى المليون فقط (512K–1M)، تكون الصورة كالتالي. جميعها من جداول التقييم في إعلانات OpenAI، وبالاختبار نفسه: OpenAI MRCR v2 (ثماني إبر).

OpenAI MRCR v2 (ثماني إبر) × 512K–1M

قرب المليون: هل يعيد النموذج العنصر المطلوب بعينه؟

GPT-6 Astra سبتمبر 2026 96.3%
GPT-5.5 أبريل 2026 74.0%
GPT-5.6 Sol سبتمبر 2026 73.8%
GPT-5.4 أبريل 2026 36.6%
Claude Opus 4.7 أبريل 2026 · جدول OpenAI 32.2%

المصادر: جداول التقييم في «Introducing GPT-5.5» (23 أبريل 2026؛ GPT-5.5 وGPT-5.4 وClaude Opus 4.7) و«GPT-6 Astra» (3 سبتمبر 2026؛ GPT-6 Astra وGPT-5.6 Sol) من OpenAI. أسماء النماذج كما كانت وقت كل إعلان.
في النطاق القصير من الجدول نفسه (4K–8K) سجّل GPT-5.5 98.1% وGPT-5.4 97.3%. كلها قيم نشرتها OpenAI في إعلاناتها، وليست قياسات طرف ثالث.

هذا لا يعني أن «النماذج ذات النتائج المنخفضة سيئة». ففي النطاق القصير من الجدول نفسه يتجاوز كلٌّ من GPT-5.5 وGPT-5.4 نسبة 97%، ومعظم العمل الفعلي — مراجعة الشيفرة، والكتابة الطويلة، وتلخيص محاضر الاجتماعات، وتجميع نتائج البحث — يكتمل قبل المليون بكثير. المشكلة في منطق «لديه 1M إذن سأرمي 1M». وتذكّر أيضًا أن هذه قيم نشرتها OpenAI في إعلاناتها، ولا تصح المقارنة بينها إلا داخل الجدول الواحد. وتنشر Google كذلك نتائج MRCR v2 (ثماني إبر) في بطاقة نموذج Gemini 3.1 Pro (فبراير 2026) — 84.9% عند 128K (متوسطًا) مقابل 26.3% عند 1M — لكنها تقسّم الأطوال بطريقة مختلفة، لذلك لم تُدرج بين الأشرطة أعلاه. ولا تتضمن صفحات إعلانات Anthropic عن Claude Opus 5.5 ونماذجها الحالية الأخرى نتائج من هذا النوع حسب الطول. ولمعرفة قدرة النموذج الذي تستخدمه اليوم، اختبره على استخدامك بالطريقة التالية.

قِس «النطاق الفعّال» لاستخدامك أنت

أرقام الاختبارات المرجعية مأخوذة من أنواع وثائق وأساليب أسئلة تختلف عن استخدامك. والأكثر موثوقية أن تبني اختبار needle-in-a-haystack صغيرًا بوثائقك أنت.

  1. خذ نوع الوثيقة الذي تستخدمه فعلًا (شيفرة، محاضر اجتماعات، عقود، إلخ)، وضع 3–5 حقائق ذات إجابات واضحة في البداية والمنتصف والنهاية (تصلح أيضًا حقائق موجودة أصلًا في الوثيقة)
  2. اطلب منه «أن يسردها كلها ويذكر أين ورد كل منها»، ليضطر إلى استخراج عدة حقائق في آن واحد. فالسؤال عن حقيقة واحدة يُظهر النموذج أفضل مما هو عليه (الفرق بين إبرة واحدة وعدة إبر)
  3. كرر السؤال نفسه بأطوال مختلفة — مثل 50K و200K و500K — وسجّل الطول الذي تبدأ عنده الإجابات في الانهيار
  4. أضف أسئلة تجمع بين الحقائق لا تكتفي باستخراجها («قارن بين A وB»). فالأسئلة التي تتطلب تركيبًا تنهار عادةً في وقت أبكر

ما قبل الطول الذي تبدأ عنده الأخطاء مباشرةً هو «السياق الفعّال» لذلك النموذج في ذلك الاستخدام. أعد القياس حين تغيّر النموذج. يستغرق الأمر بضع عشرات من الدقائق، لكنه يفيد القرارات الفعلية أكثر من أي رقم في ورقة المواصفات.

5. فخ التكلفة — نماذج يرتفع سعرها مع المدخلات الطويلة ونماذج لا يتغير سعرها

رأينا في الفصل السابق أن النطاق الفعّال يقع دون الحد المعلن. ويُضاف إلى ذلك فخ ثانٍ: إرسال مدخلات طويلة قد يرفع الفاتورة فجأة. وقد صمّم كل مزوّد ذلك بطريقة مختلفة.

النموذج (حتى سبتمبر 2026)السعر القياسي (إدخال / إخراج، لكل مليون رمز)المدخلات الطويلة
Claude Opus 5.5$4 / $20السعر نفسه عبر المليون كاملًا
GPT-6 Sol$2 / $10عند إدخال يتجاوز 272K يُحتسب الطلب كله بضعف سعر الإدخال و1.5 ضعف سعر الإخراج
GPT-6 Astra$10 / $50كما سبق
Gemini 3.1 Pro (معاينة)$2 / $12فوق 200K: الإدخال $4، والإخراج $18

لنحسب مثالًا. لنفترض أنك ترسل وثيقة من 500K رمز وتتلقى ردًا واحدًا من 50K — وهو السيناريو المعتاد لـ«تلخيص قاعدة شيفرة كبيرة أو تقرير سنوي دفعة واحدة».

  • Claude Opus 5.5 (سعر ثابت): $4.00 × 0.5 + $20.00 × 0.05 = $3.00
  • GPT-6 Sol (رسوم إضافية فوق 272K): $4.00 × 0.5 + $15.00 × 0.05 = $2.75 ($1.50 دون الرسوم الإضافية)
  • Gemini 3.1 Pro (سعر ما فوق 200K): $4.00 × 0.5 + $18.00 × 0.05 = $2.90 ($1.60 بسعر ما دون 200K)
  • GPT-6 Astra (رسوم إضافية فوق 272K): $20.00 × 0.5 + $75.00 × 0.05 = $13.75

يمكن قراءة ذلك من زاويتين. الأولى: بمجرد تجاوز العتبة، تصبح تكلفة النموذج نفسه نحو 1.8 ضعف. ففي المدخلات القصيرة يكلّف GPT-6 Sol نصف ما يكلّفه Claude Opus 5.5، لكن عند 500K يكاد الفرق يختفي — أيّ النموذجين «أرخص» ينقلب بحسب طول الإدخال. والثانية: حين تُضاف الرسوم الإضافية إلى نموذج رائد مرتفع السعر أصلًا، تنتقل التكلفة إلى مرتبة أخرى (GPT-6 Astra يكلّف أكثر من 4 أضعاف Opus 5.5). أعد الحساب بالنماذج التي تقارن بينها وبمتوسط طول مدخلاتك قبل أن تختار.

مع التسعير القائم على العتبات، قسّم ما يمكن تقسيمه بحيث يبقى كل جزء تحت العتبة. فإذا أرسلت الـ 500K في طلبين من 250K لكل منهما، لا يفرض GPT-6 Sol رسومًا إضافية — والمجموع $1.50 (مع أن ذلك لا يصلح للمهام التي تتطلب رؤية كل شيء دفعة واحدة). وهي البنية نفسها التي تناولتها في «توفير تكلفة رموز وجلسات الذكاء الاصطناعي».

ملاحظة: قد يختلف عدد رموز الوثيقة نفسها من نموذج لآخر. فالحدود والأسعار تُحسب بالرموز، ولذا يغيّر المُرمِّز الجديد تكلفة الوثيقة والهامش المتاح معًا. وتذكر Anthropic في نظرتها العامة الرسمية على النماذج أن المليون رمز يتسع بالمُرمِّز الحالي، المستخدم منذ Claude Opus 4.7، لنحو 555 ألف كلمة، مقابل نحو 750 ألف كلمة في النماذج السابقة — أي نحو 1.35 ضعف الرموز للنص الإنجليزي نفسه. وحتى إن بقي سعر الرمز كما هو، قارن الفواتير الفعلية بعد تغيير النموذج.

6. خمسة أساليب للتوفير — مرتبة وفق الأثر الفعلي للمطورين الفرديين

«الوعاء 1M لكن النطاق الفعّال ينتهي قبل ذلك بكثير، والاستخدام المطول مكلف.» قد غطّينا ذلك. إذًا ما الذي يمكنك فعله ميدانيًا؟ فيما يلي خمسة أساليب أستخدمها يوميًا، مرتبة حسب الأكبر مردودًا.

خمسة نصائح عملية

توفير السياق — ترتيب الأولويات

① اقطع الجلسة
عندما يتغير الموضوع، افتح دردشة جديدة. مجرد منع السياق القديم من الانتقال يقضي على Context Rot. في Claude Code، استخدم /compact أو ابدأ جلسة جديدة.
② أرسل مقتطفات لا نصوصًا كاملة
لصق PDF من 100 صفحة كاملًا أسوأ خطوة. استخدم grep / البحث لاستخراج الأقسام ذات الصلة، واضغطها إلى 3–5 صفحات ثم أرسلها. عقلية RAG، مطبَّقة فرديًا.
③ كرّر التعليمات الرئيسية في النهاية
إجراء مضاد لـ Lost-in-the-Middle. أعد ذكر القاعدة المذكورة في الأعلى بسطر واحد في النهاية: «بناءً على ما سبق، أخرج بصيغة X».
④ Prompt Caching
إذا كنت تعيد استخدام موجّه النظام نفسه أو المواد نفسها، فإن تخزين الموجّهات مؤقتًا (prompt caching) لدى Anthropic/OpenAI يُنزل سعر الإدخال للجزء المقروء من الذاكرة المؤقتة إلى 10% من السعر الأساسي أو أقل (الأسعار الرسمية حتى سبتمبر 2026). إن كنت تستخدم الـ API فاضبطه أولًا.
⑤ صرّح بعناوين الملفات
تحديد «الملف N، السطر X» يعزز دقة الاسترجاع في السياقات الطويلة. اعتبر الأمر كأنك تسلّم الذكاء الاصطناعي جدول محتويات بإدخالات فهرس.

من بين الأساليب الخمسة، الأسلوب ① «اقطع الجلسة» يحقق أكبر مكسب ملحوظ. مجرد قطع الدردشة يقلّل الهلوسات بشكل ملموس.
الأسلوب ④ مخصص لمطوري API — أما الواجهات (claude.ai / ChatGPT) فتدير التخزين المؤقت تلقائيًا.

أفضل ممارسة شخصية لي: مجرد الالتزام بـ ① و② باستمرار يحرّك الدقة المُدرَكة بشكل ملحوظ. حتى مع Claude Code، بدلًا من دفع جلسة طويلة واحدة، فإن الضغط على /compact أو بدء جلسة جديدة عند كل تغيير موضوع يبقي جودة المخرج النهائي مستقرة.

الخلاصة

أبرز نقاط هذا المقال:

  • نافذة السياق = الحد الأقصى لعدد الرموز التي يستطيع الذكاء الاصطناعي معالجتها في تبادل واحد. إنها حجم الوعاء
  • حتى سبتمبر 2026، النماذج العليا لدى Anthropic وOpenAI وGoogle كلها في فئة المليون رمز. حدود الإدخال متقاربة، والفروق في حدود الإخراج وتسعير المدخلات الطويلة
  • الحد المعلن والنطاق الفعّال أمران مختلفان. في اختبار MRCR متعدد الإبر (ثماني إبر) الذي تنشره OpenAI، تنخفض نتيجة النموذج نفسه كلما طال الإدخال، وتراوحت القيم قرب المليون بين 32.2% لـ Claude Opus 4.7 (في جدول OpenAI) و96.3% لـ GPT-6 Astra
  • أوثق طريقة لمعرفة النطاق الفعّال هي توزيع حقائق في وثائقك واختبارها بأطوال مختلفة. أعد القياس عند تغيير النموذج
  • لتسعير المدخلات الطويلة شكلان: السعر نفسه حتى الحد الأقصى (Anthropic)، أو رسوم إضافية بعد عتبة (272K لدى OpenAI و200K لدى Google). والأرخص ينقلب بحسب طول الإدخال
  • يتلخص التوفير في خمس خطوات: قطع الجلسات، وإرسال المقتطفات، وتكرار التعليمات في النهاية، والتخزين المؤقت، وتوضيح العناوين — و① و② هما الأكثر أثرًا

كبر الوعاء، لكن ما نفعله حقًا ما زال الاختيار بين ما نمرّره وما نتركه. لم تعد المهارة الأساسية في الذكاء الاصطناعي «القدرة على حشو كل شيء»، بل حسن التقدير لتمرير المطلوب بالضبط وبالشكل الصحيح — وهي مهارة تبقى نافعة مهما تعاقبت أجيال النماذج. هذا استنتاجي الآن وقد صار 1M هو المعتاد.

الأسئلة الشائعة

س1. كيف أقيس عدد الرموز مسبقًا؟

لدى OpenAI مكتبة tiktoken، وفي API الخاصة بـ Anthropic ميزة لعدّ الرموز (token counting). وكتقدير تقريبي: الحرف الياباني الواحد ≈ 1–1.5 رمز، والكلمة الإنجليزية الواحدة ≈ 1.3–1.8 رمز، لكن ذلك يتغير بحسب جيل المُرمِّز (انظر الملاحظة في §5). وتتفاوت الشيفرة كثيرًا بحسب نوعها أيضًا، لذا فالأسلم أن تقيس قبل إرسال مدخل طويل.

س2. ما الفرق بين «الذاكرة» والسياق؟

السياق يعيش داخل الجلسة فقط — أغلق الدردشة فيختفي. أما الذاكرة (ChatGPT Memory / Claude Memory) فهي آلية احتفاظ منفصلة عبر الجلسات. ينتهي الأمر بحقن محتويات الذاكرة في نافذة السياق، لكن من منظور المستخدم هي دائمة مقابل عابرة.

س3. ما علاقة RAG بنافذة السياق؟

RAG هو نمط «جلب المعلومات اللازمة فقط ديناميكيًا إلى السياق». حتى مع نافذة 1M، فإن إغراقها بكل شيء يجعلها بطيئة وثقيلة ومكلفة، ولذلك يبقى الاسترجاع ثم التحميل (RAG) المنهج السائد. راجع ما هو RAG للمزيد.

س4. لماذا تتراجع الدقة قبل امتلاء نافذة المليون بكثير؟

تتراكم عدة عوامل: عدم التطابق بين أطوال التسلسلات الغالبة أثناء التدريب وتلك المستخدمة أثناء الاستدلال، وحدود الترميز الموضعي في آلية الانتباه، والارتفاع الحاد في الحوسبة اللازمة لدمج عدة معلومات. «الدعم» و«الدقة عبر النافذة كاملة» مسألتان مختلفتان. ويتوقف موضع بدء التراجع على النموذج والمهمة، لذا فالأوثق أن تقيسه بوثائقك وفق الطريقة الواردة في §4.

س5. هل توفّر خوادم MCP السياق؟

نعم. MCP هو آلية للجلب عند الطلب عبر الأدوات، فلا تحتاج إلى تحميل كل شيء في السياق مسبقًا. بدّل النموذج الذهني من «ألصق الملف بأكمله» إلى «دعه يذهب ويقرأ الملف».

س6. كيف أقسّم أو ألخّص وثيقة أطول من النطاق الفعّال؟

قرّر بحسب الهدف. ① إن أردت ملخصًا للكل، فلخّص كل فصل أولًا، ثم اجمع هذه الملخصات في مرحلة ثانية. ② إن كنت تبحث عن إجابة محددة، فلا ترسل النص كاملًا، بل استخرج الأجزاء ذات الصلة فقط عبر البحث (RAG). ③ فقط حين تحتاج إلى المقارنة عبر الوثيقة كلها يكون إرسالها دفعة واحدة مجديًا، بطول يتسع ضمن النطاق الفعّال. وعند التقسيم، اقطع عند العناوين واجعل بضع فقرات تتداخل على الجانبين، كي لا ينقطع الخيط عند مواضع الوصل.