جدول المحتويات
- 1. دعم 1M صار شائعًا — لكن «القراءة حتى النهاية» أمر آخر
- 2. ما هو السياق؟ — افصل بين الوعاء ومحتواه
- 3. اقرأ حجم الوعاء من ثلاثة أرقام
- 4. ثلاثة أسباب تجعل مقولة «الأكبر أفضل» غير صحيحة
- 5. فخ التكلفة — نماذج يرتفع سعرها مع المدخلات الطويلة ونماذج لا يتغير سعرها
- 6. خمسة أساليب للتوفير — مرتبة وفق الأثر الفعلي للمطورين الفرديين
- الخلاصة
- الأسئلة الشائعة
في عام 2023، كانت نافذة سياق بحجم 32K رمز تبدو «فسيحة». أما اليوم فأصبحت نافذة من فئة المليون رمز (1M) أمرًا مفروغًا منه في النماذج العليا. وحتى سبتمبر 2026، تذكر Anthropic وOpenAI وGoogle جميعها في المواصفات الرسمية لنماذجها العليا حدًّا للإدخال يقارب مليون رمز. تتبدل أسماء النماذج وأرقامها مع كل إصدار، لذلك أتركها لـقائمة النماذج الحالية وتواريخ انقطاع المعرفة وللصفحات الرسمية لكل مزوّد، ويركّز هذا المقال على ما يبقى صالحًا عبر الأجيال: كيف تقرأ الأرقام، وكيف تتعامل معها.
«مليون رمز» تعني تقريبًا 8–10 كتب جيب بالإنجليزية، أو عشرات الآلاف من أسطر الشيفرة المصدرية. صار بإمكاننا الإبقاء على هذا الكم «أمام أعيننا» داخل جلسة واحدة. لكن أن تتسع الوثيقة داخل الوعاء لا يعني أن النموذج يقرؤها كاملة. فالنتائج التي تنشرها OpenAI لاختبارها متعدد الإبر للسياق الطويل (MRCR) تُظهر أن نتيجة النموذج نفسه تنخفض كلما طال الإدخال، وأن مقدار الانخفاض يختلف كثيرًا بين النماذج والأجيال (التفاصيل في §1 و§4).
دعني أصرّح برأيي مبكرًا: انتهى عصر اختيار النموذج بناءً على حجم الوعاء فقط. ما يهم هو ثلاثية «السياق الفعّال × التكلفة × طريقة التغذية». يستعرض هذا المقال ماهية السياق فعلًا، وكيف تقرأ ورقة المواصفات، ولماذا لا يكفي الحجم وحده، وكيف تقيس النطاق الفعّال لاستخدامك أنت، وكيف يقفز السعر مع المدخلات الطويلة، وخمسة أساليب للتوفير يمكن للمطورين الفرديين والفرق الصغيرة تطبيقها اليوم — مدعومة بالأرقام الرسمية ونتائج الاختبارات المرجعية المنشورة.
في ثلاث سنوات تضخّم الوعاء 250 مرة
— خط زمني لتحوّل 1M من رفاهية إلى أمر مسلَّم به
لكن «الدعم» و«القراءة حتى النهاية» شيئان مختلفان. في اختبار السياق الطويل MRCR (ثماني إبر) من OpenAI، تنخفض نتيجة GPT-5.5 من 98.1% عند 4K–8K إلى 74.0% عند 512K–1M.
ويختلف حجم الانخفاض بين النماذج والأجيال (جدول التقييم في «Introducing GPT-5.5» من OpenAI، 23 أبريل 2026؛ التفاصيل في §1 و§4).
1. دعم 1M صار شائعًا — لكن «القراءة حتى النهاية» أمر آخر
انتشر دعم 1M بسرعة خلال العامين الماضيين. ففي أبريل 2025 صدر GPT-4.1 من OpenAI بنافذة تقارب 1.05 مليون رمز، وفي أغسطس 2025 بلغ Claude Sonnet 4 من Anthropic مليون رمز (في نسخة تجريبية)، وحتى سبتمبر 2026 تذكر النماذج العليا لدى Anthropic وOpenAI وGoogle جميعها قرابة مليون رمز في مواصفاتها الرسمية. في 2023 كانت 32K تبدو فسيحة — أي نمو يتجاوز 30 ضعفًا في ثلاث سنوات فقط. بدا أن سباق حجم الوعاء قد بلغ نهايته.
لكن إذا نظرت إلى نتائج السياق الطويل التي تنشرها الشركات نفسها، تصبح الصورة أعقد. الاختبار الذي تتوفر له نتائج كاملة حسب الطول هو MRCR v2 (ثماني إبر) من OpenAI. يُخفي هذا الاختبار ثمانية طلبات من النوع نفسه — مثل «اكتب قصيدة عن حيوان التابير» — داخل محادثة طويلة مع ذكاء اصطناعي، ثم يطلب إعادة واحد منها بعينه بدقة، مثل «أعد القصيدة الثانية». ولأن على النموذج أن يميّز بين عناصر شبه متطابقة حتى في ترتيبها، فهو اختبار needle-in-a-haystack متعدد الإبر. وتقيس الدرجة مدى تطابق النص المُعاد مع النص الصحيح. هذه هي النتائج حسب الطول:
- GPT-5.5: 98.1% عند 4K–8K، و87.5% عند 128K–256K، و74.0% عند 512K–1M
- GPT-5.4 (الجيل السابق في الجدول نفسه): 97.3% → 79.3% → 36.6% في النطاقات الثلاثة نفسها
- Claude Opus 4.7 (قيم أدرجتها OpenAI في الجدول نفسه): 59.2% عند 128K–256K، و32.2% عند 512K–1M
- GPT-6 Astra (أُعلن في سبتمبر 2026): 100.0% عند 256K–512K، و96.3% عند 512K–1M (وفي الجدول نفسه سجّل GPT-5.6 Sol 91.5% و73.8%)
المصادر (تم التحقق في 26 سبتمبر 2026): جداول التقييم في «Introducing GPT-5.5» (23 أبريل 2026) و«GPT-6 Astra» (3 سبتمبر 2026) من OpenAI. طريقة عمل الاختبار: وصف مجموعة بيانات OpenAI MRCR. أسماء النماذج كما كانت وقت كل إعلان.
يظهر أمران. الأول: نتيجة النموذج نفسه تنخفض كلما طال الإدخال. والثاني: حدّة الانخفاض تختلف كثيرًا بين النماذج والأجيال — ففي النطاق الأقرب إلى المليون هبط GPT-5.4 إلى ما دون 40%، بينما بقي GPT-6 Astra، الذي أُعلن في سبتمبر 2026، فوق 90%. يتبدل الترتيب مع كل جيل، لذا تتقادم هذه الأرقام بسرعة. أما الدرس الباقي فهو: الحد المعلن والنطاق الذي تصمد فيه الدقة فعلًا رقمان مختلفان.
لا تسئ الفهم؛ ليس المقصود أن «Claude أو GPT سيئان». حالات الاستخدام التي تحتاج فعلًا إلى المليون كاملًا أقل مما تظن. إذا قرأ النموذج بثبات حتى 300K (نحو 2–3 كتب)، فإن معظم مهام البرمجة والبحث والتلخيص تكتمل ضمنها. المشكلة هي الاختيار بناءً على رقم «يدعم 1M» وحده — فهكذا تنتهي بمعايير قرار خاطئة.
2. ما هو السياق؟ — افصل بين الوعاء ومحتواه
توضيح سريع للمصطلحات. ثلاث كلمات يخلط الناس بينها في هذا المجال.
الرمز (Token)، النافذة (Window)، السياق (Context)
باختصار: «النافذة = حجم الوعاء»، و«السياق = المحتوى»، و«الرمز = الوحدة».
وعاء كبير بمحتوى مشوش يعطيك إجابات مشوشة أيضًا.
كذلك: لا تخلط بين «السياق» و«الذاكرة». السياق يعيش داخل الجلسة — أغلق الدردشة فيختفي. أما ميزات مثل ChatGPT Memory أو Claude Memory فهي آلية احتفاظ منفصلة عبر الجلسات. تُحقن محتويات الذاكرة في النهاية داخل نافذة السياق، لكن من منظور المستخدم هي تخزين دائم مقابل مساحة عمل مؤقتة.
3. اقرأ حجم الوعاء من ثلاثة أرقام
عند النظر إلى ورقة مواصفات أي نموذج، هناك ثلاثة أشياء فقط يجب التحقق منها فيما يخص السياق. أتقنها، وستتمكن من مقارنة أي نموذج بالطريقة نفسها.
الرقم الأبرز في الكتالوج. لكنه «ما يمكن أن يدخل» لا «ما يمكن أن يُقرأ» — وكما نتناول في القسم التالي، القيمة الفعّالة أصغر من هذا الرقم بكثير.
كثيرًا ما يُغفَل، لكنه أصغر من حد الإدخال بمرتبة عشرية كاملة. حتى في النماذج الرئيسية حتى سبتمبر 2026، يمكنك إدخال مليون رمز لكنك لا تستعيد سوى نحو 65K–128K. وفي مهام مثل «أعد كتابة هذه الوثيقة الطويلة كاملة» يكون هذا الحد أول ما تصطدم به.
هل هو ثابت عبر النافذة كلها، أم أن سعر الوحدة يقفز فوق عتبة معينة؟ هذا أكثر ما يؤثر في التشغيل الفعلي، ومع ذلك يغيب غالبًا عن أوراق المواصفات. نحسبه بالأرقام في §5.
فيما يلي القيم الواردة في الصفحات الرسمية لكل مزوّد حتى 29 سبتمبر 2026. تتغير الأرقام مع كل جيل، فاقرأها مثالًا عمليًا على كيف تتحول المحاور الثلاثة أعلاه إلى فروق حقيقية. أما أسماء النماذج الحالية فراجعها في قائمة النماذج الحالية وتواريخ انقطاع المعرفة، والأرقام في الصفحات الرسمية لكل مزوّد.
| العائلة (أمثلة حتى سبتمبر 2026) | حد الإدخال | حد الإخراج | تسعير المدخلات الطويلة |
|---|---|---|---|
| Anthropic، الفئة العليا (Claude Fable 5.1 وOpus 5.5 وSonnet 5.5) | 1,000,000 | 128,000 | السعر نفسه حتى الحد الأقصى |
| Anthropic، الفئة الخفيفة (Claude Haiku 4.5) | 200,000 | 64,000 | — |
| OpenAI (GPT-6 Astra وSol) | 1,050,000 | 128,000 | عند إدخال يتجاوز 272K يُحتسب الطلب كله بضعف سعر الإدخال و1.5 ضعف سعر الإخراج |
| Google (Gemini 3.1 Pro، معاينة) | 1,048,576 | 65,536 | فوق 200K: الإدخال من $2 إلى $4، والإخراج من $12 إلى $18 |
المصادر (تم التحقق في 29 سبتمبر 2026): Anthropic Models overview وPricing / صفحات نماذج OpenAI لـGPT-6 Astra وGPT-6 Sol / Google Gemini 3.1 Pro Preview وGemini API pricing
يُظهر الجدول أن حدود الإدخال متقاربة جدًا لدى جميع المزوّدين، وأن الفروق تكمن في حدود الإخراج وشكل التسعير. وحين تتساوى الحدود، لا يعود حجم النافذة سببًا للاختيار. الفرق الحقيقي هو أن Anthropic تُبقي السعر نفسه حتى الحد الأقصى، بينما ترفع OpenAI وGoogle السعر بعد طول معين — أي أنه تحت ملصق «يدعم 1M» نفسه، تختلف حرية إرسال المدخلات الطويلة. وهذا ليس مجرد تفصيل في التسعير، بل يعكس مقاربات مختلفة لأحمال العمل ذات السياق الطويل. سنحسب ذلك في فصل التكلفة.
عمليًا، يكون الاختيار على هذا النحو. قرّر بناءً على حجم الوثائق التي تتعامل معها عادةً. إذا كانت تتسع ضمن نحو 200K، فاختر وفق ثبات الدقة في هذا النطاق ووفق بقائك تحت عتبة التسعير، لا وفق حجم النافذة. ولا يصبح اتساع النطاق الفعّال وسعر المدخلات الطويلة عاملًا حاسمًا إلا إذا كنت تتعامل باستمرار مع وثائق ضخمة تتجاوز 300K. لا تراهن على نموذج واحد — وزّع حسب حالة الاستخدام. وطريقة القرار هذه تبقى صالحة أيًّا كان الجيل الحالي.
أين تتحقق من الحدود
تحقق من الأرقام في الصفحات الرسمية لكل مزوّد، لا في مواقع التجميع ولا في جداول المقالات (بما فيها هذا المقال). أماكن البحث ثابتة إلى حد كبير:
- Anthropic: في جدول المقارنة بصفحة نظرة عامة على النماذج صفّان بعنوان «Context window» و«Max output». أما تسعير المدخلات الطويلة ففي قسم «Long context pricing» بصفحة الأسعار
- OpenAI: صفحة كل نموذج في توثيق الـ API تذكر «context window» و«max output tokens»، مع ملاحظة عن تسعير الموجّهات الطويلة
- Google: صفحة النموذج في Gemini API تذكر «Input token limit» و«Output token limit»، وفي صفحة الأسعار شريحة «prompts > 200k tokens»
نقطة أخرى يسهل إغفالها: الحد نفسه يتسع لكمية مختلفة من النص بحسب النموذج. فالحدود تُحسب بالرموز، وحين يتغير المُرمِّز (الآلية التي تقسّم النص إلى رموز) يتغير عدد رموز الوثيقة نفسها أيضًا (انظر الملاحظة في §5). بعد تغيير النموذج، أعد العدّ باستخدام وثائقك للتأكد من بقاء هامش كافٍ.
4. ثلاثة أسباب تجعل مقولة «الأكبر أفضل» غير صحيحة
جدول الفصل السابق يُظهر فقط الحجم المادي للوعاء. فهل يستخدم النموذج فعلًا الوعاء الذي يعلن عنه؟ الخلاصة أولًا: لا تفترض أنه يقرأ بالدقة نفسها حتى الحد الأقصى. وهناك ثلاثة أسباب لذلك.
السبب ①: Lost in the Middle
هذه الظاهرة وثّقها باحثون من جامعة ستانفورد ومؤسسات أخرى (Liu وزملاؤه) عام 2023 في ورقة «Lost in the Middle». ففي مهام مثل البحث عن إجابة بين عدة وثائق، كانت النماذج تجيب بأفضل شكل حين تقع الإجابة في بداية الإدخال أو نهايته، وتفقد قدرًا كبيرًا من الدقة حين تقع في المنتصف — وظهر النمط نفسه حتى في النماذج المصممة للسياق الطويل.
عمليًا يبدو الأمر هكذا: «تلصق ملف PDF طويلًا كاملًا، وتسأل "ما رقم كذا؟"، فيخلط النموذج رقمًا يقع في منتصف الوثيقة تمامًا». هذا هو Lost in the Middle. تختلف شدته من نموذج لآخر، لكن الأسلم أن تفترض أن المعلومات الموضوعة في منتصف الوثيقة أسهل ضياعًا، وأن تعدّل طريقة تقديمها على هذا الأساس.
السبب ②: Context Rot
كلما طالت المحادثة، بهتت التعليمات الأولى. طلبت في البداية نبرة رسمية، وبعد 20 جولة عاد النموذج إلى النبرة العفوية — هذا هو Context Rot.
هناك سببان. ① تُعامَل التعليمات الأولى داخل سجل المحادثة على أنها قديمة وخفيفة نسبيًا. ② يشتّت السجل الطويل الانتباه، فيصعب الرجوع إلى رموز بعينها. وتسمّي Anthropic في توثيقها للمطورين تراجع الدقة والاسترجاع مع تزايد عدد الرموز «context rot»، وتكتب أن اختيار ما يدخل السياق لا يقل أهمية عن مقدار ما يتسع له. وفي سبتمبر 2025 عرضت التعامل مع هذه المشكلة بوصفه مهارة واعية في مقال تقني بعنوان «Effective context engineering for AI agents».
السبب ③: السياق المُعلن ≠ السياق الفعّال
إذا أخذنا من قيم §1 النطاق الأقرب إلى المليون فقط (512K–1M)، تكون الصورة كالتالي. جميعها من جداول التقييم في إعلانات OpenAI، وبالاختبار نفسه: OpenAI MRCR v2 (ثماني إبر).
قرب المليون: هل يعيد النموذج العنصر المطلوب بعينه؟
المصادر: جداول التقييم في «Introducing GPT-5.5» (23 أبريل 2026؛ GPT-5.5 وGPT-5.4 وClaude Opus 4.7) و«GPT-6 Astra» (3 سبتمبر 2026؛ GPT-6 Astra وGPT-5.6 Sol) من OpenAI. أسماء النماذج كما كانت وقت كل إعلان.
في النطاق القصير من الجدول نفسه (4K–8K) سجّل GPT-5.5 98.1% وGPT-5.4 97.3%. كلها قيم نشرتها OpenAI في إعلاناتها، وليست قياسات طرف ثالث.
هذا لا يعني أن «النماذج ذات النتائج المنخفضة سيئة». ففي النطاق القصير من الجدول نفسه يتجاوز كلٌّ من GPT-5.5 وGPT-5.4 نسبة 97%، ومعظم العمل الفعلي — مراجعة الشيفرة، والكتابة الطويلة، وتلخيص محاضر الاجتماعات، وتجميع نتائج البحث — يكتمل قبل المليون بكثير. المشكلة في منطق «لديه 1M إذن سأرمي 1M». وتذكّر أيضًا أن هذه قيم نشرتها OpenAI في إعلاناتها، ولا تصح المقارنة بينها إلا داخل الجدول الواحد. وتنشر Google كذلك نتائج MRCR v2 (ثماني إبر) في بطاقة نموذج Gemini 3.1 Pro (فبراير 2026) — 84.9% عند 128K (متوسطًا) مقابل 26.3% عند 1M — لكنها تقسّم الأطوال بطريقة مختلفة، لذلك لم تُدرج بين الأشرطة أعلاه. ولا تتضمن صفحات إعلانات Anthropic عن Claude Opus 5.5 ونماذجها الحالية الأخرى نتائج من هذا النوع حسب الطول. ولمعرفة قدرة النموذج الذي تستخدمه اليوم، اختبره على استخدامك بالطريقة التالية.
قِس «النطاق الفعّال» لاستخدامك أنت
أرقام الاختبارات المرجعية مأخوذة من أنواع وثائق وأساليب أسئلة تختلف عن استخدامك. والأكثر موثوقية أن تبني اختبار needle-in-a-haystack صغيرًا بوثائقك أنت.
- خذ نوع الوثيقة الذي تستخدمه فعلًا (شيفرة، محاضر اجتماعات، عقود، إلخ)، وضع 3–5 حقائق ذات إجابات واضحة في البداية والمنتصف والنهاية (تصلح أيضًا حقائق موجودة أصلًا في الوثيقة)
- اطلب منه «أن يسردها كلها ويذكر أين ورد كل منها»، ليضطر إلى استخراج عدة حقائق في آن واحد. فالسؤال عن حقيقة واحدة يُظهر النموذج أفضل مما هو عليه (الفرق بين إبرة واحدة وعدة إبر)
- كرر السؤال نفسه بأطوال مختلفة — مثل 50K و200K و500K — وسجّل الطول الذي تبدأ عنده الإجابات في الانهيار
- أضف أسئلة تجمع بين الحقائق لا تكتفي باستخراجها («قارن بين A وB»). فالأسئلة التي تتطلب تركيبًا تنهار عادةً في وقت أبكر
ما قبل الطول الذي تبدأ عنده الأخطاء مباشرةً هو «السياق الفعّال» لذلك النموذج في ذلك الاستخدام. أعد القياس حين تغيّر النموذج. يستغرق الأمر بضع عشرات من الدقائق، لكنه يفيد القرارات الفعلية أكثر من أي رقم في ورقة المواصفات.
5. فخ التكلفة — نماذج يرتفع سعرها مع المدخلات الطويلة ونماذج لا يتغير سعرها
رأينا في الفصل السابق أن النطاق الفعّال يقع دون الحد المعلن. ويُضاف إلى ذلك فخ ثانٍ: إرسال مدخلات طويلة قد يرفع الفاتورة فجأة. وقد صمّم كل مزوّد ذلك بطريقة مختلفة.
| النموذج (حتى سبتمبر 2026) | السعر القياسي (إدخال / إخراج، لكل مليون رمز) | المدخلات الطويلة |
|---|---|---|
| Claude Opus 5.5 | $4 / $20 | السعر نفسه عبر المليون كاملًا |
| GPT-6 Sol | $2 / $10 | عند إدخال يتجاوز 272K يُحتسب الطلب كله بضعف سعر الإدخال و1.5 ضعف سعر الإخراج |
| GPT-6 Astra | $10 / $50 | كما سبق |
| Gemini 3.1 Pro (معاينة) | $2 / $12 | فوق 200K: الإدخال $4، والإخراج $18 |
لنحسب مثالًا. لنفترض أنك ترسل وثيقة من 500K رمز وتتلقى ردًا واحدًا من 50K — وهو السيناريو المعتاد لـ«تلخيص قاعدة شيفرة كبيرة أو تقرير سنوي دفعة واحدة».
- Claude Opus 5.5 (سعر ثابت): $4.00 × 0.5 + $20.00 × 0.05 = $3.00
- GPT-6 Sol (رسوم إضافية فوق 272K): $4.00 × 0.5 + $15.00 × 0.05 = $2.75 ($1.50 دون الرسوم الإضافية)
- Gemini 3.1 Pro (سعر ما فوق 200K): $4.00 × 0.5 + $18.00 × 0.05 = $2.90 ($1.60 بسعر ما دون 200K)
- GPT-6 Astra (رسوم إضافية فوق 272K): $20.00 × 0.5 + $75.00 × 0.05 = $13.75
يمكن قراءة ذلك من زاويتين. الأولى: بمجرد تجاوز العتبة، تصبح تكلفة النموذج نفسه نحو 1.8 ضعف. ففي المدخلات القصيرة يكلّف GPT-6 Sol نصف ما يكلّفه Claude Opus 5.5، لكن عند 500K يكاد الفرق يختفي — أيّ النموذجين «أرخص» ينقلب بحسب طول الإدخال. والثانية: حين تُضاف الرسوم الإضافية إلى نموذج رائد مرتفع السعر أصلًا، تنتقل التكلفة إلى مرتبة أخرى (GPT-6 Astra يكلّف أكثر من 4 أضعاف Opus 5.5). أعد الحساب بالنماذج التي تقارن بينها وبمتوسط طول مدخلاتك قبل أن تختار.
مع التسعير القائم على العتبات، قسّم ما يمكن تقسيمه بحيث يبقى كل جزء تحت العتبة. فإذا أرسلت الـ 500K في طلبين من 250K لكل منهما، لا يفرض GPT-6 Sol رسومًا إضافية — والمجموع $1.50 (مع أن ذلك لا يصلح للمهام التي تتطلب رؤية كل شيء دفعة واحدة). وهي البنية نفسها التي تناولتها في «توفير تكلفة رموز وجلسات الذكاء الاصطناعي».
6. خمسة أساليب للتوفير — مرتبة وفق الأثر الفعلي للمطورين الفرديين
«الوعاء 1M لكن النطاق الفعّال ينتهي قبل ذلك بكثير، والاستخدام المطول مكلف.» قد غطّينا ذلك. إذًا ما الذي يمكنك فعله ميدانيًا؟ فيما يلي خمسة أساليب أستخدمها يوميًا، مرتبة حسب الأكبر مردودًا.
توفير السياق — ترتيب الأولويات
/compact أو ابدأ جلسة جديدة.
من بين الأساليب الخمسة، الأسلوب ① «اقطع الجلسة» يحقق أكبر مكسب ملحوظ. مجرد قطع الدردشة يقلّل الهلوسات بشكل ملموس.
الأسلوب ④ مخصص لمطوري API — أما الواجهات (claude.ai / ChatGPT) فتدير التخزين المؤقت تلقائيًا.
أفضل ممارسة شخصية لي: مجرد الالتزام بـ ① و② باستمرار يحرّك الدقة المُدرَكة بشكل ملحوظ. حتى مع Claude Code، بدلًا من دفع جلسة طويلة واحدة، فإن الضغط على /compact أو بدء جلسة جديدة عند كل تغيير موضوع يبقي جودة المخرج النهائي مستقرة.
الخلاصة
أبرز نقاط هذا المقال:
- نافذة السياق = الحد الأقصى لعدد الرموز التي يستطيع الذكاء الاصطناعي معالجتها في تبادل واحد. إنها حجم الوعاء
- حتى سبتمبر 2026، النماذج العليا لدى Anthropic وOpenAI وGoogle كلها في فئة المليون رمز. حدود الإدخال متقاربة، والفروق في حدود الإخراج وتسعير المدخلات الطويلة
- الحد المعلن والنطاق الفعّال أمران مختلفان. في اختبار MRCR متعدد الإبر (ثماني إبر) الذي تنشره OpenAI، تنخفض نتيجة النموذج نفسه كلما طال الإدخال، وتراوحت القيم قرب المليون بين 32.2% لـ Claude Opus 4.7 (في جدول OpenAI) و96.3% لـ GPT-6 Astra
- أوثق طريقة لمعرفة النطاق الفعّال هي توزيع حقائق في وثائقك واختبارها بأطوال مختلفة. أعد القياس عند تغيير النموذج
- لتسعير المدخلات الطويلة شكلان: السعر نفسه حتى الحد الأقصى (Anthropic)، أو رسوم إضافية بعد عتبة (272K لدى OpenAI و200K لدى Google). والأرخص ينقلب بحسب طول الإدخال
- يتلخص التوفير في خمس خطوات: قطع الجلسات، وإرسال المقتطفات، وتكرار التعليمات في النهاية، والتخزين المؤقت، وتوضيح العناوين — و① و② هما الأكثر أثرًا
كبر الوعاء، لكن ما نفعله حقًا ما زال الاختيار بين ما نمرّره وما نتركه. لم تعد المهارة الأساسية في الذكاء الاصطناعي «القدرة على حشو كل شيء»، بل حسن التقدير لتمرير المطلوب بالضبط وبالشكل الصحيح — وهي مهارة تبقى نافعة مهما تعاقبت أجيال النماذج. هذا استنتاجي الآن وقد صار 1M هو المعتاد.
الأسئلة الشائعة
لدى OpenAI مكتبة tiktoken، وفي API الخاصة بـ Anthropic ميزة لعدّ الرموز (token counting). وكتقدير تقريبي: الحرف الياباني الواحد ≈ 1–1.5 رمز، والكلمة الإنجليزية الواحدة ≈ 1.3–1.8 رمز، لكن ذلك يتغير بحسب جيل المُرمِّز (انظر الملاحظة في §5). وتتفاوت الشيفرة كثيرًا بحسب نوعها أيضًا، لذا فالأسلم أن تقيس قبل إرسال مدخل طويل.
السياق يعيش داخل الجلسة فقط — أغلق الدردشة فيختفي. أما الذاكرة (ChatGPT Memory / Claude Memory) فهي آلية احتفاظ منفصلة عبر الجلسات. ينتهي الأمر بحقن محتويات الذاكرة في نافذة السياق، لكن من منظور المستخدم هي دائمة مقابل عابرة.
RAG هو نمط «جلب المعلومات اللازمة فقط ديناميكيًا إلى السياق». حتى مع نافذة 1M، فإن إغراقها بكل شيء يجعلها بطيئة وثقيلة ومكلفة، ولذلك يبقى الاسترجاع ثم التحميل (RAG) المنهج السائد. راجع ما هو RAG للمزيد.
تتراكم عدة عوامل: عدم التطابق بين أطوال التسلسلات الغالبة أثناء التدريب وتلك المستخدمة أثناء الاستدلال، وحدود الترميز الموضعي في آلية الانتباه، والارتفاع الحاد في الحوسبة اللازمة لدمج عدة معلومات. «الدعم» و«الدقة عبر النافذة كاملة» مسألتان مختلفتان. ويتوقف موضع بدء التراجع على النموذج والمهمة، لذا فالأوثق أن تقيسه بوثائقك وفق الطريقة الواردة في §4.
نعم. MCP هو آلية للجلب عند الطلب عبر الأدوات، فلا تحتاج إلى تحميل كل شيء في السياق مسبقًا. بدّل النموذج الذهني من «ألصق الملف بأكمله» إلى «دعه يذهب ويقرأ الملف».
قرّر بحسب الهدف. ① إن أردت ملخصًا للكل، فلخّص كل فصل أولًا، ثم اجمع هذه الملخصات في مرحلة ثانية. ② إن كنت تبحث عن إجابة محددة، فلا ترسل النص كاملًا، بل استخرج الأجزاء ذات الصلة فقط عبر البحث (RAG). ③ فقط حين تحتاج إلى المقارنة عبر الوثيقة كلها يكون إرسالها دفعة واحدة مجديًا، بطول يتسع ضمن النطاق الفعّال. وعند التقسيم، اقطع عند العناوين واجعل بضع فقرات تتداخل على الجانبين، كي لا ينقطع الخيط عند مواضع الوصل.