المحتويات
- 1. لماذا تتضخّم فاتورة الذكاء الاصطناعي بهدوء
- 2. تفصيل التكلفة — المدخلات والمخرجات والتخزين المؤقّت والمعالجة الدفعيّة
- 3. اختيار الخطّة وأثره في التوفير
- 4. التخزين المؤقّت للموجّهات — الرافعة الأكثر مردودًا
- 5. إدارة السياق — /compact والتقسيم
- 6. اختيار النموذج — توجيه قائم على المهمّة
- 7. إدارة ميزانية المخرجات
- 8. المعالجة الدفعيّة — نصف السعر لما يحتمل الانتظار
- 9. فخّ الوكلاء المتعدّدين — 15 ضعفًا من الرموز
- 10. المراقبة وتنبيهات الفوترة
- 11. سبعة أنماط شائعة من الهدر
- الخلاصة
- الأسئلة الشائعة
- تصحيحات على النسخة السابقة
تحديث 26 سبتمبر 2026: حذفنا الأرقام الواردة في العنوان وفي الرسم الافتتاحيّ — «ضغط التكلفة إلى 20-30% من غير المحسّنة» و«-60 إلى 90% بالتخزين المؤقّت» و«30 ألف دولار شهريًّا تنزل إلى 6-9 آلاف» و«ثماني مهامّ من عشرة تنجح على نموذج أرخص» — لأنّنا لم نستطع ذكر مصدر لها. وحلّت محلّها أمثلة يمكن حسابها من أسعار الوحدة والمضاعِفات المنشورة في صفحات الأسعار الرسميّة لدى Anthropic وOpenAI، مع المعادلة. وصحّحنا كذلك نقطة التعادل في التخزين المؤقّت (قراءة واحدة تكفي مع تخزين الدقائق الخمس، وقراءتان مع تخزين الساعة) وسعر المخرجات (5 أضعاف المدخلات)، وأضفنا فصلًا عن المعالجة الدفعيّة. ملخّص التغييرات في آخر المقال.
حين تنتقل من خطّة بسعر ثابت مثل ChatGPT Plus (20 دولارًا شهريًّا) إلى الدفع مقابل كلّ رمز — Claude Code بمفتاح API، أو تطبيق ذكاء اصطناعي بنيته بنفسك — قد تتغيّر فاتورتك بمرتبة كاملة بحسب طريقة الاستخدام. فالفوترة حسب الاستخدام لا سقف لها.
والخبر السارّ أنّ أكثر الإجراءات أثرًا ثلاثة: التخزين المؤقّت للموجّهات، واختيار النموذج، وميزانية المخرجات. أثر كلّ منها تحدّده مضاعِفات منشورة في قوائم الأسعار الرسميّة، فيمكنك حسابه على استخدامك أنت. يعرض هذا المقال تلك المضاعِفات وطريقة الحساب استنادًا إلى الوثائق الرسميّة من Anthropic وOpenAI.
الوفر يُحسب من الأسعار الرسميّة
— وفق قوائم الأسعار الرسميّة لدى Anthropic وOpenAI في 26 سبتمبر 2026
مثال حسابيّ: أرسِل إلى Opus 5.5 البادئة نفسها بطول 100 ألف رمز عشر مرّات، بفاصل أقلّ من 5 دقائق بين كلّ مرّة، فتنخفض تكلفة المدخلات من 4.00 دولار دون تخزين مؤقّت إلى 0.68 دولار مع تخزين الدقائق الخمس (كتابة واحدة بـ 0.50 دولار، وتسع قراءات بـ 0.18 دولار).
وما يحتمل الانتظار يكلّف النصف في المدخلات والمخرجات عبر واجهة المعالجة الدفعيّة، وتُضاف إليه مضاعِفات التخزين المؤقّت.
المصادر: Claude Platform Docs «Pricing» وOpenAI API Pricing (تم التحقّق في 26 سبتمبر 2026؛ الحساب من إعداد المقال)
1. لماذا تتضخّم فاتورة الذكاء الاصطناعي بهدوء
أدوات الذكاء الاصطناعي تأتي على مسارَي فوترة: الخطط الشخصيّة (سعر ثابت) وفوترة API (حسب الاستخدام). الفاتورة التي تنفجر هي الثانية أساسًا.
- الخطط الشخصيّة: ChatGPT Plus بـ 20 دولارًا شهريًّا، Claude Pro بـ 20 دولارًا (17 دولارًا شهريًّا مع الدفع السنويّ)، Max ابتداءً من 100 دولار. تكلفة ثابتة، فحتّى الاستخدام الكثيف له سقف (مع حدود للاستخدام).
- فوترة API: لكلّ رمز، حسب الاستخدام. تندرج تحتها Claude Code بمفتاح API وتطبيقات الذكاء الاصطناعي التي تطوّرها بنفسك. قد يتقلّب مجموع الشهر كثيرًا بحسب طريقة الاستخدام.
تتضخّم الفوترة حسب الاستخدام لأنّ (1) رموز المخرجات أغلى 5 أضعاف من المدخلات، و(2) كلّما طال السياق زاد ما تعيد إرساله كاملًا في كلّ طلب، و(3) يُستدعى الوكلاء الفرعيّون مرّة بعد مرّة خلف الكواليس، و(4) ما يدخل في حلقة لا يتوقّف — وهذه تتراكب. متى فهمت الآليّة، كلٌّ منها قابل للإصلاح.
2. تفصيل التكلفة — المدخلات والمخرجات والتخزين المؤقّت والمعالجة الدفعيّة
لنأخذ تسعير API لنموذج Claude Opus (وهو Opus 5.5 حتّى سبتمبر 2026؛ يأتي دون Fable الأعلى فئةً، وهو المستوى الذي توصي به Anthropic نقطةَ بداية) مثالًا، لنرى إلى أين يذهب المال.
| البند | السعر (لكلّ مليون رمز) | الوصف |
|---|---|---|
| رموز المدخلات | 4 دولارات | ما ترسله: الموجّه + سجلّ المحادثة + الملفّات وغيرها. |
| رموز المخرجات | 20 دولارًا | ما يردّ به الذكاء الاصطناعي. 5 أضعاف المدخلات. |
| كتابة التخزين المؤقّت (5 دقائق) | 5 دولارات (1.25x من المدخلات) | حفظ بادئة في التخزين المؤقّت. كلّ قراءة خلال 5 دقائق تمدّد صلاحيتها دون تكلفة إضافيّة. |
| كتابة التخزين المؤقّت (ساعة) | 8 دولارات (2x من المدخلات) | يصمد أمام فترات توقّف تتجاوز 5 دقائق، لكنّ الكتابة أغلى. |
| قراءة التخزين المؤقّت | 0.20 دولار (0.05x من المدخلات) | 0.1x في معظم النماذج، و0.05x في Opus 5.5. هذا هو نجم عرض التوفير. |
| المعالجة الدفعيّة | المدخلات دولاران، المخرجات 10 دولارات (نصف السعر) | معالجة غير متزامنة للطلبات التي تحتمل الانتظار. تجتمع مع مضاعِفات التخزين المؤقّت. |
| استدعاءات الأدوات | تُحتسب مدخلات | تعريفات الأدوات جزء من السياق. وبمجرّد تمرير أداة يُضاف أيضًا موجّه نظام خاصّ بالأدوات (286 رمزًا في Opus 5.5). |
باختصار، البادئة الموجودة في التخزين المؤقّت تُقرأ بعُشر سعر المدخلات أو أقلّ. مضاعِفات الكتابة (1.25x للدقائق الخمس و2x للساعة) وكون المخرجات 5 أضعاف المدخلات أمور واحدة في جميع نماذج Claude الحاليّة؛ ولا يختلف من نموذج إلى آخر إلّا مضاعِف القراءة (0.025x في Fable 5.1). ولاحظ أيضًا أنّ Claude Opus 4.7 وما بعده تستخدم محلّلًا جديدًا للرموز ينتج، بحسب Anthropic، نحو 30% رموزًا أكثر للنصّ نفسه — وهذا مهمّ عند مقارنة الأسعار بين الأجيال. المصدر: Claude Platform Docs «Pricing» (تم التحقّق في 26 سبتمبر 2026).
3. اختيار الخطّة وأثره في التوفير
لحظة قدرتك على توقّع كيف ستستخدمه، انتقل إلى الخطّة الصحيحة أوّلًا.
| الاستخدام | الخطّة الموصى بها | الهدف الشهريّ | تحفّظات |
|---|---|---|---|
| هواية، تعلّم، بضع مرّات أسبوعيًّا | Claude Free / ChatGPT Free | 0 دولار | بحدود استخدام؛ ليست لبيانات العمل. |
| شخصيّ، بضع ساعات يوميًّا | Claude Pro / ChatGPT Plus | 20 دولارًا | خطّة شخصيّة؛ ليست لبيانات العمل. |
| استخدام شخصيّ كثيف | Claude Max | من 100 دولار | استخدام أكبر من Pro بـ 5 أو 20 ضعفًا؛ لمن يشغّل Claude Code ساعات طويلة. |
| عمل جماعيّ | Claude Team / ChatGPT Business | المقعد القياسيّ في Claude Team من 20 دولارًا (سنويًّا) إلى 25 دولارًا للمستخدم | جيّدة لبيانات العمل؛ البيانات لا تُستخدم للتدريب. |
| منظّمة كبيرة | Enterprise | عرض مبيعات | SSO وسجلّات تدقيق وSLA. |
| تطوير مدمج بالذكاء الاصطناعي | API مباشر (Anthropic / OpenAI) | حسب الاستخدام | استخدم التخزين المؤقّت والمعالجة الدفعيّة. |
المصادر: صفحة أسعار Claude ومساعدة OpenAI «What is ChatGPT Plus?» (تم التحقّق في 26 سبتمبر 2026).
إن كنت تستخدم Claude Code ساعات طويلة يوميًّا وتصطدم كثيرًا بحدود Pro، ففكّر في خطّة Max. فهي بسعر ثابت، ولا يمكن أن تنفلت الفاتورة كما قد يحدث مع مفتاح API. وتبدأ Cursor بخطّة Pro الفرديّة بـ 20 دولارًا شهريًّا، وفوقها Pro+ وUltra.
4. التخزين المؤقّت للموجّهات — الرافعة الأكثر مردودًا
إن كنت تستدعي API مباشرة وترسل البادئة نفسها مرّة بعد مرّة، فلا يكاد يوجد سبب لعدم استخدام التخزين المؤقّت للموجّهات. وما يُقرأ من التخزين المؤقّت يُحاسَب بجزء صغير من سعر المدخلات الأساسيّ.
كيف يعمل
عندما تعيد استخدام نفس موجّه النظام أو نفس الوثائق عبر طلبات متعدّدة، تكتبها المكالمة الأولى إلى التخزين المؤقّت (1.25x من المدخلات مع تخزين الدقائق الخمس). وكلّ مكالمة لاحقة تقرأ من التخزين المؤقّت بـ 0.1x من المدخلات (0.05x في Opus 5.5، و0.025x في Fable 5.1). لكنّ البادئة القصيرة جدًّا لا تُخزَّن: الحدّ الأدنى 512 رمزًا في Opus 5.5، و1,024 في Sonnet 5، و4,096 في Haiku 4.5 (Claude Platform Docs، «Prompt caching»).
نقطة التعادل — قراءة واحدة مع تخزين الدقائق الخمس، وقراءتان مع تخزين الساعة
إذا اعتبرنا سعر المدخلات 1، فهذه تكلفة إرسال البادئة نفسها (محسوبة من المضاعِفات الرسميّة لدى Anthropic):
- تخزين الدقائق الخمس: كتابة 1.25 + قراءة واحدة 0.1 = 1.35. إرسالها مرّتين دون تخزين يكلّف 2، إذن قراءة واحدة تكفي لاسترداد تكلفة الكتابة
- تخزين الساعة: كتابة 2 + قراءتان 0.2 = 2.2. إرسالها ثلاث مرّات دون تخزين يكلّف 3، إذن قراءتان تكفيان (مع قراءة واحدة فقط تصبح 2.1، أعلى قليلًا من 2 دون تخزين)
وصفحة أسعار Anthropic تقول الشيء نفسه: التخزين المؤقّت يسترد تكلفته بعد قراءة واحدة لمدّة الدقائق الخمس، وبعد قراءتين لمدّة الساعة. ويقرأ Opus 5.5 بـ 0.05x، فيتّسع الفارق أكثر مع العدد نفسه من القراءات.
مثال حسابيّ — بادئة بطول 100 ألف رمز تُرسَل 10 مرّات
| النموذج | دون تخزين مؤقّت | تخزين الدقائق الخمس | الفرق |
|---|---|---|---|
| Claude Opus 5.5 (مدخلات 4 دولارات، كتابة 5، قراءة 0.20) | 0.1 × $4 × 10 = $4.00 | 0.1 × $5 + 0.1 × $0.20 × 9 = $0.68 | أقلّ بنحو 83% |
| Claude Sonnet 5 (مدخلات دولاران، كتابة 2.50، قراءة 0.20) | 0.1 × $2 × 10 = $2.00 | 0.1 × $2.50 + 0.1 × $0.20 × 9 = $0.43 | أقلّ بنحو 79% |
يُحسب هنا مدخل البادئة وحده (موجّه النظام، الوثائق المرجعيّة ونحوها)؛ 100 ألف رمز = 0.1 بوحدة المليون. ويُفترض أنّ الطلبات العشرة تصل بفاصل أقلّ من 5 دقائق، وأنّ الأوّل يكتب التخزين المؤقّت والتسعة الباقية تقرؤه. الأسعار من Claude Platform Docs «Pricing» (تم التحقّق في 26 سبتمبر 2026). لا تشمل المخرجات ولا الجزء المتغيّر من كلّ طلب.
ونماذج GPT-6 من OpenAI تعمل بطريقة قريبة. المدخلات المخزّنة بـ 0.1x والكتابة بـ 1.25x، ويقدّم دليل OpenAI الحساب نفسه: كتابة البادئة مرّة ثمّ إعادة استخدامها مرّة تكلّف 1.35x، مقابل 2x لمعالجتها مرّتين دون تخزين. ويبقى التخزين 30 دقيقة من آخر استخدام، ويكون مفعّلًا افتراضيًّا في النماذج المدعومة (OpenAI، «Prompt caching»).
مدّة الصلاحية الافتراضيّة 5 دقائق
في API لدى Anthropic، مدّة صلاحية (TTL) التخزين المؤقّت للموجّهات افتراضيًّا 5 دقائق. كلّ قراءة تجدّدها دون تكلفة إضافيّة، لكن إذا مرّت أكثر من 5 دقائق دون استخدام تنتهي صلاحيّتها، ويعيد الطلب التالي كتابتها (1.25 ضعف سعر المدخلات). يمكنك اختيار صلاحية ساعة واحدة، لكنّ الكتابة تكلّف حينها ضعفي سعر المدخلات (المصدر: Claude Platform Docs، «Prompt caching»).
ويعمل Claude Code على الآلية نفسها. ضمن الاستخدام المشمول في اشتراك Claude، يمنح المحادثة الرئيسيّة صلاحية ساعة واحدة، لكن عند استخدام مفتاح API، أو بعد تجاوز حدّ خطّتك والانتقال إلى أرصدة الاستخدام، تنخفض إلى 5 دقائق. ومنذ الإصدار v2.1.242 يمكنك أن تختار بنفسك 5m أو 1h عبر الإعداد promptCacheTtl (المصدر: Claude Code Docs، «Prompt caching»، تمّ التحقّق في 26 سبتمبر 2026). وإن كنت تعمل مع فترات استراحة، فإنّ أيّ المدّتين تنطبق يغيّر عدد مرّات إعادة كتابة التخزين المؤقّت.
كيف تختار بين 5 دقائق وساعة
إرشادات الوثائق الرسميّة:
- بادئة يُعاد استخدامها بوتيرة أسرع من مرّة كلّ 5 دقائق: ابقَ على تخزين الدقائق الخمس. كلّ قراءة تجدّده مجّانًا، فلا حاجة إلى كتابة الساعة الأغلى
- بادئة يُعاد استخدامها بفواصل بين 5 دقائق وساعة (انتظار ردّ مستخدم، أو استدعاء يأتي بعد مهمّة تستغرق أكثر من 5 دقائق): يناسبها تخزين الساعة
- عند الجمع بينهما: ضع تخزين الساعة قبل تخزين الدقائق الخمس — وهو الترتيب نفسه لوضع موجّه النظام وتعريفات الأدوات الثابتة في البداية
وللتحقّق من أنّ التخزين المؤقّت يعمل، انظر إلى cache_read_input_tokens (القراءة) وcache_creation_input_tokens (الكتابة) في usage ضمن الاستجابة. إن بقيت القراءة صفرًا، فالبادئة تتغيّر في مكان ما مع كلّ طلب، أو لم تبلغ الحدّ الأدنى من الرموز.
5. إدارة السياق — /compact والتقسيم
استخدم Claude Code أو Cursor لفترة، وفي منتصف محادثة طويلة ستجد أنّك تعيد في كلّ دور إرسال قدر كبير من المحادثة الماضية. ليست المخرجات ما ينتفخ، بل المدخلات (= المحادثة الماضية).
تكتيك 1: استخدم /compact بنشاط
يمتلك Claude Code أمر /compact. يلخّص المحادثة حتّى تلك اللحظة ليحرّر مساحة في السياق (Claude Code Docs، «Commands»)، ويمكنك أن تحدّد له ما ينبغي أن يحتفظ به الملخّص. استخدمه عند التوقّفات الطبيعيّة في العمل.
تكتيك 2: قسّم الجلسات حسب المهمّة
لا تنفّذ "تنفيذ الميزة A" و"إصلاح الخلل B" و"توليد الوثيقة C" في محادثة طويلة واحدة — ابدأ جلسات جديدة. أغلق الجلسة عند انتهاء كلّ مهمّة. إن احتجت إلى ذاكرة طويلة المدى، اكتبها في ملفّ ذاكرة.
تكتيك 3: قلّم الضوضاء بـ Hooks
يوفّر Claude Agent SDK / Claude Code Hooks، التي تتيح لك تحويل مخرجات الأدوات قبل أن تصل إلى الذكاء الاصطناعي. مثال: اضغط سجلّ npm install الطويل إلى مجرّد "نجاح/فشل" عبر Hook. وكلّما طال السجلّ خفّت مدخلات كلّ دور أكثر.
6. اختيار النموذج — توجيه قائم على المهمّة
"دائمًا Opus" استراتيجيّة المليونير. الأعمال الروتينيّة مثل التصنيف والاستخراج كثيرًا ما يكفيها Sonnet أو Haiku. يتحدّد السعر بفئة النموذج (العليا، المتوسّطة، الخفيفة)، وهذه الأسعار الرسميّة حتّى 26 سبتمبر 2026 (لكلّ مليون رمز). ومن إصدار إلى آخر لم تتغيّر العلاقة: كلّما ارتفعت الفئة ارتفع السعر، والفئة الخفيفة تكلّف جزءًا صغيرًا من العليا.
| النموذج | المدخلات | المخرجات | الأفضل في |
|---|---|---|---|
| Claude Opus 5.5 (العليا) | 4 دولارات | 20 دولارًا | تصميم معقّد، استدلال، مهامّ مستقلّة طويلة |
| Claude Sonnet 5 (المتوسّطة) | دولاران | 10 دولارات | برمجة يوميّة، تحليل، تلخيص |
| Claude Haiku 4.5 (الخفيفة) | دولار واحد | 5 دولارات | تصنيف، استخراج، تحويل قصير، استجابة آنيّة |
| GPT-6 Sol (النموذج المتوازن من OpenAI) | دولاران | 10 دولارات | برمجة معقّدة وعمل وكيليّ |
| GPT-6 Luna (النموذج منخفض التكلفة من OpenAI) | 0.10 دولار | 0.50 دولار | أعمال خفيفة محدّدة وبكمّيّات كبيرة |
المصادر: Claude Platform Docs «Pricing» وOpenAI API Pricing (تم التحقّق في 26 سبتمبر 2026؛ أسعار OpenAI للسياق القصير). وفوقها Fable 5.1 من Anthropic (10 / 50 دولارًا) والنموذج الرائد لدى OpenAI، أي GPT-6 Astra (10 / 50 دولارًا). والنماذج الحاليّة لكلّ شركة موجودة في قائمة النماذج الحاليّة وتواريخ انقطاع المعرفة.
الانتقال من Opus في الفئة العليا إلى Haiku الخفيف يخفض سعر الرمز إلى الربع (حتّى سبتمبر 2026). ولمهمّة تصنيف تستهلك مليونَي رمز مدخلات و200 ألف رمز مخرجات يوميًّا، تعطي الأسعار الرسميّة:
- Opus 5.5: 2 × $4 + 0.2 × $20 = $12
- Sonnet 5: 2 × $2 + 0.2 × $10 = $6
- Haiku 4.5: 2 × $1 + 0.2 × $5 = $3
- Haiku 4.5 بالمعالجة الدفعيّة: $3 × 0.5 = $1.50 (الفصل 8)
كفاية الجودة تتوقّف على العمل نفسه، فقارن النتائج على المدخلات ذاتها قبل الانتقال إلى نموذج أرخص (الأسئلة الشائعة، س4). معايير استرشاديّة:
- استخدم Opus لـ: عمليّات إعادة الهيكلة المعقّدة، التصاميم الممتدّة عبر ملفّات كثيرة، الاستدلال العميق، استكشاف مجال غير مألوف
- استخدم Sonnet لـ: البرمجة اليوميّة، التحليل، التلخيص، المراجعة، إضافة الاختبارات
- استخدم Haiku لـ: التصنيف، الاستخراج، تحويل التنسيق، الاقتراحات الآنيّة، توليد رسائل الكوميت
7. إدارة ميزانية المخرجات
رموز المخرجات أغلى 5 أضعاف من المدخلات — في نماذج Claude الحاليّة وفي GPT-6 Astra وSol وLuna على السواء. استجابة من Opus 5.5 بـ 2,000 رمز مدخلات و1,000 رمز مخرجات تكلّف $0.008 + $0.020 = $0.028. وإذا حدّدت المخرجات بـ 500 رمز تصبح 0.018 دولار، أي أقلّ بنحو 36% (محسوبة من الأسعار الرسميّة).
ثلاثة مقاربات
- اضبط
max_tokensعلى قدر المهمّة: في Messages API من Anthropic،max_tokensمعامل إلزاميّ، والرقم الذي تضعه فيه هو سقف المخرجات (مرجع API، «Messages»). لا تترك قيمة كبيرة بحكم العادة؛ ضع قيمة تناسب الاستخدام، مثلmax_tokens: 1000. - أضف "أجب بإيجاز" أو "خمس نقاط" إلى موجّهك: الذكاء الاصطناعي يستجيب. اقمع المقدّمات والملخّصات والإمضاءات الزائدة.
- المخرجات المهيكلة (وضع JSON): JSON أقصر من النثر. إن كان تطبيقك يستهلك النتيجة فهذا هو الطريق.
في الحالات التي لا تحتاج فيها إلى "إجابة طويلة جميلة" (التصنيف، الاستخراج، القرارات)، الاقتطاع الحاسم أكثر كفاءة من حيث التكلفة.
8. المعالجة الدفعيّة — نصف السعر لما يحتمل الانتظار
العمل الذي لا يحتاج إلى إجابة فوريّة — التصنيف الجماعيّ الليليّ، والتلخيص بالجملة، وجولات التقييم — يكلّف عبر واجهة المعالجة الدفعيّة النصف في المدخلات والمخرجات. تقبل Message Batches API من Anthropic حتّى 100 ألف طلب في الدفعة الواحدة؛ ينتهي معظمها في أقلّ من ساعة، لكنّ الدفعة قد تستغرق حتّى 24 ساعة (Claude Platform Docs، «Batch processing»). وتمنح Batch API من OpenAI خصمًا بنسبة 50% كذلك، بمهلة إنجاز قدرها 24 ساعة (OpenAI، «Batch API»).
وبحسب صفحة أسعار Anthropic، تجتمع مضاعِفات التخزين المؤقّت مع خصم المعالجة الدفعيّة. فقراءة من التخزين المؤقّت في Haiku 4.5 ضمن دفعة تكلّف مثلًا $1 × 0.1 × 0.5 = $0.05 لكلّ مليون رمز.
9. فخّ الوكلاء المتعدّدين — 15 ضعفًا من الرموز
اتّجاه 2026، إعدادات الوكلاء المتعدّدين (منسّق + وكلاء فرعيّون متوازون)، قويّ، لكنّ Anthropic نشرت بيانات من ميزة Research لديها: الوكلاء يستهلكون نحو 4 أضعاف رموز المحادثة العاديّة، وأنظمة الوكلاء المتعدّدين نحو 15 ضعفًا (Anthropic، «How we built our multi-agent research system»، يونيو 2025). والـ 15 ضعفًا مقيسة مقارنةً بالمحادثة، لا بوكيل واحد.
معايير القرار للتوفير
- مهامّ واضحة ومتسلسلة (تعديل ملفّ واحد، تلخيص، مراجعة كود) → وكيل واحد يكفي
- توازٍ يقلّل وقت الجدار بصورة معتبرة → الوكلاء المتعدّدون مبرّرون
- "الوكلاء المتعدّدون افتراضيًّا" خاطئ اقتصاديًّا. ابدأ بوكيل واحد وقسّم فقط الاختناقات التي تراها فعلًا.
التفاصيل: انظر ما هو الوكيل المتعدّد؟
10. المراقبة وتنبيهات الفوترة
كي لا تفاجئك فاتورة الاستخدام، فإنّ المراقبة الروتينيّة + التنبيهات لا غنى عنها.
مستخدمو API
- راجع استهلاك الرموز اليوميّ في Claude Console / OpenAI Dashboard
- اضبط حدّ استخدام: الإيقاف عند تجاوز 200 دولار شهريًّا مثلًا. لا حدّ = خطر.
- تنبيهات الفوترة: بريد عند 50 دولارًا، Slack عند 100 دولار — عتبات متدرّجة.
مستخدمو Claude Code
- استخدم
/usageلمراجعة تكلفة الجلسة الحاليّة واستخدام خطّتك (صار/costاسمًا بديلًا لـ/usage) - اجعل مراجعة
/usageفي نهاية كلّ يوم عادةً
مديرو المنظّمات
- تقارير استخدام لكلّ مستخدم (لوحة إدارة Anthropic Team / Enterprise)
- كشف الشذوذ (تحديد من يستهلكون أكثر بكثير من المعتاد)
- مشاركة "أنماط الهدر" على مستوى الشركة فصليًّا
11. سبعة أنماط شائعة من الهدر
| النمط | ما الخطأ | الإصلاح |
|---|---|---|
| إعادة إرفاق كلّ الملفّات في كلّ دور | التخزين المؤقّت لا يفعّل؛ تتضخّم المدخلات | ضع الوثائق غير المتغيّرة في البادئة وخزّنها |
| طرح نفس السؤال في ChatGPT وClaude | الدفع مرّتين عن نفس المدخلات على خطّتين منفصلتين | اختر واحدة |
متابعة محادثة طويلة دون /compact | السجلّ الكامل يُرسَل في كلّ دور | /compact عند التوقّفات الطبيعيّة |
| استخدام Opus لتصنيف أو استخراج بسيط | دفع 4 أضعاف ما يكلّفه Haiku للنتيجة ذاتها | طابق النموذج مع المهمّة |
| تكرار "أكثر صقلًا" / "أطول قليلًا" | رموز المخرجات تتراكم | اذكر الطول المطلوب مقدّمًا |
| تعريف أدوات كثيرة لا لزوم لها | تعريفات الأدوات تركب في السياق | عرّف فقط ما ستستخدمه |
| اللجوء إلى الوكلاء المتعدّدين بسهولة | نحو 15 ضعفًا من رموز المحادثة (والوكيل الواحد نحو 4 أضعاف) | فقط حين تكون الحاجة واضحة |
الخلاصة
- الروافع الثلاث لتحسين تكلفة الذكاء الاصطناعي: التخزين المؤقّت للموجّهات، اختيار النموذج، ميزانية المخرجات. أثر كلّ منها تحدّده مضاعِفات رسميّة، وهذه المضاعِفات تتضافر.
- قراءة التخزين المؤقّت = 0.1x من المدخلات (0.05x في Opus 5.5). يسترد تخزين الدقائق الخمس تكلفته بعد قراءة واحدة، وتخزين الساعة بعد قراءتين. بادئة بطول 100 ألف رمز تُرسَل إلى Opus 5.5 عشر مرّات تنخفض من 4.00 إلى 0.68 دولار.
- اختيار النموذج: من Opus 5.5 إلى Haiku 4.5 ينخفض سعر الرمز إلى الربع، وإلى Sonnet 5 إلى النصف (حتّى سبتمبر 2026).
- ميزانية المخرجات: المخرجات 5 أضعاف المدخلات. اضبط
max_tokensصراحةً واطلب "موجزًا". - المعالجة الدفعيّة: ما يحتمل الانتظار يكلّف النصف في المدخلات والمخرجات، ويجتمع مع خصم التخزين المؤقّت.
- إدارة السياق:
/compactعند التوقّفات الطبيعيّة، تقسيم حسب المهمّة، ضغط المخرجات بـ Hooks. - فخّ الوكلاء المتعدّدين: نحو 15 ضعفًا من رموز المحادثة. لا تستخدمه إلّا مع حاجة واضحة.
- المراقبة: حدود الاستخدام، تنبيهات الفوترة، ومراجعة
/usageينبغي أن تكون عادات.
الأسئلة الشائعة
س1. أستخدم Claude Code يوميًّا — هل Pro (20 دولارًا) أم Max صفقة أفضل؟
إن كنت تصطدم كثيرًا بحدود Pro، ففكّر في Max. ينصح مركز مساعدة Anthropic مستخدمي Pro الذين يصطدمون بالحدود باستمرار ويحتاجون سعة أكبر للمستودعات الكبيرة بالتفكير في الترقية إلى Max 5x (Claude Help Center، «Using Claude Code with your Pro or Max plan»). وإن لم تبلغ الحدود، فابقَ على Pro.
س2. هل أحتاج إلى إعداد خاصّ لاستخدام التخزين المؤقّت للموجّهات؟
في API لدى Anthropic يلزم تحديد cache_control — إمّا مرّة واحدة في المستوى الأعلى من الطلب (التخزين التلقائيّ)، وإمّا على كتل بعينها (نقاط فصل صريحة). أمّا OpenAI فتفعّله افتراضيًّا في النماذج المدعومة. ويستخدم Claude Code التخزين المؤقّت تلقائيًّا. راجع وثائق Anthropic الرسميّة للتفاصيل.
س3. ChatGPT مقابل Claude — أيّهما أكثر كفاءةً من حيث التكلفة؟
يعتمد على حالة الاستخدام. من حيث سعر الوحدة وحده، يتساوى Claude Sonnet 5 (الفئة المتوسّطة) وGPT-6 Sol: دولاران للمدخلات و10 دولارات للمخرجات. ولـ الأسئلة والأجوبة القصيرة والمهامّ الروتينيّة بكمّيّات كبيرة، يكلّف النموذج منخفض التكلفة من OpenAI (وهو GPT-6 Luna حتّى سبتمبر 2026، بـ 0.10 دولار للمدخلات) عُشر Haiku 4.5 (دولار واحد للمدخلات). وفي المهامّ الطويلة التي تعيد إرسال البادئة نفسها، تصبح قراءات التخزين المؤقّت مؤثّرة، فيدخل Opus 5.5 (0.05x) في الحساب أيضًا. "اشترك في الاثنين واختر الأداة المناسبة" عمليّ أيضًا.
س4. كيف أحكم على أنّ "Haiku يكفي"؟
أجرِ تجربة من ثلاث خطوات. (1) شغّله على Opus. (2) أرسل نفس الموجّه إلى Sonnet وقارن الجودة. (3) إن بدا Sonnet مماثلًا، جرّب Haiku أيضًا. وكلّما كانت المهمّة أكثر روتينيّة صغر الفارق عادةً. احفظ Opus للحالات التي تحتاج فعلًا حكمًا أو استدلالًا عميقًا.
س5. هل ينبغي للمستخدمين الأفراد استدعاء API مباشرة؟
يعتمد. إن كان معظم عملك برمجة تفاعليّة، فخطّة Max تُبقي الفاتورة ثابتة وهي أيسر. أمّا تضمين الذكاء الاصطناعي في تطبيقك الخاصّ، أو المعالجة الدفعيّة، أو الأتمتة، فتحتاج إلى API مباشرة. كثيرون يفعلون الاثنين.
س6. ما العتبة التي ينبغي ضبطها لتنبيهات الفوترة؟
لا توجد إجابة واحدة صحيحة، لكنّ إحدى طرق التدرّج هي تنبيه أوّل عند 1.5 ضعف إنفاقك الشهريّ المعتاد وإيقاف عند 3 أضعاف. إن أنفقت عادةً 30 دولارًا شهريًّا، نبّه عند 50 وأوقِف عند 100. وفي البداية، اضبط تنبيهات يوميّة صغيرة لتتعرّف إلى حجم استهلاكك، ثمّ خفّفها.
س7. قيل لنا "ميزانيّة الذكاء الاصطناعي للشركة صارت كبيرة جدًّا." ماذا نفعل أوّلًا؟
ثلاثة أشياء بالترتيب. (1) انظر إلى الاستخدام لكلّ مستخدم واكتشف أين يتركّز الاستهلاك. (2) تحدّث مع أكثر المستخدمين استهلاكًا عن سير عملهم وحدّد أنماط الهدر. (3) وزّع دليلًا داخليًّا عن "التخزين المؤقّت، اختيار النموذج، ميزانية المخرجات" على مستوى الشركة وقدّم تقريرًا شهريًّا عن التقدّم.
تصحيحات على النسخة السابقة
في 26 سبتمبر 2026 صحّحنا ما يلي.
| النسخة السابقة | الآن |
|---|---|
| ثلاث روافع تضغط التكلفة إلى 20-30% من غير المحسّنة (العنوان، المقدّمة، الصورة) | حُذف لتعذّر ذكر مصدر. استُبدلت به أمثلة محسوبة من الأسعار والمضاعِفات الرسميّة. |
| -60 إلى 90% بالتخزين المؤقّت، -50 إلى 80% باختيار النموذج، -30 إلى 60% بميزانية المخرجات، 30 ألف دولار شهريًّا تنزل إلى 6-9 آلاف | كذلك. استُبدلت بها أمثلة حسابيّة مثل «بادئة بطول 100 ألف رمز تُرسَل عشر مرّات: من 4.00 إلى 0.68 دولار». |
| ثماني مهامّ من عشرة تنجح على نموذج أرخص | حُذف؛ لا مصدر له. |
| تخزين الدقائق الخمس يعادل تكلفته بقراءتين | يستردّها بقراءة واحدة (1.25 + 0.1 = 1.35 < 2). |
| تخزين الساعة يعادل تكلفته بخمس قراءات | يستردّها بقراءتين (2 + 0.2 = 2.2 < 3). |
| رموز المخرجات أغلى 5-6 أضعاف من المدخلات | 5 أضعاف (في جميع نماذج Claude الحاليّة ونماذج GPT-6 الثلاثة). |
| معدّل إصابة أقلّ من 60% يعني مجالًا للتحسين؛ واهدف في الإنتاج إلى 80% وما فوق | حُذف؛ لا مصدر له. استُبدل به فحص رموز القراءة والكتابة في usage. |
/compact يقلّص 200 ألف رمز إلى 5,000 | حُذفت الأرقام؛ لا مصدر لها. |