تخطي إلى المحتوى
المواضيع

وكلاء الذكاء الاصطناعي والأتمتة: RAG وسير العمل والأدلة

افهم وكلاء الذكاء الاصطناعي وRAG وسير العمل الآلي. من المفاهيم إلى التطبيقات العملية.

45 مقالات

رتّب المقالات للعثور على ما تحتاجه

مقالات في وكلاء AI والأتمتة

كيفية استخدام ChatGPT Work — وكيل العمل من GPT-5.6

كيفية استخدام ChatGPT Work — وكيل العمل من GPT-5.6

ChatGPT Work هو «وكيل الذكاء الاصطناعي للعمل» الذي أعلنته OpenAI في 9 يوليو 2026 بالتزامن مع GPT-5.6. وخلافًا لمحادثة عادية تكتفي بالإجابة، فهو يجمع السياق من تطبيقاتك وملفاتك المتصلة ليبني مخرجات جاهزة — مستندات وجداول بيانات وشرائح وحتى تطبيقات ويب. عقله هو النموذج الرائد الجديد GPT-5.6 Sol (المبني على Codex)، وبإمكانه تقسيم مشروع معقّد إلى خطوات ومواصلة العمل لساعات (Thurrott). وداخل تطبيق سطح المكتب الموحّد، تتعايش ثلاثة أوضاع — Work (المخرجات)، وCodex (التقني الذي يُظهر التفاصيل)، والمحادثة العادية (المحادثة) — مع وضع Work كـ«النسخة التجارية» التي تُخفي التفاصيل التقنية لـ Codex (9to5Mac). والنموذج يعتمد على خطتك: يعتمد Free/Go على Terra افتراضيًا، بينما تختار خطط Plus/Pro/Business/Enterprise من Sol/Terra/Luna (وفق التقارير). وقوّته في سحب «سياقك الخاص» عبر موصّلات مثل Google Drive وSharePoint وSlack، إضافةً إلى MCP — وللمؤسسات، لا تُستخدَم البيانات للتدريب افتراضيًا. واعتمادًا على Axios وTechCrunch و9to5Mac وThurrott وOpenAI، يوضّح هذا المقال ما هو ChatGPT Work، وبمَ يختلف عن ChatGPT العادي وعن Codex، وأي الخطط يمكنها استخدامه، ومع أي التطبيقات يتصل — مع وسم مستوى الثقة على ما لم يصبح رسميًا بعد.

GPT-5.6 Sol مقابل Gemini: مقارنة شاملة — البرمجة الوكيلة ضد الوسائط المتعددة والسعر

GPT-5.6 Sol مقابل Gemini: مقارنة شاملة — البرمجة الوكيلة ضد الوسائط المتعددة والسعر

مقارنة بين GPT-5.6 «Sol» من OpenAI (متاح للجميع في 9 يوليو 2026) وGemini من Google، حيث لا تكاد مجالات تفوّقهما تتداخل. يتفوّق Sol بلا منازع في البرمجة الطرفية والوكيلة (Terminal-Bench 88.8% مقابل 68.5%، SWE-bench Pro 64.6% مقابل 54.2%) وقوي في الرياضيات وGPQA، بينما يفوز Gemini 3.1 Pro في الوسائط المتعددة الأصلية (صوت/فيديو) وبسعر يعادل النصف وفي MMLU وARC-AGI-2 وWebDev Arena. المنافس الحقيقي Gemini 3.5 Pro لم يصدر بعد (منتصف يوليو). نرتّب القدرات والأسعار وكيفية الاختيار حسب الاستخدام.

مقارنة GPT-5.6 vs GPT-5.5: من نموذج واحد إلى 3 نماذج (Luna/Terra/Sol) وTerra بـ40% من السعر — وإلى أيّها تنتقل

مقارنة GPT-5.6 vs GPT-5.5: من نموذج واحد إلى 3 نماذج (Luna/Terra/Sol) وTerra بـ40% من السعر — وإلى أيّها تنتقل

ليس تحديث GPT-5.6 مجرد رفع للأداء، بل إعادة هيكلة من نموذج رئيسي واحد إلى منظومة من 3 نماذج: Luna ($0.20/$1.20) للمعالجة الضخمة، وTerra ($2/$12) الذي يقدّم جودة بمستوى GPT-5.5 بـ40% من سعر 5.5 — كان نصف السعر عند الإطلاق ثم صار 40% بعد خفض الأسعار في 30 يوليو 2026 — وSol ($5/$30) الذي يرفع الأداء بنفس السعر مع SWE-Bench Pro من 58.6 إلى 64.6% (تقديري). نرتّب هنا ما الذي تغيّر من 5.5 إلى 5.6، وأثر ذلك على الفاتورة، وإلى أي نموذج ينبغي أن تنتقل حسب استخدامك.

مقارنة شاملة: GPT-5.6 Sol مقابل Claude Fable 5 — نصف السعر مقابل الأعلى مستوى

مقارنة شاملة: GPT-5.6 Sol مقابل Claude Fable 5 — نصف السعر مقابل الأعلى مستوى

مقارنة غير متماثلة بين GPT-5.6 Sol المتعدّد الاستخدامات بنصف السعر ($5/$30) و Claude Fable 5 الأعلى مستوى لكن بضِعف السعر ($10/$50). يتفوّق Fable 5 في البرمجة على مستوى الإنتاج الفعلي (SWE-Bench Pro 80.3%) والاستقلالية طويلة الأمد حتى 12 ساعة، بينما يتصدّر Sol تشغيل الطرفية (TerminalBench 88.8%) والقدرة الإجمالية للوكلاء مع كفاءة رموز أعلى بـ 54%. نوضّح كيف تختار بين القطبين حسب حالة الاستخدام والتكلفة لكل مهمة مكتملة، مع تنبيه أن نتيجة Sol في SWE-bench Pro قيمة تقديرية لم تُعلنها OpenAI رسميًا.

GPT-5.6 Sol مقابل Claude Opus 4.8: مقارنة معمّقة في الاختبارات والبرمجة والسعر وكيفية الاختيار

GPT-5.6 Sol مقابل Claude Opus 4.8: مقارنة معمّقة في الاختبارات والبرمجة والسعر وكيفية الاختيار

مقارنة معمّقة بين قطبي البرمجة بالذكاء الاصطناعي لعام 2026: Claude Opus 4.8 (28 مايو) والطراز الأعلى Sol من GPT-5.6 (9 يوليو). مجالات تفوّقهما متعاكسة تقريبًا: يتصدّر Sol في التحكم بالطرفية والقدرة الوكيلة الشاملة (TerminalBench 2.1 88.8% مقابل Opus 78.9%، Agents' Last Exam 53.6، Coding Agent Index 80)، بينما يتصدّر Opus 4.8 في البرمجة على مستوى الإنتاج والرياضيات والسياق الطويل (SWE-bench Pro 69.2% مقابل Sol 64.6%، USAMO 2026 96.7%، GraphWalks 1M 68.1%) ويُبرز الصدق (تقليل الثقة المفرطة إلى العُشر، 0% إبلاغ غير نقدي عن نتائج معيبة). كما لم تُعلن OpenAI عن كثير من اختبارات Sol (SWE-bench Pro وGPQA وAIME وMMLU)، ففي صميم البرمجة يتفوّق Opus المُفصِح. نتناول جدول المواصفات وتفاصيل الاختبارات ومشكلة الاختبارات غير المعلنة والتكلفة الفعلية ($25 مقابل $30 وكفاءة رموز +54%) وخريطة القوة والضعف والاختيار حسب الاستخدام واستراتيجية المزوّدين المزدوجين.

إصدار GPT-5.6: الدليل الكامل — Luna/Terra/Sol، الاختبارات المرجعية، الأسعار، ومقارنة مع Claude

إصدار GPT-5.6: الدليل الكامل — Luna/Terra/Sol، الاختبارات المرجعية، الأسعار، ومقارنة مع Claude

أطلقت OpenAI النموذج GPT-5.6 للتوفر العام في 9 يوليو 2026، مستبدلةً بنية «العادي + Pro» القديمة بتشكيلة من ثلاثة نماذج: Luna (سريع ومنخفض التكلفة، $0.20/$1.20)، وTerra (متوازن، $2/$12، بمستوى GPT-5.5 وبـ40% من سعر وحدة Sol)، وSol (الرائد، $5/$30)، وذلك بحسب أسعار 30 يوليو 2026. يتصدّر Sol المرتبة الأولى في Agents' Last Exam (53.6) وفي Coding Agent Index (80)، وتتفوّق نسبته 88.8% في TerminalBench 2.1 على Claude Fable 5 (86.0%)——غير أن Claude Fable 5 يتصدّر بوضوح في SWE-Bench Pro على مستوى الإنتاج بنسبة 80.0% مقابل 64.6% لـ Sol. يغطّي هذا المقال الفروق بين النماذج الثلاثة، والأسعار، والاختبارات المرجعية، والميزات الجديدة (Programmatic Tool Calling، وChatGPT Work، والنموذج الصوتي ثنائي الاتجاه GPT-Live)، والتوفر حسب خطة ChatGPT، ومقارنة مع Claude (Fable 5 / Opus 4.8)، وكيفية الاختيار حسب الاستخدام——كل ذلك مستندًا إلى الإعلان الرسمي من OpenAI والاختبارات المستقلة.

ما هي بوابة LLM (الوكيل)؟ واجهة برمجية واحدة لكل مزوّد — دليل 2026

ما هي بوابة LLM (الوكيل)؟ واجهة برمجية واحدة لكل مزوّد — دليل 2026

بنيتَ على OpenAI، ثم أردتَ تجربة Claude ومقارنة Gemini — فضاعت منك ساعات في اختلاف أدوات SDK والصيغ ومعالجة الأخطاء لكل مزوّد. بوابة LLM (بوابة الذكاء الاصطناعي / وكيل LLM) وسيط تُدرجه بين تطبيقك والمزوّدين: يعرض واجهة برمجية واحدة متوافقة مع OpenAI للوصول إلى كل نموذج، ويتولّى المهام الشاملة — التبديل الاحتياطي، وتتبّع التكلفة، والمفاتيح الافتراضية، والتخزين المؤقت، وتحديد المعدّل، والقابلية للمراقبة. يغطّي هذا الدليل لماذا تحتاج إليها، وما هي البوابة حقًّا، والأنواع الثلاثة (وكيل مُستضاف ذاتيًا = LiteLLM / مُدار = OpenRouter / SDK = Vercel AI SDK)، وكيف تختار بين LiteLLM وOpenRouter وVercel AI SDK، وكود إعداد أدنى يبدّل نقطة النهاية فقط، والحدود — قفزة زمن استجابة، والبوابة كنقطة فشل جديدة، والرسوم (يفرض OpenRouter 5.5% عند الشراء)، وفقدان الميزات، والخصوصية.

تقييم وكلاء الذكاء الاصطناعي: 5 طرق لقياس الجودة (2026)

تقييم وكلاء الذكاء الاصطناعي: 5 طرق لقياس الجودة (2026)

بعد أن تبني وكيل ذكاء اصطناعي، تصطدم دائماً بالجدار نفسه: "حسناً، لكن هل يعمل فعلاً؟" والآلية التي تقرّر ما إذا كان تغيير مطالبة أو نموذج قد جعل الأمور أفضل أم أسوأ اعتماداً على البيانات بدل الحدس هي الـ evals. تنتج نماذج اللغة الكبيرة مخرجاً مختلفاً في كل مرة للمدخل نفسه، لذا لا تناسبها اختبارات الوحدة بالمطابقة الدقيقة. يتناول هذا المقال ما هي الـ evals، وخمس طرق لقياس الجودة (① المطابقة مع الحقيقة المرجعية ② الفحوصات القائمة على القواعد ③ LLM-as-judge ④ اختبار التراجع ⑤ مراقبة الإنتاج)، والتقييم الخاص بالوكلاء (معدل نجاح المهمة، استدعاءات الأدوات الصحيحة، المسار، التكلفة)، وكيف تبدأ على نطاق صغير من 20 مثال إخفاق، والأخطاء الشائعة، والأدوات الأساسية (Anthropic Console/Evals، OpenAI Evals، LangSmith، Langfuse، Ragas) — وهو مكتوب للممارسين.

وكلاء الذكاء الاصطناعي مقابل RPA: الفرق ومتى تستخدم كلًّا منهما (2026)

وكلاء الذكاء الاصطناعي مقابل RPA: الفرق ومتى تستخدم كلًّا منهما (2026)

سؤال الأتمتة الدائم: «وكلاء الذكاء الاصطناعي أم RPA؟» الإجابة ليست إمّا هذا أو ذاك — اختر بحسب الدور، والنمط الرابح في 2026 هو مزج الاثنين (الهجين). RPA هو «يدان» حتميّتان تشغّلان إجراءً ثابتًا بسرعة ودقة (لكنه ينهار عند تغيّر الشاشة/المواصفات)؛ ووكيل الذكاء الاصطناعي هو «عقل» احتمالي يقرأ الموقف ويقرّر (قويّ في الغموض والاستثناءات، لكن ليس متطابقًا في كل مرة). تغطّي المقالة فرق مبدأ العمل، وجدول مقارنة (مقايضة قابلية التكرار مقابل المرونة)، وكيفية الاختيار (المحور هو «هل يُكتب بالكامل قواعدَ؟» — نعم ← RPA، حُكم لا يُكتب ← وكيل)، واتجاه 2026 (تحوّل روّاد RPA مثل UiPath وAutomation Anywhere وBlue Prism نحو الوكيلية — تقارب؛ لم يعد السؤال «أيهما» بل «أين يقع الاستدلال» = الأولوية للتنسيق)، والحل العملي: نموذج هجين يتولّى فيه العقل (الوكيل) الحُكم/التنسيق وتشغّل اليدان (RPA) التنفيذ الحتمي — لا تضع وكيلًا حيث تُطلب الحتمية، واقرِن الحُكم المفوَّض بحواجز حماية وموافقة بشرية. استنادًا إلى المعلومات الرسمية للموردين، مع أسئلة شائعة.

كيف تدع الذكاء الاصطناعي يدير AWS: الطرق والمزايا والعيوب (2026)

كيف تدع الذكاء الاصطناعي يدير AWS: الطرق والمزايا والعيوب (2026)

هل يمكنك تسليم تشغيل AWS إلى الذكاء الاصطناعي؟ في 2026 يمكنك تفويض الكثير. فـ AWS نفسها تقدّم Amazon Q Developer وAgent Toolkit for AWS (مايو 2026 — أكثر من 40 مهارة للوكلاء + خادم AWS MCP Server مُدار + إضافات)، بحيث يمتد الذكاء الاصطناعي من توليد البنية التحتية ككود إلى تشغيل الموارد. يؤطّر هذا الدليل «التفويض» في ثلاثة مستويات (① توليد الكود/البنية التحتية ككود، ② التشغيل/الاستقصاء القائم على القراءة، ③ وكيل ذاتي يشغّل AWS فعليًا)، ويغطّي الأدوات الرئيسية (Amazon Q Developer، وAgent Toolkit، وAWS MCP Server، وTerraform MCP، وBedrock AgentCore) — بما في ذلك مسار أدواتك الخاصة بمنح Claude Code أو Codex واجهة AWS CLI لتشغيل «aws» من الصدفة — والمزايا (بنية تحتية ككود سريعة، وفرز آلي، وأفكار لتحسين التكلفة، ودمقرطة المعرفة)، ثم صلب الموضوع: العيوب (تضخّم صلاحيات IAM، والصلاحية المفرطة كمضخّم لنطاق تأثير الأخطاء/حقن التعليمات، والصلاحيات التي تعمّر بعد المهمة، وانفلات التكلفة — مع حوادث فعلية لحذف قواعد بيانات إنتاجية في 2025-2026)، اعتمادًا على مصادر AWS الرسمية وشركات الأمن. المفارقة الجوهرية: السؤال ليس «هل يستطيع؟» بل «كيف تفوّض دون انفلات أو انفجار في الفاتورة» — وبناء AWS نفسها لحواجز حماية IAM وتدقيق CloudTrail والعزل ضمن Agent Toolkit يبيّن شكل الإجابة. ويشمل المبادئ الخمسة (صلاحيات IAM الأقل امتيازًا، وموافقة بشرية على العمليات المدمّرة، وقابلية المراقبة، وبيانات اعتماد قصيرة العمر تُصدر عند الحاجة، والعزل) وقسم أسئلة شائعة.

مقارنة أطر عمل وكلاء الذكاء الاصطناعي 2026: LangGraph وCrewAI وAutoGen وOpenAI وGoogle وClaude — أيّها تختار؟

مقارنة أطر عمل وكلاء الذكاء الاصطناعي 2026: LangGraph وCrewAI وAutoGen وOpenAI وGoogle وClaude — أيّها تختار؟

أول عقبة عند دمج وكيل ذكاء اصطناعي في عمل حقيقي هي «على أي إطار عمل تبنيه». من منظور المطوِّر ومتّخذ قرار التقنية، يقارن هذا المقال ستة أطر كبرى — LangGraph وCrewAI وAutoGen (المدموج في Microsoft Agent Framework، GA أبريل 2026) وOpenAI Agents SDK وGoogle ADK وClaude Agent SDK — حسب مقاربة التنسيق (رسم بياني موجَّه / طاقم قائم على الأدوار / محادثة GroupChat / تسليمات / شجرة هرمية / حلقة أدوات مستقلة)، واللغة، ومنحنى التعلّم، والتحكم، ونضج الإنتاج، وتكلفة الرموز، وأنسب حالة استخدام. التحذير الأهم: إطار العمل «الأسرع في بناء النموذج الأولي» (CrewAI) قد يكون الأغلى في الإنتاج — نحو 3× من الرموز (41k مقابل 18.5k لـ LangGraph في أحد المعايير) ولاحتمي، ما يجعله غير مناسب للتمويل والرعاية الصحية. كما يشرح كيف جلب 2026 التشغيل البيني عبر MCP (الأدوات) وA2A (وكيل إلى وكيل)، بحيث صار وكلاء من أطر مختلفة يعملون معًا وتلاشى الاحتجاز. ويتضمن دليل اختيار حسب حالة الاستخدام وأسئلة شائعة.

ما هي AI observability؟ مراقبة وتتبّع LLMs والوكلاء للمبتدئين

ما هي AI observability؟ مراقبة وتتبّع LLMs والوكلاء للمبتدئين

قلنا في "كيف تبني نظامًا متعدد الوكلاء" إنه يجب تجهيز القياس لكل عملية تسليم قبل إضافة الوكلاء؛ والتقنية التي تشغّل هذا القياس في الإنتاج هي AI observability. فهي تُظهر ما تفعله LLMs والوكلاء فعليًا في الإنتاج (أي نموذج وبأي prompt، وأي أدوات وعمليات بحث، وما الذي أُعيد، وكم استغرق وكلّف) حتى تتبّع رجوعًا إلى السبب. الفرق الحاسم عن مراقبة التطبيقات العادية: قد يعيد الذكاء الاصطناعي 200 OK في 50ms ومع ذلك يهلوس بثقة، فمعظم الإخفاقات إخفاقات جودة (هلوسة، استرجاع ضعيف، إجابات غير آمنة، مهام غير مكتملة) لا إخفاقات بنية تحتية. تقوم الـobservability على ثلاث ركائز: traces (طلب واحد كشجرة spans) وmetrics (زمن الاستجابة والتكلفة والـtokens) وlogs. والمعيار OpenTelemetry GenAI يلتقط الـprompts والاستجابات والـtokens واستدعاءات الأدوات بمخطط محايد قابل للتغذية في Datadog/Grafana. الفرق الأكثر خلطًا هو observability مقابل evals: الأولى تُظهر ما حدث، والثانية تقيس جودة الإجابة (الدقة وgroundedness والأمان). تنقسم المقاييس إلى تشغيلية (تكلفة، زمن استجابة، tokens) وجودة (هلوسة، groundedness الأهم لـRAG، أمان، إتمام المهمة)، مع كشف الهلوسة عبر LLM-as-a-judge ودرجات groundedness. الأدوات الرئيسية: LangSmith وLangfuse وArize Phoenix وMLflow وAgentOps وOpenTelemetry. ابدأ بالتقاط traces ثم صوّر المقاييس واربط evals قبل الإطلاق. للأنظمة متعددة الوكلاء المراقبة ضرورية لأن الإخفاقات تختبئ في سلاسل متعددة الخطوات.