تقييم وكلاء الذكاء الاصطناعي: 5 طرق لقياس الجودة (2026)
بعد أن تبني وكيل ذكاء اصطناعي، تصطدم دائماً بالجدار نفسه: "حسناً، لكن هل يعمل فعلاً؟" والآلية التي تقرّر ما إذا كان تغيير مطالبة أو نموذج قد جعل الأمور أفضل أم أسوأ اعتماداً على البيانات بدل الحدس هي الـ evals. تنتج نماذج اللغة الكبيرة مخرجاً مختلفاً في كل مرة للمدخل نفسه، لذا لا تناسبها اختبارات الوحدة بالمطابقة الدقيقة. يتناول هذا المقال ما هي الـ evals، وخمس طرق لقياس الجودة (① المطابقة مع الحقيقة المرجعية ② الفحوصات القائمة على القواعد ③ LLM-as-judge ④ اختبار التراجع ⑤ مراقبة الإنتاج)، والتقييم الخاص بالوكلاء (معدل نجاح المهمة، استدعاءات الأدوات الصحيحة، المسار، التكلفة)، وكيف تبدأ على نطاق صغير من 20 مثال إخفاق، والأخطاء الشائعة، والأدوات الأساسية (Anthropic Console/Evals، OpenAI Evals، LangSmith، Langfuse، Ragas) — وهو مكتوب للممارسين.