Colay / الأدلة

قارن نماذج الذكاء الاصطناعي باستخدام الموجّهات التي يحتاجها منتجك

قبل إنشاء مسار التقييم، يمكنك إجراء مقارنة صغيرة ومنظمة في Colay. امنح الوكلاء المتاحين نفس المدخلات المسموح بها، وافحص إجاباتهم المنفصلة وسجل المتطلبات التي يستوفونها. يعد هذا فحصًا أوليًا عمليًا بدون كتابة تعليمات برمجية أو توفير مفاتيح API للموفر؛ فهو ليس أداة قياس أداء تلقائية أو دليلاً على أن النموذج سيتصرف بشكل مماثل في منتجك.

تحويل الميزة إلى حالات قابلة للاختبار

ابدأ بالمخرجات التي يحتاجها المستخدم، لا بترتيب النموذج في قوائم التقييم. إذا كانت الميزة تستخرج المهام من النص، فالنجاح يعني الحفاظ على المهمة والمسؤول عنها وموعدها، وترك المعلومات غير المحددة مجهولة. الملخص الأنيق الذي يخترع موعدًا نهائيًا يفشل في هذا الاختبار.

كمجموعة أولية توضيحية، جهّز 12 مثالًا يُسمح لك بمشاركتها: 4 مدخلات اعتيادية، و4 غامضة، و4 حالات حدية. هذا حجم عملي للتمرين، وليس عينة مثبتة الصلاحية إحصائيًا. احذف البيانات الشخصية والسرية التي لا يحق لك مشاركتها، واحتفظ بالنتيجة المتوقعة أو قاعدة قبول صريحة لكل حالة.

قم بإجراء مقارنة يمكنك تفسيرها

يميّز دليل Anthropic للتقييم بين المهمة والمحاولات المتكررة لتنفيذها، لأن النتائج قد تختلف. نطبّق هذا التمييز هنا على تمرين مقارنة يدوي. لا تكفي إجابات قليلة سليمة لاستنتاج معدل الإخفاق عند تشغيل المنتج فعليًا.

لا تمنح مرشحًا موجّهًا محسّنًا بعد إخفاق مرشح آخر في النسخة السابقة. إذا احتاج الموجّه إلى تعديل، أنشئ إصدارًا جديدًا واختبر جميع المرشحين به. وإلا فستقارن اختلاف التعليمات إلى جانب اختلاف النماذج.

  1. اختر الوكلاء المرشحين بشكل صريح من الكتالوج الحالي. لا تستخدم Auto عندما تحتاج إلى معرفة المرشح الذي أجاب.
  2. قدّم الموجز والمادة المصدرية وتنسيق الإجابة نفسه لكل مرشح. استخدم Ask separately للحصول على الإجابات الأولية، واحتفظ باسم الوكيل الذي أنتج كل إجابة.
  3. سجّل التاريخ واسم الوكيل الظاهر وإصدار الموجّه والإعدادات المتاحة لك. ميّز غياب الإجابة عن الإجابة الخاطئة.
  4. راجع كل نتيجة وفقًا للقواعد قبل مقارنة جودة النثر. كرر الحالات المهمة أو الغامضة واحتفظ بكل المحاولات، بما في ذلك المحاولات الفاشلة.

مثال: عناصر عمل من مذكرة اجتماع

مدخل افتراضي: «سترسل ميرا المسودة يوم الثلاثاء. ما زال الفريق يحتاج إلى تحديد مسؤول عن مراجعة الأسعار». النتيجة الصحيحة تتضمن مهمة لها مسؤول وأخرى لم يُحدّد مسؤولها. لا ينبغي إسناد المهمتين كلتيهما إلى ميرا أو اختراع موعد لمراجعة الأسعار.

المخرج المفيد هو سجل للحالات، لا صورة لأجمل إجابة. أرفق النص الناتج كما هو بكل صف حتى يتمكن زميلك من مراجعة تقييمك. افصل أخطاء التنسيق عن الأخطاء الواقعية: خلل قابل للإصلاح في شكل الجدول يختلف عن اختراع التزام.

ورقة تسجيل يدوية لهذه الحالة الخيالية
تحققحالة النجاحالإخفاق المراد تسجيله
المسؤولميرا مسؤولة عن المسودة فقطتم تعيين مراجعة الأسعار بدون أدلة
الموعد النهائيالثلاثاء موعد المسودة فقطاختراع موعد لمراجعة الأسعار
حقل غير معروفيبقى المسؤول عن مراجعة الأسعار غير محددتم ملء المعلومات المفقودة بصمت
سهولة الاستخدامتظهر كلتا المهمتين في البنية المطلوبةتم حذف المهمة أو التنسيق غير قابل للاستخدام

موجّه لاختبار استخراج المهام

احتفظ بتعليمات التقييم في قائمة مرجعية منفصلة تطبقها على الإجابة. يمكنك أن تطلب من وكيل آخر تحديد الأخطاء المحتملة، ولكن حكمه هو نتيجة أخرى يجب فحصها. Consensus يمكن أن يساعد في تلخيص المفاضلات التي تمت ملاحظتها بعد المقارنة الأولى؛ قم بتقديم النتائج المصنفة ودرجاتك بشكل صريح.

استخرج المهام من مذكرة الاجتماع التالية: [نص يُسمح بمشاركته]. أعد جدولًا يتضمن المهمة والمسؤول والموعد النهائي والمقتطف الداعم. استخدم النص المرفق وحده. اكتب «غير معروف» عندما لا يُحدّد المسؤول أو الموعد. لا تحوّل اقتراحًا إلى التزام متفق عليه. افصل الأسئلة التي لم تُحسم. معرّف المدخل: [معرّف الحالة].

استخدم القائمة المختصرة للاختبار التالي

لخّص الحالات التي يتعامل معها كل مرشح، وإخفاقاته الحاسمة، والأسئلة المتبقية. أبقِ المرشح فقط إذا استوفى الحد الأدنى لمتطلبات الميزة. إذا لم يتأهل أي منها، فقلّص نطاق الميزة أو حسّن السياق المقدم قبل اختيار فائز.

يجب أن تختبر تجربة الدمج، على نحو منفصل، نقطة النهاية الفعلية للنموذج وأدواته وتعليمات النظام وزمن الاستجابة وتكلفة الاستخدام ومعالجة الإخفاقات. أرصدة Colay ليست عرض سعر لتشغيل واجهة API في منتجك. ابدأ بحالة حقيقية أزيلت منها المعرّفات، ويمكنك تقييمها بنفسك، ثم وسّع الاختبار عندما يؤثر ذلك في اختيار المرشحين.

إجابات عن أسئلتك

هل يمكنني مقارنة النماذج بدون مفاتيح API؟

نعم، لمقارنة المستخدم النهائي في Colay. يعد إنشاء هذه النماذج في منتجك بمثابة تكامل منفصل له إمكانية الوصول والشروط والتكاليف الخاصة به.

هل هذا معيار موثوق إحصائيًا؟

لا. يكشف تمرين يدوي صغير عن سلوكيات وإخفاقات ملموسة. تتطلب الادعاءات الأوسع حالات تمثيلية وتجارب متكررة وتصميم تقييم مناسب للقرار.

هل يجب أن أستخدم Consensus لاختيار الفائز؟

قم أولاً بتسجيل نتائج منفصلة وفقًا لقواعد القبول الخاصة بك. استخدم التوليف لتنظيم الأدلة، مع إبقاء نتائجك الأصلية وقراراتك البشرية مرئية.

المصادر والمنهجية

  1. Anthropic — Demystifying evals for AI agents

    مرجع هندسي أولي يشرح الفرق بين المهمة والمحاولات المتكررة. لا يقيّم Colay ولا يثبت صلاحية حجم العينة التوضيحية.

اطرح سؤالك التالي على Colay

اختر نموذجًا، واستخدم Auto، أو اجمع عدة وجهات نظر معًا باستخدام Consensus.

جرّب مقارنة موجّهاتك