Colay / الأدلة
Mixture-of-Agents: على التوليف أن يثبت قيمته
يعد جمع العديد من استجابات الذكاء الاصطناعي أمراً سهلاً؛ إن تحويلها إلى نتائج متماسكة وقابلة للتحقق أمر أصعب. توفر أبحاث خليط الوكلاء سببًا لأخذ عملية التوليف على محمل الجد، ولكن من السهل إساءة قراءة النسب المئوية الرئيسية لها. نحن هنا نفحص القياس ونميز بين التفضيل والدقة الواقعية ونقترح طريقة عملية لتقييم الناتج النهائي.
نتائج الأبحاث الخارجية والحسابات التوضيحية ليست قياسات لأداء Colay.
النتيجة والمقياس والإجابة المرجعية
تورد ورقة Wang وزملائه عن MoA لعام 2024 معدل فوز بعد ضبط أثر طول الإجابة يبلغ 65.1% على 805 تعليمات في AlpacaEval 2.0، مقابل 57.5% لـ GPT-4o (05/13). وكلاهما مقارن بـ gpt-4-1106-preview. يقيس ذلك تفضيل مُقيّم من الذكاء الاصطناعي، لا نسبة الحقائق الصحيحة ولا أداء Colay. Wang et al., 2024
يبلغ الفرق 7.6 نقطة مئوية في هذا المقياس. ولا تحدد الدقة في مكان العمل أو نسبة العملاء الذين سيختارون المنتج.
ما أهمية التعديل حسب الطول
دوبوا وآخرون. قدم نظام AlpacaEval للتحكم في الطول لضبط تفضيلات الحكم التلقائي للاختلافات في طول الإجابة. ولا يؤدي هذا التعديل إلى تحويل النتيجة إلى تدقيق لكل بيان واقعي. Dubois et al., Length-Controlled AlpacaEval, 2024
في المقارنة الخاصة بك، قد يبدو التوليف الطويل مكتملًا حتى عندما لا تؤدي التفاصيل الإضافية إلى تحسين القرار. امنح كلا سير العمل نفس الحد من المساحة والمحتوى المطلوب. ثم سجل مدى الفائدة والصحة الواقعية وسهولة القراءة بشكل منفصل. يمكن أن تؤدي النتيجة المجمعة الواحدة إلى إخفاء النتيجة التي يتحسن فيها العرض التقديمي بينما يصبح أساس التوصية أضعف.
احتفظ بالشروط الكامنة وراء كل توصية
فكر في مثال افتراضي. تقترح إحدى الردود التنفيذ لمدة أسبوعين إذا كانت البيانات جاهزة؛ ويقدر آخر ستة أسابيع إذا كان التنظيف ضروريا. إن الجملة التجميعية التي تقول إن التنفيذ يستغرق أربعة أسابيع تبدو متوازنة، ولكنها لا تمثل أياً من السيناريوهين. الإجابة الأفضل تحافظ على الفرع وتسأل عن جاهزية البيانات. يؤدي حساب متوسط العبارات إلى تدمير المعلومات المفيدة.
لهذا نقترح التعامل مع الادعاء وشروط انطباقه كوحدة واحدة أثناء التوليف. تحتاج كل توصية إلى أساس وحدود وأدلة مدخلة يمكن تتبعها. يمكنك طلب جدول بالخلافات من المنسق، ثم التحقق من أن الاختصار لم يحذف شرطًا غير مريح. التحرير الجيد يوضح الاختلافات بدل طمسها.
تدقيق ما اختفى بين المسودات والنص النهائي
لنفترض أن ملخص المورد يحتوي على 12 شرطًا إلزاميًا. في مراجعة افتراضية، تغطي إجابات المرشح بشكل جماعي جميع 12، لكن التجميع النهائي يحتفظ بتسعة فقط. تبلغ نسبة تغطية الشرط المطلوب 75%، حتى لو كانت قراءة المستند النهائي أفضل من أي مسودة. وهذا مقياس منفصل وليس له أي صلة بنسبة AlpacaEval.
اكتب الشروط الإلزامية من الموجز، وحدد موضع كل منها في النص النهائي وسجل ما حُذف. ثم افحص الادعاءات التي أضيفت أثناء التوليف فقط. يحتاج كل رقم أو وعد جديد إلى دليل. إن لم يوجد، فوسمه كافتراض أو احذفه. يختبر ذلك بقاء المحتوى المفيد عبر سير العمل، بدلًا من الاكتفاء بانطباع عن صقل النتيجة.
| تحقق | مثال للنتيجة | الإجراء |
|---|---|---|
| الشروط المطلوبة | الاحتفاظ بـ 9 من أصل 12 | استعادة ثلاث حالات حذف |
| ادعاءات رقمية جديدة | 2 غير مدعوم | التحقق أو الإزالة |
| الافتراضات المتنازع عليها | 1 مخفي | إظهار فرع القرار |
استخدم مقارنة قوية لنموذج واحد
لاختبار قيمة النماذج المتعددة في عملك، قم بإعطاء سير عمل النموذج الفردي نفس الملخص المعد والمصادر ومعايير التصنيف. إن مقارنة عملية منظمة مع طلب مهمل من سطر واحد يربك إعداد المهمة مع الهندسة المعمارية. سجل الجهد المطلوب لإعداد المدخلات ومراجعة المخرجات، بالإضافة إلى استخدام النموذج ووقت الانتظار.
جرّب سؤالًا واقعيًا قصيرًا ومذكرة قرار أطول تتضمن بدائل. يحتاج كل منهما إلى معايير نجاح مختلفة. الأول يتطلب دعم ادعاء محدد؛ والثانية تتطلب أيضًا تغطية الشروط الجوهرية وتفسير الاختيار بوضوح. إذا ظهر التحسن في مذكرات القرار وحدها، فاحصر التوصية العملية في هذا النوع من العمل.
تطبيق الفكرة على Consensus دون استعارة نتيجتها
ينتهي Colay Consensus أيضًا بتوليف من المنسق، لكن ذلك لا يجعله مطابقًا لتكوين MoA الذي دُرس. لا تتضمن هذه المقالة معيار أداء منشورًا لـ Colay. تعامل مع النتيجة الخارجية بوصفها سببًا لاختبار سير العمل على موادك، لا درجة جودة جاهزة لكل تشغيل لـ Consensus.
اطلب خاتمة مكونة من أربعة أجزاء: التوصية والأدلة والخلاف الذي لم يتم حله والخطوة التالية القابلة للتحقق. توفير حد المساحة وقائمة الشروط الإلزامية. قم بمراجعة النتيجة ومقارنتها بالموجز ومصادره. يكتسب سير العمل دورًا مفيدًا عندما يمكنك تحديد ما تم حفظه أو إضافته ومقدار العمل البشري المتبقي.
المصادر والمنهجية
- Wang et al., 2024
الجدول 2أ؛ القسم 3.1.
- Dubois et al., Length-Controlled AlpacaEval, 2024
يضبط المقياس تفضيلات القاضي النموذجي لطول الاستجابة؛ إنها ليست درجة دقة واقعية.
اطرح سؤالك التالي على Colay
اختر نموذجًا، واستخدم Auto، أو اجمع عدة وجهات نظر معًا باستخدام Consensus.