Colay / الأدلة

عندما تضيف مناظرة الذكاء الاصطناعي قيمة إلى الإجابة

تبدأ حالة Consensus بسؤال قابل للاختبار: هل تكتشف المناقشة خطأً فاتته الإجابة الأولى؟ قد تساهم عدة نماذج بملاحظات مفيدة، لكن عدد المشاركين وحده لا يثبت سوى القليل. تتناول هذه المقالة نتيجة البحث وتحويلها إلى طريقة تقييم عملية، مع فصل التجارب المنشورة عن الادعاءات المتعلقة بمنتج معين.

نتائج الأبحاث الخارجية والحسابات التوضيحية ليست قياسات لأداء Colay.

تجربة صغيرة تستحق القراءة بعناية

في المسودة البحثية التي نشرها Du وزملاؤه عام 2023، قبل نشرها في ICML 2024، حلّ Bard عدد 11 من أصل 20 مسألة GSM8K، وحلّ ChatGPT عدد 14، بينما حلّ النقاش المشترك 17: أي 55% و70% و85%. هذه نتائج لنماذج محددة على عينة صغيرة، وليست قياسات لأداء Colay. Du et al., 2023/ICML 2024

ثلاث إجابات صحيحة إضافية في عينة 20 من الأسئلة هي إشارة وليست معدل تحسن عالمي. يؤدي اختبار لغة أو نموذج أو مستند آخر إلى تغيير الشروط.

حدد التحسين الذي تحتاجه بالفعل

تصوّر قرار إطلاق افتراضيًا له ثلاثة خيارات. توصي إجابة بأسرع مسار، وتكتشف ثانية اعتمادًا على مورّد، وتلاحظ ثالثة أن الجدول المقدّر يغطي التطوير لكنه يستبعد الموافقات. يصحح التوليف المفيد نطاق التقدير ويوضح ما إذا كان ذلك يغيّر التوصية. مجرد سرد ثلاث وجهات نظر لا ينجز هذا العمل.

المعيار الذي نقترحه هو تغيير القرار، لا إبهار القارئ بالمناقشة. هل استُعيد قيد مفقود؟ هل صُححت وحدة خاطئة؟ هل وُسم أمر مجهول كانت الإجابة الأولى تعرضه كحقيقة؟ إذا كان التغيير الوحيد إجابة أطول، فالفائدة لم تثبت بعد. يصلح هذا المعيار عبر المنتجات وتشكيلات النماذج المختلفة.

عدد الوكلاء وتنوع النماذج متغيران منفصلان

ReConcile، المنشور في ACL 2024، يبحث في بروتوكول متميز: نماذج مختلفة تناقش الإجابات وتستخدم التصويت المرجح بالثقة. ويقوم بتقييم هذا الترتيب، بدلاً من التحقق من صحة كل خدمة تنسق بين عدة وكلاء. Chen, Saha and Bansal, ACL 2024

في مراجعتك الخاصة، ميز بين عدد إجابات المرشحين، والاختلافات في طرق البداية، والقاعدة المستخدمة لتكوين الإجابة النهائية. ثلاثة أدوار مخصصة لنموذج واحد لا تصبح ثلاثة مصادر معرفة مستقلة. لا تؤدي أسماء النماذج المختلفة إلى إنشاء أخطاء مستقلة أيضًا: يمكن لكل مشارك أن يرث نفس الفرضية الخاطئة من الطلب.

احصاء التراجعات جنبًا إلى جنب مع التصحيحات

هذا مثال افتراضي، وليس نتيجة بحث. عبر 100 مهمة محددة مسبقًا، تكون الإجابة الأولية صحيحة في 60. تعمل المناقشة على إصلاح 14 إجابة خاطئة ولكنها تغير ست إجابات صحيحة إلى إجابات خاطئة. والنتيجة هي 68 إجابة صحيحة: ربح صافي قدره ثماني نقاط مئوية. إن الإبلاغ عن 14 فقط من الإصلاحات من شأنه أن يخفي جزءًا جوهريًا من النتيجة.

افحص أيضًا العواقب. إصلاح الخطأ المطبعي وفقدان قيد الميزانية لهما تكاليف مختلفة. احتفظ بالإجابة الأولية بجانب الإجابة النهائية وسجل سبب تغيير كل ادعاء جوهري. يمكن أن يُظهر هذا المكان الذي يساعد فيه سير العمل حتى عندما تتحرك نتيجته الإجمالية بالكاد. بالنسبة للقرارات اللاحقة، يجب على المراجع الذي يفهم الموضوع تحديد ما إذا كانت هذه التغييرات مبررة أم لا.

تقييم افتراضي عبر 100 مهمة
الانتقالالعددالتفسير
خطأ → صحيح14التصحيحات
صحيح → خطأ6التراجعات
صافي التغير+868 صحيح بدلاً من 60

قم بإجراء مقارنة صغيرة ولكنها عادلة

اختر المهام الحقيقية الحديثة ذات النتائج المقبولة المحددة. قم بتدوين معايير التصنيف والحد الأقصى للإنفاق والحد الأقصى للتأخير المقبول قبل إنشاء الإجابات. أعط كلا سير العمل نفس الأدلة. لا تحدد فقط الأسئلة التي فشل النموذج الأول فيها بالفعل: فهذا من شأنه أن يميل المقارنة نحو أي محاولة ثانية، بغض النظر عما إذا كانت المناقشة قد ساهمت بأي شيء.

راجع المخرجات دون كشف اسم سير العمل. قيّم الصحة وتغطية القيود الجوهرية وحجم التعديل البشري كلًّا على حدة. احتفظ بالأمثلة الفاشلة إلى جانب الناجحة. إذا ساعد زملاء في التقييم، فليضع كل منهم درجاته مستقلاً قبل المناقشة؛ وإلا فقد يخفي اتفاق المراجعين اختلافات حقيقية في فهم المهمة.

تطبيق السؤال على Colay Consensus

في Consensus، يناقش الوكلاء المشاركون مهمة ويقوم المنسق بإنتاج تجميع. يطلب منهم الطلب العملي مقارنة البدائل بمعايير واضحة، وتحديد الافتراضات المتنازع عليها، وتجنب تحويل البيانات المفقودة إلى ثقة. قدم الأساس الواقعي واطلب ربط الادعاءات المهمة بفقرات معينة في تلك المادة. قم بمراجعة تلك الاتصالات بنفسك.

لا تعرض هذه المقالة تحسنًا مقاسًا في دقة Colay. تدعم الأبحاث اختبار المناقشة عندما تكون التفسيرات المتنافسة مهمة، لكن قيمة كل تجربة تعتمد على مخرجاتها الفعلية. احتفظ بالخلافات غير المحسومة في الوثيقة النهائية إذا لم تكفِ الأدلة. وقد تنتهي النتيجة المفيدة بطلب مزيد من المعلومات بدلًا من الموافقة بالإجماع.

المصادر والمنهجية

  1. Du et al., 2023/ICML 2024

    القسم 3: 20 مسألة من GSM8K.

  2. Chen, Saha and Bansal, ACL 2024

    ReConcile: بروتوكول متميز يستخدم نماذج متنوعة ومناقشة وتصويتًا مرجحًا بالثقة.

اطرح سؤالك التالي على Colay

اختر نموذجًا، واستخدم Auto، أو اجمع عدة وجهات نظر معًا باستخدام Consensus.

افتح Colay