Colay / الأدلة
إجابات متعددة من نموذج واحد أم مناقشة بين النماذج؟
يمكنك حل السؤال عدة مرات واختيار الإجابة الأكثر تكرارًا. يمكنك أيضًا أن تطلب من المشاركين مناقشة الحلول المتنافسة وإنتاج توليفة. يستخدم كلا الأسلوبين أكثر من محاولة واحدة، لكنهما يختبران أفكارًا مختلفة. إن فهم هذا التمييز يجعل من السهل تحديد أي جزء من Consensus يكون مفيدًا لوظيفة معينة.
نتائج الأبحاث الخارجية والحسابات التوضيحية ليست قياسات لأداء Colay.
ما تم قياسه فعليًا في ورقة الاتساق الذاتي
أفاد Wang وزملاؤه في ICLR 2023 بارتفاع دقة PaLM-540B على GSM8K من 56.5% باستخدام فك الترميز الجشع لسلسلة التفكير إلى 74.4% مع الاتساق الذاتي: فرق قدره 17.9 نقطة مئوية. النتائج متوسط 10 تشغيلات، تتضمن كل منها 40 إجابة مولّدة بالعينة. هذه نتائج بحثية وليست قياسات لأداء Colay. Wang et al., ICLR 2023
تضم مجموعة الاختبار في GSM8K عدد 1,319 مسألة رياضية لفظية ابتدائية. وهي توفر إجابات نهائية قابلة للتحقق، ولا تمثل كل مهام البحث أو الكتابة أو اتخاذ القرار. مجموعة بيانات GSM8K، OpenAI
التفسير العملي هو أن الاستجابة الأولى لا يجب أن تكون أفضل إجابة متاحة من النموذج. التكرار يستهلك الموارد أيضًا. إن المقارنة بين أربعين محاولة ومحاولة واحدة، دون احتساب التكلفة، لا تحدد سير العمل الأفضل ضمن حد الإنفاق الخاص بك أو وقت الانتظار المقبول.
افصل بين ثلاث عمليات في سير العمل
للتقييم العملي، ميّز بين توليد الإجابات المرشحة وتقييمها وصياغة الجواب النهائي. يحدد التوليد الحلول المحتملة المتاحة، ويحدد التقييم أيها يفي بمتطلبات المهمة، وتنتج الصياغة جوابًا قابلًا للاستخدام. يمكن تحسين كل عملية على حدة، ولا يصلح النجاح في مرحلة تلقائيًا إخفاق مرحلة أخرى.
قد يكون الحل الصحيح موجودًا بالفعل ولكنه يخسر التصويت. وبدلاً من ذلك، يمكن اختيار المرشح المناسب بينما يسقط النثر النهائي شرطًا أساسيًا. احتفظ بالإجابات المتوسطة عند تقييم سير العمل. بدونها، من الصعب معرفة ما إذا كنت بحاجة إلى المزيد من المرشحين، أو قاعدة اختيار أفضل، أو تعليمات أكثر وضوحًا للمنسق.
عندما يكون تكرار الإجابة مفيدًا
فكر في سؤال حسابي افتراضي ينتج عنه خمس إجابات: 42، و42، و42، و24 و24. التصويت بالأغلبية يحدد 42. هذا الاختيار قابل للتكرار، لكن صحته لا تزال تعتمد على المشكلة والحساب. إذا كانت الإجابات الثلاثة المتطابقة تخلط بين الدقائق والساعات، فإن التصويت يحافظ على نفس الخطأ. لا تعني مشاركة التصويت تلقائيًا احتمالية صحة الإجابة.
تطرح الأسئلة المفتوحة صعوبة سابقة: تحديد ما يمكن اعتباره اتفاقًا. قد يوصي ردان بنفس المنتج لأسباب غير متوافقة. قد تعمل توصيتان مختلفتان في ظل قيود مختلفة. قبل إحصاء المطابقات، حدد المخرجات التي تحتاجها: القرار، وشروط تطبيقه، والحقائق المطلوبة وأي معلومات تظل مفقودة.
لماذا قد تكون المناقشة مفيدة لمهمتك
بالنسبة لسؤال قصير بإجابة رقمية واحدة، قد يكون التحقق من العملية الحسابية كافيًا. يستفيد قرار هندسة البرمجيات من مقارنة الافتراضات حول الحجم والصيانة والقيود غير المعروفة. في هذا الإطار، يمكن تقييم المناقشة من حيث قدرتها على الكشف عن المقدمات غير المتوافقة، بدلاً من مجرد إنتاج التوصيات الأكثر تكرارًا.
لنفترض أن اثنين من المشاركين يوصيان بتصميمات مختلفة لأنهما يفترضان أحجام بيانات مختلفة. يحدد التوليف المفيد النقطة التي يتغير عندها التفضيل. اطلب وصفًا موجزًا لما هو معروف وما هو مفترض وما هي الملاحظة التي من شأنها أن تحسم الخلاف. هذه هي الطريقة التي نقترحها لتصميم المهام، وليست ضمانًا بأن النموذج سيكتشف كل التبعيات.
مقارنة سير العمل دون تغيير السؤال
قم بتعيين سقف للإنفاق وقاعدة تقييم مشتركة مسبقًا. قارن بين الإجابة العادية والمحاولات المنفصلة بقاعدة الاختيار الصريحة والمناقشة. لا تؤدي أعداد المكالمات المتساوية إلى إنشاء تكاليف متساوية: طول السياق وحجم المخرجات واختيار النموذج كلها أمور مهمة. سجل الإنفاق الفعلي والتأخير بجانب الجودة، بدلاً من التعامل مع العمل الإضافي باعتباره تحسينًا مجانيًا.
الحساب الافتراضي يجعل المقايضة مرئية. يُنتج سير العمل "أ" 18 نتيجة مقبولة من 20 مهمة لـ 40 وحدة محاسبية. يُنتج سير العمل "ب" 19 مقابل 80 وحدة. تبلغ تكلفة النتيجة الإضافية المقبولة 40 وحدة. هذا لا يعني أن "أ" هو الأفضل: فقد تكون المهمة الإضافية الناجحة ذات قيمة خاصة. فهو يجعل تكلفة التحسين واضحة بما يكفي للمناقشة.
ماذا يعني هذا بالنسبة إلى Consensus في Colay
يعتمد Colay Consensus على نقاش المشاركين ثم توليف المنسق. أرقام الاتساق الذاتي لا تصف هذا الوضع، فالتكوين المختلف يحتاج إلى تقييم مستقل. لاختبار الفائدة، اختر مهمة متكررة، وقدّم المادة الواقعية نفسها، واحتفظ بإجابة الوضع العادي إلى جانب نتيجة Consensus. قيّم النتيجتين وفق المعايير المحددة مسبقًا.
اسأل عن أساس التوصية وأقوى اعتراض جوهري عليها والشروط التي من شأنها تغييرها. تحقق من المصادر والحسابات بشكل منفصل. عندما يمكن لصيغة أو اختبار قابل للتنفيذ إثبات الصحة، استخدم هذا التحقق بدلاً من عدد المشاركين المتفقين. تقوم المحاولات المتعددة بتوسيع مجموعة المرشحين؛ لا يزال سير العمل بحاجة إلى قاعدة يمكن الدفاع عنها لقبول الإجابة.
المصادر والمنهجية
- Wang et al., ICLR 2023
الجدول 2; القسم 3.2.
- مجموعة بيانات GSM8K، OpenAI
يحتوي قسم الاختبار الرئيسي على 1,319 مسألة لفظية في الرياضيات الابتدائية.
اطرح سؤالك التالي على Colay
اختر نموذجًا، واستخدم Auto، أو اجمع عدة وجهات نظر معًا باستخدام Consensus.