Colay / الأدلة

عندما تشترك العديد من نماذج الذكاء الاصطناعي في نفس النقطة العمياء

يمكن أن تبدو ثلاث إجابات متطابقة وكأنها ثلاثة اختبارات. يعتمد هذا التفسير على كيفية إنتاج الإجابات. إذا اعتمد كل مشارك على نفس الفرضية الخاطئة، فإن الاتفاق يكرر الفرضية بدلاً من اختبارها. للحكم على إجماع الذكاء الاصطناعي، قم بفحص الطرق المؤدية إلى الإجابة بالإضافة إلى الإجابة نفسها.

نتائج الأبحاث الخارجية والحسابات التوضيحية ليست قياسات لأداء Colay.

التشابه والصحة سؤالان مختلفان

وجدت دراسة Artificial Hivemind في NeurIPS 2025 تكرارًا داخل النموذج وتشابهًا بين النماذج عند الإجابة عن طلبات مفتوحة. تقبل هذه الطلبات عدة إجابات معقولة. هذه أدلة على تنوع الاستجابات، وليست احتمالًا مقاسًا لاشتراك النماذج في الأخطاء الواقعية. Artificial Hivemind, NeurIPS 2025

لنفترض أن فريق المنتج يسأل العديد من الوكلاء عن سبب مغادرة العملاء. قد تكون التفسيرات المماثلة صحيحة، أو عصرية، أو مستعارة من ملخص غير مكتمل. والسؤال المفيد هو ما هي الملاحظة التي يمكن أن تدحض كل تفسير؟ بدون هذا الاختبار، قد تخفي الصياغة المختلفة افتراضًا أساسيًا واحدًا، في حين أن الصياغة المتطابقة قد تعكس ببساطة حقيقة واضحة.

يشرح تحليل ديتريش المجمع سبب استفادة التصويت من مصنفات دقيقة ذات أخطاء مختلفة. ويعتبر حساب الخطأ المستقل الخاص به نموذجًا رياضيًا مشروطًا، وليس خاصية يتم توفيرها تلقائيًا باستخدام أسماء نماذج مختلفة. Dietterich: Ensemble Methods in Machine Learning

عملية حسابية تتضمن افتراضات مبسطة عمدًا

ما يلي هو مثالنا الافتراضي للتصنيف الثنائي، وليس تجربة Colay. افترض ثلاثة ناخبين، وتسمية واحدة صحيحة، واحتمال خطأ 20% لكل ناخب، وتصويت الأغلبية دون مناقشة. في حالة الأخطاء المستقلة، تحتاج الأغلبية الخاطئة إلى خطأين أو ثلاثة أخطاء بالضبط. احتمالها هو 3 × 0.2² × 0.8 + 0.2³ = 0.104، أو 10.4%.

الآن قم بتغيير بنية التبعية فقط. إذا نجح الثلاثة دائمًا أو فشلوا معًا، فإن الأغلبية مخطئون 20% من الوقت. وفي حالة ثالثة، دع نصف المهام يستخدم آلية الخطأ المشترك والنصف الآخر يستخدم أخطاء مستقلة. لا يزال لدى كل ناخب معدل خطأ 20%، لكن خطأ الأغلبية يصبح 0.5 × 20% + 0.5 × 10.4% = 15.2%.

مثال مبني: نفس معدل الأخطاء الفردية، ونتائج مشتركة مختلفة
العلاقة المفترضةخطأ فرديخطأ الأغلبية
أخطاء مستقلة20%10.4%
نصف مشترك ونصف مستقل20%15.2%
أخطاء تمت مشاركتها بالكامل20%20%

لماذا لا تعتبر المناقشة تجربة بأغلبية الأصوات

يمكن لمنسق المحادثة قبول اعتراض الأقلية، أو الجمع بين حلين جزئيين، أو تقديم خطأ جديد. يمكن للمشاركين أيضًا تغيير إجاباتهم بعد قراءة بعضهم البعض. وبالتالي فإن الحساب أعلاه لا يمكنه التنبؤ بدقة المناقشة. إنه يعزل مشكلة واحدة: إن إحصاء المخرجات لا يخبرك بكمية الأدلة الإضافية التي تحتوي عليها.

في Colay Consensus، يناقش العديد من الوكلاء الطلب ويقوم وكيل منسق بتجميع الاستنتاج. لا ينشئ سير العمل هذا استقلالاً إحصائيًا بين المشاركين. يمكن أن تؤدي الإجابات الأولية المنفصلة إلى تسهيل فحص الاختلافات، ولكن حتى الإجابات التي يتم إنشاؤها بشكل منفصل يمكنها مشاركة تأثيرات التدريب، أو المستندات المقدمة، أو الإغفالات، أو تفسيرات المهمة.

افحص التبعيات قبل إضافة المشاركين

لإجراء مراجعة محددة، أنشئ سجل أدلة صغيرًا. دوّن الادعاء المتنازع عليه والوثيقة الداعمة والافتراض الذي يصلها بالاستنتاج ومثالًا مضادًا محتملًا. اطلب من كل مراجع إكمال الحقول الناقصة. تبقى ثلاثة استشهادات بالبيان الصحفي نفسه مصدرًا أصليًا واحدًا، حتى لو أعادت ثلاثة مواقع نشره.

وزّع مهام تحقق ذات مخرجات مختلفة يمكن ملاحظتها. يمكن لمراجع فحص الحسابات، ولآخر تتبع الاقتباسات إلى مقاطع المصدر، ولثالث البحث في الموجز عن الحالات المستثناة. هذه طرق عمل مقترحة، لا ضمانات لاستقلال الأخطاء. فائدتها أنك تستطيع معرفة ما إذا كان المشارك أضاف فحصًا جديدًا بدلًا من مجرد تأييد آخر.

  • احتفظ بالاعتراض حتى تتم معالجة الأدلة الداعمة له.
  • سجل الحقائق الواردة من الموجه وتلك التي تم التحقق منها بشكل مستقل.
  • تفضيل المثال المضاد الموضح على العدد الواثق من الوكلاء الموافقين.

قياس الخلاف المفيد

في المهام ذات الإجابات المعروفة، حدد مكان فشل كلا الوكيلين، ومكان فشل أحدهما فقط، ومكان نجاح كلاهما. قم بالتحقيق في حالات الفشل المشتركة أولاً: فهي تكشف عن فجوات قد لا يتمكن مشارك آخر مماثل من إصلاحها. بالنسبة للمهام الإبداعية، استبدل تصنيف صحة واحد بمتطلبات واضحة، مثل المفاهيم المميزة، أو ملاءمة الجمهور، أو تغطية القيود المتنافسة.

توقف عن إضافة المشاركين عندما لا تغير الإجابات الجديدة الأدلة، أو تكشف عن قيد، أو تحسن نتيجة تم اختبارها. تحتوي اشتراكات Colay على أرصدة وحدود، لذا فإن الاتفاقية المتكررة لها أيضًا تكلفة استخدام. يمكن أن تكون المناقشة المدمجة التي تحافظ على اعتراض واحد حاسم أكثر فائدة من المناقشة الطويلة التي تنتهي بنثر إجماعي ولكن غير مدعوم.

المصادر والمنهجية

  1. Artificial Hivemind, NeurIPS 2025

    دراسة لتوليد الإجابات المفتوحة.

  2. Dietterich: Ensemble Methods in Machine Learning

    افتراضات المجموعة الكلاسيكية.

اطرح سؤالك التالي على Colay

اختر نموذجًا، واستخدم Auto، أو اجمع عدة وجهات نظر معًا باستخدام Consensus.

افتح Colay