Colay / मार्गदर्शिकाएँ
जब कई AI मॉडल एक ही ब्लाइंड स्पॉट साझा करते हैं
तीन मेल खाने वाले उत्तर तीन जांचों की तरह महसूस हो सकते हैं। वह व्याख्या इस बात पर निर्भर करती है कि उत्तर कैसे तैयार किये गये। यदि प्रत्येक भागीदार एक ही गलत आधार पर भरोसा करता है, तो सहमति परीक्षण के बजाय आधार को दोहराता है। AI सर्वसम्मति का आकलन करने के लिए, उत्तर के साथ-साथ उत्तर तक पहुंचने के मार्गों की भी जांच करें।
बाहरी शोध परिणाम और उदाहरणात्मक गणना Colay प्रदर्शन का माप नहीं हैं।
समानता और शुद्धता अलग-अलग प्रश्न हैं
NeurIPS 2025 के Artificial Hivemind अध्ययन में खुले प्रश्नों पर एक ही मॉडल के उत्तरों में दोहराव और अलग-अलग मॉडलों के उत्तरों में समानता मिली। ऐसे प्रश्नों के कई उचित उत्तर हो सकते हैं। यह उत्तरों की विविधता का साक्ष्य है, मॉडलों द्वारा समान तथ्यात्मक गलतियाँ करने की मापी गई संभावना नहीं। Artificial Hivemind, NeurIPS 2025
एक उत्पाद टीम पर विचार करें जो कई एजेंटों से पूछ रही है कि ग्राहक क्यों चले गए। समान स्पष्टीकरण सही, फैशनेबल या अधूरे कार्य-विवरण से उधार लिए गए हो सकते हैं। उपयोगी प्रश्न यह है कि कौन सा अवलोकन प्रत्येक स्पष्टीकरण को अस्वीकार कर सकता है। उस परीक्षण के बिना, अलग-अलग शब्दांकन एक अंतर्निहित धारणा को छिपा सकते हैं, जबकि समान शब्दांकन केवल एक स्पष्ट तथ्य को प्रतिबिंबित कर सकते हैं।
डिएटरिच का समग्र विश्लेषण बताता है कि अलग-अलग त्रुटियों वाले सटीक क्लासिफायर से वोटिंग को क्यों फायदा हो सकता है। इसकी स्वतंत्र-त्रुटि गणना एक सशर्त गणितीय मॉडल है, न कि विभिन्न मॉडल नामों का उपयोग करके स्वचालित रूप से आपूर्ति की जाने वाली संपत्ति। Dietterich: Ensemble Methods in Machine Learning
जानबूझकर सरलीकृत मान्यताओं के साथ एक गणना
नीचे हमारा द्विआधारी वर्गीकरण का काल्पनिक उदाहरण है, Colay का प्रयोग नहीं। मान लें कि तीन मतदाता हैं, केवल एक सही लेबल है, हर मतदाता की गलती की संभावना 20% है और बिना चर्चा के बहुमत मतदान होता है। स्वतंत्र त्रुटियों की स्थिति में बहुमत गलत होने के लिए ठीक दो या तीन त्रुटियाँ होनी चाहिए। इसकी संभावना 3 × 0.2² × 0.8 + 0.2³ = 0.104, यानी 10.4% है।
अब केवल निर्भरता की संरचना बदलें। यदि तीनों हमेशा एक साथ सफल या विफल होते हैं, तो बहुमत 20% मामलों में गलत होगा। तीसरे कल्पित परिदृश्य में आधे कार्यों में यही साझा-त्रुटि तंत्र और आधे में स्वतंत्र त्रुटियाँ मानें। हर मतदाता की त्रुटि दर फिर भी 20% है, लेकिन बहुमत की त्रुटि दर 0.5 × 20% + 0.5 × 10.4% = 15.2% हो जाती है।
| अनुमानित संबंध | व्यक्तिगत त्रुटि | बहुमत की त्रुटि दर |
|---|---|---|
| स्वतंत्र त्रुटियाँ | 20% | 10.4% |
| आधा साझा, आधा स्वतंत्र | 20% | 15.2% |
| पूरी तरह से साझा की गई त्रुटियां | 20% | 20% |
चर्चा बहुमत-मत प्रयोग क्यों नहीं है
एक वार्तालाप समन्वयक अल्पसंख्यक आपत्ति को स्वीकार कर सकता है, दो आंशिक समाधानों को जोड़ सकता है, या एक नई गलती पेश कर सकता है। प्रतिभागी एक-दूसरे को पढ़ने के बाद अपने उत्तर बदल भी सकते हैं। इसलिए उपरोक्त गणना किसी चर्चा की सटीकता का अनुमान नहीं लगा सकती। यह एक मुद्दे को अलग करता है: आउटपुट की गिनती से आपको यह नहीं पता चलता कि उनमें कितने अतिरिक्त सबूत हैं।
Colay Consensus में, कई एजेंट एक अनुरोध पर चर्चा करते हैं और एक समन्वय एजेंट निष्कर्ष को संश्लेषित करता है। वह वर्कफ़्लो प्रतिभागियों के बीच सांख्यिकीय स्वतंत्रता स्थापित नहीं करता है। अलग-अलग प्रारंभिक उत्तरों से मतभेदों का निरीक्षण करना आसान हो सकता है, लेकिन अलग-अलग तैयार किए गए उत्तर भी प्रशिक्षण प्रभाव, आपूर्ति किए गए दस्तावेज़, चूक या कार्य की व्याख्या को साझा कर सकते हैं।
प्रतिभागियों को जोड़ने से पहले निर्भरता का निरीक्षण करें
एक ठोस समीक्षा के लिए, एक छोटा सा साक्ष्य बही-खाता बनाएं। विवादित दावे, उसका समर्थन करने वाले दस्तावेज़, दस्तावेज़ को निष्कर्ष से जोड़ने वाली धारणा और एक संभावित प्रति-उदाहरण को रिकॉर्ड करें। प्रत्येक समीक्षक से छूटे हुए फ़ील्ड भरने के लिए कहें। एक ही प्रेस विज्ञप्ति के तीन संदर्भ साक्ष्य का एक स्रोत बने रहते हैं, भले ही तीन वेबसाइटें इसे पुन: प्रस्तुत करती हों।
विभिन्न अवलोकन योग्य आउटपुट के साथ चेक असाइन करें। एक समीक्षक अंकगणित का परीक्षण कर सकता है, दूसरा स्रोत अंशों के उद्धरणों का पता लगा सकता है, और दूसरा बहिष्कृत मामलों के लिए कार्य-विवरण में खोज कर सकता है। ये असाइनमेंट प्रस्तावित कार्य पद्धतियाँ हैं, स्वतंत्र त्रुटियों की गारंटी नहीं। उनका मूल्य यह है कि आप देख सकते हैं कि क्या किसी प्रतिभागी ने किसी अन्य समर्थन के बजाय एक नया चेक योगदान दिया है।
- जब तक इसके सहायक साक्ष्य का समाधान नहीं हो जाता तब तक आपत्ति को अपने पास रखें।
- रिकॉर्ड करें कि कौन से तथ्य प्रॉम्प्ट से आए और कौन से तथ्य स्वतंत्र रूप से जांचे गए।
- सहमत एजेंटों की विश्वसनीय संख्या के बजाय प्रदर्शित प्रति-उदाहरण को प्राथमिकता दें।
उपयोगी असहमति को मापें
ज्ञात उत्तर वाले कार्यों पर, चिह्नित करें कि दोनों एजेंट कहाँ विफल होते हैं, कहाँ केवल एक विफल होता है, और जहाँ दोनों सफल होते हैं। पहले साझा विफलताओं की जांच करें: वे उन कमियों को उजागर करते हैं जिन्हें कोई अन्य समान भागीदार सुधार नहीं सकता है। रचनात्मक कार्यों के लिए, एकल शुद्धता लेबल को स्पष्ट आवश्यकताओं से बदलें, जैसे विशिष्ट अवधारणाएँ, दर्शकों के लिए उपयुक्तता, या प्रतिस्पर्धी बाधाओं का कवरेज।
जब नई प्रतिक्रियाएँ सबूत नहीं बदलतीं, कोई बाधा प्रकट नहीं करतीं, या परीक्षण किए गए परिणाम में सुधार नहीं करतीं तो प्रतिभागियों को जोड़ना बंद कर दें। Colay सदस्यता में क्रेडिट और सीमाएं होती हैं, इसलिए बार-बार समझौते की भी उपयोग लागत होती है। एक संक्षिप्त चर्चा जो एक निर्णायक आपत्ति को बरकरार रखती है वह सर्वसम्मत लेकिन असमर्थित गद्य में समाप्त होने वाली लंबी चर्चा की तुलना में अधिक उपयोगी हो सकती है।
स्रोत और कार्यप्रणाली
- Artificial Hivemind, NeurIPS 2025
ओपन-एंडेड जनरेशन अध्ययन।
- Dietterich: Ensemble Methods in Machine Learning
पारंपरिक एन्सेम्बल पद्धति की धारणाएँ।
अपना अगला सवाल Colay में पूछें
एक मॉडल चुनें, Auto का उपयोग करें, या Consensus के साथ कई दृष्टिकोण एक साथ लाएं।