Colay / मार्गदर्शिकाएँ
जब AI चर्चा अतिरिक्त कार्य को उचित नहीं ठहराती है
Consensus के पक्ष में विश्वसनीय तर्क देते समय उन स्थितियों को भी शामिल करना चाहिए जहाँ चर्चा का परिणाम कमज़ोर पड़ता है। वरना सफल उदाहरण वर्कफ़्लो चुनने का आधार बनने के बजाय प्रचार बन जाता है। शोध में ठोस प्रतिउदाहरण मिलते हैं। वे यह उपयोगी प्रश्न उठाते हैं: कई अलग-अलग प्रयासों की तुलना में तर्कों का आदान-प्रदान क्या अतिरिक्त लाभ देता है और उसकी लागत क्या है?
बाहरी शोध परिणाम और उदाहरणात्मक गणना Colay प्रदर्शन का माप नहीं हैं।
एक ठोस मामला जहां मतदान का प्रदर्शन बेहतर रहा
NeurIPS 2025 के Debate or Vote शोध में GSM8K के 300 प्रश्नों पर पाँच Qwen2.5-7B-Instruct एजेंटों के बहुमत मतदान की सटीकता 94.00% बताई गई है। दो दौर की विकेंद्रीकृत बहस का स्कोर 88.67% और पाँच दौर का स्कोर 83.33% था (तालिका 1)। यह एक शोध विन्यास है, Colay का मूल्यांकन या कोई सार्वभौमिक नियम नहीं। Debate or Vote, NeurIPS 2025
दो दौर की बहस के मुकाबले अंतर 5.33 प्रतिशत अंक है। अधिक चर्चा का मतलब स्वचालित रूप से बेहतर परिणाम नहीं है; यह सामूहिक तरीकों की तुलना करता है, व्यक्तिगत-मॉडल श्रेष्ठता की नहीं।
एक मजबूत विकल्प एक आकर्षक उदाहरण से अधिक मायने रखता है
Smit et al., ICML 2024, ने पाया कि परीक्षण की गई बहस रणनीतियाँ विश्वसनीय रूप से स्व-संगति और अन्य मजबूत विकल्पों से बेहतर प्रदर्शन नहीं करती हैं। प्रोटोकॉल ट्यूनिंग ने परिणाम बदल दिए। यह प्रत्येक सेटिंग में चर्चा को अस्वीकार करने के बजाय विशिष्ट स्थितियों के परीक्षण का समर्थन करता है। Smit et al., ICML 2024
जब पहला उत्तर कमजोर हो, तो लगभग कोई भी अतिरिक्त प्रयास प्रभावशाली लग सकता है। एक सुस्पष्ट व्यक्तिगत अनुरोध और अलग-अलग संभावित उत्तरों के साथ चर्चा की तुलना करें जो कभी एक-दूसरे के उत्तर नहीं देखते हैं। इससे अधिक विकल्प उत्पन्न करने के लाभ को प्रतिभागियों द्वारा एक-दूसरे को संशोधित करने के लिए मनाने के लाभ से अलग करने में मदद मिलती है।
सही आपत्ति खोना एक अलग जोखिम है
एक काल्पनिक लागत तुलना की कल्पना करें। एक प्रतिभागी ने नोटिस किया कि आंकड़े मासिक और वार्षिक कीमतों को मिलाते हैं; दूसरे उन्हें सीधे तौर पर तुलनीय मानते हैं। संश्लेषण बहुमत का अनुसरण करता है और इकाई चेतावनी को छोड़ देता है। समस्या पाठ की कमी नहीं है: आवश्यक चेक दिखाई दिया, फिर समझौते के दौरान गायब हो गया। जरूरी नहीं कि एक और दौर इसे बहाल कर दे।
महत्वपूर्ण आपत्तियों को तब तक दृश्यमान रहने के लिए कहें जब तक कि कोई स्रोत, गणना या स्पष्ट स्पष्टीकरण उनका समाधान न कर दे। अंतिम उत्तर में, आपत्ति अस्वीकार किए जाने का कारण देखें। यह कहना कि प्रतिभागी सहमत हैं, निर्णय को साबित करने के बजाय बातचीत का वर्णन करता है। जब कोई विवाद किसी तथ्य से संबंधित होता है, तो प्रस्तुति के विश्वास के बजाय साक्ष्य को इसका समाधान करना चाहिए।
शुरू करने से पहले रुकने का नियम चुनें
पहले से तय कर लें कि पर्याप्त परिणाम कैसा दिखेगा। उदाहरण के लिए: सभी अनिवार्य बाधाओं को कवर किया गया है, गणना की जाँच की गई है, विवादित तथ्यों को आपूर्ति की गई सामग्री द्वारा समर्थित किया गया है और शेष अज्ञात का नाम दिया गया है। एक बार जब वे शर्तें पूरी हो जाती हैं, तो केवल अधिक आत्मविश्वासपूर्ण स्वर प्राप्त करने के लिए जारी रखने का कोई स्पष्ट मूल्य नहीं है। यह एक प्रस्तावित वर्कफ़्लो नियम है, अंतर्निहित गारंटी नहीं।
यदि कोई अन्य एक्सचेंज समान तर्क दोहराता है, तो कार्रवाई बदलें: गुम दस्तावेज़ प्राप्त करें, परीक्षण निष्पादित करें या उस व्यक्ति से परामर्श लें जो तथ्य जानता है। एक नया संदेश तब उपयोगी होता है जब वह नई जाँच योग्य जानकारी प्रस्तुत करता है। उस जानकारी के बिना, बातचीत समझौते में समाप्त हो सकती है जबकि निर्णय का साक्ष्य आधार वहीं रहता है जहां से शुरू हुआ था।
एक अतिरिक्त स्वीकार्य परिणाम की लागत निकालें
एक काल्पनिक तुलना में दो वर्कफ़्लो समान 50 अनुरोधों पर काम करते हैं। पहला 100 लेखा इकाइयों के खर्च में 40 स्वीकार्य परिणाम देता है; दूसरा 220 इकाइयों में 43। तीन अतिरिक्त स्वीकार्य परिणामों के लिए 120 अतिरिक्त इकाइयाँ लगती हैं, यानी हर अतिरिक्त परिणाम पर 40 इकाइयाँ। ये गणना समझाने के लिए मानी गई धारणाएँ हैं, Colay की मापी गई लागत या सटीकता नहीं।
यह अतिरिक्त खर्च उचित है या नहीं, यह कार्य पर निर्भर करता है। किसी आंतरिक मसौदे के लिए यह अनावश्यक और किसी जटिल निर्णय ज्ञापन के लिए उचित हो सकता है। मानवीय समीक्षा का समय और गंभीर गलती के परिणाम भी शामिल करें। देखे गए परिणामों को अनुमानित नुकसान से अलग रखें: पहले माप एकत्र करें, फिर उन धारणाओं को स्पष्ट करें जिनसे आप इन अवलोकनों को खर्च के निर्णय में बदल रहे हैं।
| मापें | वर्कफ़्लो ए | वर्कफ़्लो बी |
|---|---|---|
| अनुरोध | 50 | 50 |
| स्वीकार्य परिणाम | 40 | 43 |
| लागत, लेखांकन इकाइयाँ | 100 | 220 |
| प्रति अतिरिक्त परिणाम में वृद्धिशील लागत | — | 40 |
कहाँ Consensus उपयोगी भूमिका निभा सकता है
चर्चा उस काम पर परीक्षण के लायक है जो प्रतिस्पर्धी तर्कों पर निर्भर करता है: डिजाइन निर्णय, परस्पर विरोधी आवश्यकताएं और कई व्यावहारिक दृष्टिकोणों के बीच विकल्प। आसानी से जांचे जा सकने वाले परिणाम वाले सरल ऑपरेशन के लिए पहले सीधी विधि आज़माएं। यह क्रम उन कार्यों पर क्रेडिट के उपयोग पर ध्यान केंद्रित करने में मदद करता है जहां चर्चा आपके आगे के कार्यों को महत्वपूर्ण रूप से बदल सकती है।
Colay में, Consensus प्रतिभागी कार्य पर चर्चा करते हैं और एक समन्वयक एक संश्लेषण तैयार करता है। यह मोड समझौते को साक्ष्य में नहीं बदलता या बाहरी सत्यापन को प्रतिस्थापित नहीं करता। तुलना के लिए एक सामान्य उत्तर रखें, सबसे मजबूत महत्वपूर्ण आपत्ति के लिए पूछें और जो बदला है उसका मूल्यांकन करें। यदि गुणवत्ता में सुधार नहीं होता है, या नई त्रुटियाँ सामने आती हैं, तो उस वर्ग के कार्य के लिए एक सरल प्रक्रिया का उपयोग करें।
स्रोत और कार्यप्रणाली
- Debate or Vote, NeurIPS 2025
तालिका 1; परिशिष्ट A.2.
- Smit et al., ICML 2024
Should we be going MAD? बहस की तुलना मज़बूत प्रॉम्प्ट और नमूना-आधारित आधाररेखाओं से की गई है।
अपना अगला सवाल Colay में पूछें
एक मॉडल चुनें, Auto का उपयोग करें, या Consensus के साथ कई दृष्टिकोण एक साथ लाएं।