Colay / मार्गदर्शिकाएँ

जब AI बहस किसी उत्तर में मूल्य जोड़ती है

Consensus का मामला एक परीक्षण योग्य प्रश्न से शुरू होता है: क्या चर्चा में कोई त्रुटि पकड़ी जाती है कि पहला उत्तर छूट गया? कई मॉडल उपयोगी अवलोकनों में योगदान दे सकते हैं, लेकिन अकेले प्रतिभागियों की संख्या बहुत कम साबित होती है। यह आलेख एक शोध परिणाम की जांच करता है और इसे एक व्यावहारिक मूल्यांकन पद्धति में बदल देता है, जबकि प्रकाशित प्रयोगों को किसी विशेष उत्पाद के बारे में दावों से अलग रखता है।

बाहरी शोध परिणाम और उदाहरणात्मक गणना Colay प्रदर्शन का माप नहीं हैं।

ध्यान से पढ़ने लायक एक छोटा सा प्रयोग

Du और सहलेखकों के 2023 प्रीप्रिंट में, जो उनके ICML 2024 प्रकाशन से पहले आया था, Bard ने GSM8K की 20 समस्याओं में से 11 हल कीं, ChatGPT ने 14 और संयुक्त बहस ने 17: क्रमशः 55%, 70% और 85%। ये छोटे नमूने पर विशिष्ट मॉडलों के परिणाम हैं, Colay के माप नहीं। Du et al., 2023/ICML 2024

20-प्रश्न नमूने में तीन अतिरिक्त सही उत्तर एक संकेत हैं, सार्वभौमिक सुधार दर नहीं। किसी अन्य भाषा, मॉडल या दस्तावेज़ का परीक्षण करने से स्थितियाँ बदल जाती हैं।

उस सुधार की पहचान करें जिसकी आपको वास्तव में आवश्यकता है

तीन विकल्पों के साथ एक काल्पनिक लॉन्च निर्णय पर विचार करें। एक उत्तर सबसे तेज़ मार्ग की अनुशंसा करता है। दूसरा आपूर्तिकर्ता पर निर्भरता को दर्शाता है। तीसरे ने नोटिस किया कि अनुमानित समय-सीमा में विकास शामिल है लेकिन अनुमोदन शामिल नहीं है। एक उपयोगी संश्लेषण अनुमान के दायरे को सही करता है और बताता है कि क्या इससे सिफारिश में बदलाव होता है। केवल तीन दृष्टिकोणों को सूचीबद्ध करने से वह काम पूरा नहीं होता।

हमारा सुझाया गया मानदंड निर्णय में बदलाव है, कोई प्रभावशाली चर्चा नहीं। क्या कोई गुम बाधा पुनः प्राप्त हो गई? क्या कोई ग़लत इकाई ठीक की गई थी? क्या परिणाम में अज्ञात का लेबल लगा दिया गया कि पहले उत्तर को तथ्य माना गया? यदि एकमात्र परिवर्तन लंबी प्रतिक्रिया है, तो लाभ अप्रमाणित रहता है। यह मानदंड सभी उत्पादों और मॉडल संयोजनों पर काम करता है।

एजेंटों की संख्या और मॉडल की विविधता अलग-अलग पहलू हैं

ACL 2024 में प्रकाशित ReConcile एक अलग प्रोटोकॉल की जाँच करता है: अलग-अलग मॉडल उत्तरों पर चर्चा करते हैं और विश्वास-स्तर के अनुसार भारित मतदान करते हैं। यह उसी व्यवस्था का मूल्यांकन है, कई एजेंटों का समन्वय करने वाली हर सेवा की पुष्टि नहीं। Chen, Saha and Bansal, ACL 2024

अपनी समीक्षा में, संभावित उत्तरों की संख्या, उनके शुरुआती दृष्टिकोण में अंतर और अंतिम उत्तर बनाने के लिए उपयोग किए जाने वाले नियम में अंतर करें। एक मॉडल को सौंपी गई तीन भूमिकाएँ तीन स्वतंत्र ज्ञान स्रोत नहीं बन जाती हैं। अलग-अलग मॉडल नाम स्वतंत्र त्रुटियां स्थापित नहीं करते हैं: प्रत्येक प्रतिभागी अनुरोध से एक ही गलत आधार प्राप्त कर सकता है।

सुधारों के साथ नई गलतियों को भी गिनें

यहां एक काल्पनिक उदाहरण है, कोई शोध निष्कर्ष नहीं। 100 पूर्व-चयनित कार्यों में, प्रारंभिक उत्तर 60 पर सही है। चर्चा 14 गलत उत्तरों को सुधारती है लेकिन छह सही उत्तरों को गलत उत्तरों में बदल देती है। परिणाम 68 सही उत्तर है: आठ प्रतिशत अंकों का शुद्ध लाभ। केवल 14 मरम्मत की रिपोर्ट करने से परिणाम का एक महत्वपूर्ण हिस्सा छिप जाएगा।

परिणामों के प्रभाव भी जाँचें। टाइपिंग की गलती सुधारने और बजट की सीमा को अनदेखा कर देने की कीमत अलग होती है। प्रारंभिक उत्तर को अंतिम उत्तर के साथ रखें और लिखें कि हर महत्वपूर्ण दावा क्यों बदला। इससे पता चल सकता है कि वर्कफ़्लो कहाँ मदद करता है, भले ही कुल स्कोर में बहुत कम बदलाव हो। गंभीर प्रभाव वाले निर्णयों के लिए विषय जानने वाले समीक्षक को तय करना चाहिए कि ये बदलाव उचित हैं या नहीं।

100 कार्यों पर काल्पनिक मूल्यांकन
संक्रमणगिनतीव्याख्या
गलत → सही14सुधार
सही → ग़लत6सही से गलत हुए उत्तर
शुद्ध परिवर्तन+860 के बजाय 68 सही उत्तर

एक छोटी लेकिन निष्पक्ष तुलना चलाएँ

स्थापित स्वीकार्य परिणाम के साथ हाल के वास्तविक कार्यों को चुनें। प्रतिक्रियाएँ उत्पन्न करने से पहले ग्रेडिंग मानदंड, व्यय सीमा और अधिकतम स्वीकार्य विलंब लिखें। दोनों वर्कफ़्लो को समान साक्ष्य दें। केवल उन प्रश्नों का चयन न करें जिनका पहला मॉडल पहले ही विफल हो चुका है: इससे तुलना किसी दूसरे प्रयास की ओर झुक जाएगी, भले ही चर्चा ने कुछ भी योगदान दिया हो।

वर्कफ़्लो नाम उजागर किए बिना आउटपुट की समीक्षा करें। स्कोर की शुद्धता, महत्वपूर्ण बाधाओं का कवरेज और मानव संशोधन की मात्रा अलग से। सफलताओं के साथ-साथ असफल उदाहरणों को भी सुरक्षित रखें। यदि सहकर्मी परिणामों का मूल्यांकन करने में मदद करते हैं, तो उन पर चर्चा करने से पहले उन्हें स्वतंत्र रूप से स्कोर करने दें। अन्यथा, समीक्षा में सहमति लोगों के कार्य को समझने के तरीके में वास्तविक अंतर को छिपा सकती है।

इस प्रश्न को Colay Consensus पर लागू करें

Consensus में, भाग लेने वाले एजेंट किसी कार्य पर चर्चा करते हैं और एक समन्वयक एक संश्लेषण तैयार करता है। एक व्यावहारिक अनुरोध उन्हें स्पष्ट मानदंडों के विरुद्ध विकल्पों की तुलना करने, विवादित मान्यताओं की पहचान करने और लापता डेटा को विश्वास में परिवर्तित करने से बचने के लिए कहता है। तथ्यात्मक आधार प्रदान करें और उस सामग्री के विशेष अंशों से जुड़े महत्वपूर्ण दावों के लिए पूछें। उन कनेक्शनों की स्वयं समीक्षा करें.

यह आलेख मापी गई Colay सटीकता में सुधार की रिपोर्ट नहीं करता है। जब प्रतिस्पर्धी व्याख्याएं मायने रखती हैं तो शोध चर्चा की जांच का समर्थन करता है; किसी विशेष रन का मूल्य उसके वास्तविक आउटपुट पर निर्भर करता है। साक्ष्य अपर्याप्त होने पर अंतिम दस्तावेज़ में अनसुलझी असहमतियों को सुरक्षित रखें। एक उपयोगी परिणाम सर्वसम्मत अनुमोदन के बजाय अधिक जानकारी के अनुरोध के साथ समाप्त हो सकता है।

स्रोत और कार्यप्रणाली

  1. Du et al., 2023/ICML 2024

    अनुभाग 3: 20 GSM8K समस्याएं।

  2. Chen, Saha and Bansal, ACL 2024

    ReConcile: विविध मॉडल, चर्चा और विश्वास-स्तर के अनुसार भारित मतदान वाला विशिष्ट प्रोटोकॉल।

अपना अगला सवाल Colay में पूछें

एक मॉडल चुनें, Auto का उपयोग करें, या Consensus के साथ कई दृष्टिकोण एक साथ लाएं।

Colay खोलें