Colay / मार्गदर्शिकाएँ

Mixture-of-Agents: संयुक्त उत्तर को अपनी उपयोगिता साबित करनी चाहिए

कई AI प्रतिक्रियाएँ एकत्र करना सीधा है; उन्हें एक सुसंगत, जांच योग्य वितरण योग्य में बदलना कठिन है। एजेंटों का मिश्रण अनुसंधान संश्लेषण को गंभीरता से लेने का एक कारण प्रदान करता है, लेकिन इसके शीर्षक प्रतिशत को गलत तरीके से पढ़ना आसान है। यहां हम माप की जांच करते हैं, प्राथमिकता को तथ्यात्मक सटीकता से अलग करते हैं और अंतिम आउटपुट का आकलन करने के लिए एक व्यावहारिक तरीका प्रस्तावित करते हैं।

बाहरी शोध परिणाम और उदाहरणात्मक गणना Colay प्रदर्शन का माप नहीं हैं।

परिणाम, मीट्रिक और संदर्भ उत्तर

Wang और सहलेखकों के 2024 MoA शोधपत्र में AlpacaEval 2.0 के 805 निर्देशों पर उत्तर की लंबाई का प्रभाव नियंत्रित करने के बाद 65.1% जीत दर बताई गई है, जबकि GPT-4o (05/13) के लिए यह 57.5% थी। दोनों की तुलना gpt-4-1106-preview से की गई है। यह AI निर्णायक की पसंद मापता है, सही तथ्यों का अनुपात या Colay का प्रदर्शन नहीं। Wang et al., 2024

अंतर उस मीट्रिक पर 7.6 प्रतिशत अंक है। यह कार्यस्थल की सटीकता या किसी उत्पाद को चुनने वाले ग्राहकों के अनुपात को स्थापित नहीं करता है।

लंबाई के लिए समायोजन क्यों मायने रखता है

डुबॉइस एट अल। उत्तर की लंबाई में अंतर के लिए स्वचालित-न्यायाधीश प्राथमिकताओं को समायोजित करने के लिए लंबाई-नियंत्रित AlpacaEval की शुरुआत की गई। वह समायोजन स्कोर को प्रत्येक तथ्यात्मक कथन के ऑडिट में नहीं बदलता है। Dubois et al., Length-Controlled AlpacaEval, 2024

आपकी अपनी तुलना में, एक लंबा संश्लेषण तब भी पूर्ण महसूस हो सकता है जब अतिरिक्त विवरण निर्णय में सुधार नहीं करता है। दोनों वर्कफ़्लो को समान स्थान सीमा और आवश्यक सामग्री दें। फिर उपयोगिता, तथ्यात्मक शुद्धता और पठनीयता को अलग-अलग अंक दें। एक एकल संयुक्त स्कोर एक परिणाम को छिपा सकता है जिसमें प्रस्तुति में सुधार होता है जबकि अनुशंसा का आधार कमजोर हो जाता है।

प्रत्येक अनुशंसा के पीछे शर्तों को सुरक्षित रखें

एक काल्पनिक उदाहरण पर विचार करें। यदि डेटा तैयार है तो एक प्रतिक्रिया दो सप्ताह के कार्यान्वयन का प्रस्ताव करती है; एक अन्य का अनुमान है कि यदि सफाई आवश्यक हो तो छह सप्ताह लगेंगे। एक संश्लेषण जिसमें कहा गया है कि कार्यान्वयन में चार सप्ताह लगते हैं, संतुलित लगता है, लेकिन किसी भी परिदृश्य का प्रतिनिधित्व नहीं करता है। एक बेहतर उत्तर शाखा को संरक्षित करता है और डेटा की तैयारी के बारे में पूछता है। कथनों का औसत लगाने से उपयोगी जानकारी नष्ट हो जाती है।

इस कारण से, हम संश्लेषण के दौरान किसी दावे और उसकी प्रयोज्यता शर्तों को एक इकाई के रूप में मानने का सुझाव देते हैं। प्रत्येक सिफ़ारिश के लिए एक आधार, एक सीमा और पहचान योग्य इनपुट साक्ष्य की आवश्यकता होती है। आप एक समन्वयक से एक संघर्ष तालिका के लिए पूछ सकते हैं, फिर जांचें कि संपीड़न ने एक असुविधाजनक स्थिति को दूर नहीं किया है। अच्छा संपादन मतभेदों को दूर करने के बजाय समझने में आसान बनाता है।

ड्राफ्ट और अंतिम पाठ के बीच क्या गायब हुआ इसका ऑडिट करें

मान लीजिए कि आपूर्तिकर्ता विवरण में 12 अनिवार्य शर्तें शामिल हैं। एक काल्पनिक समीक्षा में, संभावित उत्तर सामूहिक रूप से सभी 12 को कवर करते हैं, लेकिन अंतिम संश्लेषण केवल नौ को संरक्षित करता है। आवश्यक शर्त कवरेज 75% है, भले ही अंतिम दस्तावेज़ किसी भी ड्राफ्ट से बेहतर पढ़ा जाता हो। यह एक अलग माप है और इसका AlpacaEval प्रतिशत से कोई संबंध नहीं है।

कार्य-विवरण से अनिवार्य शर्तों की सूची बनाएं, अंतिम पाठ में प्रत्येक का पता लगाएं और चूकों को रिकॉर्ड करें। इसके बाद, केवल संश्लेषण के दौरान पेश किए गए दावों का निरीक्षण करें। एक नए नंबर या वादे के लिए सहायक साक्ष्य की आवश्यकता होती है। यदि कोई समर्थन मौजूद नहीं है, तो इसे एक धारणा के रूप में लेबल करें या हटा दें। यह परीक्षण करता है कि उपयोगी सामग्री वर्कफ़्लो में बची है या नहीं, बजाय यह मापने के कि परिणाम कितना अच्छा लगता है।

अंतिम संश्लेषण का एक काल्पनिक ऑडिट
चेक करेंउदाहरण परिणामकार्रवाई
आवश्यक शर्तें12 में से 9 सुरक्षित रहेतीन चूक पुनर्स्थापित करें
नए संख्यात्मक दावे2 असमर्थितसत्यापित करें या हटाएं
विवादित धारणाएँ1 छिपा हुआनिर्णय शाखा दिखाएँ

एक मजबूत एकल-मॉडल तुलना का उपयोग करें

अपने काम में कई मॉडलों के मूल्य का परीक्षण करने के लिए, एकल-मॉडल वर्कफ़्लो को समान तैयार कार्य-विवरण, स्रोत और ग्रेडिंग मानदंड दें। एक संगठित प्रक्रिया की तुलना एक लापरवाह एक-पंक्ति अनुरोध के साथ करने से कार्य की तैयारी वास्तुकला के साथ भ्रमित हो जाती है। इनपुट तैयार करने और आउटपुट की समीक्षा करने के लिए आवश्यक प्रयास, साथ ही मॉडल के उपयोग और प्रतीक्षा समय को रिकॉर्ड करें।

विकल्पों के साथ एक छोटा तथ्यात्मक प्रश्न और एक लंबा निर्णय ज्ञापन दोनों आज़माएं। उन्हें अलग-अलग सफलता मानदंड की आवश्यकता है। पहले को किसी विशिष्ट दावे के लिए समर्थन की आवश्यकता होती है; उत्तरार्द्ध को महत्वपूर्ण स्थितियों के कवरेज और पसंद की स्पष्ट व्याख्या की भी आवश्यकता है। यदि सुधार केवल निर्णय ज्ञापनों में दिखाई देता है, तो व्यावहारिक अनुशंसा को उस प्रकार के कार्य तक ही सीमित रखें।

इस विचार को Consensus पर लागू करें, बिना इसके स्कोर को उधार लिए

Colay Consensus भी एक समन्वयक के संश्लेषण के साथ समाप्त होता है, लेकिन यह इसे शोध किए गए MoA कॉन्फ़िगरेशन के समान नहीं बनाता है। इस आलेख में कोई प्रकाशित Colay बेंचमार्क नहीं है। बाहरी परिणाम को अपनी सामग्री पर वर्कफ़्लो का परीक्षण करने के एक कारण के रूप में मानें, न कि प्रत्येक Consensus रन के लिए तैयार गुणवत्ता स्कोर के रूप में।

चार भागों के साथ निष्कर्ष का अनुरोध करें: अनुशंसा, साक्ष्य, अनसुलझे असहमति और अगला जांच योग्य कदम। स्थान सीमा और अनिवार्य शर्तों की सूची प्रदान करें। कार्य-विवरण और उसके स्रोतों के आधार पर परिणाम की समीक्षा करें। वर्कफ़्लो एक उपयोगी भूमिका अर्जित करता है जब आप पहचान सकते हैं कि इसने क्या संरक्षित या जोड़ा है और कितना मानव कार्य अभी भी बाकी है।

स्रोत और कार्यप्रणाली

  1. Wang et al., 2024

    तालिका 2a; अनुभाग 3.1.

  2. Dubois et al., Length-Controlled AlpacaEval, 2024

    मीट्रिक प्रतिक्रिया की लंबाई के लिए मॉडल-न्यायाधीश प्राथमिकताओं को समायोजित करता है; यह तथ्यात्मक-सटीकता स्कोर नहीं है।

अपना अगला सवाल Colay में पूछें

एक मॉडल चुनें, Auto का उपयोग करें, या Consensus के साथ कई दृष्टिकोण एक साथ लाएं।

Colay खोलें