Colay / मार्गदर्शिकाएँ

एक मॉडल से कई उत्तर, या मॉडलों के बीच चर्चा?

आप एक प्रश्न को कई बार हल कर सकते हैं और सबसे अधिक बार आने वाला उत्तर चुन सकते हैं। आप प्रतिभागियों से प्रतिस्पर्धी समाधानों पर चर्चा करने और एक संश्लेषण तैयार करने के लिए भी कह सकते हैं। दोनों दृष्टिकोण एक से अधिक प्रयासों का उपयोग करते हैं, लेकिन वे विभिन्न विचारों का परीक्षण करते हैं। उस अंतर को समझने से यह तय करना आसान हो जाता है कि Consensus का कौन सा भाग किसी विशेष कार्य के लिए उपयोगी है।

बाहरी शोध परिणाम और उदाहरणात्मक गणना Colay प्रदर्शन का माप नहीं हैं।

स्व-संगति वाले शोधपत्र ने वास्तव में क्या मापा

Wang और सहलेखकों ने ICLR 2023 में बताया कि GSM8K पर PaLM-540B की सटीकता greedy chain-of-thought के साथ 56.5% से बढ़कर स्व-संगति के साथ 74.4% हुई: 17.9 प्रतिशत अंकों का अंतर। परिणाम 10 रन का औसत हैं; हर रन में 40 उत्तर नमूने लिए गए। ये शोध परिणाम हैं, Colay के माप नहीं। Wang et al., ICLR 2023

GSM8K के परीक्षण विभाजन में 1,319 प्रारंभिक गणित शब्द समस्याएं शामिल हैं। यह प्रत्येक शोध, लेखन या निर्णय लेने के कार्य का प्रतिनिधित्व करने के बजाय जांच योग्य अंतिम उत्तर प्रदान करता है। GSM8K dataset, OpenAI

इसका व्यावहारिक अर्थ यह है कि पहला उत्तर हमेशा किसी मॉडल से मिल सकने वाला सर्वोत्तम उत्तर नहीं होता। दोहराव में संसाधन भी लगते हैं। लागत को ध्यान में रखे बिना चालीस प्रयासों और एक प्रयास की तुलना से यह तय नहीं होता कि आपकी खर्च सीमा या स्वीकार्य प्रतीक्षा अवधि में कौन-सा वर्कफ़्लो बेहतर है।

वर्कफ़्लो के तीन चरणों को अलग करें

व्यावहारिक मूल्यांकन के लिए संभावित उत्तर तैयार करने, उनका आकलन करने और अंतिम उत्तर लिखने को अलग-अलग चरण मानें। पहला चरण तय करता है कि कौन-से संभावित समाधान उपलब्ध होंगे। आकलन तय करता है कि कौन-से समाधान कार्य की आवश्यकताओं को पूरा करते हैं। अंतिम लेखन पाठक को उपयोग योग्य उत्तर देता है। हर चरण को अलग से सुधारा जा सकता है; एक चरण की सफलता दूसरे चरण की विफलता अपने आप ठीक नहीं करती।

एक सही समाधान पहले से मौजूद हो सकता है लेकिन वोट खो सकता है। वैकल्पिक रूप से, सही संभावित उत्तर का चयन किया जा सकता है जबकि अंतिम गद्य एक आवश्यक शर्त छोड़ देता है। वर्कफ़्लो का मूल्यांकन करते समय मध्यवर्ती उत्तरों को सुरक्षित रखें। उनके बिना, यह बताना मुश्किल है कि आपको अधिक संभावित उत्तरों, बेहतर चयन नियम या समन्वयक को स्पष्ट निर्देश की आवश्यकता है या नहीं।

कब किसी उत्तर का बार-बार आना उपयोगी जानकारी देता है

पांच उत्तर देने वाले एक काल्पनिक अंकगणितीय प्रश्न पर विचार करें: 42, 42, 42, 24 और 24। अधिकांश मतदान 42 का चयन करता है। वह चयन प्रतिलिपि प्रस्तुत करने योग्य है, लेकिन शुद्धता अभी भी समस्या और गणना पर निर्भर करती है। यदि तीन मेल खाने वाली प्रतिक्रियाएँ मिनटों को घंटों के साथ भ्रमित करती हैं, तो वोट उसी त्रुटि को बरकरार रखता है। वोट शेयर स्वचालित रूप से किसी उत्तर के सत्य होने की संभावना नहीं है।

खुले प्रश्न पहले की कठिनाई का परिचय देते हैं: यह तय करना कि सहमति के रूप में क्या गिना जाता है। असंगत कारणों से दो प्रतिक्रियाएँ एक ही उत्पाद की अनुशंसा कर सकती हैं। दो अलग-अलग सिफ़ारिशें अलग-अलग बाधाओं के तहत काम कर सकती हैं। मिलानों की गिनती करने से पहले, आपके लिए आवश्यक आउटपुट को परिभाषित करें: एक निर्णय, इसकी प्रयोज्यता की शर्तें, आवश्यक तथ्य और कोई भी जानकारी जो गायब है।

चर्चा आपके कार्य के लिए क्यों उपयोगी हो सकती है

एक संख्यात्मक उत्तर वाले छोटे प्रश्न के लिए, गणना की जाँच करना पर्याप्त हो सकता है। एक सॉफ़्टवेयर आर्किटेक्चर निर्णय पैमाने, रखरखाव और अज्ञात बाधाओं के बारे में धारणाओं की तुलना करने से लाभान्वित होता है। उस सेटिंग में, चर्चा का मूल्यांकन असंगत आधारों को प्रकट करने की क्षमता के लिए किया जा सकता है, न कि केवल सबसे बार-बार दोहराई जाने वाली अनुशंसाओं को प्रस्तुत करने के लिए।

मान लीजिए कि दो प्रतिभागी अलग-अलग डिज़ाइन की अनुशंसा करते हैं क्योंकि वे अलग-अलग डेटा वॉल्यूम मानते हैं। एक उपयोगी संश्लेषण उस बिंदु की पहचान करता है जिस पर प्राथमिकता बदलती है। क्या ज्ञात है, क्या अनुमान लगाया गया है और किस अवलोकन से असहमति का समाधान होगा, इसका एक संक्षिप्त विवरण मांगें। यह हमारी प्रस्तावित कार्य-डिज़ाइन पद्धति है, यह गारंटी नहीं है कि एक मॉडल प्रत्येक निर्भरता की खोज करेगा।

प्रश्न बदले बिना वर्कफ़्लो की तुलना करें

पहले से ही खर्च की सीमा और साझा स्कोरिंग रूब्रिक निर्धारित करें। एक सामान्य उत्तर, स्पष्ट चयन नियम के साथ अलग-अलग प्रयासों और चर्चा की तुलना करें। समान कॉल गणना समान लागत स्थापित नहीं करती है: संदर्भ लंबाई, आउटपुट आकार और मॉडल की पसंद सभी मायने रखती है। अतिरिक्त कार्य को निःशुल्क सुधार मानने के बजाय, गुणवत्ता के साथ-साथ वास्तविक खर्च और देरी को भी रिकॉर्ड करें।

एक काल्पनिक गणना इस संतुलन को स्पष्ट करती है। वर्कफ़्लो A, 40 लेखा इकाइयों के खर्च पर 20 कार्यों में से 18 स्वीकार्य परिणाम देता है। वर्कफ़्लो B, 80 इकाइयों में 19 स्वीकार्य परिणाम देता है। एक अतिरिक्त स्वीकार्य परिणाम की लागत 40 इकाइयाँ है। इसका अर्थ यह नहीं कि A बेहतर है: अतिरिक्त सफल कार्य विशेष रूप से मूल्यवान हो सकता है। यह गणना सुधार की लागत को चर्चा योग्य रूप में स्पष्ट करती है।

Colay के Consensus के लिए इसका क्या अर्थ है

Colay Consensus प्रतिभागियों के बीच चर्चा और एक समन्वयक के संश्लेषण का उपयोग करता है। स्व-संगति संख्याएँ उस मोड का वर्णन नहीं करती हैं: एक अलग व्यवस्था को अपने स्वयं के मूल्यांकन की आवश्यकता होती है। लाभ की जांच करने के लिए, एक आवर्ती कार्य चुनें, समान तथ्यात्मक सामग्री प्रदान करें और Consensus परिणाम के बगल में एक सामान्य-मोड उत्तर रखें। दोनों का मूल्यांकन पहले से स्थापित मानदंडों के अनुसार करें।

सिफारिश का आधार, इसकी सबसे मजबूत महत्वपूर्ण आपत्ति और इसे बदलने वाली स्थितियों के बारे में पूछें। स्रोतों और गणनाओं की अलग से जाँच करें। जहां कोई सूत्र या निष्पादन योग्य परीक्षण शुद्धता स्थापित कर सकता है, वहां सहमत प्रतिभागियों की संख्या के बजाय उस चेक का उपयोग करें। कई प्रयासों से संभावित उत्तर पूल का विस्तार होता है; उत्तर स्वीकार करने के लिए वर्कफ़्लो को अभी भी एक तर्कसंगत नियम की आवश्यकता है।

स्रोत और कार्यप्रणाली

  1. Wang et al., ICLR 2023

    तालिका 2; अनुभाग 3.2.

  2. GSM8K dataset, OpenAI

    मुख्य परीक्षण विभाजन में 1,319 प्रारंभिक गणित शब्द समस्याएं शामिल हैं।

अपना अगला सवाल Colay में पूछें

एक मॉडल चुनें, Auto का उपयोग करें, या Consensus के साथ कई दृष्टिकोण एक साथ लाएं।

Colay खोलें