Colay / मार्गदर्शिकाएँ

आपको जो काम वास्तव में करने की जरूरत है उस पर Consensus का परीक्षण करें

एक उपयोगी मूल्यांकन यह पूछता है कि क्या वर्कफ़्लो उन बाधाओं के तहत आपके डिलिवरेबल्स में सुधार करता है जिन्हें आप वहन कर सकते हैं। यह प्रभावशाली उदाहरण एकत्र करने से शुरू नहीं होता है। समान कार्यों की तुलना करें, उत्तर देखने से पहले तय करें कि सफलता कैसे मिलेगी, और विफलताओं को सुरक्षित रखें। यह एक ऐसा निर्णय उत्पन्न करता है जिस पर आप दोबारा विचार कर सकते हैं न कि केवल सटीक दिखने वाली संख्या।

बाहरी शोध परिणाम और उदाहरणात्मक गणना Colay प्रदर्शन का माप नहीं हैं।

स्कोर चुनने से पहले निर्णय चुनें

एनआईएसटी AI आरएमएफ का माप फ़ंक्शन प्रलेखित परीक्षण सेट, मेट्रिक्स, अनिश्चितता और तैनाती जैसी स्थितियों में मूल्यांकन की मांग करता है। यह एक माप ढांचा प्रदान करता है, न कि किसी निर्धारित विजेता या AI उत्पाद का प्रमाणन। NIST AI RMF: Measure

नई पद्धति अपनाने का अपना नियम लिखें। उदाहरण के लिए: आवश्यकताओं के विश्लेषण में समीक्षा वाले वर्कफ़्लो का उपयोग तभी करें जब वह समान खर्च सीमा में अधिक महत्वपूर्ण चूक खोजे और तय प्रतीक्षा अवधि से अधिक समय न ले। यह आपके प्रयोग के लिए एक सुझाया गया नियम है। मॉडल के उत्तर देने से पहले ठोस उदाहरण लिखकर तय करें कि कौन-सी चूक महत्वपूर्ण मानी जाएगी।

तथ्यात्मक शुद्धता को पूर्णता, उपयोगिता और शैली से अलग करें। एक परिष्कृत प्रतिक्रिया जो किसी बाधा का आविष्कार करती है, उसे तथ्यात्मक जांच में विफल होना चाहिए, भले ही समीक्षक उसके लहजे को पसंद करते हों। ओपन-एंडेड कार्यों के लिए, विशिष्ट उदाहरणों के साथ एक संक्षिप्त रूब्रिक का उपयोग करें और मानव समीक्षकों के बीच असहमति को रिकॉर्ड करें। जजों के बीच सहमति अपने आप में निरीक्षण करने की चीज है, मानने की नहीं।

समान कार्यों की जोड़ी बनाकर बजट नियंत्रित करें

वास्तविक कार्य से एक नमूना बनाएं: सामान्य कार्य, कठिन मामले, अस्पष्ट अनुरोध और अनुपलब्ध जानकारी वाले उदाहरण। ट्यूनिंग संकेतों के लिए एक अलग सेट रखें। प्रत्येक मूल्यांकन कार्य को समान स्रोत सामग्री के साथ दोनों वर्कफ़्लो के माध्यम से चलाएँ। स्कोरर्स से वर्कफ़्लो नाम छुपाएं और उत्तर क्रम को यादृच्छिक करें ताकि स्थिति और ब्रांडिंग तुलना का निर्णय न करें।

कार्य सेट में प्रत्येक वर्कफ़्लो के लिए समान कुल खर्च सीमा और समान पूर्णता समय सीमा का उपयोग करें। लेखांकन में प्रत्येक जनरेशन, समन्वय चरण, पुनः प्रयास और टूल कॉल को शामिल करें। एकल-एजेंट बेसलाइन के पास उचित संकेत और समान प्रासंगिक जानकारी तक पहुंच होनी चाहिए। केवल अंतिम उत्तर को गिनते समय एक तरफ अतिरिक्त प्रयास करने से तुलना विफल हो जाती है।

समान खर्च सीमा के लिए अप्रयुक्त बजट बर्बाद करने की आवश्यकता नहीं है। वास्तविक खर्च को रिकॉर्ड करें, और पूर्वनिर्धारित करें कि जब वर्कफ़्लो अपनी सीमा तक पहुँच जाता है तो क्या होता है: एक अधूरा कार्य दृश्यमान रहना चाहिए। आप लागत का अनुमान लगाने के लिए एक अलग समान-गुणवत्ता तुलना भी चला सकते हैं, लेकिन इसके परिणाम को समान-बजट प्रयोग के साथ न मिलाएं।

एक छोटे नमूने को अनिश्चितता अंतराल की आवश्यकता होती है

NIST द्विपद अनुपात के लिए Wilson अंतराल का वर्णन करता है। 100 स्वतंत्र, प्रतिनिधि परीक्षणों में 95 सफलताओं की हमारी गणना, z = 1.9599639845 का उपयोग करके 88.82%–97.85% का 95% विश्वास अंतराल देती है। ये समझाने के लिए दिए गए अवलोकन हैं, Colay के माप नहीं। NIST: Confidence intervals for proportions

अंतराल नमूना धारणाओं के तहत परिभाषित कार्य जनसंख्या की सफलता दर से संबंधित है। यह संभावना नहीं है कि कोई विशेष उत्तर सही है। यह पक्षपाती नमूने की मरम्मत भी नहीं कर सकता। एक दस्तावेज़ से लगभग समान अनुरोधों को दोहराने से निर्भरता पैदा हो सकती है, और केवल आसान ड्राफ्ट का परीक्षण करना जटिल विश्लेषण के बारे में बहुत कम कहता है।

यह घोषणा न करें कि 95% देखा गया स्कोर 95% विश्वसनीय उत्पाद साबित होता है। दिनांक, मॉडल संस्करण, संकेत, कार्य चयन, बहिष्करण, स्कोरिंग नियम और बजट रिकॉर्ड करें। एक बदला हुआ मॉडल या एक नया कार्य मिश्रण पुराने अनुमान को अगले महीने के लिए खराब मार्गदर्शक बना सकता है।

केवल दो प्रतिशत नहीं, बल्कि युग्मित परिणाम पढ़ें

उन्हीं 100 कार्यों पर एक और स्पष्ट रूप से काल्पनिक परिणाम मानें: दोनों वर्कफ़्लो 89 पर सफल हैं, केवल Consensus 6 पर सफल है, केवल एकल-एजेंट वर्कफ़्लो 1 पर सफल है और दोनों 4 पर विफल हैं। कुल सफलताएँ 95 और 90 हैं। युग्मित अंतर पाँच कार्यों का है, लेकिन सबसे उपयोगी अवलोकन वे सात मामले हैं जहाँ दोनों वर्कफ़्लो के परिणाम अलग हैं।

इस कल्पित तालिका में द्विपक्षीय सटीक McNemar परीक्षण उन सात युग्मों पर आधारित है जिनके परिणाम अलग हैं। जीत की समान संभावना मानने पर p-मूल्य 2 × (1 + 7) ÷ 128 = 0.125 है। यह पहले से चुनी गई 0.05 सीमा तक नहीं पहुँचता। इससे समतुल्यता सिद्ध नहीं होती; यह दिखाता है कि दिख रही बढ़त के लिए और साक्ष्य चाहिए। अलग-अलग विश्वास अंतरालों का एक-दूसरे से ओवरलैप होना युग्मित विश्लेषण का विकल्प नहीं है।

100 कार्यों पर काल्पनिक युग्मित परिणाम
परिणामकार्य
दोनों पास89
केवल Consensus पास होता है6
केवल एकल-एजेंट पास1
दोनों विफल4

निष्कर्षों को एक सीमित परिचालन नियम में बदलें

प्रत्येक प्रतिगमन का निरीक्षण करें। एक वर्कफ़्लो जो कई कम प्रभाव वाले ड्राफ्ट में सुधार करता है लेकिन एक गंभीर तथ्यात्मक विफलता पेश करता है वह आपके अपनाने के नियम को पूरा नहीं कर सकता है। नए कार्यों के साथ आशाजनक श्रेणियों का विस्तार करें, और एक होल्डआउट सेट रखें जिसमें संकेतों को आकार न दिया गया हो। बार-बार परिणामों का निरीक्षण करना और पहले आकर्षक स्कोर पर रुकना स्पष्ट लाभ को बढ़ा-चढ़ाकर पेश कर सकता है।

Colay Consensus में, एजेंट अनुरोध पर चर्चा करते हैं और एक समन्वय एजेंट एक निष्कर्ष का संश्लेषण करता है। उस अंतिम सुपुर्दगी और उसे सत्यापित करने के लिए आवश्यक प्रयास का मूल्यांकन करें। क्रेडिट रिकॉर्ड करें क्योंकि Colay सदस्यता में क्रेडिट और सीमाएं होती हैं। केवल वही प्रकाशित करें जो आपका परीक्षण समर्थन करता है: नमूना किए गए कार्य, परीक्षण किया गया कॉन्फ़िगरेशन, देखे गए ट्रेड-ऑफ़ और अनिश्चितता। इस उदाहरण में से कोई भी मापा गया Colay बेंचमार्क स्थापित नहीं करता है।

स्रोत और कार्यप्रणाली

  1. NIST AI RMF: Measure

    मूल्यांकन ढांचा।

  2. NIST: Confidence intervals for proportions

    विल्सन अंतराल विधि।

अपना अगला सवाल Colay में पूछें

एक मॉडल चुनें, Auto का उपयोग करें, या Consensus के साथ कई दृष्टिकोण एक साथ लाएं।

Colay खोलें