Colay / मार्गदर्शिकाएँ
अपने उत्पाद के वास्तविक प्रॉम्प्ट पर AI मॉडल की तुलना करें
मूल्यांकन पाइपलाइन बनाने से पहले, आप Colay में एक छोटी, संरचित तुलना चला सकते हैं। उपलब्ध एजेंटों को समान अनुमत इनपुट दें, उनके अलग-अलग उत्तरों का निरीक्षण करें और रिकॉर्ड करें कि वे किन आवश्यकताओं को पूरा करते हैं। यह बिना कोड लिखे या प्रदाता एपीआई कुंजी की आपूर्ति के एक व्यावहारिक पहली स्क्रीनिंग है; यह कोई स्वचालित बेंचमार्क रनर या प्रमाण नहीं है कि मॉडल आपके उत्पाद में समान व्यवहार करेगा।
किसी सुविधा को परीक्षण योग्य मामलों में बदलें
उस आउटपुट से शुरुआत करें जिसकी आपके उपयोगकर्ता को ज़रूरत है, किसी मॉडल लीडरबोर्ड से नहीं। यदि सुविधा क्रिया आइटम निकालती है, तो सफलता का अर्थ है अज्ञात फ़ील्ड को अज्ञात छोड़ते हुए सही स्वामी, कार्य और समय सीमा को संरक्षित करना। एक सुंदर सारांश जो एक समय सीमा का आविष्कार करता है उसे उस मामले में असफल होना चाहिए।
एक उदाहरणात्मक प्रारंभिक सेट के रूप में, 12 अनुमत उदाहरण तैयार करें: 4 सामान्य इनपुट, 4 अस्पष्ट इनपुट और 4 एज केस। ये संख्याएँ एक प्रबंधनीय अभ्यास हैं, न कि सांख्यिकीय रूप से मान्य नमूना आकार। व्यक्तिगत और गोपनीय जानकारी हटा दें जिसे साझा करने के लिए आप अधिकृत नहीं हैं। प्रत्येक मामले के साथ अपेक्षित परिणाम या स्पष्ट स्वीकृति नियम रखें।
एक तुलना चलाएं जिसकी आप व्याख्या कर सकें
एंथ्रोपिक की मूल्यांकन मार्गदर्शिका किसी कार्य को उस कार्य के बार-बार किए गए परीक्षणों से अलग करती है क्योंकि आउटपुट भिन्न हो सकते हैं। यह लेख मैन्युअल स्क्रीनिंग अभ्यास में उस बुनियादी अंतर को लागू करता है। कुछ साफ़ उत्तर उत्पादन विफलता दर स्थापित नहीं कर सकते।
एक मॉडल के विफल हो जाने के बाद केवल दूसरे मॉडल को सुधारा हुआ प्रॉम्प्ट न दें। प्रॉम्प्ट सुधारना हो तो नया संस्करण बनाकर सभी उम्मीदवार मॉडल पर दोबारा चलाएँ। वरना तुलना में मॉडल के साथ निर्देश भी बदल रहे होंगे।
- वर्तमान कैटलॉग से उम्मीदवार एजेंटों को स्पष्ट रूप से चुनें। जब आपको यह जानना हो कि किस उम्मीदवार ने उत्तर दिया है तो Auto का उपयोग न करें।
- काम का विवरण, स्रोत सामग्री और माँगा गया प्रारूप एक जैसा रखें। शुरुआती उत्तरों के लिए Ask separately का उपयोग करें और उनके लेबल सुरक्षित रखें।
- तिथि, प्रदर्शित एजेंट का नाम, प्रॉम्प्ट संस्करण और कोई भी दृश्यमान सेटिंग रिकॉर्ड करें। ग़लत उत्तरों से छूटे हुए उत्तरों को अलग से नोट करें।
- गद्य गुणवत्ता की तुलना करने से पहले नियमों के अनुसार प्रत्येक परिणाम की समीक्षा करें। महत्वपूर्ण या अस्पष्ट मामलों को दोहराएं और विफलताओं सहित हर प्रयास को बरकरार रखें।
उदाहरण: मीटिंग नोट से कार्रवाई आइटम
काल्पनिक इनपुट: "मीरा मंगलवार को ड्राफ्ट भेजेगी। मूल्य निर्धारण की समीक्षा के लिए टीम को अभी भी एक मालिक की आवश्यकता है।" वांछित परिणाम में एक असाइन किया गया कार्य और एक न सौंपा गया कार्य शामिल है। यह मीरा को दोनों नहीं सौंपता है या मूल्य निर्धारण की समीक्षा के लिए कोई तारीख नहीं खोजता है।
उपयोगी तैयार दस्तावेज़ एक केस शीट है, न कि सबसे अच्छे उत्तर का स्क्रीनशॉट। प्रत्येक पंक्ति में सटीक लौटाया गया पाठ संलग्न करें ताकि टीम का कोई साथी आपके स्कोर को चुनौती दे सके। फ़ॉर्मेटिंग विफलता को तथ्यात्मक विफलता से अलग रखें: एक ठीक करने योग्य तालिका लेआउट और एक आविष्कृत प्रतिबद्धता के अलग-अलग परिणाम होते हैं।
| चेक करें | पास की स्थिति | दर्ज की जाने वाली विफलता |
|---|---|---|
| जिम्मेदार व्यक्ति | मीरा केवल ड्राफ्ट वाले कार्य की जिम्मेदार है | बिना साक्ष्य के मूल्य निर्धारण समीक्षा सौंपी गई |
| समयसीमा | मंगलवार ड्राफ्ट की समय-सीमा है | मूल्य निर्धारण की समय सीमा का आविष्कार किया गया |
| अज्ञात फ़ील्ड | मूल्य निर्धारण स्वामी अज्ञात है | छूटी हुई जानकारी चुपचाप भर दी गई |
| प्रयोज्यता | दोनों कार्य अनुरोधित संरचना में दिखाई देते हैं | कार्य छोड़ दिया गया या प्रारूप अनुपयोगी है |
स्क्रीनिंग रन के लिए एक संकेत
मूल्यांकन निर्देश एक अलग चेकलिस्ट में रखें जिन्हें आप उत्तर पर लागू करते हैं। आप किसी अन्य एजेंट से संभावित त्रुटियों की पहचान करने के लिए कह सकते हैं, लेकिन उसका निर्णय निरीक्षण के लिए एक और आउटपुट है। Consensus पहली तुलना के बाद देखे गए ट्रेडऑफ़ को संक्षेप में प्रस्तुत करने में मदद कर सकती है; स्पष्ट रूप से लेबल किए गए परिणाम और अपने स्कोर प्रदान करें।
आपूर्ति किए गए मीटिंग नोट से कार्रवाई आइटम निकालें: [अनुमत नोट]। कार्य, स्वामी, समय सीमा और सहायक अंश के साथ एक तालिका लौटाएँ। केवल दिए गए पाठ का उपयोग करें. किसी अनिर्दिष्ट स्वामी या समय सीमा के लिए अज्ञात लिखें। किसी सुझाव को सहमत प्रतिबद्धता में न बदलें। अनसुलझे प्रश्नों को अलग से सुरक्षित रखें। इनपुट आईडी: [केस आईडी]।
अगले परीक्षण के लिए शॉर्टलिस्ट का उपयोग करें
हर उम्मीदवार मॉडल के सफल मामलों, गंभीर विफलताओं और अनुत्तरित प्रश्नों का सार लिखें। किसी मॉडल को सूची में तभी रखें जब उसका व्यवहार सुविधा की न्यूनतम आवश्यकताओं से मेल खाता हो। कोई उपयुक्त न हो तो विजेता चुनने से पहले सुविधा का दायरा घटाएँ या दी गई संदर्भ सामग्री सुधारें।
एकीकरण के परीक्षण में वास्तविक मॉडल एंडपॉइंट, टूल एक्सेस, सिस्टम निर्देश, विलंबता, उपयोग की लागत और विफलता से निपटने का तरीका अलग से जाँचना होगा। Colay के क्रेडिट उस API कार्यभार की कीमत नहीं बताते। Colay में एक वास्तविक, पहचान-मुक्त मामले से शुरू करें जिसे आप स्वयं जाँच सकें; तुलना से उम्मीदवारों की सूची बदलती हो तभी परीक्षण बढ़ाएँ।
आपके सवालों के जवाब
क्या मैं एपीआई कुंजियों के बिना मॉडलों की तुलना कर सकता हूं?
हां, Colay में अंतिम-उपयोगकर्ता तुलना के लिए। उन मॉडलों को अपने उत्पाद में बनाना अपनी पहुंच, शर्तों और लागतों के साथ एक अलग एकीकरण है।
क्या यह सांख्यिकीय रूप से विश्वसनीय बेंचमार्क है?
नहीं. एक छोटा सा मैनुअल अभ्यास ठोस व्यवहार और विफलताओं को प्रकट करता है। व्यापक दावों के लिए प्रतिनिधि मामलों, बार-बार परीक्षण और निर्णय के लिए उपयुक्त मूल्यांकन डिजाइन की आवश्यकता होती है।
क्या मुझे विजेता चुनने के लिए Consensus का उपयोग करना चाहिए?
पहले अपने स्वीकृति नियमों के अनुसार अलग-अलग आउटपुट स्कोर करें। अपने मूल परिणामों और मानवीय निर्णय को दृश्यमान रखते हुए, साक्ष्यों को व्यवस्थित करने के लिए संश्लेषण का उपयोग करें।
स्रोत और कार्यप्रणाली
- Anthropic — Demystifying evals for AI agents
कार्यों और बार-बार किए गए परीक्षणों के बीच अंतर के लिए प्राथमिक इंजीनियरिंग मार्गदर्शन। यह Colay का मूल्यांकन नहीं करता है या उदाहरण नमूना आकार को मान्य नहीं करता है।
अपना अगला सवाल Colay में पूछें
एक मॉडल चुनें, Auto का उपयोग करें, या Consensus के साथ कई दृष्टिकोण एक साथ लाएं।