Colay / मार्गदर्शिकाएँ

AI समीक्षा का एक अतिरिक्त दौर कब इसकी लागत के लायक है?

उपयोगी लागत का प्रश्न यह नहीं है कि कोई एजेंट कितने सस्ते में उत्तर दे सकता है। यह है कि आप स्वीकार्य परिणाम प्राप्त करने के लिए कितना खर्च करते हैं। लंबी चर्चा सार्थक हो सकती है जब यह महंगे पुनर्कार्य को रोकती है, फिर भी जब यह उस मसौदे को दोहराती है जो पहले से ही काफी अच्छा था तब बेकार हो जाता है। उस निर्णय से शुरुआत करें जिसमें आपको सुधार करने की आवश्यकता है।

बाहरी शोध परिणाम और उदाहरणात्मक गणना Colay प्रदर्शन का माप नहीं हैं।

शोध लागत और लाभ के बीच संतुलन दिखाता है, हर स्थिति में छूट नहीं

FrugalGPT (2023), तालिका 3, GPT-4 सटीकता से मेल खाते हुए HEADLINES पर 98.3% लागत बचत की रिपोर्ट करती है। इसने यादृच्छिक ट्रेन/परीक्षण विभाजन का उपयोग करके तीन मॉडलों तक के कैस्केड सीखे। यह ऐतिहासिक कार्य-विशिष्ट परिणाम चयनात्मक वृद्धि से संबंधित है, न कि बहु-एजेंट चर्चा से। FrugalGPT, 2023, Table 3

RouteLLM v4 (2025) की तालिकाएँ 1 और 6, MT Bench पर 3.66 लागत-बचत अनुपात बताती हैं: स्कोर 8.8, जबकि GPT-4 का स्कोर 9.3 था। रूटिंग में GPT-4-1106-preview और Mixtral-8x7B का उपयोग ऐतिहासिक टोकन कीमतों की धारणाओं के साथ किया गया। बताया गया 95% सापेक्ष बेंचमार्क स्कोर है, उत्तरों की शुद्धता नहीं। RouteLLM, ICLR 2025, Tables 1 and 6

ये प्रत्येक प्रतिभागी से उत्तर देने और फिर बहस करने के लिए अलग-अलग हस्तक्षेप हैं। अपने वर्कफ़्लो के लिए, विकल्पों की अलग-अलग तुलना करें: एक उत्तर, लक्षित जाँच वाला एक उत्तर, चयनात्मक वृद्धि और एक पूर्ण चर्चा। अन्यथा एक सस्ता मॉडल चुनने से होने वाले लाभ को गलती से सहयोग के लिए श्रेय दिया जा सकता है, या एक उपयोगी समीक्षा को खारिज कर दिया जा सकता है क्योंकि इसकी पहली प्रतिक्रिया की लागत अधिक है।

एक छोटा निर्णय मॉडल बनाएं

हमारा उदाहरणात्मक मॉडल कुल अपेक्षित लागत = निष्पादन लागत + त्रुटि संभावना × त्रुटि का परिणाम है। यह जानबूझकर कई वास्तविक विवरण छोड़ देता है ताकि ब्रेक-ईवन स्थिति दिखाई दे। नीचे दी गई संख्याएँ आविष्कृत शिक्षण इनपुट हैं, जिन्हें अंकगणित के लिए डॉलर में व्यक्त किया गया है। वे Colay कीमतें नहीं हैं, मापी गई Colay त्रुटि दरें, या आपके काम के अनुमान नहीं हैं।

मान लें कि एकल-उत्तर वर्कफ़्लो की लागत $0.02 है और इसमें 12% त्रुटि की संभावना है। मान लें कि एक समीक्षा किए गए वर्कफ़्लो की लागत $0.08 है और इसमें 8% त्रुटि की संभावना है। यदि किसी त्रुटि के कारण $5 को दोबारा काम करना पड़ता है, तो अपेक्षित लागत $0.02 + 0.12 × $5 = $0.62 और $0.08 + 0.08 × $5 = $0.48. इन धारणाओं के तहत, समीक्षा प्रति कार्य $0.14 बचाती है।

अतिरिक्त निष्पादन लागत $0.06 है और अनुमानित त्रुटि में कमी 0.04 है। इसलिए ब्रेक-ईवन पुनः कार्य लागत $0.06 ÷ 0.04 = $1.50 प्रति त्रुटि है। उस सीमा के नीचे, सस्ता वर्कफ़्लो इस सरलीकृत मॉडल में जीतता है। यदि समीक्षा त्रुटियों को बिल्कुल भी कम नहीं करती है, तो यह गणना इसके लिए भुगतान करने के लिए कोई त्रुटि-रोकथाम लाभ प्रदान नहीं करती है।

काल्पनिक अपेक्षित लागत; Colay की दर या बेंचमार्क नहीं
वर्कफ़्लोनिष्पादनप्रति त्रुटि $5 पर अपेक्षित पुनर्कार्यकुल
एकल उत्तर$0.02$0.60$0.62
समीक्षित उत्तर$0.08$0.40$0.48

कल्पित मानों की जगह वास्तविक अवलोकन रखें

सबसे कठिन संख्या आमतौर पर त्रुटि संभावना में परिवर्तन है। इससे यह अनुमान न लगाएं कि संशोधित उत्तर कितना प्रेरक लगता है। दोनों वर्कफ़्लो को समान प्रतिनिधि कार्यों पर चलाएँ, वर्कफ़्लो को प्रकट किए बिना अंतिम परिणाम स्कोर करें, और उन सुधारों को रिकॉर्ड करें जो किसी को वास्तव में करने थे। अनिश्चित मामलों को चुपचाप सफलताओं के रूप में गिनने के बजाय उन्हें दृश्यमान रखें।

कार्य श्रेणी के आधार पर परिणामों का अनुमान लगाएं। एक निजी ड्राफ्ट में गलत शीर्षक और परिचालन योजना में गलत मात्रा के लिए अलग-अलग मरम्मत की आवश्यकता होती है। समीक्षक का समय, प्रतीक्षा समय, बार-बार प्रयास और डाउनस्ट्रीम सुधार प्रयास रिकॉर्ड करें। कुछ परिणामों को एक सट्टा मौद्रिक संख्या में संपीड़ित करने के बजाय स्पष्ट बाधाओं और विशेषज्ञ समीक्षा के माध्यम से नियंत्रित किया जाना चाहिए।

समीक्षा का प्रयास वहाँ लगाएँ जहाँ परिणाम बदल सकता है

चर्चा शुरू करने से पहले, किसी अनसुलझे मुद्दे का नाम बताएं। किसी प्रस्ताव के लिए, यह एक लुप्त निर्भरता हो सकती है। गणना के लिए, यह एक इकाई रूपांतरण हो सकता है। अतिरिक्त भागीदार को एक चेक दें जो निर्णय बदल सकता है और पूछें कि कौन से सबूत उस बदलाव को उचित ठहराएंगे। उत्तर को बेहतर बनाने के अनुरोध का मूल्यांकन करना बहुत कठिन है।

रोकने का नियम पहले से निर्धारित करें: जब बताई गई स्वीकृति जांच पास हो जाए तो समाप्त करें, जब कोई महत्वपूर्ण असहमति बनी रहे तो किसी व्यक्ति को आगे बढ़ाएं, और समकक्ष तर्क दोहराना बंद करें। कोई प्रतिक्रिया अधिक उपयोगी बने बिना लंबी हो सकती है। प्रतिक्रिया गुणवत्ता के साथ-साथ बजट की प्रति इकाई स्वीकृत डिलिवरेबल्स को ट्रैक करें, ताकि प्रेजेंटेशन पॉलिश पूरे उपयोग सीमा को अवशोषित न कर सके।

इस गणना को Colay के उपयोग पर लागू करें

Colay Consensus में एजेंट एक अनुरोध पर चर्चा करते हैं, इससे पहले कि एक समन्वयकारी एजेंट निष्कर्ष को संश्लेषित करता है। Colay सदस्यताएं क्रेडिट और सीमा का उपयोग करती हैं। आपके चुने हुए मॉडल और वर्कफ़्लो द्वारा उपभोग किए गए वास्तविक क्रेडिट को मापें; काल्पनिक डॉलर उदाहरण को Colay संदेशों की वादा की गई संख्या में अनुवाद न करें। सामान्य सप्ताह का अनुमान लगाते समय असफल प्रयासों को शामिल करें।

एक साधारण साप्ताहिक खाता रखें: कार्य प्रकार, चयनित वर्कफ़्लो, खर्च किए गए क्रेडिट, मानव सुधार समय, और क्या आउटपुट इसकी आवश्यकताओं को पूरा करता है। पर्याप्त तुलनीय उदाहरणों के बाद, उन श्रेणियों के लिए चर्चा आरक्षित करें जहां यह अपना अतिरिक्त प्रयास अर्जित करता है। जब मॉडल, कार्य, या सदस्यता शर्तें बदलती हैं तो उस विकल्प को दोबारा जांचें। परिणाम यह दावा करने के बजाय एक व्यावहारिक व्यय नियम है कि अधिक एजेंट हमेशा सस्ते या हमेशा बेहतर होते हैं।

स्रोत और कार्यप्रणाली

  1. FrugalGPT, 2023, Table 3

    ऐतिहासिक कैस्केड प्रयोग।

  2. RouteLLM, ICLR 2025, Tables 1 and 6

    संस्करण 4; ऐतिहासिक रूटिंग प्रयोग.

अपना अगला सवाल Colay में पूछें

एक मॉडल चुनें, Auto का उपयोग करें, या Consensus के साथ कई दृष्टिकोण एक साथ लाएं।

Colay खोलें