Colay / मार्गदर्शिकाएँ

अधिक AI प्रतिभागी सुरक्षा सीमा नहीं बनाते हैं

एजेंट को एक ही दस्तावेज़ में उपयोगी साक्ष्य और दुर्भावनापूर्ण निर्देश मिल सकते हैं। अतिरिक्त समीक्षक संदिग्ध सामग्री पहचानने में मदद कर सकते हैं, लेकिन उसे दोहराए जाने के अवसर भी बढ़ाते हैं। सुरक्षित वर्कफ़्लो में स्पष्ट नियम चाहिए कि कौन-सी सामग्री उत्तर के लिए जानकारी दे सकती है और कौन किसी कार्रवाई की अनुमति दे सकता है। आपसी सहमति वह अनुमति नहीं बन जाती।

बाहरी शोध परिणाम और उदाहरणात्मक गणना Colay प्रदर्शन का माप नहीं हैं।

शोध ने वास्तव में क्या प्रदर्शित किया

AgentPoison (2024) ने तीन एजेंट सेटिंग्स में विषाक्त दीर्घकालिक स्मृति और पुनर्प्राप्ति भंडार का अध्ययन किया। हमले के लिए किसी मॉडल फाइन-ट्यूनिंग की आवश्यकता नहीं थी। यह एक पुनर्प्राप्ति विश्वास समस्या को प्रदर्शित करता है, न कि Colay में मापी गई भेद्यता को। AgentPoison, NeurIPS 2024

Agent Smith (ICML 2024) ने यादृच्छिक जोड़ीवार चैट के साथ अधिकतम दस लाख LLaVA-1.5 एजेंटों का सिमुलेशन किया। एक प्रतिकूल छवि हानिकारक व्यवहार फैला सकती थी। यह विशिष्ट सिमुलेशन किसी भी उत्पादन प्रणाली के लिए सामान्य संक्रमण दर स्थापित नहीं करता। Agent Smith, ICML 2024

OWASP LLM01:2025 सीधे और अप्रत्यक्ष प्रॉम्प्ट इंजेक्शन में अंतर करता है और कई स्तरों पर सुरक्षा उपाय सुझाता है। यह दावा नहीं करता कि एक और मॉडल जोड़ने या केवल सिस्टम प्रॉम्प्ट पर निर्भर रहने से समस्या समाप्त हो जाती है। OWASP LLM01:2025 Prompt Injection

व्यावहारिक निहितार्थ जानकारी द्वारा अपनाए गए पथ की जांच करना है। एक संदिग्ध निर्देश एक उद्धरण के रूप में दर्ज हो सकता है, एक एजेंट का सारांश बन सकता है, और बाद में एक विश्वसनीय भागीदार की सिफारिश के रूप में दिखाई दे सकता है। अंतर्निहित अनुरोध जीवित रहने पर शब्द बदल सकते हैं। सामग्री के मूल और अनुमत उपयोग की समीक्षा करें, न कि केवल अंतिम वक्ता की पहचान की।

एक हानिरहित समीक्षा कई विश्वास सीमाओं को पार कर सकती है

आपूर्तिकर्ता प्रस्तावों की समीक्षा करने वाली एक टीम की कल्पना करें। एक प्रस्ताव में वह पाठ है जो समीक्षकों के कार्य को बदलने का प्रयास करता है। एक शोध एजेंट दस्तावेज़ का सारांश प्रस्तुत करता है; एक अन्य एजेंट उस सारांश की आलोचना करता है; एक समन्वयक अनुशंसा एकत्र करता है। यह एक काल्पनिक रक्षात्मक परिदृश्य है. उनमें से किसी भी स्थानांतरण को आपूर्तिकर्ता-लिखित निर्देशों को उपयोगकर्ता के निर्देशों में नहीं बदलना चाहिए।

एक उपयोगी समीक्षा रिकॉर्ड निकाले गए दावे के साथ स्रोत अंश को रखता है। अगले प्रतिभागी को दस्तावेज़ के दावे को समीक्षक के अनुमान और उपयोगकर्ता के वास्तविक अनुरोध से अलग करने में सक्षम होना चाहिए। यदि संक्षेपण उस अंतर को हटा देता है, तो समन्वयक बार-बार दोहराई गई सामग्री को पुष्टिकरण के रूप में मान सकता है, भले ही प्रत्येक पुनरावृत्ति का एक ही अविश्वसनीय मूल हो।

समस्या तब और अधिक महत्वपूर्ण हो जाती है जब कोई वर्कफ़्लो संदेश भेज सकता है, साझा रिकॉर्ड संपादित कर सकता है, या टूल लागू कर सकता है। पाठ तैयार करना और बाहरी कार्रवाई को अधिकृत करना अलग-अलग निर्णय हैं। यहां तक कि एक अच्छी तरह से समर्थित अनुशंसा को भी केवल इसलिए अतिरिक्त अनुमतियां प्राप्त नहीं करनी चाहिए क्योंकि कई प्रतिभागियों ने इसे दोहराया है।

मानचित्रित करें कि प्रत्येक प्रतिभागी क्या पढ़ और बदल सकता है

आपके द्वारा संचालित वर्कफ़्लो के लिए, एक छोटा नक्शा बनाएं: बाहरी दस्तावेज़, पुनर्प्राप्ति स्टोर, प्रतिभागी, साझा नोट्स, समन्वयक और संभावित बाहरी क्रियाएं। चिह्नित करें कि जानकारी एक क्षेत्र से दूसरे क्षेत्र में कहां पहुंचती है। फिर पूछें कि इसके साथ कौन से साक्ष्य यात्रा करते हैं, कौन सा घटक अनुमतियों की जांच करता है, और क्या कोई भागीदार अपनी निर्दिष्ट भूमिका के बाहर अनुरोध पारित कर सकता है।

समीक्षा कार्य को निरीक्षण के लिए पर्याप्त संकीर्ण रखें। अंकगणित की जाँच करने वाले एक प्रतिभागी को प्रासंगिक मात्राओं और इकाइयों की आवश्यकता होती है; इसे हर अनुलग्नक या मेलबॉक्स तक पहुंच की आवश्यकता नहीं हो सकती है। यह अनावश्यक जोखिम को कम करने के लिए एक प्रस्तावित डिज़ाइन सिद्धांत है। यह इस बारे में कोई दावा नहीं है कि Colay वर्तमान में कौन सा नियंत्रण लागू करता है या किसी विशेष प्रदाता के अलगाव के बारे में है।

अपने स्वयं के एजेंट वर्कफ़्लो की समीक्षा के लिए प्रश्न
सीमाउत्तर देने योग्य प्रश्न
दस्तावेज़ → प्रतिभागीक्या स्रोत पाठ कार्य निर्देशों से अलग है?
प्रतिभागी → समन्वयकक्या प्रत्येक महत्वपूर्ण दावे के मूल का पता लगाया जा सकता है?
समन्वयक → बाहरी कार्रवाईकार्रवाई और उसके दायरे को अलग से कौन अधिकृत करता है?
वर्तमान कार्य → सहेजा गया संदर्भकौन सी सामग्री बाद के कार्य में बनी रह सकती है?

असली गोपनीय जानकारी का उपयोग किए बिना सुरक्षा सीमाओं का परीक्षण करें

सिंथेटिक दस्तावेज़ों और हानिरहित कैनरी मूल्यों के साथ नियंत्रित अभ्यास का उपयोग करें। उस व्यवहार को परिभाषित करें जो अपरिवर्तित रहना चाहिए, जैसे चयनित मूल्यांकन मानदंड या अनुमत आउटपुट गंतव्य। इसमें परिवर्तन करें कि कोई संदिग्ध अंश सीधे, उद्धरण के अंदर या सारांश में प्रकट होता है या नहीं। लक्ष्य सीमा प्रबंधन का निरीक्षण करना है, न कि वास्तविक ग्राहक रिकॉर्ड को उजागर करना।

केवल अंतिम उत्तर स्वीकार्य दिखता है या नहीं, इसी आधार पर मूल्यांकन न करें। जाँचें कि प्रतिभागियों ने मूल कार्य का पालन किया, स्रोतों का पता बनाए रखा, अनधिकृत कार्रवाइयाँ माँगीं या अवांछित निर्देश आगे के संदर्भ में पहुँचाए। परीक्षण के सटीक विन्यास और विफलताओं को दर्ज करें। छोटे अभ्यास में साफ़ परिणाम उन्हीं मामलों का साक्ष्य है; यह हर संभव इंजेक्शन से सुरक्षा का प्रमाण नहीं है।

विश्लेषण के रूप में Consensus का उपयोग करें, फिर निर्णय को सत्यापित करें

Colay Consensus एजेंटों को एक अनुरोध पर चर्चा करने देता है और एक समन्वय एजेंट को एक निष्कर्ष को संश्लेषित करने का कार्य देता है। यह सहयोग वर्कफ़्लो का वर्णन करता है, सुरक्षा प्रमाणीकरण का नहीं। जब सामग्री अविश्वसनीय हो, तो स्रोत से जुड़े दावों के लिए पूछें और अंतिम निर्णय को किसी भी परिणामी बाहरी कार्रवाई से अलग रखें। उपलब्ध नियंत्रणों के लिए वर्तमान उत्पाद दस्तावेज़ की जाँच करें।

यदि ऐसा प्रतीत होता है कि कोई चर्चा किसी दस्तावेज़ के निर्देशों को प्राप्त करती है, तो उस परिणाम का उपयोग करना बंद कर दें, मूल अनुच्छेद की पहचान करें, और जहां उपयुक्त हो, एक स्वच्छ कार्य संदर्भ के साथ समीक्षा दोहराएं। अतिरिक्त राउंड अकेले ही उसी संदूषण को दोहरा सकते हैं। Colay सदस्यताएं क्रेडिट और सीमा का उपयोग करती हैं, इसलिए अधिक समीक्षा में उपयोग सीमा भी खर्च होता है; इसे एक विशिष्ट चेक खरीदना चाहिए जिसके परिणाम का आप निरीक्षण कर सकें।

स्रोत और कार्यप्रणाली

  1. AgentPoison, NeurIPS 2024

    स्मृति और पुनर्प्राप्ति विषाक्तता।

  2. Agent Smith, ICML 2024

    सिम्युलेटेड मल्टीमॉडल एजेंट इंटरैक्शन।

  3. OWASP LLM01:2025 Prompt Injection

    प्रॉम्प्ट इंजेक्शन के जोखिम पर मार्गदर्शन।

अपना अगला सवाल Colay में पूछें

एक मॉडल चुनें, Auto का उपयोग करें, या Consensus के साथ कई दृष्टिकोण एक साथ लाएं।

Colay खोलें