Colay / الأدلة
لا يقوم المزيد من المشاركين في الذكاء الاصطناعي بإنشاء حدود أمنية
يمكن أن يواجه الوكيل أدلة مفيدة وتعليمات معادية في نفس المستند. قد تساعد إضافة المراجعين في الكشف عن المحتوى المشبوه، ولكنها أيضًا تخلق المزيد من الفرص لتكراره. يحتاج سير العمل الآمن إلى قواعد واضحة حول المواد التي يمكن أن توفر إجابة وأي الجهات الفاعلة يمكنها السماح بإجراء ما. اتفاق المشاركين لا يمنح هذا التفويض.
نتائج الأبحاث الخارجية والحسابات التوضيحية ليست قياسات لأداء Colay.
ما أظهره البحث بالفعل
درست AgentPoison (2024) تسميم الذاكرة طويلة الأمد ومخازن الاسترجاع في ثلاثة إعدادات للوكلاء. لم يتطلب الهجوم ضبطًا دقيقًا للنموذج. يوضح البحث مشكلة ثقة في الاسترجاع، لا ثغرة مقاسة في Colay. AgentPoison, NeurIPS 2024
حاكت Agent Smith (ICML 2024) ما يصل إلى مليون وكيل LLaVA-1.5 بمحادثات ثنائية عشوائية. استطاعت صورة عدائية نشر سلوك ضار. لا تثبت هذه المحاكاة المحددة معدل إصابة لأنظمة الإنتاج عمومًا. Agent Smith, ICML 2024
يميّز OWASP LLM01:2025 بين حقن التعليمات المباشر وغير المباشر، ويوصي بتخفيف المخاطر على عدة طبقات. ولا يدّعي أن إضافة نموذج آخر أو الاعتماد على تعليمات النظام وحدها يزيل المشكلة. OWASP LLM01:2025 Prompt Injection
المعنى العملي هو فحص معلومات المسار الذي تتخذه. يمكن أن تدخل التعليمات المشبوهة كاقتباس، وتصبح ملخصًا للوكيل، وتظهر لاحقًا كتوصية من مشارك يبدو موثوقًا به. قد تتغير الصياغة أثناء بقاء الطلب الأساسي. راجع أصل المحتوى والاستخدام المسموح به، وليس فقط هوية المتحدث الأخير.
يمكن للمراجعة غير الضارة أن تتجاوز عدة حدود ثقة
تخيل فريقًا يراجع عروض الموردين. يحتوي أحد الاقتراحات على نص يحاول تغيير مهمة المراجعين. يقوم وكيل الأبحاث بتلخيص الوثيقة؛ وكيل آخر ينتقد هذا الملخص؛ يقوم المنسق بتجميع التوصية. هذا سيناريو دفاعي افتراضي. ولا ينبغي لأي من عمليات النقل هذه أن تحول التعليمات الصادرة عن المورد إلى تعليمات من المستخدم.
يحتفظ سجل المراجعة المفيد بالمقطع المصدري إلى جانب الادعاء المستخرج منه. ينبغي للمشارك التالي أن يميّز بين ما تقوله الوثيقة واستنتاج المراجع وطلب المستخدم الفعلي. إذا أزال التلخيص هذا التمييز، فقد يعدّ المنسق تكرار المحتوى تأكيدًا له، مع أن جميع التكرارات ترجع إلى المصدر غير الموثوق نفسه.
تصبح المشكلة أكثر أهمية عندما يتمكن سير العمل من إرسال رسائل أو تحرير السجلات المشتركة أو استدعاء الأدوات. إن إنتاج النص والتفويض بإجراء خارجي هما قراران منفصلان. وحتى التوصية المدعومة جيدًا لا ينبغي أن تحصل على أذونات إضافية لمجرد أن العديد من المشاركين كرروها.
رسم خريطة لما يمكن لكل مشارك قراءته وتغييره
بالنسبة لسير العمل الذي تقوم بتشغيله، ارسم خريطة صغيرة: المستندات الخارجية، ومخازن الاسترجاع، والمشاركين، والملاحظات المشتركة، والمنسق، والإجراءات الخارجية المحتملة. حدد مكان انتقال المعلومات من منطقة إلى أخرى. ثم اسأل عن الدليل الذي ينتقل معه، وما هو المكون الذي يتحقق من الأذونات، وما إذا كان بإمكان المشارك تمرير طلب خارج الدور المعين له.
اجعل مهمة المراجعة ضيقة بما يكفي لفحصها. يحتاج المشارك الذي يقوم بفحص العمليات الحسابية إلى الكميات والوحدات ذات الصلة؛ قد لا يحتاج إلى كل مرفق أو الوصول إلى صندوق البريد. هذا هو مبدأ التصميم المقترح لتقليل التعرض غير الضروري. ولا يعد هذا ادعاءً بشأن عناصر التحكم التي يطبقها Colay حاليًا أو بشأن عزل أي مزود معين.
| الحدود | سؤال للإجابة |
|---|---|
| المستند ← المشارك | هل يمكن تمييز النص المصدر عن تعليمات المهمة؟ |
| مشارك ← منسق | هل يمكن إرجاع كل ادعاء مهم إلى أصله؟ |
| المنسق ← العمل الخارجي | من الذي يأذن بالإجراء ونطاقه بشكل منفصل؟ |
| المهمة الحالية ← السياق المحفوظ | ما هي المواد التي قد تستمر في مهمة لاحقة؟ |
اختبر الاحتواء دون التعامل مع أسرار حقيقية
استخدم تمرينًا مضبوطًا بوثائق مصطنعة وقيم اختبار غير ضارة. حدد السلوك الذي يجب أن يبقى ثابتًا، مثل معايير التقييم أو وجهة الإخراج المسموح بها. غيّر موضع المقطع المشبوه: مباشرة، أو داخل اقتباس، أو ضمن ملخص. الهدف مراقبة احترام حدود الثقة، لا كشف سجلات عملاء حقيقية.
يسجل أكثر مما إذا كانت الإجابة النهائية تبدو مقبولة. تحقق مما إذا كان المشاركون قد اتبعوا المهمة الأصلية، أو احتفظوا بالمصدر، أو طلبوا إجراءات غير مصرح بها، أو حملوا تعليمات غير مرغوب فيها في سياق لاحق. قم بتسجيل التكوين والفشل الذي تم اختباره بدقة. إن النتيجة الواضحة في تمرين صغير هي دليل على تلك الحالات، وليست دليلاً على أن النظام يقاوم كل حقنة ممكنة.
استخدم Consensus كتحليل، ثم تحقق من القرار
يتيح Colay Consensus للوكلاء مناقشة طلب، ويكلّف وكيلًا منسقًا بتوليف الخلاصة. هذا وصف لمسار التعاون، لا شهادة أمنية. إذا كانت المادة غير موثوقة، فاطلب ادعاءات مرتبطة بمصادرها وافصل القرار النهائي عن أي إجراء خارجي ذي عواقب. راجع وثائق المنتج الحالية لمعرفة وسائل الضبط المتاحة.
إذا بدا أن المناقشة تتبنى تعليمات وثيقة، فتوقف عن استخدام النتيجة، وحدد المقطع الأصلي، وأعد المراجعة في سياق مهمة نظيف عند الاقتضاء. قد تكرر الجولات الإضافية وحدها التلوث نفسه. تستخدم اشتراكات Colay الرصيد وحدود الاستخدام، لذا تستهلك المراجعة الإضافية من الحصة؛ وينبغي أن تحقق فحصًا محددًا تستطيع معاينة نتيجته.
المصادر والمنهجية
- AgentPoison, NeurIPS 2024
تسمم الذاكرة والاسترجاع.
- Agent Smith, ICML 2024
محاكاة تفاعلات الوكيل متعدد الوسائط.
- OWASP LLM01:2025 Prompt Injection
إرشادات مخاطر حقن التعليمات.
اطرح سؤالك التالي على Colay
اختر نموذجًا، واستخدم Auto، أو اجمع عدة وجهات نظر معًا باستخدام Consensus.