Colay / Посібники

Більше учасників ШІ не створюють кордон безпеки

Агент може зустріти корисні докази та ворожі вказівки в одному документі. Додавання рецензентів може допомогти виявити підозрілий вміст, але це також створює більше можливостей для його повторення. Безпечний робочий процес потребує чітких правил щодо того, який матеріал може давати відповідь і які учасники можуть дозволяти дію. Згода між учасниками не надає такого дозволу.

Результати зовнішніх досліджень та ілюстративні розрахунки не є вимірюванням ефективності Colay.

Що насправді продемонструвало дослідження

AgentPoison (2024) вивчав отруєну довготривалу пам’ять і сховища для пошуку в трьох налаштуваннях агента. Атака не потребувала точного налаштування моделі. Це демонструє проблему довіри до пошуку, а не виміряну вразливість у Colay. AgentPoison, NeurIPS 2024

Agent Smith (ICML 2024) моделював до мільйона агентів LLaVA-1.5 за допомогою рандомізованих парних чатів. Ворожий образ може пропагувати шкідливу поведінку. Це спеціальне моделювання не визначає рівень зараження для довільних виробничих систем. Agent Smith, ICML 2024

OWASP LLM01:2025 розрізняє прямі й непрямі ін’єкції інструкцій та рекомендує багаторівневий захист. Він не стверджує, що ще одна модель або лише системний запит усувають проблему. OWASP LLM01:2025 Prompt Injection

Практичний висновок — перевіряти шлях інформації. Підозріла інструкція може потрапити як цитата, стати зведенням агента, а потім виглядати рекомендацією начебто надійного учасника. Формулювання змінюється, але закладена вимога зберігається. Перевіряйте походження й дозволене використання вмісту, а не лише особу останнього мовця.

Нешкідлива перевірка може перетнути кілька меж довіри

Уявіть собі команду, яка переглядає пропозиції постачальників. Одна пропозиція містить текст, який намагається змінити завдання рецензентів. Дослідницький агент підсумовує документ; інший агент критикує це резюме; координатор складає рекомендацію. Це гіпотетичний оборонний сценарій. Жодна з цих передач не повинна перетворювати інструкції, створені постачальником, на інструкції від користувача.

Корисний запис перевірки зберігає вихідний уривок поряд із виділеним твердженням. Наступний учасник має відрізняти твердження документа від висновку перевіряльника та справжнього запиту користувача. Якщо узагальнення прибирає цю відмінність, координатор може прийняти повторений вміст за підтвердження, хоча всі повторення походять з одного ненадійного джерела.

Проблема стає більш серйозною, коли робочий процес може надсилати повідомлення, редагувати спільні записи або викликати інструменти. Створення тексту та авторизація зовнішньої дії — це окремі рішення. Навіть добре підтверджена рекомендація не повинна отримувати додаткові дозволи лише тому, що її повторили кілька учасників.

Позначте, що кожен учасник може читати та змінювати

Для робочого процесу, яким ви керуєте, намалюйте невелику карту: зовнішні документи, сховища пошуку, учасники, спільні нотатки, координатор і можливі зовнішні дії. Позначте, де інформація переходить з однієї області в іншу. Потім запитайте, які докази переміщуються з ним, який компонент перевіряє дозволи та чи може учасник передати запит поза його призначеною роллю.

Зберігайте завдання рецензування достатньо вузьким, щоб перевірити. Учаснику, який перевіряє арифметику, потрібні відповідні величини та одиниці; йому може не знадобитися кожне вкладення або доступ до поштової скриньки. Це запропонований принцип конструкції для мінімізації непотрібного впливу. Це не заява про те, які елементи керування Colay зараз застосовує, або про ізоляцію будь-якого конкретного постачальника.

Запитання для перегляду власного робочого процесу агента
МежаЗапитання, на яке потрібно відповісти
Документ → учасникЧи можна відрізнити вихідний текст від інструкцій до завдання?
Учасник → координаторЧи можна відстежити походження кожної важливої заяви?
Координатор → зовнішня діяХто окремо авторизує дію та її обсяг?
Поточне завдання → збережений контекстЯкий матеріал може залишитися в наступному завданні?

Перевіряйте ізоляцію без справжніх секретних даних

Використовуйте контрольовану вправу із синтетичними документами й нешкідливими контрольними значеннями. Визначте поведінку, яка має залишатися незмінною, наприклад критерії оцінювання чи дозволене місце виведення. Змінюйте розміщення підозрілого уривка: безпосередньо, всередині цитати або в зведенні. Мета — спостерігати за дотриманням меж довіри, а не розкривати справжні клієнтські дані.

Оцініть більше, ніж те, чи остаточна відповідь виглядає прийнятною. Перевірте, чи виконали учасники початкове завдання, чи зберегли походження, чи вимагали несанкціонованих дій чи перенесли небажані інструкції в пізніший контекст. Записуйте точну перевірену конфігурацію та несправності. Чистий результат невеликої вправи є доказом цих випадків, а не доказом того, що система протистоїть усім можливим ін’єкціям.

Використовуйте Consensus як аналіз, а потім перевірте рішення

Colay Consensus дозволяє агентам обговорювати запит і дає агенту-координатору завдання синтезувати висновок. Це описує робочий процес співпраці, а не сертифікацію безпеки. Коли матеріалу не надано довіри як джерелу інструкцій, вимагайте твердження з посиланнями на джерела й відокремлюйте остаточне рішення від будь-якої зовнішньої дії з істотними наслідками. Перегляньте доступні елементи керування в поточній документації продукту.

Якщо обговорення, схоже, переймає інструкції документа, припиніть використовувати результат, знайдіть початковий уривок і за потреби повторіть перевірку в чистому контексті завдання. Самі додаткові раунди можуть повторювати те саме забруднення. Підписки Colay мають кредити й ліміти, тож додатковий перегляд витрачає пакет; за ці витрати має виконуватися конкретна перевірка з доступним для оцінки результатом.

Джерела та методологія

  1. AgentPoison, NeurIPS 2024

    Отруєння пам'яті та пошуку.

  2. Agent Smith, ICML 2024

    Змодельована мультимодальна взаємодія агента.

  3. OWASP LLM01:2025 Prompt Injection

    Рекомендації щодо ризиків ін’єкції інструкцій.

Задайте своє наступне запитання Colay

Виберіть модель, скористайтеся Auto або об'єднайте кілька точок зору за допомогою Consensus.

Відкрити Colay