Colay / Руководства
Больше AI-участников не создаёт границу безопасности
В одном документе агент может встретить полезные сведения и враждебные инструкции. Дополнительные проверяющие иногда помогают заметить подозрительный фрагмент, но также получают возможность повторить его. Безопасному процессу нужны понятные правила: какие материалы служат данными и кто имеет право разрешать действия. Единодушие участников само по себе такого разрешения не создаёт.
Результаты сторонних исследований и учебные расчёты не являются замером качества Colay.
Что именно показали исследования
AgentPoison (2024) исследовал отравление долговременной памяти и хранилищ для поиска в трёх агентных сценариях без дообучения модели. Это демонстрация проблемы доверия к извлекаемым данным, а не измеренная уязвимость Colay. AgentPoison, NeurIPS 2024
Agent Smith, ICML 2024, моделировал до миллиона агентов LLaVA-1.5 со случайными парными диалогами. Вредоносное изображение могло распространять нежелательное поведение. Такая симуляция не устанавливает вероятность заражения произвольной промышленной системы. Agent Smith, ICML 2024
OWASP LLM01:2025 различает прямые и косвенные prompt injection и рекомендует несколько уровней защиты. Документ не утверждает, что дополнительная модель или один системный промпт устраняют проблему. OWASP LLM01:2025 Prompt Injection
Практический вывод — исследовать путь информации. Подозрительная инструкция может сначала попасть в цитату, затем в пересказ агента, а после появиться как рекомендация якобы доверенного участника. Формулировка меняется, но исходное требование сохраняется. Поэтому важны происхождение и разрешённое использование содержания, а не только личность последнего говорящего.
Обычная проверка пересекает несколько границ доверия
Представьте команду, которая сравнивает предложения поставщиков. В одном документе есть текст, пытающийся изменить задание проверяющих. Исследующий агент пересказывает документ, другой участник критикует пересказ, координатор собирает рекомендацию. Это условный защитный сценарий. Ни один перенос не должен превращать инструкции автора коммерческого предложения в указания пользователя.
Полезная запись проверки сохраняет исходный фрагмент рядом с извлечённым утверждением. Следующий участник должен отличать заявление документа от вывода проверяющего и от настоящей задачи пользователя. Если пересказ стирает различие, координатор может принять многократное повторение за подтверждение, хотя все повторения происходят из одного недоверенного источника.
Последствия становятся существеннее, если процесс может отправлять сообщения, менять общие записи или обращаться к инструментам. Подготовить текст и разрешить внешнее действие — отдельные решения. Даже хорошо обоснованная рекомендация не должна получать дополнительные полномочия только потому, что её повторили несколько участников обсуждения.
Отдельный вопрос — сохранение материала между задачами. Фрагмент, оставшийся в общих заметках, может попасть в новый разбор уже без исходного контекста. Для собственного процесса решите, какие сведения допустимо переносить дальше и как человек увидит их происхождение. Простое переименование заметки не превращает её содержание в проверенное основание.
Опишите, что каждый участник читает и меняет
Нарисуйте небольшую карту своего процесса: внешние документы, поиск, участники, общие заметки, координатор и возможные внешние действия. Отметьте переходы между областями. Для каждого перехода спросите, какие доказательства сохраняются, какой компонент проверяет полномочия и может ли участник передать запрос за пределы назначенной ему роли.
Сделайте задание достаточно узким для проверки. Участнику, проверяющему арифметику, нужны соответствующие количества и единицы; ему могут не понадобиться все вложения или доступ к почте. Это предлагаемый принцип уменьшения лишнего раскрытия данных. Он не описывает реализованные средства Colay и не утверждает конкретную степень изоляции какого-либо провайдера.
Для координатора заранее определите формат результата: подтверждённые утверждения, их источники, нерешённые противоречия и необходимые решения человека. Такой формат помогает проследить переход от данных к рекомендации. Он также позволяет заметить, что участник принёс новое требование без основания, вместо того чтобы просто улучшить качество исходного анализа.
| Переход | Что нужно выяснить |
|---|---|
| Документ → участник | Можно ли отличить источник от инструкций задания? |
| Участник → координатор | Прослеживается ли происхождение важных утверждений? |
| Координатор → внешнее действие | Кто отдельно разрешает действие и его объём? |
| Текущая задача → сохранённый контекст | Какие материалы попадут в следующую задачу? |
Проверяйте сдерживание на искусственных данных
Используйте контролируемое упражнение с синтетическими документами и безвредными контрольными значениями. Определите поведение, которое должно сохраниться: например, критерии оценки или разрешённое направление вывода. Меняйте способ появления подозрительного текста — напрямую, внутри цитаты, в пересказе. Цель упражнения — наблюдать обращение с границами доверия, не подвергая риску реальные записи клиентов.
Оценивайте не только внешний вид заключения. Проверьте, сохранили ли участники исходную задачу и происхождение сведений, запрашивали ли неразрешённые действия, перенесли ли посторонние инструкции в следующий контекст. Запишите точную конфигурацию и провалы. Отсутствие проблемы в небольшом упражнении говорит о проверенных случаях, а не о защите от любой возможной инъекции.
Используйте обсуждение для анализа, затем проверяйте решение
В Colay Consensus агенты обсуждают запрос, а координирующий агент собирает заключение. Это описание совместной работы, не сертификат безопасности. При недоверенных материалах запрашивайте утверждения с источниками и отделяйте итоговое решение от значимого внешнего действия. Доступные средства контроля проверяйте по актуальной документации продукта.
Если обсуждение, похоже, унаследовало инструкции документа, прекратите использовать этот результат, найдите исходный фрагмент и при необходимости повторите разбор в чистом контексте задачи. Дополнительные раунды сами по себе могут лишь повторять загрязнение. У подписок Colay есть кредиты и лимиты: дополнительный расход должен давать конкретную проверку с результатом, который можно самостоятельно оценить.
Источники и методология
- AgentPoison, NeurIPS 2024
Отравление памяти и извлекаемых данных.
- Agent Smith, ICML 2024
Симуляция взаимодействий мультимодальных агентов.
- OWASP LLM01:2025 Prompt Injection
Рекомендации по рискам внедрения инструкций.
Задайте следующий вопрос в Colay
Выберите модель, используйте Auto или объедините несколько точек зрения с Consensus.