Colay / ガイド

AI 参加者が増えてもセキュリティ境界線が作成されない

同じ文書の中に、有用な証拠と悪意ある指示が含まれていることがあります。確認役を増やすと、不審な内容に気付く助けになる一方、それを繰り返す機会も増えます。安全な作業手順には、どの資料を回答の参考にできるか、誰が操作を承認できるかについて、明確なルールが必要です。参加者の合意だけでは、操作の権限は与えられません。

外部の調査結果や計算例は、Colay のパフォーマンスを測定するものではありません。

研究で実際に実証されたこと

AgentPoison(2024)は、三つのエージェント構成で、汚染された長期記憶と検索用データストアを調べました。この攻撃には、モデルのファインチューニングは不要でした。これは取得した情報をどこまで信頼するかという問題を示した研究であり、Colayの脆弱性を測定したものではありません。 AgentPoison, NeurIPS 2024

Agent Smith(ICML 2024)は、無作為なペアでチャットする最大100万のLLaVA-1.5エージェントをシミュレーションしました。敵対的な画像により、有害な行動が広がる可能性が示されました。この特定のシミュレーションから、任意の実運用システムの感染率を導くことはできません。 Agent Smith, ICML 2024

OWASP LLM01:2025 では、直接プロンプト インジェクションと間接的なプロンプト インジェクションを区別し、多層的な緩和策を推奨しています。別のモデルを追加したり、システム プロンプトのみに依存したりすることで問題が解決されるとは主張しません。 OWASP LLM01:2025 Prompt Injection

実務上は、情報がどの経路を通るかを調べる必要があります。不審な指示が引用として入り、エージェントの要約を経て、信頼できそうな参加者の推奨として現れることがあります。文言が変わっても、元の要求は残るかもしれません。最後に発言した相手だけでなく、内容の出所と、許可された用途を確認してください。

無害なレビューは複数の信頼境界を越える可能性があります

サプライヤーの提案を検討するチームを想像してみてください。ある提案には、レビュー担当者のタスクを変更しようとするテキストが含まれています。研究エージェントが文書を要約します。別のエージェントがその要約を批判します。コーディネーターが推奨事項をまとめます。これは仮想的な防御シナリオです。こうした転送によって、サプライヤー作成の指示がユーザーからの指示に変わってはなりません。

有用なレビュー記録では、抽出した主張とともに原文の該当箇所を残します。次の参加者が、文書の主張、レビュー担当者の推論、ユーザーの実際の依頼を区別できる必要があります。要約でこの区別が失われると、すべてが同じ、指示元として信頼されていない出所に由来していても、調整役が繰り返された内容を裏付けとみなす場合があります。

ワークフローでメッセージの送信、共有レコードの編集、ツールの呼び出しができる場合、この問題はさらに重大になります。テキストの生成と外部アクションの承認は別個の決定です。十分にサポートされた推奨事項であっても、複数の参加者がそれを繰り返したからという理由だけで追加の権限を取得すべきではありません。

各参加者が読めるものと変更できるものを整理する

運用するワークフローについて、外部ドキュメント、検索ストア、参加者、共有メモ、コーディネーター、および考えられる外部アクションなどの小さなマップを描きます。あるエリアから別のエリアに情報が交差する場所をマークします。次に、どのような証拠が一緒に移動するのか、どのコンポーネントが権限をチェックするのか、参加者が割り当てられた役割の外でリクエストを渡すことができるかどうかを尋ねます。

レビュー タスクは検査できる範囲に限定してください。算術をチェックする参加者には、関連する量と単位が必要です。すべての添付ファイルやメールボックスへのアクセスが必要なわけではありません。これは、不必要な露出を最小限に抑えるために提案された設計原則です。これは、Colay が現在どのコントロールを実装しているか、または特定のプロバイダの分離について主張するものではありません。

独自のエージェント ワークフローを確認するための質問
境界回答すべき質問
ドキュメント → 参加者ソース テキストはタスクの指示と区別できますか?
参加者 → コーディネーターそれぞれの重要な主張はその起源をたどることができますか?
コーディネーター → 外部アクションアクションとその範囲を個別に承認するのは誰ですか?
現在のタスク → 保存されたコンテキスト後のタスクに残る可能性のある資料はどれですか?

実際の機密情報を扱わずに封じ込めを試す

人工的に作った文書と無害な追跡用の値を使い、管理された条件で検証してください。選択した評価基準や許可された出力先など、変わってはいけない動作を定めます。不審な箇所が直接現れる場合、引用の中にある場合、要約に含まれる場合を試してください。目的は境界の扱いを観察することであり、実際の顧客記録をさらすことではありません。

最終回答が問題なく見えるかだけで評価しないでください。参加者が元のタスクを守ったか、情報の出所を保ったか、許可されていない操作を求めたか、不要な指示を後の文脈へ持ち越したかを確認します。試した正確な構成と失敗を記録してください。小規模な検証で問題がなかったという結果は、そのケースについての証拠であり、あらゆるインジェクションに耐える証明ではありません。

Consensusで分析した後、判断を検証する

ColayのConsensusでは、エージェントがリクエストについて議論し、調整役が結論をまとめます。これは協調的な作業手順の説明であり、セキュリティ認証ではありません。指示元としての信頼を与えていない資料を扱う場合は、各主張と出典の対応を求め、最終的な判断と、重大な影響を伴う外部操作の実行を分けてください。利用できる制御機能は、現在の製品文書で確認してください。

議論が文書中の指示を引き継いでいるようなら、その結果の使用を止め、原文の該当箇所を特定してください。必要に応じて、不要な指示を取り除いたタスクの文脈でレビューをやり直します。ラウンドを増やすだけでは、同じ汚染を繰り返しかねません。Colayのサブスクリプションにはクレジットと制限があり、追加のレビューでも利用枠を消費します。その支出は、結果を確認できる具体的な検証に結び付けてください。

出典と方法

  1. AgentPoison, NeurIPS 2024

    メモリと検索ポイズニング。

  2. Agent Smith, ICML 2024

    シミュレートされたマルチモーダル エージェント インタラクション。

  3. OWASP LLM01:2025 Prompt Injection

    プロンプトインジェクションのリスクに関する指針。

次の質問を Colay に送ってください。

モデルを選択するか、Autoを使用するか、Consensusを使用して複数の視点を組み合わせます。

Colayを開く