Colay / Anleitungen

Mehr KI-Teilnehmer schaffen keine Sicherheitsgrenze

Ein Agent kann im selben Dokument auf nützliche Beweise und feindselige Anweisungen stoßen. Das Hinzufügen von Prüfern kann dazu beitragen, verdächtige Inhalte aufzudecken, schafft aber auch mehr Möglichkeiten, diese zu wiederholen. Ein sicherer Arbeitsablauf braucht klare Regeln darüber, welches Material eine Antwort liefern kann und welche Akteure eine Aktion autorisieren können. Die Übereinstimmung der Teilnehmer erteilt keine solche Autorisierung.

Externe Forschungsergebnisse und anschauliche Berechnungen sind keine Messungen der Colay-Leistung.

Was die Forschung tatsächlich gezeigt hat

AgentPoison (2024) untersuchte vergiftete Langzeitgedächtnis- und Abrufspeicher in drei Agentenumgebungen. Der Angriff erforderte keine Feinabstimmung des Modells. Es handelt sich um ein Vertrauensproblem beim Abruf und nicht um eine gemessene Schwachstelle in Colay. AgentPoison, NeurIPS 2024

Agent Smith (ICML 2024) simulierte bis zu eine Million LLaVA-1.5-Agenten mit zufälligen paarweisen Chats. Ein gegnerisches Bild könnte schädliches Verhalten verbreiten. Diese spezielle Simulation ermittelt keine Infektionsrate für beliebige Produktionssysteme. Agent Smith, ICML 2024

OWASP LLM01:2025 unterscheidet direkte und indirekte Prompt-Injection und empfiehlt mehrschichtige Gegenmaßnahmen. Es behauptet nicht, dass ein zusätzliches Modell oder allein ein System-Prompt das Problem beseitigt. OWASP LLM01:2025 Prompt Injection

Praktisch bedeutet das, den Weg der Informationen zu untersuchen. Eine verdächtige Anweisung kann als Zitat eingehen, in die Zusammenfassung eines Agenten gelangen und später als Empfehlung eines scheinbar vertrauenswürdigen Teilnehmers erscheinen. Der Wortlaut kann sich ändern, während die zugrunde liegende Aufforderung erhalten bleibt. Prüfen Sie Herkunft und zulässige Verwendung des Inhalts, nicht nur die Identität des letzten Sprechers.

Eine harmlose Bewertung kann mehrere Vertrauensgrenzen überschreiten

Stellen Sie sich ein Team vor, das Lieferantenvorschläge prüft. Ein Vorschlag enthält Text, der versucht, die Aufgabe der Gutachter zu ändern. Ein Recherchemitarbeiter fasst das Dokument zusammen; ein anderer Agent kritisiert diese Zusammenfassung; Ein Koordinator stellt die Empfehlung zusammen. Dies ist ein hypothetisches Verteidigungsszenario. Keine dieser Übertragungen sollte vom Lieferanten verfasste Anweisungen in Anweisungen des Benutzers umwandeln.

Ein nützliches Prüfprotokoll bewahrt die Quellenpassage zusammen mit der daraus entnommenen Aussage auf. Der nächste Teilnehmer muss zwischen der Behauptung eines Dokuments, der Schlussfolgerung eines Prüfers und der tatsächlichen Nutzeranfrage unterscheiden können. Geht diese Unterscheidung beim Zusammenfassen verloren, kann der Koordinator wiederholte Inhalte als Bestätigung werten, obwohl alle Wiederholungen denselben nicht vertrauenswürdigen Ursprung haben.

Das Problem wird schwerwiegender, wenn ein Workflow Nachrichten senden, freigegebene Datensätze bearbeiten oder Tools aufrufen kann. Die Erstellung von Texten und die Genehmigung einer externen Aktion sind getrennte Entscheidungen. Selbst eine gut unterstützte Empfehlung sollte keine zusätzlichen Berechtigungen erhalten, nur weil sie von mehreren Teilnehmern wiederholt wurde.

Ordnen Sie zu, was jeder Teilnehmer lesen und ändern kann

Zeichnen Sie für einen von Ihnen betriebenen Workflow eine kleine Karte: externe Dokumente, Abrufspeicher, Teilnehmer, gemeinsame Notizen, Koordinator und mögliche externe Aktionen. Markieren Sie, wo Informationen von einem Bereich zum anderen übergehen. Fragen Sie dann, welche Beweise mit ihm transportiert werden, welche Komponente Berechtigungen prüft und ob ein Teilnehmer eine Anfrage außerhalb seiner zugewiesenen Rolle weiterleiten kann.

Halten Sie die Überprüfungsaufgabe eng genug, um sie prüfen zu können. Ein Teilnehmer, der das Rechnen prüft, benötigt relevante Mengen und Einheiten; Es ist möglicherweise nicht jeder Anhang oder Zugriff auf ein Postfach erforderlich. Dies ist ein vorgeschlagenes Designprinzip zur Minimierung unnötiger Exposition. Es handelt sich nicht um eine Aussage darüber, welche Kontrollen Colay derzeit implementiert, oder über die Isolation eines bestimmten Anbieters.

Fragen zur Überprüfung Ihres eigenen Agenten-Workflows
GrenzeZu beantwortende Frage
Dokument → TeilnehmerIst der Quelltext von den Aufgabenanweisungen unterscheidbar?
Teilnehmer → KoordinatorLässt sich jede wichtige Aussage bis zu ihrem Ursprung zurückverfolgen?
Koordinator → externe AktionWer genehmigt die Aktion und ihren Umfang gesondert?
Aktuelle Aufgabe → gespeicherter KontextWelches Material kann in einer späteren Aufgabe bestehen bleiben?

Abgrenzungen ohne echte Geheimnisse testen

Nutzen Sie eine kontrollierte Übung mit synthetischen Dokumenten und harmlosen Testmarkierungen. Definieren Sie das Verhalten, das unverändert bleiben soll, etwa die gewählten Bewertungskriterien oder das erlaubte Ausgabeziel. Variieren Sie, ob eine verdächtige Passage direkt, in einem Zitat oder in einer Zusammenfassung erscheint. Ziel ist es, den Umgang mit Vertrauensgrenzen zu beobachten, ohne echte Kundendaten offenzulegen.

Bewerten Sie mehr als nur die Frage, ob die endgültige Antwort akzeptabel aussieht. Überprüfen Sie, ob die Teilnehmer die ursprüngliche Aufgabe befolgten, die Herkunft bewahrten, unerlaubte Aktionen forderten oder unerwünschte Anweisungen in einen späteren Kontext übertragen. Notieren Sie die genaue getestete Konfiguration und Fehler. Ein sauberes Ergebnis bei einer kleinen Übung ist ein Beweis für diese Fälle, kein Beweis dafür, dass das System jeder möglichen Injektion standhält.

Verwenden Sie Consensus als Analyse und überprüfen Sie dann die Entscheidung

Colay Consensus lässt Agenten eine Anfrage diskutieren und beauftragt einen koordinierenden Agenten, eine gemeinsame Schlussfolgerung zu erstellen. Das beschreibt den Ablauf der Zusammenarbeit, keine Sicherheitszertifizierung. Fordern Sie bei nicht vertrauenswürdigem Material Aussagen mit Quellenbezug an und trennen Sie die abschließende Entscheidung von folgenreichen externen Aktionen. Prüfen Sie die aktuelle Produktdokumentation auf verfügbare Schutzmaßnahmen.

Wenn eine Diskussion Anweisungen aus einem Dokument zu übernehmen scheint, verwenden Sie das Ergebnis nicht weiter. Ermitteln Sie die ursprüngliche Passage und wiederholen Sie die Prüfung bei Bedarf in einem bereinigten Aufgabenkontext. Zusätzliche Runden allein können dieselbe Verunreinigung wiederholen. Colay-Abonnements nutzen Credits und Limits, sodass weitere Prüfungen das Kontingent belasten; dafür sollten sie eine konkrete, nachvollziehbare Kontrolle liefern.

Quellen und Methodik

  1. AgentPoison, NeurIPS 2024

    Manipulation von Gedächtnis- und Abrufspeichern.

  2. Agent Smith, ICML 2024

    Simulierte multimodale Agenteninteraktionen.

  3. OWASP LLM01:2025 Prompt Injection

    Leitlinien zum Risiko von Prompt-Injection.

Senden Sie Ihre nächste Frage an Colay

Wählen Sie ein Modell, verwenden Sie Auto oder bringen Sie mehrere Perspektiven mit Consensus zusammen.

Colay öffnen