Colay / Guides

Plus de participants à l'IA ne créent pas de limite de sécurité

Un agent peut rencontrer des preuves utiles et des instructions hostiles dans le même document. L'ajout de réviseurs peut aider à révéler un contenu suspect, mais cela crée également davantage d'opportunités de le répéter. Un flux de travail sécurisé nécessite des règles claires indiquant quels éléments peuvent éclairer une réponse et quels acteurs peuvent autoriser une action. L'accord ne peut pas fournir cette autorisation.

Les résultats de recherches externes et les calculs illustratifs ne constituent pas des mesures des performances de Colay.

Ce que la recherche a réellement démontré

AgentPoison (2024) a étudié l’empoisonnement de la mémoire à long terme et des bases de récupération d’informations dans trois contextes d’agents. L’attaque ne nécessitait aucun ajustement du modèle par entraînement supplémentaire. Elle démontre un problème de confiance dans la récupération d’informations, pas une vulnérabilité mesurée de Colay. AgentPoison, NeurIPS 2024

Agent Smith (ICML 2024) a simulé jusqu’à un million d’agents LLaVA-1.5 avec des conversations aléatoires par paires. Une image adversariale pouvait propager des comportements nuisibles. Cette simulation précise n’établit pas un taux d’infection pour n’importe quel système en production. Agent Smith, ICML 2024

OWASP LLM01:2025 distingue les injections directes et indirectes de consignes et recommande plusieurs couches de protection. Il n’affirme pas qu’ajouter un modèle ou se fier uniquement à une consigne système élimine le problème. OWASP LLM01:2025 Prompt Injection

L'implication pratique est d'examiner le chemin emprunté par les informations. Une instruction suspecte peut être présentée sous forme de citation, devenir le résumé d’un agent, puis apparaître comme une recommandation d’un participant apparemment digne de confiance. Le libellé peut changer pendant que la demande sous-jacente survit. Vérifiez l'origine et l'utilisation autorisée du contenu, pas seulement l'identité du dernier intervenant.

Un avis inoffensif peut dépasser plusieurs limites de confiance

Imaginez une équipe examinant les propositions des fournisseurs. Une proposition contient un texte qui tente de modifier la tâche des évaluateurs. Un agent de recherche résume le document ; un autre agent critique ce résumé ; un coordinateur rassemble la recommandation. Il s’agit d’un scénario défensif hypothétique. Aucun de ces transferts ne doit transformer les instructions rédigées par le fournisseur en instructions de l'utilisateur.

Un enregistrement de révision utile conserve le passage source à côté de l’affirmation extraite. Le prochain participant devrait être capable de distinguer l’affirmation d’un document de l’inférence d’un réviseur et de la demande réelle de l’utilisateur. Si le résumé supprime cette distinction, le coordinateur peut traiter le contenu répété comme une corroboration même si chaque répétition a la même origine non fiable.

Le problème devient plus important lorsqu'un flux de travail peut envoyer des messages, modifier des enregistrements partagés ou appeler des outils. Produire un texte et autoriser une action extérieure sont des décisions distinctes. Même une recommandation bien étayée ne devrait pas acquérir d'autorisations supplémentaires simplement parce que plusieurs participants l'ont répétée.

Cartographier ce que chaque participant peut lire et modifier

Pour un flux de travail que vous exploitez, dessinez une petite carte : documents externes, bases de récupération d’informations, participants, notes partagées, coordinateur et actions externes possibles. Marquez où les informations passent d’une zone à une autre. Demandez ensuite quelles preuves l'accompagnent, quel composant vérifie les autorisations et si un participant peut transmettre une demande en dehors du rôle qui lui est attribué.

Gardez la tâche de révision suffisamment restreinte pour permettre une inspection. Un participant vérifiant l’arithmétique a besoin de quantités et d’unités pertinentes ; il n'a peut-être pas besoin de toutes les pièces jointes ou de l'accès à une boîte aux lettres. Il s'agit d'un principe de conception proposé pour minimiser l'exposition inutile. Il ne s'agit pas d'une affirmation sur les contrôles que Colay implémente actuellement ni sur l'isolement d'un fournisseur particulier.

Questions pour revoir votre propre flux de travail d'agent
LimiteQuestion à répondre
Document → participantLe texte source se distingue-t-il des instructions de tâche ?
Participant → coordinateurChaque affirmation importante peut-elle être retracée jusqu'à son origine ?
Coordinateur → action externeQui autorise séparément l'action et sa portée ?
Tâche en cours → contexte enregistréQuels éléments peuvent être conservés dans une tâche ultérieure ?

Tester le confinement sans gérer les secrets actifs

Utilisez un exercice contrôlé avec des documents synthétiques et des valeurs canari inoffensives. Définissez le comportement qui doit rester inchangé, tel que les critères d'évaluation sélectionnés ou la destination de sortie autorisée. Variez selon qu'un passage suspect apparaît directement, à l'intérieur d'une citation ou dans un résumé. L'objectif est d'observer la gestion des limites, et non d'exposer les enregistrements réels des clients.

Évaluez davantage que l’apparence acceptable de la réponse finale. Vérifiez si les participants ont suivi la tâche initiale, conservé la provenance, demandé des actions non autorisées ou transmis des instructions indésirables à un contexte ultérieur. Notez la configuration exacte testée et les échecs. Un résultat sans problème dans un petit exercice renseigne sur ces cas ; il ne prouve pas que le système résiste à toutes les injections possibles.

Utilisez Consensus comme analyse, puis vérifiez la décision

Colay Consensus permet aux agents de discuter d'une demande et confie à un agent coordinateur la tâche de synthétiser une conclusion. Ceci décrit le flux de travail de collaboration, et non une certification de sécurité. Lorsque le matériel n'est pas fiable, demandez des allégations liées à la source et gardez la décision finale séparée de toute action externe aux conséquences importantes. Consultez la documentation actuelle du produit pour connaître les contrôles disponibles.

Si une discussion semble reprendre les instructions d’un document, cessez d’utiliser ce résultat, identifiez le passage d’origine et répétez la révision avec un contexte de tâche propre si nécessaire. Des tours supplémentaires peuvent simplement répéter la même contamination. Les abonnements Colay ont des crédits et des limites : une révision supplémentaire consomme aussi des crédits et doit servir à une vérification précise dont vous pouvez examiner le résultat.

Sources et méthodologie

  1. AgentPoison, NeurIPS 2024

    Empoisonnement de la mémoire et de la récupération.

  2. Agent Smith, ICML 2024

    Interactions d'agents multimodaux simulées.

  3. OWASP LLM01:2025 Prompt Injection

    Recommandations sur le risque d’injection de consignes.

Posez votre prochaine question à Colay

Choisissez un modèle, utilisez Auto ou rassemblez plusieurs perspectives avec Consensus.

Ouvrir Colay