Colay / Guías
Más participantes de IA no crean un límite de seguridad
Un agente puede encontrar pruebas útiles e instrucciones hostiles en el mismo documento. Agregar revisores puede ayudar a revelar contenido sospechoso, pero también crea más oportunidades para repetirlo. Un flujo de trabajo seguro necesita reglas claras sobre qué material puede informar una respuesta y qué actores pueden autorizar una acción. El acuerdo no puede proporcionar esa autorización.
Los resultados de investigaciones externas y los cálculos ilustrativos no son mediciones del rendimiento de Colay.
Lo que realmente demostró la investigación
AgentPoison (2024) estudió la memoria a largo plazo envenenada y los almacenes de recuperación en tres entornos de agentes. El ataque no requirió ningún ajuste del modelo. Demuestra un problema de confianza en la recuperación, no una vulnerabilidad medida en Colay. AgentPoison, NeurIPS 2024
Agent Smith (ICML 2024) simuló hasta un millón de agentes LLaVA-1.5 con conversaciones aleatorias por parejas. Una imagen adversaria podía propagar comportamientos dañinos. Esta simulación específica no establece una tasa de infección para cualquier sistema en producción. Agent Smith, ICML 2024
OWASP LLM01:2025 distingue la inyección directa e indirecta de instrucciones y recomienda medidas de mitigación en varias capas. No afirma que añadir otro modelo o confiar solo en una instrucción del sistema elimine el problema. OWASP LLM01:2025 Prompt Injection
La implicación práctica es examinar el camino que toma la información. Una instrucción sospechosa puede ingresar como una cita, convertirse en un resumen de un agente y luego aparecer como una recomendación de un participante aparentemente confiable. La redacción puede cambiar mientras la solicitud subyacente sobreviva. Revisa el origen y uso permitido del contenido, no solo la identidad del último hablante.
Una revisión inofensiva puede cruzar varios límites de confianza
Imagínese un equipo revisando propuestas de proveedores. Una propuesta contiene texto que intenta cambiar la tarea de los revisores. Un agente de investigación resume el documento; otro agente critica ese resumen; un coordinador elabora la recomendación. Este es un hipotético escenario defensivo. Ninguna de esas transferencias debe convertir las instrucciones escritas por el proveedor en instrucciones del usuario.
Un registro de revisión útil mantiene el pasaje fuente junto con la afirmación extraída. El siguiente participante debería poder distinguir la afirmación de un documento de la inferencia de un revisor y de la solicitud real del usuario. Si el resumen elimina esa distinción, el coordinador puede tratar el contenido repetido como corroboración aunque cada repetición tenga el mismo origen no confiable.
El problema adquiere mayores consecuencias cuando un flujo de trabajo puede enviar mensajes, editar registros compartidos o invocar herramientas. Elaborar un texto y autorizar una acción externa son decisiones independientes. Incluso una recomendación bien respaldada no debería adquirir permisos adicionales simplemente porque varios participantes la repitieron.
Identifique qué puede leer y modificar cada participante
Para el flujo de trabajo que usted opera, dibuje un pequeño mapa: documentos externos, almacenes de recuperación, participantes, notas compartidas, coordinador y posibles acciones externas. Marque dónde cruza la información de un área a otra. Luego pregunte qué evidencia viaja con él, qué componente verifica los permisos y si un participante puede pasar una solicitud fuera de su función asignada.
Mantenga la tarea de revisión lo suficientemente estrecha como para inspeccionarla. Un participante que comprueba aritmética necesita cantidades y unidades relevantes; es posible que no necesite todos los archivos adjuntos ni el acceso a un buzón. Este es un principio de diseño propuesto para minimizar la exposición innecesaria. No es una afirmación sobre qué controles implementa Colay actualmente ni sobre el aislamiento de ningún proveedor en particular.
| Límite | Pregunta a responder |
|---|---|
| Documento → participante | ¿Se distingue el texto fuente de las instrucciones de la tarea? |
| Participante → coordinador | ¿Se puede rastrear cada afirmación importante hasta su origen? |
| Coordinador → acción externa | ¿Quién autoriza de forma separada la acción y su alcance? |
| Tarea actual → contexto guardado | ¿Qué material puede persistir en una tarea posterior? |
Pruebe la contención sin manejar secretos activos
Utilice un ejercicio controlado con documentos sintéticos y valores canarios inofensivos. Defina el comportamiento que debe permanecer sin cambios, como los criterios de evaluación seleccionados o el destino de salida permitido. Varíe si un pasaje sospechoso aparece directamente, dentro de una cita o en un resumen. El objetivo es observar el manejo de límites, no exponer registros reales de clientes.
Evalúe más aspectos que la apariencia aceptable de la respuesta final. Compruebe si los participantes siguieron la tarea original, conservaron la procedencia de la información, solicitaron acciones no autorizadas o trasladaron instrucciones no deseadas a contextos posteriores. Registre la configuración exacta probada y los fallos. Un resultado sin problemas en un ejercicio pequeño aporta evidencia sobre esos casos; no prueba que el sistema resista todas las inyecciones posibles.
Utilice Consensus como análisis y luego verifique la decisión
Colay Consensus permite a los agentes discutir una solicitud y asigna a un agente coordinador la tarea de sintetizar una conclusión. Esto describe el flujo de trabajo de colaboración, no una certificación de seguridad. Cuando el material no sea de confianza, solicite declaraciones vinculadas a la fuente y mantenga la decisión final separada de cualquier acción externa con consecuencias importantes. Consulte la documentación actual del producto para conocer los controles disponibles.
Si una discusión parece heredar las instrucciones de un documento, deje de utilizar ese resultado, identifique el pasaje original y repita la revisión con un contexto de tarea limpio cuando corresponda. Las rondas adicionales por sí solas pueden repetir la misma contaminación. Las suscripciones de Colay tienen créditos y límites, por lo que revisar más también consume créditos; ese gasto debe servir para una comprobación específica cuyo resultado pueda examinar.
Fuentes y metodología
- AgentPoison, NeurIPS 2024
Envenenamiento de la memoria y la recuperación.
- Agent Smith, ICML 2024
Interacciones de agentes multimodales simuladas.
- OWASP LLM01:2025 Prompt Injection
Orientación sobre el riesgo de inyección de instrucciones.
Envíe su próxima pregunta a Colay
Elija un modelo, utilice Auto o reúna varias perspectivas con Consensus.