Colay / Guias
Mais participantes da IA não criam um limite de segurança
Um agente pode encontrar evidências úteis e instruções hostis no mesmo documento. Adicionar revisores pode ajudar a revelar conteúdo suspeito, mas também cria mais oportunidades para repeti-lo. Um fluxo de trabalho seguro necessita de regras claras sobre quais materiais podem informar uma resposta e quais atores podem autorizar uma ação. A concordância não pode fornecer essa autorização.
Resultados de pesquisas externas e cálculos ilustrativos não são medidas do desempenho do Colay.
O que a pesquisa realmente demonstrou
AgentPoison (2024) estudou memória de longo prazo envenenada e armazenamentos de recuperação em três ambientes de agente. O ataque não exigiu nenhum ajuste fino do modelo. Isso demonstra um problema de confiança na recuperação, não uma vulnerabilidade medida no Colay. AgentPoison, NeurIPS 2024
Agent Smith (ICML 2024) simulou até um milhão de agentes LLaVA-1.5 com conversas aleatórias em pares. Uma imagem adversarial podia propagar comportamentos prejudiciais. Essa simulação específica não estabelece uma taxa de infecção para qualquer sistema em produção. Agent Smith, ICML 2024
OWASP LLM01:2025 distingue injeção direta e indireta de prompts e recomenda mitigação em camadas. Não afirma que adicionar outro modelo ou confiar apenas em um prompt de sistema elimine o problema. OWASP LLM01:2025 Prompt Injection
A implicação prática é examinar o caminho que a informação percorre. Uma instrução suspeita pode entrar como uma citação, tornar-se um resumo do agente e, posteriormente, aparecer como uma recomendação de um participante aparentemente confiável. O texto pode mudar enquanto a solicitação subjacente sobreviver. Revise a origem e o uso permitido do conteúdo, não apenas a identidade do último orador.
Uma avaliação inofensiva pode ultrapassar vários limites de confiança
Imagine uma equipe analisando propostas de fornecedores. Uma proposta contém texto que tenta mudar a tarefa dos revisores. Um agente de pesquisa resume o documento; outro agente critica esse resumo; um coordenador monta a recomendação. Este é um cenário defensivo hipotético. Nenhuma dessas transferências deve transformar instruções de autoria do fornecedor em instruções do usuário.
Um registro de revisão útil mantém a passagem de origem ao lado da declaração extraída. O próximo participante deverá ser capaz de distinguir a afirmação de um documento da inferência de um revisor e da solicitação real do usuário. Se o resumo remover essa distinção, o coordenador poderá tratar o conteúdo repetido como corroboração, mesmo que cada repetição tenha a mesma origem não confiável.
O problema se torna mais importante quando um fluxo de trabalho pode enviar mensagens, editar registros compartilhados ou invocar ferramentas. Produzir texto e autorizar uma ação externa são decisões distintas. Mesmo uma recomendação bem fundamentada não deve adquirir permissões adicionais simplesmente porque vários participantes a repetiram.
Mapeie o que cada participante pode ler e alterar
Para um fluxo de trabalho que você opera, desenhe um pequeno mapa: documentos externos, armazenamentos de recuperação, participantes, notas compartilhadas, coordenador e possíveis ações externas. Marque onde as informações passam de uma área para outra. Em seguida, pergunte quais evidências o acompanham, qual componente verifica as permissões e se um participante pode passar uma solicitação fora da função atribuída.
Mantenha a tarefa de revisão restrita o suficiente para inspecionar. Um participante que verifica a aritmética precisa de quantidades e unidades relevantes; pode não precisar de todos os anexos ou acesso a uma caixa de correio. Este é um princípio de design proposto para minimizar a exposição desnecessária. Não se trata de uma afirmação sobre quais controles o Colay implementa atualmente ou sobre o isolamento de qualquer provedor específico.
| Limite | Pergunta a ser respondida |
|---|---|
| Documento → participante | O texto fonte é distinguível das instruções da tarefa? |
| Participante → coordenador | Cada afirmação importante pode ser rastreada até sua origem? |
| Coordenador → ação externa | Quem autoriza separadamente a ação e seu escopo? |
| Tarefa atual → contexto salvo | Qual material pode persistir em uma tarefa posterior? |
Teste a contenção sem lidar com segredos ativos
Use um exercício controlado com documentos sintéticos e valores canários inofensivos. Defina o comportamento que deve permanecer inalterado, como os critérios de avaliação selecionados ou o destino de saída permitido. Varie se uma passagem suspeita aparece diretamente, dentro de uma citação ou em um resumo. O objetivo é observar o tratamento dos limites e não expor registros reais de clientes.
Avalie mais aspectos do que a aparência aceitável da resposta final. Verifique se os participantes seguiram a tarefa original, preservaram a origem da informação, solicitaram ações não autorizadas ou levaram instruções indesejadas a contextos posteriores. Registre a configuração exata testada e as falhas. Um resultado sem problemas em um exercício pequeno é evidência sobre esses casos, não prova de resistência a todas as injeções possíveis.
Use o Consensus como análise e verifique a decisão
Colay Consensus permite que os agentes discutam uma solicitação e dá ao agente coordenador a tarefa de sintetizar uma conclusão. Isto descreve o fluxo de trabalho de colaboração, não uma certificação de segurança. Quando o material não for confiável, solicite afirmações vinculadas à fonte e mantenha a decisão final separada de qualquer ação externa com consequências importantes. Verifique a documentação atual do produto para conhecer os controles disponíveis.
Se uma discussão parecer herdar as instruções de um documento, pare de usar o resultado, identifique o trecho original e repita a revisão com um contexto de tarefa limpo quando apropriado. Rodadas adicionais, por si só, podem repetir a mesma contaminação. As assinaturas do Colay têm créditos e limites; revisar mais também consome créditos e deve proporcionar uma verificação específica cujo resultado você possa examinar.
Fontes e metodologia
- AgentPoison, NeurIPS 2024
Envenenamento de memória e recuperação.
- Agent Smith, ICML 2024
Interações simuladas de agentes multimodais.
- OWASP LLM01:2025 Prompt Injection
Orientações sobre o risco de injeção de prompts.
Traga sua próxima pergunta paro Colay
Escolha um modelo, use Auto ou reúna diversas perspectivas com Consensus.