Colay / 指南
更多的AI参与者不会创建安全边界
智能体可能在同一文档中遇到有用证据和恶意指令。增加审阅者可能帮助发现可疑内容,但也增加了这些内容被重复传播的机会。安全工作流程需要明确:哪些材料可以为答案提供信息,哪些参与方有权批准行动。一致意见不能代替授权。
外部研究结果和示例计算并不是对 Colay 性能的实际测量。
研究实际证明了什么
AgentPoison (2024) 研究了三种智能体设置中中毒的长期记忆和检索存储。该攻击不需要模型微调。它展示了检索信任问题,而不是 Colay 中的可测量漏洞。 AgentPoison, NeurIPS 2024
Agent Smith(ICML 2024)模拟了最多一百万个 LLaVA-1.5 智能体之间的随机配对聊天。对抗性图像能够传播有害行为。该特定模拟不能确定任意生产系统的感染率。 Agent Smith, ICML 2024
OWASP LLM01:2025 区分直接和间接提示注入,并建议分层缓解。它并不声称添加另一个模型或仅依靠系统提示就可以消除问题。 OWASP LLM01:2025 Prompt Injection
实际启示是要检查信息的传播路径。可疑指令可能先以引文进入,再变成智能体的摘要,最后成为看似可信的参与者提出的建议。措辞可能改变,底层请求却仍然存在。应检查内容的来源和允许用途,而不只是最后一位发言者的身份。
无害的审阅可以跨越多个信任界限
设想一个团队正在审阅供应商提案,其中一份试图用文字改变审阅任务。研究智能体总结文档,另一个智能体评议摘要,协调智能体整理建议。这是一个假设的防御场景。任何一次传递都不应把供应商写下的指令变成用户指令。
有用的审核记录将源段落与提取的声明一起保存。下一个参与者应该能够区分文档的断言、审阅者的推论以及用户的实际请求。如果摘要消除了这种区别,则协调智能体可能会将重复的内容视为佐证,即使每个重复都具有相同的不受信任的来源。
当工作流可以发送消息、编辑共享记录或调用工具时,问题会变得更加严重。生成文本和授权外部操作是单独的决定。即使是一个得到充分支持的建议,也不应该仅仅因为多个参与者重复它而获得额外的权限。
映射每个参与者可以读取和更改的内容
对于您操作的工作流程,绘制一个小地图:外部文档、检索存储、参与者、共享笔记、协调者和可能的外部操作。标记信息从一个区域跨越到另一个区域的位置。然后询问携带哪些证据、哪个组件检查权限以及参与者是否可以在其分配的角色之外传递请求。
将审核任务的范围缩小到足以进行检查。参加者检查算术需要相关的数量和单位;它可能不需要每个附件或对邮箱的访问。这是为尽量减少不必要的暴露而提出的设计原则。它并不是关于 Colay 当前实施哪些控制或任何特定提供商的隔离的声明。
| 边界 | 要回答的问题 |
|---|---|
| 文档 → 参与者 | 源文本与任务说明是否可以区分? |
| 参与者 → 协调智能体 | 每一个重要的主张都能追溯到其起源吗? |
| 协调智能体→外部行动 | 谁单独授权该操作及其范围? |
| 当前任务 → 已保存上下文 | 哪些材料可以保留到以后的任务中? |
不用真实秘密信息测试防护边界
使用综合文档和无害的金丝雀值进行受控练习。定义应保持不变的行为,例如所选的评估标准或允许的输出目的地。改变可疑段落是直接出现、出现在引文中还是出现在摘要中。目标是观察边界处理,而不是暴露真实的客户记录。
评估时不要只看最终答案是否看似合格。还要检查参与者是否遵循原始任务、保留来源、请求未经授权的操作,或将不需要的指令带入后续上下文。记录具体测试配置和失败情况。小型演练中的干净结果只说明这些案例的表现,不能证明系统能抵御所有可能的注入。
使用Consensus作为分析,然后验证决策
Colay Consensus让智能体可以讨论请求,并为协调智能体提供综合结论的任务。这描述了协作工作流程,而不是安全认证。当材料不可信时,要求提供与来源相关的声明,并将最终决定与任何后续的外部行动分开。检查当前产品文档以获取可用的控件。
如果讨论似乎继承了文档中的指令,请停止使用结果,找到原始段落,并在适当时使用干净的任务上下文重新审阅。单纯增加轮次可能只会重复同样的污染。Colay 订阅有积分和限额,更多审阅也会消耗额度;这种消耗应换来一项具体、结果可检查的核查。
来源和方法
- AgentPoison, NeurIPS 2024
内存和检索中毒。
- Agent Smith, ICML 2024
模拟多模式智能体交互。
- OWASP LLM01:2025 Prompt Injection
提示词注入风险指南。
将您的下一个问题提交给 Colay
选择一个模型、使用 Auto,或通过 Consensus 汇集多种观点。