Colay / 指南
当多个AI模型共享相同的盲点时
三个相同答案可能让人感觉经过了三次检查。但这种解释取决于答案如何产生。如果每个参与者都依赖同一个错误前提,一致意见只是重复它,并未检验它。判断 AI 共识时,既要检查答案,也要检查得出答案的路径。
外部研究结果和示例计算并不是对 Colay 性能的实际测量。
相似性和正确性是不同的问题
Artificial Hivemind 是一项 NeurIPS 2025 研究,发现开放式提示存在模型内重复和跨模型相似性。这些提示承认了多个看似合理的答案。这是有关响应多样性的证据,而不是模型共享事实错误的测量概率。 Artificial Hivemind, NeurIPS 2025
假设一个产品团队向多个智能体询问客户流失的原因。相似解释可能是正确的,可能只是流行说法,也可能来自不完整的需求说明。关键是:什么观察能够推翻各项解释?没有这种检验,不同措辞可能掩盖同一个假设,而相同措辞也可能只是反映明显事实。
Dietterich 的集成分析解释了为什么投票可以受益于具有不同错误的准确分类器。它的独立误差计算是一个条件数学模型,而不是使用不同模型名称自动提供的属性。 Dietterich: Ensemble Methods in Machine Learning
有意简化假设的计算
以下是我们假设的二元分类示例,而不是 Colay 实验。假设三个投票者,一个正确标签,每个投票者的错误概率为 20%,并且多数投票无需讨论。对于独立错误,错误多数只需要两个错误或三个错误。其概率为 3 × 0.2² × 0.8 + 0.2³ = 0.104,或 10.4%。
现在只改变依赖结构。如果三者总是一起成功或失败,多数决策就会在 20% 的情况下出错。第三种假设情形是:一半任务采用这种共同出错机制,另一半采用独立错误机制。每个投票者的错误率仍为 20%,但多数决策的错误率变为 0.5 × 20% + 0.5 × 10.4% = 15.2%。
| 假定关系 | 个别错误 | 多数错误 |
|---|---|---|
| 独立错误 | 20% | 10.4% |
| 一半共享,一半独立 | 20% | 15.2% |
| 完全共享的错误 | 20% | 20% |
为什么讨论不是多数投票实验
对话协调智能体可以接受少数人的反对意见,合并两个部分解决方案,或者引入一个新的错误。参与者还可以在互相阅读后更改答案。因此,上述计算无法预测讨论的准确性。它孤立了一个问题:对输出进行计数并不能告诉您它们包含多少额外证据。
在 Colay Consensus 中,多个智能体讨论请求,协调智能体综合结论。该工作流程并未在参与者之间建立统计独立性。单独的初始答案可以使差异更容易检查,但即使单独生成的答案也可以共享训练影响、提供的文档、遗漏或任务解释。
添加参与者之前检查依赖关系
进行具体审阅时,可以建立一份简短的证据记录,列出争议说法、支持它的文件、从文件通向结论的假设,以及可能的反例。请各审阅者补全缺失部分。即使三个网站转载了同一篇新闻稿,三次引用仍然只对应一个证据来源。
分配能产生不同可观察结果的核查任务:一位审阅者验算,另一位追溯引文的来源段落,第三位检查需求说明中排除的情形。这些是建议的工作方法,并不保证各方错误彼此独立。价值在于可以看出某个参与者是否提供了新的核查,而不只是又一次赞同。
- 保留反对意见,直至其支持证据得到解决。
- 记录哪些事实来自提示,哪些事实经过独立检查。
- 更喜欢一个经过论证的反例,而不是对同意智能体的自信计数。
衡量有用的分歧
对于答案已知的任务,标记两个智能体都失败的位置、只有一个智能体失败的位置以及两个智能体都成功的位置。首先调查共同的失败:它们揭示了其他类似参与者可能无法修复的差距。对于创意任务,请用明确的要求替换单个正确性标签,例如不同的概念、受众适合度或竞争约束的覆盖范围。
当新响应不再改变证据、揭示限制或改善测试结果时,停止添加参与者。 Colay 订阅有积分和限制,因此重复一致意见也会产生使用成本。保留一个决定性反对意见的紧凑讨论可能比以一致但缺乏依据的散文结尾的冗长讨论更有用。
来源和方法
将您的下一个问题提交给 Colay
选择一个模型、使用 Auto,或通过 Consensus 汇集多种观点。