Colay / 指南
当AI讨论不足以证明额外工作的合理性时
要可信地说明 Consensus 的价值,也必须讨论其表现较差的情况。否则,成功案例就只是宣传,而不是选择工作流程的依据。研究给出了具体反例,有助于提出一个实用问题:与多次独立尝试相比,交换论据增加了什么价值,又付出了什么成本?
外部研究结果和示例计算并不是对 Colay 性能的实际测量。
投票效果更好的具体案例
NeurIPS 2025 的 Debate or Vote 研究报告:在 300 道 GSM8K 题上,五个 Qwen2.5-7B-Instruct 智能体进行多数投票的准确率为 94.00%。两轮去中心化辩论的准确率为 88.67%,五轮为 83.33%(表 1)。这是一种研究配置,不是对 Colay 的评估,也不是普遍规律。 Debate or Vote, NeurIPS 2025
与两轮辩论相比,差距为 5.33 个百分点。讨论更多并不自动意味着结果更好;这里比较的是集体方法,不能据此判断单个模型谁更强。
一个强有力的替代方案比一个引人注目的例子更重要
Smit 等人,ICML 2024 发现,经过测试的辩论策略并没有可靠地优于自洽策略和其他强大的替代策略。协议调整改变了结果。这支持测试特定条件,而不是拒绝每个设置中的讨论。 Smit et al., ICML 2024
当第一个答案很弱时,几乎任何额外的努力都会看起来令人印象深刻。将讨论与明确的个人请求以及从未看到彼此答案的单独候选答案进行比较。这有助于区分产生更多选项的好处和参与者说服彼此修改选项的好处。
失去正确的反对意见是一种明显的风险
想象一下假设的成本比较。一位参与者注意到这些数字混合了月度和年度价格;其他人将它们视为直接可比的。综合遵循多数并放弃单位警告。问题不在于缺少文本:必要的检查出现了,然后在一致意见期间消失了。再一轮并不一定能恢复它。
要求重大异议保持可见,直到来源、计算或明确的澄清解决它们为止。在最终答案中,查找异议被拒绝的原因。说参与者同意描述了对话,而不是证明了决定。当争议涉及事实时,应该用证据而不是陈述的可信度来解决问题。
开始之前选择停止规则
提前决定什么样的结果才是足够的。例如:涵盖所有强制性约束、检查计算、提供的材料支持有争议的事实以及命名剩余的未知数。一旦满足这些条件,仅仅继续获得更自信的语气就没有明显的价值。这是建议的工作流程规则,而不是内置保证。
如果下一轮交流只是重复相同论据,就应改变行动:获取缺失文档、运行测试,或咨询了解事实的人。新消息只有带来新的可核验信息才有价值。缺少这类信息时,对话即使最终达成一致,决策的证据基础仍可能毫无进展。
为额外可接受的结果定价
在一个假设比较中,两个工作流程处理相同的 50 个请求。第一个花费 100 个记账单位,得到 40 个可接受结果;第二个花费 220 个单位,得到 43 个。额外三个可接受结果多花 120 个单位,即每个额外结果花费 40 个单位。这些是假设的示例计算,不是 Colay 成本或准确性的实测结果。
这种增量是否值得取决于工作。对于内部草案来说可能没有必要,但对于要求严格的决策备忘录来说却是合理的。包括人工审核时间和重大错误的后果。将观察到的结果与假设的损失分开:首先收集测量结果,然后标记用于将这些观察结果转化为支出决策的假设。
| 测量 | 工作流程 A | 工作流程 B |
|---|---|---|
| 请求 | 50 | 50 |
| 可接受的结果 | 40 | 43 |
| 成本,会计单位 | 100 | 220 |
| 每个额外结果的增量费用 | — | 40 |
Consensus 在哪些任务上仍可能有价值
讨论值得对依赖于相互竞争的理由的工作进行测试:设计决策、相互冲突的需求以及几种可行方法之间的选择。首先尝试直接方法,操作简单,结果易于检查。该顺序有助于将积分使用集中在讨论可能会实质性改变您下一步要做的事情的任务上。
在Colay中,Consensus参与者讨论任务,协调智能体进行综合。该模式不会将一致意见转化为证据或取代外部验证。保留一个普通的答案进行比较,询问最强烈的实质性反对意见并评估发生了什么变化。如果质量没有提高,或者出现新错误,请对此类任务使用更简单的流程。
来源和方法
- Debate or Vote, NeurIPS 2025
表1;附录 A.2.
- Smit et al., ICML 2024
Should we be going MAD? 将辩论与强提示词和采样基线进行比较。
将您的下一个问题提交给 Colay
选择一个模型、使用 Auto,或通过 Consensus 汇集多种观点。