Colay / 指南
当AI辩论为答案增添价值时
Consensus的案例从一个可测试的问题开始:讨论是否发现了第一个答案遗漏的错误?一些模型可能会提供有用的观察结果,但仅凭参与者数量证明的很少。本文检验了一项研究结果,并将其转化为一种实用的评估方法,同时将已发表的实验与特定产品的声明分开。
外部研究结果和示例计算并不是对 Colay 性能的实际测量。
一个值得仔细阅读的小实验
在 Du 等人于 ICML 2024 发表论文之前的 2023 年预印本中,Bard 解出了 20 道 GSM8K 题中的 11 道,ChatGPT 解出 14 道,联合辩论解出 17 道:分别为 55%、70% 和 85%。这是特定模型在小样本上的结果,不是 Colay 的实测数据。 Du et al., 2023/ICML 2024
20 问题样本中的三个额外正确答案是一个信号,而不是普遍的改进率。测试另一种语言、模型或文档会改变条件。
确定您真正需要的改进
考虑一个包含三个选项的假设启动决策。一个答案推荐最快的路线。第二点是对供应商的依赖。第三个人注意到,预计的时间表涵盖了开发,但不包括批准。有用的综合可以纠正估计的范围,并解释这是否会改变建议。仅仅列出三个观点并不能完成这项工作。
我们建议以决策是否发生变化为标准,而不是看讨论是否精彩。遗漏的限制条件是否得到补充?错误的单位是否得到纠正?最初被当作事实的未知信息是否被明确标出?如果唯一的变化是答案变长,收益仍未得到证实。该标准适用于不同产品和模型组合。
智能体数量和模型多样性是独立的变量
ReConcile,在 ACL 2024 上发布,研究了一种独特的协议:不同的模型讨论答案并使用置信度加权投票。它评估这种安排,而不是验证协调多个智能体的每项服务。 Chen, Saha and Bansal, ACL 2024
在您自己的审阅中,区分候选答案的数量、它们起始方法的差异以及用于形成最终答案的规则。分配给一个模型的三个角色不会成为三个独立的知识源。不同的模型名称也不会产生独立的错误:每个参与者都可以从请求中继承相同的错误前提。
同时统计纠正的错误和新增的错误
这是一个假设示例,不是研究发现。在 100 项预先选定的任务中,初始答案有 60 项正确。讨论修正了 14 个错误答案,但也将六个正确答案改错。最终有 68 项正确,净增八个百分点。只报告 14 次修正会掩盖结果的重要部分。
还要检查后果。修复拼写错误和取消预算限制具有不同的成本。将最初的答案放在最终答案旁边,并记录每项重要论断发生变化的原因。这可以显示工作流程在哪些方面有所帮助,即使其总体得分几乎没有变化。对于后续的决定,了解该主题的审阅者必须确定这些更改是否合理。
| 过渡 | 计数 | 解释 |
|---|---|---|
| 错误→正确 | 14 | 更正 |
| 正确 → 错误 | 6 | 由正确变为错误 |
| 净变化 | +8 | 68 正确,而不是 60 |
进行小规模但公平的比较
选择最近的实际任务,并确定可接受的结果。在生成回复之前写下评分标准、支出限额和最大可接受的延迟。为两个工作流程提供相同的证据。不要只选择第一个模型已经失败的问题:这将使比较倾向于任何第二次尝试,无论讨论是否有所贡献。
在不公开工作流程名称的情况下查看输出。分别对正确性、关键限制的覆盖范围和人工修改量进行评分。在成功的同时保留不成功的例子。如果同事帮助评估结果,让他们在讨论之前独立评分。否则,评审中的一致意见可能会掩盖人们对任务理解方式的真正差异。
将问题应用于Colay Consensus
在Consensus中,参与智能体讨论任务,协调智能体生成综合。实际要求要求他们将替代方案与明确的标准进行比较,识别有争议的假设并避免将丢失的数据转化为信心。提供事实依据并要求将重要主张与该材料中的特定段落相关联。亲自检查这些联系。
本文并未报告测量到的 Colay 准确性改进。该研究支持在相互竞争的解释很重要时调查讨论;特定运行的价值取决于其实际输出。当证据不足时,在最终文件中保留未解决的分歧。有用的结果可能会以要求提供更多信息而不是一致批准而结束。
来源和方法
- Du et al., 2023/ICML 2024
第 3 部分:20 GSM8K 问题。
- Chen, Saha and Bansal, ACL 2024
ReConcile:一种使用不同模型、讨论和置信加权投票的独特协议。
将您的下一个问题提交给 Colay
选择一个模型、使用 Auto,或通过 Consensus 汇集多种观点。