Colay / 指南
来自一个模型的许多答案,还是模型之间的讨论?
您可以多次解决某个问题并选择最常见的答案。您还可以要求参与者讨论竞争解决方案并进行综合。两种方法都使用了不止一种尝试,但它们测试了不同的想法。了解这种区别可以更轻松地确定Consensus的哪一部分对特定工作有用。
外部研究结果和示例计算并不是对 Colay 性能的实际测量。
自洽论文实际测量的内容
Wang 等人在 ICLR 2023 报告,PaLM-540B 在 GSM8K 上的准确率从贪心思维链的 56.5% 提升至自洽方法的 74.4%,相差 17.9 个百分点。结果为 10 次运行的平均值,每次运行采样 40 个输出。这是研究结果,不是 Colay 的实测数据。 Wang et al., ICLR 2023
GSM8K 的测试分组包含 1,319 道初等数学应用题。它提供了可检查的最终答案,而不是代表每项研究、写作或决策任务。 GSM8K dataset, OpenAI
实际的解释是,第一个响应不一定是模型中可用的最佳答案。重复也会消耗资源。在不考虑成本的情况下,对四十次尝试和一次尝试进行比较并不能确定在您的支出限制或可接受的等待时间下哪种工作流程更可取。
将工作流程中的三个操作分开
实际评估时,应区分候选答案生成、候选答案评估和最终成文。生成阶段决定有哪些可能的解法;评估阶段判断哪些满足任务要求;成文阶段向读者交付可用答案。每个环节都可以单独改进,一个环节的成功不会自动弥补另一个环节的失败。
正确解法可能已经出现,却在投票中落选。也可能选中了正确的候选答案,但最终文字遗漏了关键条件。评估工作流程时请保留中间答案。否则,很难判断需要增加候选答案、改进选择规则,还是给协调智能体更明确的指令。
当回答频率提供信息时
考虑一个假设的算术问题,该问题会产生五个答案:42、42、42、24 和 24。多数投票选择42。该选择是可重复的,但正确性仍然取决于问题和计算。如果三个匹配的响应都将分钟与小时混淆,则投票保留相同的错误。投票份额并不自动代表答案正确的概率。
开放式问题带来了一个较早的困难:决定什么才算达成一致。两个回复可能会出于不相容的原因推荐相同的产品。两种不同的建议可能在不同的约束下都有效。在计算匹配数之前,定义您需要的输出:决策、其适用条件、所需事实以及任何仍然缺失的信息。
为什么讨论可能对您的任务有用
对于只有一个数字答案的简短问题,检查计算可能就足够了。软件架构决策受益于比较有关规模、维护和未知约束的假设。在这种情况下,可以评估讨论揭示不相容前提的能力,而不是简单地产生最频繁重复的建议。
假设两个参与者推荐不同的设计,因为他们假设不同的数据量。有用的综合可以确定偏好发生变化的点。要求对已知的内容、假设的内容以及可以解决分歧的观察结果进行简洁的说明。这是我们提出的任务设计方法,并不能保证模型会发现每个依赖项。
在不更改问题的情况下比较工作流程
提前设置支出上限和共享评分标准。比较普通答案、具有明确选择规则的单独尝试以及讨论。相同的调用计数并不意味着相同的成本:上下文长度、输出大小和模型选择都很重要。除了质量之外,还记录实际支出和延误情况,而不是将额外的工作视为免费改进。
假设计算可以说明这种取舍。工作流程 A 用 40 个记账单位处理 20 项任务,得到 18 个可接受结果;工作流程 B 花费 80 个单位,得到 19 个可接受结果。多获得一个可接受结果需要额外花费 40 个单位。这不意味着 A 更可取:额外成功的任务可能具有很高的价值。计算的作用是明确改进成本,便于讨论。
这对于 Colay 中的Consensus意味着什么
Colay Consensus使用参与者之间的讨论和协调智能体的综合。自洽数字并不能描述这种模式:不同的安排需要自己的评估。要研究好处,请选择一个重复任务,提供相同的事实材料,并在Consensus结果旁边保留普通模式答案。根据事先建立的标准对两者进行评估。
询问建议的依据、最强烈的实质性反对意见以及改变建议的条件。分别检查来源和计算。如果公式或可执行测试可以确定正确性,请使用该检查而不是同意参与者的数量。多次尝试扩大候选答案库;工作流程仍然需要一个有依据的规则来接受答案。
来源和方法
- Wang et al., ICLR 2023
表2; 3.2 部分。
- GSM8K dataset, OpenAI
主要测试部分包含 1,319 初等数学应用题。
将您的下一个问题提交给 Colay
选择一个模型、使用 Auto,或通过 Consensus 汇集多种观点。