Colay / 指南
Mixture-of-Agents:综合答案必须体现价值
收集多个 AI 答案并不难;把它们整理成连贯、可核验的成果则更困难。Mixture-of-Agents 研究说明综合环节值得认真对待,但标题中的百分比很容易被误解。本文分析这些数字衡量什么,区分偏好与事实准确性,并提出评估最终结果的实用方法。
外部研究结果和示例计算并不是对 Colay 性能的实际测量。
结果、指标和参考答案
Wang 等人的 2024 年 MoA 论文报告:在 AlpacaEval 2.0 的 805 条指令上,控制回答长度后的胜率为 65.1%,而 GPT-4o (05/13) 为 57.5%。二者均与 gpt-4-1106-preview 比较。这衡量的是 AI 评判者的偏好,不是正确事实的比例,也不是 Colay 的性能。 Wang et al., 2024
该指标的差异为 7.6 个百分点。它没有确定工作场所的准确性或选择产品的客户比例。
为什么调整长度很重要
杜波依斯等人。引入了长度控制的 AlpacaEval 来调整答案长度差异的自动判断首选项。这种调整不会将分数变成对每一个事实陈述的审核。 Dubois et al., Length-Controlled AlpacaEval, 2024
根据您自己的比较,即使额外的细节并不能改善决策,长篇综合也可能会让人感觉完整。为两个工作流程提供相同的空间限制和所需内容。然后分别对有用性、事实正确性和可读性进行评分。单个组合分数可能会隐藏这样的结果:呈现效果有所改善,而推荐的基础却变弱。
保留每条建议背后的条件
考虑一个假设的例子。一项回应建议,如果数据准备就绪,将在两周内实施;另一位估计,如果需要清洁,则需要六周时间。综合说实施需要四个星期听起来很平衡,但并不代表这两种情况。更好的答案是保留分支并询问数据准备情况。对语句进行平均会破坏有用的信息。
因此,我们建议在综合时将一个论断及其适用条件视为一个整体。每项建议都需要依据、边界和可追溯的输入证据。可以请协调智能体制作分歧表,再检查压缩内容时是否遗漏了不方便保留的条件。好的编辑应使差异更容易理解,而不是将差异抹平。
审核草稿和最终文本之间消失的内容
假设供应商的需求说明有 12 项必备条件。在一次假设审阅中,候选答案合起来覆盖全部 12 项,但最终综合答案只保留九项。必备条件覆盖率为 75%,即使最终文档比任何草稿都更易读。这是另一项指标,与 AlpacaEval 的百分比没有关系。
列出需求说明中的强制性条件,在最终文本中找到每个条件并记录遗漏。接下来,检查仅在综合期间引入的声明。新的数字或承诺需要支持证据。如果不存在支持,请将其标记为假设或将其删除。这测试了有用的内容是否在工作流程中幸存下来,而不是衡量结果的完美程度。
| 检查 | 结果示例 | 操作 |
|---|---|---|
| 所需条件 | 12 项中保留了 9 项 | 恢复三处遗漏 |
| 新的数字声明 | 2 缺乏依据 | 验证或删除 |
| 有争议的假设 | 1 隐藏 | 显示决策分支 |
使用强大的单一模型比较
要测试多个模型在您的工作中的价值,请为单模型工作流程提供相同的准备需求说明、来源和评分标准。将有组织的流程与粗心的单行请求进行比较会混淆任务准备与架构。记录准备输入和审查输出所需的工作量,以及模型的使用和等待时间。
尝试一个简短的事实问题和一个较长的决策备忘录以及替代方案。他们需要不同的成功标准。前者需要特定主张的支持;后者还需要涵盖关键条件和对选择的明确解释。如果改进仅出现在决策备忘录中,请将实际建议仅限于该类型的工作。
将想法应用于Consensus,而无需借用其分数
Colay Consensus也以协调智能体的综合结束,但这并不意味着它与研究的 MoA 配置相同。本文不包含已发布的 Colay 基准测试。将外部结果视为测试材料工作流程的原因,而不是作为每次Consensus运行的现成质量分数。
要求得出由四个部分组成的结论:建议、证据、未解决的分歧和下一步可检查的步骤。提供空间限制和强制性条件列表。根据需求说明及其来源审查结果。当您可以确定工作流程保留或添加的内容以及仍然剩余的人工工作量时,工作流程就发挥了有用的作用。
来源和方法
- Wang et al., 2024
表 2a; 3.1 部分。
- Dubois et al., Length-Controlled AlpacaEval, 2024
该指标调整模型评判对响应长度的偏好;这不是事实准确性分数。
将您的下一个问题提交给 Colay
选择一个模型、使用 Auto,或通过 Consensus 汇集多种观点。