Colay / 指南
什么时候额外一轮AI审核值得付出代价?
成本问题的重点不只是智能体能以多低的价格给出答案,而是获得可接受结果总共要花多少钱。长时间讨论如果避免了昂贵的返工,就可能值得;如果只是重复已经足够好的草稿,则可能浪费资源。请从您需要改进的决策出发。
外部研究结果和示例计算并不是对 Colay 性能的实际测量。
研究显示了一种权衡,而不是普遍折扣
FrugalGPT(2023)的表 3 报告,在 HEADLINES 任务上达到 GPT-4 的准确性时,成本节省了 98.3%。该方法使用随机训练/测试划分,学习最多由三个模型组成的级联。这是历史上针对特定任务的结果,涉及按需升级模型,不是多智能体讨论。 FrugalGPT, 2023, Table 3
RouteLLM v4(2025)的表 1 和 6 报告,MT Bench 上的成本节省比为 3.66,得分为 8.8,而 GPT-4 得分为 9.3。路由使用 GPT-4-1106-preview 和 Mixtral-8x7B,采用历史 token 价格假设。报告中的 95% 是相对基准分数,不是答案正确率。 RouteLLM, ICLR 2025, Tables 1 and 6
这些干预措施与要求每个参与者回答然后进行辩论是不同的干预措施。对于您的工作流程,分别比较替代方案:一个答案、一个有针对性检查的答案、选择性升级和全面讨论。否则,选择更便宜的模型所带来的好处可能会被错误地归功于协作,或者有用的审阅可能会被驳回,因为它的第一次响应成本更高。
构建一个小型决策模型
我们的说明性模型是总预期成本 = 执行成本 + 错误概率 × 错误后果。它故意遗漏了许多真实的细节,因此盈亏平衡的情况是可见的。下面的数字是虚构的教学投入,以美元表示算术。它们不是Colay价格、测量的Colay错误率或对您的工作的估计。
假设单答案工作流程的执行成本为 $0.02,出错概率为 12%;审阅工作流程的执行成本为 $0.08,出错概率为 8%。如果每次错误造成 $5 的返工成本,预期总成本分别为 $0.02 + 0.12 × $5 = $0.62,以及 $0.08 + 0.08 × $5 = $0.48。在这些假设下,审阅每项任务节省 $0.14。
额外的执行成本为 $0.06,假设的错误减少量为 0.04。因此,每个错误的收支平衡返工成本为 $0.06 ÷ 0.04 = $1.50。低于该阈值,在此简化模型中,更便宜的工作流程将获胜。如果审查根本不能减少错误,则此计算不会提供任何预防错误的好处。
| 工作流程 | 执行 | 每次错误返工花费 $5 时的预期返工成本 | 总计 |
|---|---|---|---|
| 单一答案 | $0.02 | $0.60 | $0.62 |
| 已审核的答案 | $0.08 | $0.40 | $0.48 |
用观察结果替换虚构的输入
最难的数字通常是错误概率的变化。不要从修改后的答案听起来有多有说服力来推断它。在相同的代表性任务上运行两个工作流程,在不透露工作流程的情况下对最终结果进行评分,并记录某人实际必须做出的更正。让不确定的案例可见,而不是默默地将它们视为成功。
按任务类别估计后果。私人草稿中的错误标题和操作计划中的错误数量需要不同的修复。记录审稿人时间、等待时间、重复尝试以及下游纠正工作。有些后果应该通过明确的约束和专家评审来处理,而不是压缩成一个投机性的货币数字。
将审核精力花在可以改变结果的地方
在发起讨论之前,请指出一个未解决的问题。对于提案来说,它可能缺少依赖项。对于计算来说,可能是单位换算。给额外的参与者一个可以改变决定的检查,并询问什么证据可以证明这种改变是合理的。使答案变得更好的请求更难评估。
提前设置停止规则:当规定的验收检查通过时完成,当仍然存在重要分歧时升级给某人,并停止重复同等的论点。回复可能会变得更长,但不会变得更有用。跟踪每单位预算已接受的可交付成果以及响应质量,因此演示文稿润色不会消耗全部额度。
将计算应用于Colay 使用量
Colay Consensus让智能体在协调智能体综合结论之前讨论请求。 Colay 订阅使用积分和限额。衡量您选择的模型和工作流程消耗的实际积分;不要将假设的美元示例转化为承诺的 Colay 消息数量。在估计正常一周时包括不成功的尝试。
保留一个简单的每周分类帐:任务类型、选定的工作流程、花费的积分、人工更正时间以及输出是否满足其要求。在足够多的可比示例之后,将讨论保留在值得付出额外努力的类别上。当模型、任务或订阅条款发生变化时,请重新检查该选择。结果是一条实用的支出规则,而不是声称更多的智能体总是更便宜或总是更好。
来源和方法
- FrugalGPT, 2023, Table 3
历史级联实验。
- RouteLLM, ICLR 2025, Tables 1 and 6
版本4;历史路由实验。
将您的下一个问题提交给 Colay
选择一个模型、使用 Auto,或通过 Consensus 汇集多种观点。