Colay / 指南

根据您实际需要完成的工作测试Consensus

有用的评估会询问工作流程是否在您可以承受的限制下改善了您的可交付成果。它并不是从收集令人印象深刻的例子开始的。比较相同的任务,在看到答案之前决定如何评分成功,并保留失败的结果。这会产生一个您可以重新审视的决定,而不是一个看起来精确的数字。

外部研究结果和示例计算并不是对 Colay 性能的实际测量。

选择分数之前先选择决定

NIST AI RMF 的测量功能要求在类似部署的条件下记录测试集、指标、不确定性和评估。它提供了一个衡量框架,而不是规定的获胜者或AI产品的认证。 NIST AI RMF: Measure

写下您的采用规则。例如:如果在相同的支出限额内发现更多重要遗漏且不超过约定的等待时间,则使用经过审核的工作流程进行需求分析。这是为您的实验建议的规则。在任何模型给出答案之前,通过列出具体示例来确定什么才是重要的。

将事实正确性与完整性、实用性和风格分别评估。即使审阅者喜欢语气,编造限制条件的精美答案也应无法通过事实核查。对于开放式任务,请使用简短评分标准,并附上明确的示例,记录人工审阅者的分歧。评判者是否一致,本身也需要检查,不能预先假定。

配对任务并控制预算

根据实际工作构建样本:普通任务、困难案例、不明确的请求以及缺少信息的示例。保留一套单独的调整提示。使用相同的源材料通过两个工作流程运行每个评估任务。对评分者隐藏工作流程名称并随机化答案顺序,以便位置和品牌不会决定比较。

对任务集中的每个工作流程使用相同的总支出范围和相同的完成期限。包括记账中的每个生成、协调步骤、重试和工具调用。单智能体基线应该有合理的提示并能够访问相同的相关信息。给一方额外的尝试,而只计算其最终答案会导致比较失败。

相同的预算上限并不意味着必须浪费未使用的预算。请记录实际支出,并提前规定工作流程达到上限时如何处理;未完成的任务必须如实保留。您也可以另行开展同等质量下的成本比较,但不要把它与同等预算实验的结果混在一起。

小样本需要不确定性区间

NIST 介绍了二项比例的 Wilson 区间。假设 100 次独立、具有代表性的试验中有 95 次成功,使用 z = 1.9599639845 计算得到的 95% 置信区间为 88.82%–97.85%。这些是示例观察,不是 Colay 的实测结果。 NIST: Confidence intervals for proportions

该区间涉及抽样假设下定义的任务群体的成功率。这并不是特定答案正确的概率。它也无法修复有偏差的样本。重复一份文档中几乎相同的请求可能会产生依赖性,并且仅测试简单的草稿并不能说明复杂的分析。

请勿宣称 95% 观察到的分数证明 95% 的产品可靠。记录日期、模型版本、提示、任务选择、排除、评分规则和预算。更改的模型或新的任务组合可能会使旧的估计成为下个月的糟糕指导。

读取配对结果,而不仅仅是两个百分比

考虑在相同的 100 任务上另一个明确虚构的结果:两个工作流程都通过了 89,只有 Consensus 通过了 6,只有单智能体工作流程通过了 1,并且都失败了4。总共成功 95 和 90 次。成对的差异是五个任务,但最丰富的观察结果是工作流程不一致的七种情况。

对于这张假设表,双侧精确 McNemar 检验以那七组结果不一致的配对为条件。在获胜概率相等的假设下,p 值为 2 × (1 + 7) ÷ 128 = 0.125,未达到预先选定的 0.05 阈值。这不能证明两者等效,而是说明表面领先仍需更多证据。分别计算的置信区间是否重叠,不能替代配对分析。

100 项任务的假设配对结果
结果任务
均通过89
仅Consensus通过6
仅单智能体工作流程通过1
都失败了4

将调查结果转化为有限的操作规则

检查每个由对变错的案例。某个工作流程即使改善了许多影响较小的草稿,只要引入一次严重事实错误,也可能不符合采用规则。用新任务扩展有前景的类别,并保留未用于调整提示词的留出测试集。反复查看结果,在第一次出现好分数时就停止,可能夸大表面收益。

在 Colay Consensus中,智能体讨论请求,协调智能体综合结论。评估最终的可交付成果以及验证它所需的工作。记录积分,因为 Colay 订阅有积分和限制。仅发布您的测试支持的内容:采样的任务、测试的配置、观察到的权衡和不确定性。此示例均未建立测量的 Colay 基准。

来源和方法

  1. NIST AI RMF: Measure

    评估框架。

  2. NIST: Confidence intervals for proportions

    威尔逊区间法。

将您的下一个问题提交给 Colay

选择一个模型、使用 Auto,或通过 Consensus 汇集多种观点。

打开 Colay