Colay / 指南
单个 AI 模型的风险:核查看似自信的答案
单个 AI 模型可以生成有说服力的备忘录,同时保留其最重要的假设未经检验。有用的问题是哪些主张可能会改变您的决定。本文将这些主张与散文分开,并解释了如何从第二个角度进行实际检查。
外部研究结果和示例计算并不是对 Colay 性能的实际测量。
研究衡量的内容
Farquhar 等人于 2024 年六月 19 日在 Nature 发表研究,报告语义熵方法在 30 个任务–模型组合上的平均 AUROC 为 0.790。该方法检测不稳定的编造内容。AUROC 衡量区分正确与错误答案的能力,并不意味着 79% 的答案正确。这不是对 Colay 的评估。 Farquhar et al., Nature, 2024
NIST AI 600-1 将自信地呈现的虚假信息识别为独特的生成式 AI 风险。它是一个风险管理框架,而不是模型排行榜或产品错误率研究。 NIST AI 600-1, 2024
我们的实际建议是将证据与演示分开评估。优雅的表可以包含缺乏依据的输入。冗长的解释可能会忽略对您的情况重要的例外情况。在要求进行更多分析之前,请标记一些会改变您所做工作的陈述。即使答案的其余部分看起来令人信服,这些陈述也值得明确检查。
错误且任意
Farquhar et al., Nature, 2024引文译文
Nature 用这一短语描述会随生成过程中的偶然细节而变化的编造内容,这是一类特定错误。
看似合理的答案可能会失败的四种方式
从事实层开始:引用的文献是否存在,其日期是否正确?接下来,检查适用性:该声明是否涵盖您的位置、产品和时间段?然后检查算术,特别是单位和分母。最后,询问完整性:哪个现实的替代方案被遗漏了?响应可以通过其中三项检查,但仍然无法做出决定。
有了一个答案,这些问题就可以归结为一个印象:一切看起来都很合理。当另一个模型将它们分开并识别特定的弱点时,它是有用的。重新表述相同的结论几乎没有增加任何证据。相关的进展单位是经过测试的假设,而不是另一段或对首选选项的另一次投票。
工作示例:正确的算术,不正确的范围
考虑一个假设的客服自动化提案。草稿假设每月有 1,200 张工单,每张节省四分钟,员工每小时价值为 €20。相乘得到 80 小时,相当于 €1,600。这些虚构数字用于说明工作流程,不是客户案例,也不是观察到的 Colay 实际结果。
第一个答案建议继续。审阅者指出,只有 40% 的工单可能符合自动化的条件。保持其他假设不变,将估计值更改为 32 小时,或 €640。原始模型可以完美计算,但由于缺少覆盖范围假设而支持错误的决策。
下一步是使用实际工单确定 40% 数字。如果它也是虚构的,那么审稿人只是用一个缺乏依据的前提替换了另一个前提。有用的综合指定了所需的样本、替代方案和继续进行的阈值。一致意见并不能解决缺失的观察结果;测量确实如此。
| 假设 | 每月小时数 | 相当于 €20/小时 |
|---|---|---|
| 所有 1,200 工单 | 80 | €1,600 |
| 40% 工单 | 32 | €640 |
使用Consensus使假设可见
在 Colay Consensus中,参与者讨论任务,协调智能体综合结果。对于此示例,用户可以明确请求假设检查、单位检查、替代解释和未解决的问题。这些是建议的说明,而不是声称该产品自动提供独立专家、经过验证的来源或完成的审核。
提供相同的输入表并区分测量值和估计值。要求每个异议确定它所依赖的行。请求一个最终答案,区分既定事实、有条件的结论和未知数。然后打开底层文档,重现决定性的计算。一些接受估计的模型并未将其转化为可测量的事实。
当额外的视角增加很少时
如果每个参与者都收到不完整的文档,那么所有人都可能会忽略相同的异常。包含您首选结论的问题也可以围绕捍卫它来构建整个讨论。消除异议的协调智能体可能会消除其最有价值的产出。额外的积分最好用在其他参与者贡献新的、可测试的挑战时。
您自己文本的简短翻译或邀请草稿可能只需要普通校对。承诺支出、改变客户承诺或依赖外部事实的建议值得更多审查。将检查过程与错误的后果以及逆转错误的难易程度相匹配。更多参与者是组织审查的一种手段,而不是跳过审查的理由。
保留决定记录
保存原始问题、决定性主张、支持文件或计算、未解决的限制和决策所有者。一周后,这份紧凑的记录将解释团队为何继续进行以及哪些新证据应引发审查。当您在自己的工作中根据Consensus测试单个模型时,它还为您提供了一些具体的比较。
从一份备忘录开始,其中最弱的假设可能会影响真正的决策。请求Consensus来确定该假设,然后在讨论之外对其进行验证。成功可能是修改建议、确认计算或决定等待一个缺失的测量结果。这三者都比没有证据支持的信心更有用。
来源和方法
- Farquhar et al., Nature, 2024
语义熵;发表于 2024 年六月 19 日。
- NIST AI 600-1, 2024
生成式 AI 风险概况,2.2 部分。
将您的下一个问题提交给 Colay
选择一个模型、使用 Auto,或通过 Consensus 汇集多种观点。