Colay / 指南
AI信心和人类判断:保持决策所有权
有用的AI结果应该帮助人们理解决策,而不仅仅是更快地接受完成的文档。面临的挑战是保持自己的标准,使反对意见具有可操作性,并确定多视角讨论是否真正改善了您所做的工作。
外部研究结果和示例计算并不是对 Colay 性能的实际测量。
信心研究可以告诉我们什么
Microsoft Research 与 Carnegie Mellon 的一项 CHI 2025 研究调查了 319 名员工,他们描述了 936 次 AI 使用经历。对 AI 的信心越高,自我报告的批判性思考越少。这是调查中的关联,并不能证明 AI 导致智力下降。 Lee et al., CHI 2025
2024 年 Nature Human Behaviour 的一项荟萃分析,涵盖 2020–2023 年研究中的 106 项实验和 370 个效应。人机组合的平均表现低于人或 AI 单独工作时二者中的较优者:Hedges’ g = −0.23,95% 置信区间为 −0.39 至 −0.07。这一标准化效应并不意味着准确率下降 23%。 Vaccaro et al., Nature Human Behaviour, 2024
我们的建议是赋予人类监督一项特定的工作。一个人应该定义目标,选择标准,检查决定性证据并解释为什么接受结论。简单地重新阅读一个完美的答案并批准它是一个过于模糊的评估过程。一个人的存在所提供的信息少于该人实际执行的检查。
在阅读答案之前写下您的标准
在请求分析之前,记录您所选择的内容、哪些约束是强制性的以及哪些会改变您的观点。对于软件选择,这可能意味着所需的集成、可接受的学习时间以及导出数据的能力。这个简短的注释不需要包含正确的答案。其目的是在有吸引力的外部框架到来之前保留您的标准。
讨论结束后,将结论与注释进行比较。如果出现新标准,请确定它来自何处:实际要求、新发现的限制还是吸引人的描述?当您能够解释原因时,修改标准是合理的。该记录有助于区分学习与默默采纳最新的自信观点。
工作示例:看起来比实际更完整的表格
想象一个虚构的团队选择用于每周报告的软件。它将三个选项与五个标准进行比较。一个AI答案会分配分数并宣布获胜者。然而,有两个标准,即所需的导出格式和特定的集成,尚未得到验证。尽管决定性的输入值仍然未知,但该表看起来已经完成。
将这些单元格标记为未知,而不是分配中性分数。要求讨论在替代值下测试决策:如果导出不可用怎么办?如果设置需要一周时间,获胜者会改变吗?这些问题产生了一个简短的产品验证套餐。这三个选项和五个标准是本教学示例的一部分,而不是关于 Colay 客户的调查结果。
然后,在更新表之前,人员会使用示例文件测试导出以及与真实工作流程的集成。如果选择发生变化,原因很重要:新的观察结果出现。如果保持不变,检查仍然可以为同事提供一个有道理的解释。目的是改善选择的基础,而不是最大化人类推翻AI的次数。
一个Consensus请求,让判断可见
Colay Consensus让参与者讨论请求,协调智能体综合结果。试试这个说明:“首先检查标准。识别未知的输入。显示哪个未知的可以改变选择。提出最小的有用验证。”您还可以询问最终答案,以保留在不同假设下仍然合理的替代方案。这是建议的做法,而不是衡量的产品保证。
不要仅仅因为大多数答复都同意就要求协调智能体结束问题。要求将证据与结论联系起来,并保持重要的不确定性可见。然后用你自己的话解释这个决定,不要复制摘要。如果该解释完全取决于模型是否同意,请返回到应证明其合理性的输入。
衡量自己工作的实用性
在比较方法之前选择多个重复任务并定义错误。为单一模型运行和讨论提供相同的作业和支持材料。检查具体缺陷,例如缺乏依据的功能声明、错误的计算或遗漏的强制约束。还记录审核时间和积分使用情况。将这些观察结果与答案听起来更深层次的印象分开。
在实际情况下,请同事评估匿名输出,而无需知道每个输出是哪种模式产生的。一个小的内部样本无法建立普遍的产品优势,但它可以揭示讨论在您的工作流程中赢得额外时间的地方。特别注意一致的错误。它们暴露了成功的演示可能会掩盖的局限性。
保留在没有获胜者的情况下停止的选项
应允许得出证据不足的结论。如果格式要求任何情况下都必须选出赢家,就容易诱使回答填补空白。对于小型、可逆的任务,可以接受某个假设并稍后核查;对于后果重大的选择,应记录行动前必须取得的观察结果。这个门槛应由任务负责人设定,而不是从答案语气中推断。
对于您的下一个工作决策,请写下标准、请求讨论、验证一个决定性事实并亲自解释结果。这使得人类的角色变得可见。 Consensus可以为不同的论点提供一个有组织的场所,而做出决定的人保留对标准、事实核查和最终行动的责任。
来源和方法
- Lee et al., CHI 2025
微软研究院和卡内基梅隆大学;调查,而不是因果实验。
- Vaccaro et al., Nature Human Behaviour, 2024
发表于 2024 年十月 28 日;预注册荟萃分析。
将您的下一个问题提交给 Colay
选择一个模型、使用 Auto,或通过 Consensus 汇集多种观点。