Colay / ガイド
1 つの AI モデルのリスク: 自信のある答えをチェックする
単一の AI モデルは、最も重要な前提を未テストのままにして、説得力のあるメモを作成できます。有益な質問は、どの主張があなたの決定を変える可能性があるかということです。この記事では、これらの主張を散文から分離し、第 2 の視点が実際のチェックにどのようにつながるかを説明します。
外部の調査結果や計算例は、Colay のパフォーマンスを測定するものではありません。
調査で測定される内容
2024年6月19日にNatureに掲載されたFarquharらの研究は、30のタスクとモデルの組み合わせで、意味的エントロピーの平均AUROCを0.790と報告しました。この方法は、生成時の偶発的な違いで変わる不安定な作話を検出します。AUROCは正答と誤答を識別する能力の指標であり、回答の79%が正しいという意味ではありません。これはColayの評価ではありません。 Farquhar et al., Nature, 2024
NIST AI 600-1 は、自信を持って提示された虚偽の情報を、生成的な AI リスクとして識別します。これはリスク管理フレームワークであり、モデルのリーダーボードや製品エラー率の調査ではありません。 NIST AI 600-1, 2024
実務では、表現のよさと根拠を分けて評価することを勧めます。整った表にも裏付けのない入力値が含まれ、長い説明でも自分の状況で重要な例外が抜けることがあります。追加の分析を求める前に、自分の行動を変え得る主張をいくつか選んで印を付けてください。回答の残りが説得的に見えても、それらは明示的に確認する価値があります。
間違っていて恣意的
Farquhar et al., Nature, 2024引用の翻訳
Natureはこの表現を、生成時の偶発的な細部に左右される作話、すなわち特定の種類の誤りについて使っています。
もっともらしい答えが失敗する可能性がある 4 つの方法
事実の層から始めます。引用された文書は存在しますか?その日付は正しいか?次に、該当性を確認します。この声明はあなたの所在地、製品、期間をカバーしていますか?次に、算術、特に単位と分母を検査します。最後に、完全性について尋ねます。どの現実的な代替案が省略されていますか?応答はこれらのチェックのうち 3 つに合格しても、決定に失敗する可能性があります。
回答が一つだけだと、これらの問いが「全体としてもっともらしい」という印象にまとめられてしまうことがあります。別のモデルが問いを切り分け、具体的な弱点を見つければ役立ちます。同じ結論の言い換えでは、根拠はほとんど増えません。進展として数えるべきなのは、段落の追加や好みの案への追加の賛成票ではなく、検証できた前提です。
具体例:計算は正しいが、対象範囲が違う
サポート業務を自動化する仮の提案を考えます。草案では、月1,200件の問い合わせ、一件あたり4分の短縮、人件費の価値を一時間€20と想定しています。掛け算すると80時間、金額にして€1,600です。これらは手順を説明するための架空の数値であり、顧客事例やColayで観測された結果ではありません。
最初の回答では、続行することをお勧めします。レビュー担当者は、チケットの 40% のみが自動化の対象となる可能性があると指摘しています。他の仮定を一定に保つと、見積もりは 32 時間、つまり €640 に変わります。元のモデルは、カバレッジの仮定が欠落しているため、不適切な決定をサポートしながら完璧に計算できた可能性があります。
次に行うべきことは、実際の問い合わせを使って40%という値を確かめることです。この値も架空なら、レビュー担当者は裏付けのない前提を別のものに置き換えただけです。有用な統合では、必要な標本、別のシナリオ、進めるための基準を示します。足りない観測を補うのは、合意ではなく測定です。
| 仮定 | 1 か月あたりの時間数 | €20/時間で換算した金額 |
|---|---|---|
| すべての 1,200 のチケット | 80 | €1,600 |
| 問い合わせの40%のみ | 32 | €640 |
Consensusを使用して仮定を可視化する
ColayのConsensusでは、参加者がタスクについて話し合い、コーディネーターが結果を総合します。この例では、ユーザーは仮定チェック、単位チェック、代替説明、未解決の質問を明示的に要求できます。これらは推奨される手順であり、製品が独立した専門家、検証済みの情報源、または完了した監査を自動的に提供すると主張するものではありません。
同じ入力テーブルを提供し、測定値と推定値を区別します。各オブジェクションに、それが依存する行を特定するように依頼します。確立された事実、条件付きの結論、未知の部分を区別する最終的な回答を要求します。次に、基礎となる文書を開いて、決定的な計算を再現します。いくつかのモデルは推定値を受け入れても、それが測定された事実にはなりません。
視点を増やしてもほとんど役立たない場合
全参加者が不完全な文書を受け取れば、全員が同じ例外を見落とすかもしれません。望ましい結論を埋め込んだ質問は、その結論を擁護する方向に議論全体を誘導する場合もあります。調整役が異論を曖昧にすると、議論の最も価値ある成果が失われかねません。追加の参加者が新たに検証できる異論を示す場合に、追加クレジットを使う意義が最も大きくなります。
独自のテキストや招待状の下書きの短い翻訳の場合は、通常の校正のみが必要な場合があります。支出をコミットしたり、顧客との約束を変更したり、外部の事実に依存したりする推奨事項は、さらに精査する必要があります。チェックプロセスをエラーの結果とそれを元に戻す容易さに合わせてください。参加者が増えることは精査を組織するための手段であり、精査をスキップする理由ではありません。
決定記録を保存する
元の質問、決定的な主張、裏付けとなる文書または計算、未解決の制限、意思決定者を保存します。 1週間後、このコンパクトな記録によって、チームがなぜ作業を進めたのか、そしてどのような新たな証拠が見直しのきっかけとなるのかが説明されることになるだろう。また、単一のモデルを自分の作業のConsensusとテストするときに、具体的に比較できるようになります。
最も弱い仮定が実際の決定に影響を与える可能性がある 1 つのメモから始めます。 Consensusにその前提を特定するよう依頼し、議論の外で検証してください。成功とは、改訂された推奨事項、確認された計算、または 1 つの欠落した測定を待つという決定である可能性があります。この 3 つはすべて、証拠に裏付けられていない自信よりも役立ちます。
出典と方法
- Farquhar et al., Nature, 2024
意味的エントロピー。2024年6月19日公開。
- NIST AI 600-1, 2024
生成 AI リスク プロファイル、セクション 2.2.
次の質問を Colay に送ってください。
モデルを選択するか、Autoを使用するか、Consensusを使用して複数の視点を組み合わせます。