Colay / ガイド

実際の業務でConsensusを試す

評価は、許容できる制約のもとで作業手順が成果物を改善するかを判断するために行います。印象的な事例集めから始めるものではありません。同じタスクを比較し、回答を見る前に成功の採点方法を決め、失敗例も残してください。そうすることで、精密に見えるだけの数字ではなく、後から見直せる判断が得られます。

外部の調査結果や計算例は、Colay のパフォーマンスを測定するものではありません。

スコアを決める前に、何を判断するか決める

NIST AI RMF の測定機能では、文書化されたテスト セット、メトリクス、不確実性、および展開に似た条件での評価が必要です。これは測定フレームワークを提供するものであり、規定の勝者や AI 製品の認定を提供するものではありません。 NIST AI RMF: Measure

採用条件を書いてください。例えば、同じ予算枠内で重要な見落としをより多く発見し、合意した待ち時間を超えない場合に、要件分析でレビュー付きの手順を使う、といった条件です。これは実験に向けたルールの提案です。モデルが回答を生成する前に、具体例を挙げて何を重要な見落としとするかを決めてください。

事実の正確さを、網羅性、有用性、文体と分けて評価してください。制約を勝手に作った回答は、文章が洗練され、評価者がその語調を好んでも、事実確認には合格させるべきではありません。自由形式のタスクでは、判断の目安となる例を添えた短い採点基準を使い、人間の評価者間の意見の相違を記録します。評価者の一致も、前提にせず調べる対象です。

タスクをペアにして予算を管理する

実際の作業からサンプルを作成します。通常のタスク、困難なケース、あいまいなリクエスト、情報が不足している例などです。調整プロンプト用に別のセットを保持します。同じ原資料を使用して、両方のワークフローを通じて各評価タスクを実行します。スコアラーからワークフロー名を隠し、回答の順序をランダム化して、順位やブランドが比較を決定しないようにします。

タスクセット全体にわたって、各ワークフローに同じ総支出枠と同じ完了期限を使用します。すべての生成、調整ステップ、再試行、およびツール呼び出しを使用量の計算に含めます。単一エージェントのベースラインには、適切なプロンプトと同じ関連情報へのアクセスが必要です。一方の側に追加の試行を与え、最終的な答えだけをカウントすると、比較は無効になります。

予算枠をそろえるために、余った予算を使い切る必要はありません。実際の支出を記録し、上限に達したときの扱いを事前に決めてください。未完了のタスクを記録から消してはいけません。同じ品質に達するための費用を別途比較することもできますが、その結果と同じ予算での実験を混同しないでください。

小さなサンプルには不確実性区間が必要です

NISTは二項比率のウィルソン区間を説明しています。独立で代表性のある100回の試行で95回成功した場合、z = 1.9599639845を用いた計算では、95%区間は88.82%–97.85%になります。これは説明用に想定した観測値であり、Colayの測定結果ではありません。 NIST: Confidence intervals for proportions

この区間は、標本抽出の仮定のもとで定義されたタスク母集団の成功率に関するものです。特定の回答が正しい確率ではなく、偏った標本を補正するものでもありません。一つの文書からほぼ同じリクエストを繰り返すと依存が生じる場合があり、簡単な草案だけを試しても複雑な分析についてはほとんど分かりません。

95% の観察スコアが 95% の信頼できる製品であることを証明すると発表しないでください。日付、モデルのバージョン、プロンプト、タスクの選択、除外、スコアリング ルール、予算を記録します。モデルが変更されたり、新しいタスクが混在したりすると、古い見積もりが翌月のガイドとして不十分になる可能性があります。

2 つのパーセンテージだけでなく、ペアになった結果を読み取る

同じ100件のタスクについて、もう一つの架空の結果を考えます。両方の手順が成功したのは89件、Consensusのみが成功したのは6件、単一エージェントの手順のみが成功したのは1件、両方が失敗したのは4件です。成功数の合計はそれぞれ95件と90件です。対応のある比較では差は5件ですが、特に有益なのは、結果が分かれた7件の観測です。

この仮の表では、両側の正確McNemar検定は、結果が分かれた7組を条件として計算します。両手順が勝つ確率が等しい場合、p値は2 × (1 + 7) ÷ 128 = 0.125です。事前に選んだ有意水準0.05を満たしません。これは同等性の証明ではなく、見かけの優位性に追加の証拠が必要な理由を示しています。別々に計算した信頼区間の重なりは、対応のある分析の代わりにはなりません。

100 個のタスクに関する仮のペア結果
結果タスク
両方とも合格89
Consensusのみ成功6
単一エージェントのみ成功1
両方とも失敗4

調査結果を限定的な運用ルールに変える

改悪をすべて調べてください。影響の小さい多くの草案を改善しても、重大な事実誤認を一つ増やす手順は、採用条件を満たさないかもしれません。有望な種類のタスクを新しい事例で増やし、プロンプトの調整に使っていない保留用の評価セットを維持してください。結果を何度も見ながら、初めて好ましいスコアが出た時点で止めると、改善を過大評価する場合があります。

Colay Consensusでは、エージェントがリクエストについて話し合い、調整エージェントが結論をまとめます。最終的な成果物とそれを検証するために必要な労力を評価します。 Colay のサブスクリプションにはクレジットと制限があるため、クレジットを記録します。サンプルされたタスク、テストされた構成、観察されたトレードオフ、不確実性など、テストでサポートされるもののみを公開してください。この例では、Colay の測定ベンチマークを確立するものはありません。

出典と方法

  1. NIST AI RMF: Measure

    評価フレームワーク。

  2. NIST: Confidence intervals for proportions

    ウィルソン区間の計算法。

次の質問を Colay に送ってください。

モデルを選択するか、Autoを使用するか、Consensusを使用して複数の視点を組み合わせます。

Colayを開く