Colay / ガイド

AI による議論が答えに価値を加えるとき

Consensusの価値を考える出発点は、検証できる問いです。議論は、最初の回答が見落とした誤りを見つけられるでしょうか。複数のモデルが有用な気付きをもたらすことはありますが、参加者の数だけではほとんど何も証明できません。この記事では研究結果を確認し、実用的な評価方法につなげます。公開された実験と、特定の製品についての主張は区別します。

外部の調査結果や計算例は、Colay のパフォーマンスを測定するものではありません。

注意深く読む価値のある小さな実験

Duらの2023年のプレプリント(ICML 2024での発表に先行)では、GSM8Kの20問のうちBardは11問、ChatGPTは14問、両者による議論では17問に正解しました。正解率はそれぞれ55%、70%、85%です。これは特定のモデルを小規模な標本で評価した結果であり、Colayの測定結果ではありません。 Du et al., 2023/ICML 2024

20 の質問サンプルにおける 3 つの追加の正解はシグナルであり、普遍的な改善率ではありません。別の言語、モデル、またはドキュメントをテストすると、条件が変わります。

実際に必要な改善点を特定する

3 つのオプションを使用して、仮の公開判断を考えてみましょう。 1 つの答えは、最速のルートを推奨することです。 2 つ目はサプライヤーの依存関係を特定します。 3 人目は、推定スケジュールには開発は含まれていますが、承認は含まれていないことに気づきました。有用な統合により、推定の範囲が修正され、それによって推奨事項が変更されるかどうかが説明されます。単に 3 つの視点を列挙するだけでは、この作業は完了しません。

提案する評価基準は、議論の印象のよさではなく、判断がどう変わったかです。欠けていた制約を取り戻せたか。単位の誤りを修正できたか。最初の回答が事実として扱った不明点を、不明だと明記できたか。回答が長くなっただけなら、利点はまだ確認できていません。この基準は、異なる製品やモデルの組み合わせにも使えます。

エージェント数とモデルの多様性は別個の変数です

ACL 2024で発表されたReConcileは、異なるモデルが回答について議論し、確信度で重み付けした投票を行う独自の手順を研究しています。評価対象はその構成であり、複数のエージェントを連携させるすべてのサービスの有効性を実証したものではありません。 Chen, Saha and Bansal, ACL 2024

独自のレビューで、回答候補の数、それらの開始アプローチの違い、最終的な回答を形成するために使用されたルールを区別します。 1 つのモデルに割り当てられた 3 つの役割は、3 つの独立した知識源にはなりません。異なるモデル名でも独立したエラーは確立されません。すべての参加者がリクエストから同じ誤った前提を継承する可能性があります。

改善とともに改悪も数える

これは仮の例であり、研究結果ではありません。事前に選んだ100件のタスクのうち、最初の回答は60件で正解しています。議論により誤答14件が修正される一方、正答6件が誤答に変わりました。最終的な正解数は68件で、正解率は差し引き8パーセントポイント上がっています。14件の修正だけを報告すると、結果の重要な部分を隠してしまいます。

結果も調べてください。タイプミスを修正することと、予算の制約を失うことには、異なるコストがかかります。最初の回答を最後の回答の横に保管し、それぞれの重要な主張が変更された理由を記録します。これにより、全体的なスコアがほとんど変わらない場合でも、ワークフローがどこで役立つかを示すことができます。重大な結果を伴う意思決定については、主題を理解しているレビュー担当者が、それらの変更が正当であるかどうかを判断する必要があります。

100 個のタスクにわたる仮の評価
移行件数解釈
間違い → 正しい14訂正
正解→不正解6改悪
純変化量+8正解数が60から68に増加

小規模だが公正な比較を実行する

許容可能な結果が確立されている最近の実際のタスクを選択します。回答を作成する前に、採点基準、支出制限、許容可能な最大遅延を書き留めてください。両方のワークフローに同じ証拠を提供します。最初のモデルがすでに失敗している質問だけを選択しないでください。その場合、議論が何らかの貢献をしたかどうかに関係なく、比較が 2 回目の試みに傾いてしまいます。

ワークフロー名を公開せずに出力を確認します。正確性、重要な制約の範囲、および人間による修正の量を個別にスコア付けします。成功例と並んで失敗例も保存しておきます。同僚が結果の評価に協力してくれる場合は、議論する前に独立して採点してもらいましょう。そうしないと、レビューでの合意によって、人々がタスクをどのように理解するかにおける本当の違いが隠れてしまう可能性があります。

ColayのConsensusでこれらの問いを検証する

Consensusでは、参加エージェントがタスクについて議論し、調整役が回答をまとめます。実用的な依頼では、明示した基準で選択肢を比較し、意見の分かれる前提を特定し、不足するデータを根拠のない確信で埋めないよう求めます。判断の基礎となる事実を渡し、重要な主張を資料の具体的な箇所に結び付けてもらってください。その対応関係は自分でも確認します。

この記事は、Colayの正解率が実測で改善したという結果を報告するものではありません。研究は、異なる解釈が重要な場合に議論を試す意義を示しますが、個々の実行の価値は実際の出力で決まります。証拠が足りなければ、未解決の相違を最終文書にも残してください。有用な結果が、全員一致の承認ではなく、追加情報の要求で終わることもあります。

出典と方法

  1. Du et al., 2023/ICML 2024

    セクション 3: 20 GSM8K の問題。

  2. Chen, Saha and Bansal, ACL 2024

    ReConcile:異なるモデル、議論、確信度に基づく重み付き投票を使う独自の手順。

次の質問を Colay に送ってください。

モデルを選択するか、Autoを使用するか、Consensusを使用して複数の視点を組み合わせます。

Colayを開く