Colay / ガイド

Mixture-of-Agents:回答の統合には、価値の検証が必要

複数のAI回答を集めるのは簡単です。それらを一貫性があり検証できる成果物にまとめるのは、より難しい作業です。Mixture-of-Agentsの研究は、回答の統合を真剣に検討する理由になりますが、注目される割合の数値は誤解されがちです。ここでは測定結果を確認し、選好と事実の正確さを区別したうえで、最終成果物を評価する実用的な方法を提案します。

外部の調査結果や計算例は、Colay のパフォーマンスを測定するものではありません。

結果、指標、および参照回答

Wangらの2024年のMoA論文では、AlpacaEval 2.0の805件の指示に対する、回答の長さを調整した勝率は65.1%と報告されています。GPT-4o(05/13)は57.5%で、いずれもgpt-4-1106-previewとの比較です。この指標はAI評価者の選好を測るものであり、事実が正しい割合やColayの性能を表すものではありません。 Wang et al., 2024

その指標では、その差は 7.6 パーセント ポイントです。職場の正確性や製品を選択する顧客の割合を確立するものではありません。

長さの調整が重要な理由

Duboisらは、自動評価者の選好が回答の長さの違いに左右される影響を調整するため、長さを調整したAlpacaEvalを導入しました。ただし、その調整によってスコアがすべての事実の監査結果になるわけではありません。 Dubois et al., Length-Controlled AlpacaEval, 2024

自分で比較する際も、長くまとめられた回答は、追加の詳細が判断を改善していなくても、網羅的に感じられることがあります。両方の手順に同じ分量の上限と必須内容を指定し、有用性、事実の正確さ、読みやすさを別々に採点してください。一つの総合点だけでは、表現がよくなった一方で推奨案の根拠が弱くなったケースを見落とす場合があります。

各推奨事項の背後にある条件を維持する

仮の例を考えてみましょう。ある回答では、データの準備ができていれば 2 週間の実装を提案しています。クリーニングが必要な場合、別の見積もりでは 6 週間かかります。導入には 4 週間かかるという総合的な意見はバランスがとれているように聞こえますが、どちらのシナリオも表しません。より良い答えは、ブランチを保存し、データの準備について尋ねます。ステートメントを平均すると、有用な情報が失われます。

そのため、統合時には主張とその適用条件を一組として扱うことを勧めます。各推奨案には、理由、適用範囲、対応する入力資料の根拠が必要です。調整役に対立点の表を求め、要約によって都合の悪い条件が失われていないか確認できます。よい編集は、相違を曖昧にせず、理解しやすくします。

下書きと最終テキストの間に消えたものを監査する

サプライヤーへの依頼書に12個の必須条件が含まれているとします。仮のレビューでは、回答候補を合わせると12個すべてを網羅していますが、最終的にまとめた回答には9個しか残りません。最終文書がどの草案より読みやすくても、必須条件の網羅率は75%です。これは別の指標であり、AlpacaEvalの割合とは関係ありません。

依頼内容から必須条件を列挙し、最終文書に各条件があるか確認して、欠落を記録してください。次に、統合の段階で初めて加わった主張を調べます。新しい数値や約束には根拠が必要です。裏付けがなければ仮定と明記するか削除してください。これは仕上がりの印象ではなく、作業の過程で有用な内容が保たれたかを確かめる方法です。

最終合成の仮の監査
チェック結果の例アクション
必要な条件9 / 12 を保持3 つの省略を復元する
新しい数値的主張裏付けのない主張が2件確認または削除
議論のある仮定明示されていない前提が1件決定分岐を表示

十分に工夫した単一モデルの手順と比較する

作業内の複数のモデルの価値をテストするには、単一モデルのワークフローに同じ準備済みの概要、ソース、採点基準を与えます。組織化されたプロセスと不注意な 1 行のリクエストを比較すると、タスクの準備とアーキテクチャが混同されます。入力の準備と出力のレビューに必要な労力、モデルの使用状況、待ち時間を記録します。

短い事実質問と、複数の選択肢を含む長い意思決定メモの両方を試してください。成功基準は異なります。前者には個々の主張の裏付けが必要です。後者には、重要な条件を網羅することと、選択理由の明確な説明も必要です。改善が意思決定メモだけに見られたなら、実用上の推奨もその作業の種類に限定してください。

研究のスコアを流用せず、考え方をConsensusに生かす

ColayのConsensusも、最後に調整役が回答をまとめます。ただし、それだけで研究されたMoAの構成と同じになるわけではありません。この記事にはColayの公開ベンチマーク結果はありません。外部の研究結果は、自分の資料で作業手順を試す理由として扱ってください。個々のConsensus実行にそのまま使える品質スコアではありません。

推奨事項、証拠、未解決の意見の相違、および次のチェック可能なステップの 4 つの部分からなる結論をリクエストします。スペース制限と必須条件のリストを提供します。概要とその出典に照らして結果を確認します。ワークフローが有用な役割を果たすのは、ワークフローが何を保持または追加したか、また人間の作業がどれだけ残っているかを特定できる場合です。

出典と方法

  1. Wang et al., 2024

    表 2a;セクション3.1.

  2. Dubois et al., Length-Controlled AlpacaEval, 2024

    この指標は、モデル評価者の選好に対する回答の長さの影響を調整します。事実の正確さを示すスコアではありません。

次の質問を Colay に送ってください。

モデルを選択するか、Autoを使用するか、Consensusを使用して複数の視点を組み合わせます。

Colayを開く