Colay / ガイド

1 つのモデルからの多くの回答、それともモデル間の議論ですか?

質問を何回か解き、最も頻繁に使用された回答を選択できます。また、参加者に競合するソリューションについて話し合って、総合的なソリューションを作成するよう依頼することもできます。どちらのアプローチも複数回の試行を必要としますが、異なるアイデアをテストします。この違いを理解すると、Consensusのどの部分が特定のジョブに役立つかを判断しやすくなります。

外部の調査結果や計算例は、Colay のパフォーマンスを測定するものではありません。

自己一貫性の論文が実際に測定した内容

Wangら(ICLR 2023)は、PaLM-540BのGSM8K正解率が、貪欲法で生成する思考の連鎖(chain-of-thought)の56.5%から、自己一貫性(self-consistency)の74.4%へ、17.9パーセントポイント上昇したと報告しています。結果は10回の実行の平均で、各実行では40件の出力をサンプリングしています。これは研究上の結果であり、Colayの測定値ではありません。 Wang et al., ICLR 2023

GSM8K のテスト分割には、1,319 個の初等数学の文章問題が含まれています。すべての調査、執筆、意思決定のタスクを表すのではなく、確認可能な最終的な答えを提供します。 GSM8K dataset, OpenAI

実用上は、最初の応答が、そのモデルから得られる最良の答えとは限らないと解釈できます。ただし、繰り返しにも資源を使います。費用を考慮せずに40回の試行と1回の試行を比べても、予算や許容できる待ち時間のもとで、どちらの作業手順が望ましいかは判断できません。

ワークフロー内の 3 つのオペレーションを分離する

実際的な評価では、候補の生成、候補の評価、および最終的な構成を区別します。生成によって、どの解決策が利用可能になるかが決まります。評価によって、どれがタスクの要件を満たしているかが決定されます。構成は、読者にとって有用な答えを生み出します。各操作は個別に改善でき、ある段階で成功しても、別の段階での失敗が自動的に修復されるわけではありません。

正しい解決策がすでに候補にあっても、投票で選ばれないことがあります。逆に、正しい候補を選んでも、最後に文章へまとめる際に必須条件を落とすこともあります。評価では途中の回答も保存してください。それがなければ、候補を増やすべきか、選択ルールを改善すべきか、調整役への指示を明確にすべきかを判断しにくくなります。

回答頻度が有益な場合

次の 5 つの答えが得られる仮想の算術質問について考えてみましょう: 42、42、42、24、24. 多数決により 42 が選択されます。この選択は再現可能ですが、正確さは問題と計算に依存します。 3 つの一致する応答がすべて分と時間を混同している場合、投票では同じエラーが保持されます。得票率は、回答が真実である確率を自動的に表すものではありません。

オープンクエスチョンは、何が合意としてみなされるかを決定するという、初期の困難をもたらします。 2 つの回答は、互換性のない理由で同じ製品を推奨している可能性があります。 2 つの異なる推奨事項は、両方とも異なる制約の下で機能する可能性があります。一致を数える前に、必要な出力(決定、その適用条件、必要な事実、不足している情報)を定義します。

ディスカッションがあなたのタスクに役立つ理由

数値の答えが 1 つある短い質問の場合は、計算を確認するだけで十分な場合があります。ソフトウェア アーキテクチャの決定には、規模、メンテナンス、未知の制約に関する前提条件を比較することが役立ちます。このような環境では、最も頻繁に繰り返される推奨事項を単に提示するだけでなく、矛盾する前提を明らかにする能力によって議論が評価されます。

二つの参加者が、異なるデータ量を想定して別々の設計を勧めたとします。有用な統合では、どの条件を境に推奨案が変わるかを示します。分かっていること、仮定していること、意見の相違を解決できる観測を簡潔に説明するよう求めてください。これはタスク設計の提案であり、モデルがすべての依存関係を発見する保証ではありません。

質問を変更せずにワークフローを比較する

支出の上限と共通の採点基準を事前に決めてください。通常の回答、明示的な選択ルールを使った個別の試行、議論の三つを比較します。呼び出し回数が同じでも費用は同じとは限りません。文脈の長さ、出力量、モデルの選択が影響します。追加作業を無料の改善とみなさず、品質とともに実際の支出と待ち時間を記録してください。

仮説計算により、トレードオフが明確になります。ワークフロー A では、40 個の計算上の費用単位に対する 20 個のタスクから 18 個の許容可能な結果が得られます。ワークフロー B では、80 ユニットに対して 19 が生成されます。追加の許容可能な結果には 40 ユニットがかかります。それは、A が好ましいという意味ではありません。余分に成功したタスクは特に価値があるかもしれません。これにより、改善にかかるコストが明確になり、議論できるようになります。

これが Colay の Consensus にとって何を意味するか

ColayのConsensusは、参加者間の議論と、調整役による統合を使います。自己一貫性の研究数値は、このモードの性能を示すものではありません。構成が異なれば独自の評価が必要です。利点を調べるには、繰り返し行うタスクを選び、同じ事実資料を渡して、通常モードの回答とConsensusの結果を保存してください。事前に決めた基準で両方を評価します。

推奨事項の根拠、その最も強力な重大な反対意見、および推奨事項を変更する条件を尋ねます。出典と計算を個別に確認してください。式または実行可能なテストによって正確性を確立できる場合は、同意する参加者の数の代わりにそのチェックを使用します。複数の試行により回答候補の集合が拡大します。ワークフローには、回答を受け入れるための根拠を説明できるルールが依然として必要です。

出典と方法

  1. Wang et al., ICLR 2023

    表 2;セクション3.2.

  2. GSM8K dataset, OpenAI

    メインのテスト分割には、1,319 個の初等数学の文章題が含まれています。

次の質問を Colay に送ってください。

モデルを選択するか、Autoを使用するか、Consensusを使用して複数の視点を組み合わせます。

Colayを開く