Colay / Anleitungen

Viele Antworten von einem Modell oder Diskussion zwischen Modellen?

Sie können eine Frage mehrmals lösen und die häufigste Antwort auswählen. Sie können die Teilnehmer auch bitten, konkurrierende Lösungen zu diskutieren und eine Synthese zu erstellen. Beide Ansätze erfordern mehr als einen Versuch, testen jedoch unterschiedliche Ideen. Das Verständnis dieser Unterscheidung erleichtert die Entscheidung, welcher Teil von Consensus für einen bestimmten Job nützlich ist.

Externe Forschungsergebnisse und anschauliche Berechnungen sind keine Messungen der Colay-Leistung.

Was im Selbstkonsistenzpapier tatsächlich gemessen wurde

Wang et al. berichten bei ICLR 2023, dass die Genauigkeit von PaLM-540B auf GSM8K mit Self-Consistency von 56.5% bei einer gierigen Chain-of-Thought-Dekodierung auf 74.4% steigt: um 17.9 Prozentpunkte. Die Ergebnisse sind Mittelwerte aus 10 Durchläufen mit jeweils 40 generierten Antworten. Dies sind Forschungsergebnisse, keine Colay-Messungen. Wang et al., ICLR 2023

Der Testdatensatz von GSM8K enthält 1,319 mathematische Textaufgaben auf Grundschulniveau. Er bietet überprüfbare Endergebnisse, bildet jedoch nicht jede Recherche-, Schreib- oder Entscheidungsaufgabe ab. GSM8K-Datensatz, OpenAI

Eine praktische Interpretation ist, dass die erste Antwort nicht unbedingt die beste verfügbare Antwort eines Modells sein muss. Auch die Wiederholung verbraucht Ressourcen. Ein Vergleich zwischen vierzig Versuchen und einem Versuch ohne Berücksichtigung der Kosten ergibt keine Aussage darüber, welcher Arbeitsablauf im Rahmen Ihres Ausgabenlimits oder Ihrer akzeptablen Wartezeit vorzuziehen ist.

Trennen Sie drei Vorgänge im Workflow

Für eine praktische Bewertung unterscheiden Sie zwischen Kandidatengenerierung, Kandidatenbewertung und endgültiger Zusammensetzung. Die Generierung bestimmt, welche möglichen Lösungen verfügbar werden. Durch die Bewertung wird entschieden, welche die Aufgabenanforderungen erfüllen. Die Komposition liefert eine brauchbare Antwort für den Leser. Jeder Vorgang kann einzeln verbessert werden, und ein Erfolg in einer Phase behebt nicht automatisch einen Fehler in einer anderen.

Eine korrekte Lösung könnte bereits vorhanden sein, aber eine Abstimmung verlieren. Alternativ kann der richtige Kandidat ausgewählt werden, während in der Schlussprosa eine wesentliche Bedingung gestrichen wird. Behalten Sie Zwischenantworten bei der Bewertung eines Workflows bei. Ohne sie ist es schwierig zu sagen, ob Sie mehr Kandidaten, eine bessere Auswahlregel oder eine klarere Anweisung an den Koordinator benötigen.

Wenn die Antworthäufigkeit informativ ist

Stellen Sie sich eine hypothetische arithmetische Frage vor, die fünf Antworten liefert: 42, 42, 42, 24 und 24. Bei der Mehrheitsabstimmung werden 42 ausgewählt. Diese Auswahl ist reproduzierbar, die Richtigkeit hängt jedoch immer noch vom Problem und der Berechnung ab. Wenn die drei übereinstimmenden Antworten alle Minuten mit Stunden verwechseln, bleibt bei der Abstimmung derselbe Fehler bestehen. Der Stimmenanteil ist nicht automatisch die Wahrscheinlichkeit, dass eine Antwort wahr ist.

Offene Fragen führen zu einer früheren Schwierigkeit: der Entscheidung, was als Zustimmung gilt. In zwei Antworten wird möglicherweise aus inkompatiblen Gründen dasselbe Produkt empfohlen. Zwei unterschiedliche Empfehlungen funktionieren möglicherweise unter unterschiedlichen Einschränkungen. Bevor Sie Übereinstimmungen zählen, definieren Sie die Ausgabe, die Sie benötigen: eine Entscheidung, ihre Anwendbarkeitsbedingungen, erforderliche Fakten und alle noch fehlenden Informationen.

Warum eine Diskussion für Ihre Aufgabe nützlich sein könnte

Bei einer kurzen Frage mit einer numerischen Antwort kann die Überprüfung der Berechnung ausreichen. Eine Softwarearchitekturentscheidung profitiert vom Vergleich der Annahmen über Skalierung, Wartung und unbekannte Einschränkungen. In diesem Umfeld kann die Diskussion auf ihre Fähigkeit hin bewertet werden, inkompatible Prämissen aufzudecken, anstatt einfach nur die am häufigsten wiederholte Empfehlung hervorzubringen.

Angenommen, zwei Teilnehmer empfehlen unterschiedliche Designs, weil sie von unterschiedlichen Datenmengen ausgehen. Eine nützliche Synthese identifiziert den Punkt, an dem sich die Präferenz ändert. Bitten Sie um eine kompakte Darstellung dessen, was bekannt ist, was angenommen wird und welche Beobachtung die Meinungsverschiedenheit beilegen würde. Dies ist unsere vorgeschlagene Aufgabenentwurfsmethode und keine Garantie dafür, dass ein Modell jede Abhängigkeit erkennt.

Vergleichen Sie Arbeitsabläufe, ohne die Frage zu ändern

Legen Sie vorab eine Ausgabenobergrenze und ein gemeinsames Bewertungsschema fest. Vergleichen Sie eine gewöhnliche Antwort, separate Versuche mit einer ausdrücklichen Auswahlregel und eine Diskussion. Gleich viele Modellaufrufe bedeuten keine gleichen Kosten: Kontextlänge, Ausgabeumfang und Modellauswahl spielen eine Rolle. Erfassen Sie tatsächliche Ausgaben und Wartezeit neben der Qualität, statt zusätzliche Arbeit als kostenlose Verbesserung zu behandeln.

Eine hypothetische Berechnung macht den Kompromiss sichtbar. Workflow A liefert 18 akzeptable Ergebnisse aus 20 Aufgaben für 40 Abrechnungseinheiten. Workflow B erzeugt 19 für 80 Einheiten. Das zusätzliche akzeptable Ergebnis kostet 40 Einheiten. Das bedeutet nicht, dass A vorzuziehen ist: Die besonders erfolgreiche Aufgabe kann besonders wertvoll sein. Es macht die Kosten der Verbesserung deutlich genug, um sie zu diskutieren.

Was das für Consensus in Colay bedeutet

Colay Consensus nutzt eine Diskussion unter den Teilnehmern und die Synthese durch einen Koordinator. Zahlen zur Self-Consistency beschreiben diesen Modus nicht: Eine andere Konfiguration benötigt eine eigene Bewertung. Wählen Sie zur Untersuchung des Nutzens eine wiederkehrende Aufgabe, stellen Sie dieselben Fakten bereit und bewahren Sie eine Antwort im gewöhnlichen Modus neben dem Consensus-Ergebnis auf. Bewerten Sie beide anhand der zuvor festgelegten Kriterien.

Fragen Sie nach der Grundlage der Empfehlung, ihrem stärksten wesentlichen Einwand und den Bedingungen, die sie ändern würden. Überprüfen Sie Quellen und Berechnungen separat. Wenn eine Formel oder ein ausführbarer Test die Richtigkeit feststellen kann, verwenden Sie diese Prüfung anstelle der Anzahl der zustimmenden Teilnehmer. Mehrere Versuche erweitern den Kandidatenpool; Der Workflow benötigt weiterhin eine vertretbare Regel für die Annahme einer Antwort.

Quellen und Methodik

  1. Wang et al., ICLR 2023

    Tabelle 2; Abschnitt 3.2.

  2. GSM8K-Datensatz, OpenAI

    Die Haupttestaufteilung enthält 1,319 Textaufgaben zur Elementarmathematik.

Senden Sie Ihre nächste Frage an Colay

Wählen Sie ein Modell, verwenden Sie Auto oder bringen Sie mehrere Perspektiven mit Consensus zusammen.

Colay öffnen