Colay / Anleitungen
Wenn die KI-Debatte einer Antwort einen Mehrwert verleiht
Die Argumente für Consensus beginnen mit einer überprüfbaren Frage: Erkennt die Diskussion einen Fehler, den die erste Antwort übersehen hat? Mehrere Modelle können nützliche Beobachtungen liefern, aber die Anzahl der Teilnehmer allein beweist wenig. In diesem Artikel wird ein Forschungsergebnis untersucht und in eine praktische Bewertungsmethode umgewandelt. Dabei werden veröffentlichte Experimente von Behauptungen über ein bestimmtes Produkt getrennt.
Externe Forschungsergebnisse und anschauliche Berechnungen sind keine Messungen der Colay-Leistung.
Ein kleines Experiment, das es wert ist, sorgfältig gelesen zu werden
Im Preprint 2023 von Du et al., der ihrer ICML-Veröffentlichung 2024 vorausging, löste Bard 11 von 20 GSM8K-Probleme, ChatGPT löste 14 und die gemeinsame Debatte löste 17: 55%, 70% und 85%. Hierbei handelt es sich um Ergebnisse für bestimmte Modelle einer kleinen Stichprobe, nicht um Messungen von Colay. Du et al., 2023/ICML 2024
Drei zusätzliche richtige Antworten in einer Stichprobe von 20 Fragen sind ein Hinweis, keine allgemeingültige Verbesserungsrate. Andere Sprachen, Modelle oder Dokumente verändern die Bedingungen.
Identifizieren Sie die Verbesserung, die Sie tatsächlich benötigen
Betrachten Sie eine hypothetische Entscheidung zur Markteinführung mit drei Optionen. Eine Antwort empfiehlt den schnellsten Weg. Eine zweite erkennt eine Abhängigkeit von einem Lieferanten. Eine dritte bemerkt, dass der geschätzte Zeitplan die Entwicklung, aber keine Freigabe umfasst. Eine nützliche Synthese korrigiert den Umfang der Schätzung und erklärt, ob sich dadurch die Empfehlung ändert. Drei Perspektiven nur aufzuzählen, erledigt diese Arbeit noch nicht.
Unser vorgeschlagenes Kriterium ist eine Änderung der Entscheidung, keine eindrucksvolle Diskussion. Wurde eine fehlende Einschränkung wiederhergestellt? Wurde eine falsche Einheit behoben? Hat das Ergebnis eine Unbekannte gekennzeichnet, die in der ersten Antwort als Tatsache behandelt wurde? Wenn die einzige Änderung in einer längeren Reaktion besteht, bleibt der Nutzen unbewiesen. Dieses Kriterium gilt für alle Produkte und Modellkombinationen.
Agentenanzahl und Modellvielfalt sind separate Variablen
ReConcile, veröffentlicht bei ACL 2024, untersucht ein bestimmtes Protokoll: Verschiedene Modelle diskutieren Antworten und verwenden konfidenzgewichtete Abstimmungen. Es wertet diese Anordnung aus, anstatt jeden Dienst zu validieren, der mehrere Agenten koordiniert. Chen, Saha and Bansal, ACL 2024
Unterscheiden Sie in Ihrer eigenen Überprüfung die Anzahl der Kandidatenantworten, die Unterschiede in ihren Ausgangsansätzen und die Regel, die zur Bildung einer endgültigen Antwort verwendet wird. Drei Rollen, die einem Modell zugewiesen sind, werden nicht zu drei unabhängigen Wissensquellen. Unterschiedliche Modellnamen begründen auch keine unabhängigen Fehler: Jeder Teilnehmer kann dieselbe falsche Prämisse von der Anfrage erben.
Regressionen neben Korrekturen zählen
Hier handelt es sich um ein hypothetisches Beispiel, nicht um ein Forschungsergebnis. Bei 100 vorausgewählten Aufgaben ist die erste Antwort bei 60 richtig. Die Diskussion korrigiert 14 falsche Antworten, wandelt aber sechs richtige Antworten in falsche um. Das Ergebnis sind 68 richtige Antworten: ein Nettogewinn von acht Prozentpunkten. Die Meldung nur der 14 Reparaturen würde einen wesentlichen Teil des Ergebnisses verschleiern.
Prüfen Sie auch die Folgen. Ein korrigierter Tippfehler und eine verlorene Budgetvorgabe verursachen unterschiedliche Kosten. Bewahren Sie die erste Antwort neben der endgültigen auf und notieren Sie, warum sich jede wesentliche Aussage geändert hat. So wird sichtbar, wo ein Ablauf hilft, selbst wenn sich die Gesamtbewertung kaum verändert. Bei folgenreichen Entscheidungen muss eine fachkundige Person beurteilen, ob diese Änderungen gerechtfertigt sind.
| Übergang | Anzahl | Interpretation |
|---|---|---|
| Falsch → richtig | 14 | Korrekturen |
| Richtig → Falsch | 6 | Regressionen |
| Nettoveränderung | +8 | 68 richtig statt 60 |
Führen Sie einen kleinen, aber fairen Vergleich durch
Wählen Sie aktuelle reale Aufgaben mit einem nachgewiesenen akzeptablen Ergebnis. Notieren Sie sich die Bewertungskriterien, das Ausgabenlimit und die maximal akzeptable Verzögerung, bevor Sie Antworten generieren. Geben Sie beiden Arbeitsabläufen die gleichen Beweise. Wählen Sie nicht nur Fragen aus, bei denen das erste Modell bereits gescheitert ist: Das würde den Vergleich auf jeden zweiten Versuch ausrichten, unabhängig davon, ob die Diskussion etwas dazu beigetragen hat.
Überprüfen Sie die Ausgaben, ohne den Workflow-Namen preiszugeben. Bewerten Sie die Korrektheit, die Abdeckung wesentlicher Einschränkungen und den Umfang der menschlichen Überarbeitung separat. Bewahren Sie neben Erfolgen auch erfolglose Beispiele auf. Wenn Kollegen bei der Bewertung der Ergebnisse helfen, lassen Sie sie unabhängig voneinander punkten, bevor Sie sie besprechen. Andernfalls kann die Übereinstimmung in der Rezension echte Unterschiede im Verständnis der Aufgabe verschleiern.
Übertragen Sie diese Frage auf Colay Consensus
Im Consensus besprechen die teilnehmenden Agenten eine Aufgabe und ein Koordinator erstellt eine Synthese. In einer praktischen Anfrage werden sie aufgefordert, Alternativen anhand expliziter Kriterien zu vergleichen, umstrittene Annahmen zu identifizieren und zu vermeiden, fehlende Daten in Vertrauen umzuwandeln. Geben Sie die sachliche Grundlage an und fordern Sie, dass wichtige Behauptungen mit bestimmten Passagen in diesem Material in Verbindung gebracht werden. Überprüfen Sie diese Verbindungen selbst.
Dieser Artikel berichtet nicht über eine gemessene Colay-Genauigkeitsverbesserung. Die Forschung unterstützt die Untersuchung von Diskussionen, wenn konkurrierende Interpretationen von Bedeutung sind; Der Wert eines bestimmten Laufs hängt von seiner tatsächlichen Leistung ab. Behalten Sie ungelöste Meinungsverschiedenheiten im endgültigen Dokument bei, wenn die Beweise nicht ausreichen. Ein nützliches Ergebnis kann mit der Bitte um weitere Informationen anstelle einer einstimmigen Zustimmung enden.
Quellen und Methodik
- Du et al., 2023/ICML 2024
Abschnitt 3: 20 GSM8K-Probleme.
- Chen, Saha and Bansal, ACL 2024
ReConcile: ein eigenständiges Protokoll, das verschiedene Modelle, Diskussionen und konfidenzgewichtete Abstimmungen verwendet.
Senden Sie Ihre nächste Frage an Colay
Wählen Sie ein Modell, verwenden Sie Auto oder bringen Sie mehrere Perspektiven mit Consensus zusammen.