Colay / Anleitungen
Mixture-of-Agents: Eine Synthese muss ihren Nutzen beweisen
Mehrere KI-Antworten zu sammeln ist einfach; daraus ein schlüssiges, überprüfbares Arbeitsergebnis zu machen, ist schwieriger. Die Forschung zu Mixture-of-Agents gibt Anlass, die Synthese ernst zu nehmen, doch die hervorgehobenen Prozentwerte werden leicht missverstanden. Wir betrachten hier die Messung, unterscheiden Präferenz von sachlicher Richtigkeit und schlagen eine praktische Bewertung des Endergebnisses vor.
Externe Forschungsergebnisse und anschauliche Berechnungen sind keine Messungen der Colay-Leistung.
Das Ergebnis, die Metrik und die Referenzantwort
Wang et al.s 2024 MoA-Papier berichtet von einer 65.1% längenkontrollierten Gewinnrate bei AlpacaEval 2.0s 805 Anweisungen im Vergleich zu 57.5% für GPT-4o (05/13). Beide werden mit gpt-4-1106-preview verglichen. Dies misst die Präferenz der KI-Richter, nicht den Anteil korrekter Fakten oder die Colay-Leistung. Wang et al., 2024
Die Differenz beträgt bei dieser Kennzahl 7.6 Prozentpunkte. Daraus lassen sich weder die Genauigkeit im Arbeitsalltag noch der Anteil der Kunden ableiten, die ein Produkt wählen werden.
Warum es wichtig ist, die Länge anzupassen
Dubois et al. führte längengesteuertes AlpacaEval ein, um die Präferenzen für die automatische Beurteilung an Unterschiede in der Antwortlänge anzupassen. Durch diese Anpassung wird die Bewertung nicht zu einer Prüfung jeder Tatsachenaussage. Dubois et al., Length-Controlled AlpacaEval, 2024
In Ihrem eigenen Vergleich kann sich eine lange Synthese vollständig anfühlen, selbst wenn die zusätzlichen Details die Entscheidung nicht verbessern. Geben Sie beiden Workflows das gleiche Platzlimit und die gleichen erforderlichen Inhalte. Bewerten Sie dann Nützlichkeit, sachliche Korrektheit und Lesbarkeit getrennt. Eine einzelne kombinierte Bewertung kann ein Ergebnis verschleiern, bei dem sich die Präsentation verbessert, während die Grundlage der Empfehlung schwächer wird.
Behalten Sie die Bedingungen hinter jeder Empfehlung bei
Betrachten Sie ein hypothetisches Beispiel. Eine Antwort schlägt eine zweiwöchige Umsetzung vor, wenn die Daten vorliegen; ein anderer schätzt sechs Wochen, wenn eine Reinigung erforderlich ist. Eine Synthese, die besagt, dass die Umsetzung vier Wochen dauert, klingt ausgewogen, stellt aber keines der beiden Szenarios dar. Eine bessere Antwort behält die Verzweigung bei und fragt nach der Datenbereitschaft. Durch die Mittelung der Aussagen werden nützliche Informationen zerstört.
Deshalb empfehlen wir, eine Aussage und ihre Geltungsbedingungen bei der Synthese als Einheit zu behandeln. Jede Empfehlung braucht eine Grundlage, eine Grenze und nachvollziehbare Belege aus dem Ausgangsmaterial. Sie können den Koordinator um eine Tabelle der Widersprüche bitten und anschließend prüfen, ob beim Kürzen eine unbequeme Bedingung verloren ging. Gute redaktionelle Arbeit macht Unterschiede verständlicher, statt sie einzuebnen.
Überprüfen Sie, was zwischen den Entwürfen und dem endgültigen Text verschwunden ist
Angenommen, ein Lieferantenbrief enthält 12 verbindliche Bedingungen. In einer hypothetischen Überprüfung decken die Kandidatenantworten insgesamt alle 12 ab, in der endgültigen Synthese bleiben jedoch nur neun erhalten. Die Abdeckung der erforderlichen Bedingungen beträgt 75%, auch wenn sich das endgültige Dokument besser liest als jeder Entwurf. Dies ist ein separates Maß und hat keine Verbindung zum AlpacaEval-Prozentsatz.
Listen Sie die verpflichtenden Bedingungen des Briefings auf, suchen Sie jede im endgültigen Text und notieren Sie Auslassungen. Prüfen Sie anschließend Aussagen, die erst beim Zusammenführen entstanden sind. Eine neue Zahl oder Zusage braucht Belege. Fehlen diese, kennzeichnen Sie sie als Annahme oder entfernen Sie sie. So prüfen Sie, ob nützlicher Inhalt den Ablauf überstanden hat, statt nur die sprachliche Ausarbeitung zu bewerten.
| Prüfung | Beispielergebnis | Aktion |
|---|---|---|
| Erforderliche Bedingungen | 9 von 12 behalten | Drei Auslassungen wiederherstellen |
| Neue Zahlenangaben | 2 unbelegt | Überprüfen oder entfernen |
| Umstrittene Annahmen | 1 verborgen | Entscheidungszweig anzeigen |
Verwenden Sie einen starken Einzelmodellvergleich
Um den Wert mehrerer Modelle in Ihrer Arbeit zu testen, geben Sie dem Einzelmodell-Workflow dasselbe vorbereitete Briefing, dieselben Quellen und dieselben Bewertungskriterien. Der Vergleich eines organisierten Prozesses mit einer nachlässigen einzeiligen Anfrage verwechselt Aufgabenvorbereitung mit Architektur. Erfassen Sie den Aufwand für die Vorbereitung von Eingaben und Überprüfungsausgaben sowie die Modellnutzung und Wartezeit.
Probieren Sie eine kurze Sachfrage und eine längere Entscheidungsnotiz mit Alternativen aus. Dafür gelten unterschiedliche Erfolgskriterien. Erstere braucht einen Beleg für eine konkrete Aussage; Letztere muss auch wesentliche Bedingungen abdecken und die Wahl verständlich begründen. Wenn sich nur Entscheidungsnotizen verbessern, begrenzen Sie die praktische Empfehlung auf diese Art von Arbeit.
Wenden Sie die Idee auf Consensus an, ohne dessen Bewertung zu übernehmen
Colay Consensus endet ebenfalls mit der Synthese eines Koordinators, was ihn jedoch nicht mit der erforschten MoA-Konfiguration identisch macht. Dieser Artikel enthält keinen veröffentlichten Colay-Benchmark. Betrachten Sie das externe Ergebnis als Anlass, den Workflow an Ihrem Material zu testen, und nicht als vorgefertigten Qualitätsfaktor für jeConsensus-Durchlauf.
Fordern Sie eine Schlussfolgerung mit vier Teilen an: Empfehlung, Beweise, ungelöste Meinungsverschiedenheiten und der nächste überprüfbare Schritt. Geben Sie eine Platzbegrenzung und eine Liste zwingender Bedingungen an. Überprüfen Sie das Ergebnis anhand des Briefings und seiner Quellen. Dem Workflow kommt eine nützliche Rolle zu, wenn Sie erkennen können, was er erhalten oder hinzugefügt hat und wie viel menschliche Arbeit noch verbleibt.
Quellen und Methodik
- Wang et al., 2024
Tabelle 2a; Abschnitt 3.1.
- Dubois et al., Length-Controlled AlpacaEval, 2024
Die Metrik passt die Präferenzen der Modellbeurteiler für die Antwortlänge an; Es handelt sich nicht um eine Bewertung der sachlichen Genauigkeit.
Senden Sie Ihre nächste Frage an Colay
Wählen Sie ein Modell, verwenden Sie Auto oder bringen Sie mehrere Perspektiven mit Consensus zusammen.