Colay / Anleitungen

Mixture-of-Agents: Eine Synthese muss ihren Nutzen beweisen

Mehrere KI-Antworten zu sammeln ist einfach; daraus ein schlüssiges, überprüfbares Arbeitsergebnis zu machen, ist schwieriger. Die Forschung zu Mixture-of-Agents gibt Anlass, die Synthese ernst zu nehmen, doch die hervorgehobenen Prozentwerte werden leicht missverstanden. Wir betrachten hier die Messung, unterscheiden Präferenz von sachlicher Richtigkeit und schlagen eine praktische Bewertung des Endergebnisses vor.

Externe Forschungsergebnisse und anschauliche Berechnungen sind keine Messungen der Colay-Leistung.

Das Ergebnis, die Metrik und die Referenzantwort

Wang et al.s 2024 MoA-Papier berichtet von einer 65.1% längenkontrollierten Gewinnrate bei AlpacaEval 2.0s 805 Anweisungen im Vergleich zu 57.5% für GPT-4o (05/13). Beide werden mit gpt-4-1106-preview verglichen. Dies misst die Präferenz der KI-Richter, nicht den Anteil korrekter Fakten oder die Colay-Leistung. Wang et al., 2024

Die Differenz beträgt bei dieser Kennzahl 7.6 Prozentpunkte. Daraus lassen sich weder die Genauigkeit im Arbeitsalltag noch der Anteil der Kunden ableiten, die ein Produkt wählen werden.

Warum es wichtig ist, die Länge anzupassen

Dubois et al. führte längengesteuertes AlpacaEval ein, um die Präferenzen für die automatische Beurteilung an Unterschiede in der Antwortlänge anzupassen. Durch diese Anpassung wird die Bewertung nicht zu einer Prüfung jeder Tatsachenaussage. Dubois et al., Length-Controlled AlpacaEval, 2024

In Ihrem eigenen Vergleich kann sich eine lange Synthese vollständig anfühlen, selbst wenn die zusätzlichen Details die Entscheidung nicht verbessern. Geben Sie beiden Workflows das gleiche Platzlimit und die gleichen erforderlichen Inhalte. Bewerten Sie dann Nützlichkeit, sachliche Korrektheit und Lesbarkeit getrennt. Eine einzelne kombinierte Bewertung kann ein Ergebnis verschleiern, bei dem sich die Präsentation verbessert, während die Grundlage der Empfehlung schwächer wird.

Behalten Sie die Bedingungen hinter jeder Empfehlung bei

Betrachten Sie ein hypothetisches Beispiel. Eine Antwort schlägt eine zweiwöchige Umsetzung vor, wenn die Daten vorliegen; ein anderer schätzt sechs Wochen, wenn eine Reinigung erforderlich ist. Eine Synthese, die besagt, dass die Umsetzung vier Wochen dauert, klingt ausgewogen, stellt aber keines der beiden Szenarios dar. Eine bessere Antwort behält die Verzweigung bei und fragt nach der Datenbereitschaft. Durch die Mittelung der Aussagen werden nützliche Informationen zerstört.

Deshalb empfehlen wir, eine Aussage und ihre Geltungsbedingungen bei der Synthese als Einheit zu behandeln. Jede Empfehlung braucht eine Grundlage, eine Grenze und nachvollziehbare Belege aus dem Ausgangsmaterial. Sie können den Koordinator um eine Tabelle der Widersprüche bitten und anschließend prüfen, ob beim Kürzen eine unbequeme Bedingung verloren ging. Gute redaktionelle Arbeit macht Unterschiede verständlicher, statt sie einzuebnen.

Überprüfen Sie, was zwischen den Entwürfen und dem endgültigen Text verschwunden ist

Angenommen, ein Lieferantenbrief enthält 12 verbindliche Bedingungen. In einer hypothetischen Überprüfung decken die Kandidatenantworten insgesamt alle 12 ab, in der endgültigen Synthese bleiben jedoch nur neun erhalten. Die Abdeckung der erforderlichen Bedingungen beträgt 75%, auch wenn sich das endgültige Dokument besser liest als jeder Entwurf. Dies ist ein separates Maß und hat keine Verbindung zum AlpacaEval-Prozentsatz.

Listen Sie die verpflichtenden Bedingungen des Briefings auf, suchen Sie jede im endgültigen Text und notieren Sie Auslassungen. Prüfen Sie anschließend Aussagen, die erst beim Zusammenführen entstanden sind. Eine neue Zahl oder Zusage braucht Belege. Fehlen diese, kennzeichnen Sie sie als Annahme oder entfernen Sie sie. So prüfen Sie, ob nützlicher Inhalt den Ablauf überstanden hat, statt nur die sprachliche Ausarbeitung zu bewerten.

Eine hypothetische Prüfung einer endgültigen Synthese
PrüfungBeispielergebnisAktion
Erforderliche Bedingungen9 von 12 behaltenDrei Auslassungen wiederherstellen
Neue Zahlenangaben2 unbelegtÜberprüfen oder entfernen
Umstrittene Annahmen1 verborgenEntscheidungszweig anzeigen

Verwenden Sie einen starken Einzelmodellvergleich

Um den Wert mehrerer Modelle in Ihrer Arbeit zu testen, geben Sie dem Einzelmodell-Workflow dasselbe vorbereitete Briefing, dieselben Quellen und dieselben Bewertungskriterien. Der Vergleich eines organisierten Prozesses mit einer nachlässigen einzeiligen Anfrage verwechselt Aufgabenvorbereitung mit Architektur. Erfassen Sie den Aufwand für die Vorbereitung von Eingaben und Überprüfungsausgaben sowie die Modellnutzung und Wartezeit.

Probieren Sie eine kurze Sachfrage und eine längere Entscheidungsnotiz mit Alternativen aus. Dafür gelten unterschiedliche Erfolgskriterien. Erstere braucht einen Beleg für eine konkrete Aussage; Letztere muss auch wesentliche Bedingungen abdecken und die Wahl verständlich begründen. Wenn sich nur Entscheidungsnotizen verbessern, begrenzen Sie die praktische Empfehlung auf diese Art von Arbeit.

Wenden Sie die Idee auf Consensus an, ohne dessen Bewertung zu übernehmen

Colay Consensus endet ebenfalls mit der Synthese eines Koordinators, was ihn jedoch nicht mit der erforschten MoA-Konfiguration identisch macht. Dieser Artikel enthält keinen veröffentlichten Colay-Benchmark. Betrachten Sie das externe Ergebnis als Anlass, den Workflow an Ihrem Material zu testen, und nicht als vorgefertigten Qualitätsfaktor für jeConsensus-Durchlauf.

Fordern Sie eine Schlussfolgerung mit vier Teilen an: Empfehlung, Beweise, ungelöste Meinungsverschiedenheiten und der nächste überprüfbare Schritt. Geben Sie eine Platzbegrenzung und eine Liste zwingender Bedingungen an. Überprüfen Sie das Ergebnis anhand des Briefings und seiner Quellen. Dem Workflow kommt eine nützliche Rolle zu, wenn Sie erkennen können, was er erhalten oder hinzugefügt hat und wie viel menschliche Arbeit noch verbleibt.

Quellen und Methodik

  1. Wang et al., 2024

    Tabelle 2a; Abschnitt 3.1.

  2. Dubois et al., Length-Controlled AlpacaEval, 2024

    Die Metrik passt die Präferenzen der Modellbeurteiler für die Antwortlänge an; Es handelt sich nicht um eine Bewertung der sachlichen Genauigkeit.

Senden Sie Ihre nächste Frage an Colay

Wählen Sie ein Modell, verwenden Sie Auto oder bringen Sie mehrere Perspektiven mit Consensus zusammen.

Colay öffnen