Colay / Anleitungen
Wenn mehrere KI-Modelle denselben toten Winkel teilen
Drei übereinstimmende Antworten können sich wie drei Prüfungen anfühlen. Diese Interpretation hängt davon ab, wie die Antworten zustande kamen. Wenn sich jeder Teilnehmer auf dieselbe falsche Prämisse verlässt, wiederholt die Einigung die Prämisse, anstatt sie zu testen. Um einen KI-Konsens zu beurteilen, untersuchen Sie die Wege zur Antwort sowie die Antwort selbst.
Externe Forschungsergebnisse und anschauliche Berechnungen sind keine Messungen der Colay-Leistung.
Ähnlichkeit und Korrektheit sind unterschiedliche Fragen
Artificial Hivemind, eine NeurIPS-Studie von 2025, fand Wiederholungen innerhalb einzelner Modelle und Ähnlichkeiten zwischen Modellen bei offenen Aufgaben. Diese lassen mehrere plausible Antworten zu. Das liefert Erkenntnisse über die Vielfalt von Antworten, keine gemessene Wahrscheinlichkeit dafür, dass Modelle dieselben sachlichen Fehler machen. Artificial Hivemind, NeurIPS 2025
Stellen Sie sich ein Produktteam vor, das mehrere Agenten fragt, warum Kunden das Unternehmen verlassen. Ähnliche Erklärungen können richtig, modisch oder einem unvollständigen Briefing entlehnt sein. Die nützliche Frage ist, welche Beobachtung jede Erklärung widerlegen könnte. Ohne diesen Test verbergen unterschiedliche Formulierungen möglicherweise eine einzelne zugrunde liegende Annahme, während identische Formulierungen möglicherweise lediglich eine offensichtliche Tatsache widerspiegeln.
Dietterichs Ensembleanalyse erklärt, warum Abstimmungen von genauen Klassifikatoren mit unterschiedlichen Fehlern profitieren können. Seine unabhängige Fehlerberechnung ist ein bedingtes mathematisches Modell und keine Eigenschaft, die automatisch durch die Verwendung verschiedener Modellnamen bereitgestellt wird. Dietterich: Ensemble Methods in Machine Learning
Eine Berechnung mit bewusst vereinfachten Annahmen
Das folgende Beispiel zur binären Klassifikation ist hypothetisch und kein Colay-Experiment. Angenommen werden drei Abstimmende, eine einzige richtige Klasse, eine Fehlerwahrscheinlichkeit von 20% für jeden und eine Mehrheitsabstimmung ohne Diskussion. Bei unabhängigen Fehlern entsteht eine falsche Mehrheit durch genau zwei oder drei Fehler. Ihre Wahrscheinlichkeit beträgt 3 × 0.2² × 0.8 + 0.2³ = 0.104, also 10.4%.
Ändern Sie jetzt nur die Abhängigkeitsstruktur. Wenn alle drei gemeinsam immer erfolgreich sind oder scheitern, liegt die Mehrheit in 20% der Fälle falsch. Lassen Sie als dritten konstruierten Fall die Hälfte der Aufgaben diesen Shared-Error-Mechanismus und die andere Hälfte unabhängige Fehler verwenden. Jeder Wähler hat immer noch eine Fehlerquote von 20%, aber der Mehrheitsfehler beträgt 0.5 × 20% + 0.5 × 10.4% = 15.2%.
| Angenommene Beziehung | Einzelner Fehler | Mehrheitsfehler |
|---|---|---|
| Unabhängige Fehler | 20% | 10.4% |
| Halb geteilt, halb unabhängig | 20% | 15.2% |
| Vollständig geteilte Fehler | 20% | 20% |
Warum eine Diskussion kein Mehrheitsexperiment ist
Ein Gesprächskoordinator kann einen Einwand einer Minderheit akzeptieren, zwei Teillösungen kombinieren oder einen neuen Fehler einbringen. Die Teilnehmer können ihre Antworten auch ändern, nachdem sie sich gegenseitig gelesen haben. Die obige Berechnung kann daher nicht die Richtigkeit einer Diskussion vorhersagen. Es isoliert ein Problem: Das Zählen der Ausgaben sagt Ihnen nicht, wie viele zusätzliche Beweise sie enthalten.
In Colay Consensus diskutieren mehrere Agenten eine Anfrage und ein koordinierender Agent fasst die Schlussfolgerung zusammen. Dieser Arbeitsablauf stellt keine statistische Unabhängigkeit zwischen den Teilnehmern her. Getrennte Anfangsantworten können die Untersuchung von Unterschieden erleichtern, aber auch separat generierte Antworten können Trainingseinflüsse, bereitgestellte Dokumente, Auslassungen oder Interpretationen der Aufgabe teilen.
Überprüfen Sie Abhängigkeiten, bevor Sie Teilnehmer hinzufügen
Für eine konkrete Überprüfung erstellen Sie ein kleines Beweisbuch. Notieren Sie die bestrittene Behauptung, das sie belegende Dokument, die Annahme, die das Dokument mit der Schlussfolgerung verbindet, und ein mögliches Gegenbeispiel. Bitten Sie jeden Prüfer, fehlende Felder auszufüllen. Drei Verweise auf dieselbe Pressemitteilung bleiben eine Beweisquelle, auch wenn drei Websites sie reproduzieren.
Weisen Sie Prüfungen mit unterschiedlichen beobachtbaren Ausgaben zu. Ein Gutachter kann Arithmetik testen, ein anderer kann Zitate auf Quellenpassagen zurückführen und ein anderer kann die Kurzbeschreibung nach ausgeschlossenen Fällen durchsuchen. Bei diesen Aufgaben handelt es sich um vorgeschlagene Arbeitsmethoden und nicht um Garantien für unabhängige Fehler. Ihr Wert besteht darin, dass Sie sehen können, ob ein Teilnehmer eine neue Prüfung und nicht eine weitere Bestätigung beigesteuert hat.
- Bewahren Sie einen Einspruch auf, bis die unterstützenden Beweise berücksichtigt wurden.
- Notieren Sie, welche Fakten aus der Eingabeaufforderung stammen und welche unabhängig überprüft wurden.
- Ein demonstriertes Gegenbeispiel ist einer sicheren Zählung der zustimmenden Agenten vorzuziehen.
Nützliche Meinungsverschiedenheiten messen
Markieren Sie bei Aufgaben mit bekannten Antworten, wo beide Agenten versagen, wo nur einer versagt und wo beide erfolgreich sind. Untersuchen Sie zunächst gemeinsame Fehler: Sie offenbaren Lücken, die ein anderer ähnlicher Teilnehmer möglicherweise nicht beheben kann. Ersetzen Sie bei kreativen Aufgaben eine einzelne Korrektheitsbezeichnung durch explizite Anforderungen, z. B. unterschiedliche Konzepte, Zielgruppenanpassung oder Abdeckung konkurrierender Einschränkungen.
Beenden Sie das Hinzufügen von Teilnehmern, wenn neue Antworten die Evidenz nicht mehr ändern, eine Einschränkung aufdecken oder ein getestetes Ergebnis nicht mehr verbessern. Colay-Abonnements haben Guthaben und Limits, sodass bei wiederholter Vereinbarung auch Nutzungskosten anfallen. Eine kompakte Diskussion, die einen entscheidenden Einwand wahrt, kann nützlicher sein als eine lange Diskussion, die in einstimmiger, aber nicht unterstützter Prosa endet.
Quellen und Methodik
- Artificial Hivemind, NeurIPS 2025
Studie zur Generierung offener Antworten.
- Dietterich: Ensemble Methods in Machine Learning
Klassische Ensembleannahmen.
Senden Sie Ihre nächste Frage an Colay
Wählen Sie ein Modell, verwenden Sie Auto oder bringen Sie mehrere Perspektiven mit Consensus zusammen.