Colay / Anleitungen

Testen Sie Consensus anhand der Arbeit, die Sie tatsächlich erledigen müssen

Bei einer nützlichen Bewertung wird gefragt, ob ein Workflow Ihre Ergebnisse unter den Einschränkungen verbessert, die Sie sich leisten können. Es beginnt nicht damit, beeindruckende Beispiele zu sammeln. Vergleichen Sie dieselben Aufgaben, entscheiden Sie, wie der Erfolg bewertet wird, bevor Sie die Antworten sehen, und bewahren Sie Fehler auf. Das führt zu einer Entscheidung, die Sie noch einmal überdenken können, und nicht zu einer Zahl, die nur präzise aussieht.

Externe Forschungsergebnisse und anschauliche Berechnungen sind keine Messungen der Colay-Leistung.

Legen Sie zuerst die Entscheidung fest, dann die Kennzahl

Die Funktion Measure des NIST AI RMF fordert dokumentierte Testsätze, Kennzahlen, Unsicherheiten und eine Bewertung unter Bedingungen, die dem Einsatz ähneln. Sie liefert einen Messrahmen, weder einen vorgegebenen Gewinner noch eine Zertifizierung eines KI-Produkts. NIST AI RMF: Measure

Notieren Sie Ihre Regel für den Einsatz des Verfahrens. Zum Beispiel: Nutzen Sie den Ablauf mit zusätzlicher Prüfung für die Anforderungsanalyse, wenn er innerhalb desselben Budgets mehr wesentliche Auslassungen findet und eine vereinbarte Wartezeit nicht überschreitet. Das ist eine vorgeschlagene Regel für Ihr Experiment. Definieren Sie anhand konkreter Beispiele, was als wesentlich gilt, bevor ein Modell antwortet.

Trennen Sie sachliche Korrektheit von Vollständigkeit, Nützlichkeit und Stil. Eine ausgefeilte Antwort, die eine Einschränkung erfindet, sollte bei einer sachlichen Prüfung durchfallen, auch wenn die Rezensenten ihren Ton bevorzugen. Verwenden Sie für offene Aufgaben eine kurze Rubrik mit verankerten Beispielen und erfassen Sie Meinungsverschiedenheiten zwischen menschlichen Prüfern. Eine Einigung zwischen Richtern ist selbst etwas, das man prüfen und nicht annehmen muss.

Koppeln Sie die Aufgaben und kontrollieren Sie das Budget

Stellen Sie eine Stichprobe aus echter Arbeit zusammen: alltägliche Aufgaben, schwierige Fälle, mehrdeutige Anfragen und Beispiele mit fehlenden Informationen. Halten Sie einen separaten Aufgabensatz zur Optimierung der Prompts bereit. Führen Sie jede Bewertungsaufgabe mit beiden Abläufen und demselben Ausgangsmaterial durch. Verbergen Sie die Namen der Abläufe vor den Bewertenden und variieren Sie die Reihenfolge der Antworten zufällig, damit weder Position noch Marke den Vergleich entscheiden.

Verwenden Sie für jeden Workflow im gesamten Aufgabensatz denselben Gesamtausgabenrahmen und denselben Abschlusstermin. Beziehen Sie jede Generierung, jeden Koordinationsschritt, jeden Wiederholungsversuch und jeden Werkzeugaufruf in die Abrechnung ein. Eine Single-Agent-Baseline sollte über eine angemessene Eingabeaufforderung und Zugriff auf dieselben relevanten Informationen verfügen. Wenn man einer Seite zusätzliche Versuche gibt, während nur die endgültige Antwort gezählt wird, ist der Vergleich zunichte.

Gleiche Budgetrahmen bedeuten nicht, dass ungenutztes Budget verschwendet werden muss. Erfassen Sie die tatsächlichen Ausgaben und legen Sie vorab fest, was beim Erreichen der Obergrenze geschieht: Eine unerledigte Aufgabe muss sichtbar bleiben. Sie können zusätzlich einen Vergleich bei gleicher Qualität zur Kostenschätzung durchführen, dürfen dessen Ergebnis aber nicht mit dem Experiment bei gleichem Budget vermischen.

Eine kleine Stichprobe benötigt ein Unsicherheitsintervall

NIST beschreibt das Wilson-Intervall für einen Binomialanteil. Unsere Berechnung für 95 Erfolge in 100 unabhängigen, repräsentativen Versuchen ergibt ein 95%-Intervall von 88.82%–97.85%, unter Verwendung von z = 1.9599639845. Hierbei handelt es sich um illustrative Beobachtungen, nicht um Colay-Messungen. NIST: Konfidenzintervalle für Anteile

Das Intervall betrifft die Erfolgsquote der definierten Aufgabenpopulation unter den Stichprobenannahmen. Es ist keine Wahrscheinlichkeit, dass eine bestimmte Antwort richtig ist. Es kann auch keine verzerrte Probe reparieren. Das Wiederholen nahezu identischer Anforderungen aus einem Dokument kann zu Abhängigkeiten führen, und das Testen nur einfacher Entwürfe sagt wenig über komplexe Analysen aus.

Verkünden Sie nicht, dass ein 95% beobachteter Wert ein 95% zuverlässiges Produkt beweist. Notieren Sie Datum, Modellversionen, Eingabeaufforderungen, Aufgabenauswahl, Ausschlüsse, Bewertungsregeln und Budget. Ein geändertes Modell oder ein neuer Aufgabenmix können die alte Schätzung zu einem schlechten Anhaltspunkt für den nächsten Monat machen.

Lesen Sie die gepaarten Ergebnisse, nicht nur zwei Prozentsätze

Betrachten Sie ein weiteres ausdrücklich erfundenes Ergebnis für dieselben 100 Aufgaben: Beide Abläufe bestehen 89 Aufgaben, nur Consensus besteht 6, nur der Ablauf mit einem Agenten besteht 1, und beide scheitern an 4. Insgesamt ergeben sich 95 und 90 Erfolge. Die gepaarte Differenz beträgt fünf Aufgaben; besonders aufschlussreich sind jedoch die sieben Fälle mit unterschiedlichen Ergebnissen.

Für diese konstruierte Tabelle berücksichtigt ein zweiseitiger exakter McNemar-Test die sieben Paare mit unterschiedlichen Ergebnissen. Bei gleicher Gewinnwahrscheinlichkeit beträgt der p-Wert 2 × (1 + 7) ÷ 128 = 0.125. Das erreicht die vorab festgelegte Schwelle von 0.05 nicht. Es beweist keine Gleichwertigkeit, sondern zeigt, warum der scheinbare Vorsprung weitere Belege braucht. Die Überlappung einzelner Konfidenzintervalle ersetzt keine gepaarte Analyse.

Hypothetische gepaarte Ergebnisse für 100 Aufgaben
ErgebnisAufgaben
Beide haben bestanden89
Nur Consensus besteht6
Nur der einzelne Agent besteht1
Beide schlagen fehl4

Ergebnisse in eine begrenzte Betriebsregel umwandeln

Untersuchen Sie jede Regression. Ein Arbeitsablauf, der viele Entwürfe mit geringer Auswirkung verbessert, aber zu einem schwerwiegenden sachlichen Fehler führt, erfüllt möglicherweise nicht Ihre Adoptionsregel. Erweitern Sie erfolgsversprechende Kategorien durch neue Aufgaben und behalten Sie einen Bestand bei, der keine Eingabeaufforderungen geprägt hat. Das wiederholte Überprüfen der Ergebnisse und das Anhalten beim ersten attraktiven Ergebnis kann scheinbare Gewinne übertreiben.

Im Colay Consensus diskutieren Agenten die Anfrage und ein koordinierender Agent fasst eine Schlussfolgerung zusammen. Bewerten Sie das endgültige Ergebnis und den Aufwand, der zu seiner Überprüfung erforderlich ist. Erfassen Sie Credits, da für Colay-Abonnements Credits und Limits gelten. Veröffentlichen Sie nur das, was Ihr Test unterstützt: die Beispielaufgaben, die getestete Konfiguration, die beobachteten Kompromisse und die Unsicherheit. Keines dieser Beispiele stellt einen gemessenen Colay-Benchmark dar.

Quellen und Methodik

  1. NIST AI RMF: Measure

    Bewertungsrahmen.

  2. NIST: Konfidenzintervalle für Anteile

    Wilson-Intervall-Methode.

Senden Sie Ihre nächste Frage an Colay

Wählen Sie ein Modell, verwenden Sie Auto oder bringen Sie mehrere Perspektiven mit Consensus zusammen.

Colay öffnen