Colay / Anleitungen

Vergleichen Sie KI-Modelle mit den Prompts, die Ihr Produkt wirklich braucht

Bevor Sie eine Evaluierungspipeline erstellen, können Sie einen kleinen, strukturierten Vergleich in Colay durchführen. Geben Sie verfügbaren Agenten die gleichen zulässigen Eingaben, überprüfen Sie ihre einzelnen Antworten und notieren Sie, welche Anforderungen sie erfüllen. Dies ist ein praktisches erstes Screening, ohne dass Code geschrieben oder Anbieter-API-Schlüssel bereitgestellt werden müssen. Es handelt sich nicht um einen automatisierten Benchmark-Läufer oder um einen Beweis dafür, dass sich das Modell in Ihrem Produkt identisch verhält.

Verwandeln Sie eine Funktion in testbare Fälle

Beginnen Sie mit dem Ergebnis, das Ihre Nutzer brauchen, nicht mit einer Modellrangliste. Soll die Funktion Aufgaben aus Notizen extrahieren, muss sie Zuständigkeit, Aufgabe und Frist korrekt wiedergeben und unbekannte Felder offenlassen. Eine elegante Zusammenfassung mit einer erfundenen Frist besteht diesen Test nicht.

Bereiten Sie als überschaubaren Einstieg 12 Beispiele vor, die Sie verwenden dürfen: 4 gewöhnliche, 4 mehrdeutige und 4 Grenzfälle. Diese Zahlen dienen der Übung und sind keine statistisch validierte Stichprobengröße. Entfernen Sie persönliche und vertrauliche Informationen, die Sie nicht weitergeben dürfen. Hinterlegen Sie zu jedem Fall ein erwartetes Ergebnis oder eine eindeutige Abnahmeregel.

Führen Sie einen interpretierbaren Vergleich durch

Anthropics Evaluierungsleitfaden unterscheidet eine Aufgabe von wiederholten Durchläufen derselben Aufgabe, da Ausgaben variieren können. Dieser Artikel überträgt diese Unterscheidung auf eine manuelle Vorauswahl. Aus wenigen fehlerfreien Antworten lässt sich keine Fehlerrate im Produktivbetrieb ableiten.

Vermeiden Sie es, einem Kandidaten eine korrigierte Eingabeaufforderung zu geben, nachdem ein anderer bereits durchgefallen ist. Wenn die Eingabeaufforderung verbessert werden muss, erstellen Sie eine neue Version und führen Sie jeden Kandidaten erneut aus. Ansonsten vergleichen Sie sowohl Anleitungen als auch Modelle.

  1. Wählen Sie die Kandidatenagenten explizit aus dem aktuellen Katalog aus. Verwenden Sie Auto nicht, wenn Sie wissen möchten, welcher Kandidat geantwortet hat.
  2. Halten Sie die Kurzbeschreibung, das Ausgangsmaterial und das gewünschte Format identisch. Verwenden Sie Ask separately für die ersten Antworten und behalten Sie deren Bezeichnungen bei.
  3. Notieren Sie das Datum, den angezeigten Agentennamen, die Prompt-Version und alle sichtbaren Einstellungen. Notieren Sie fehlende Antworten getrennt von falschen Antworten.
  4. Überprüfen Sie jedes Ergebnis anhand der Regeln, bevor Sie die Prosaqualität vergleichen. Wiederholen Sie wichtige oder unklare Fälle und bewahren Sie jeden Versuch auf, auch fehlgeschlagene.

Beispiel: Aufgaben aus einer Besprechungsnotiz

Fiktive Eingabe: „Mira sendet den Entwurf am Dienstag. Für die Überprüfung der Preise fehlt noch eine verantwortliche Person.“ Das gewünschte Ergebnis enthält eine zugewiesene und eine nicht zugewiesene Aufgabe. Es ordnet nicht beide Aufgaben Mira zu und erfindet keine Frist für die Preisprüfung.

Das nützliche Ergebnis ist ein Fallprotokoll, kein Screenshot der schönsten Antwort. Fügen Sie jeder Zeile den unveränderten Antworttext bei, damit ein Teammitglied Ihre Bewertung nachvollziehen oder hinterfragen kann. Trennen Sie Formatfehler von inhaltlichen Fehlern: Ein korrigierbares Tabellenlayout und eine erfundene Zusage haben unterschiedliche Folgen.

Manueller Bewertungsbogen für diesen fiktiven Fall
PrüfpunktBedingung für das BestehenZu protokollierender Fehler
ZuständigkeitMira ist nur für den Entwurf zuständigPreisprüfung ohne Grundlage einer Person zugewiesen
FristDienstag ist die Frist für den EntwurfFrist für die Preisprüfung erfunden
Unbekanntes FeldZuständigkeit für die Preisprüfung bleibt unbekanntFehlende Informationen stillschweigend ausgefüllt
BenutzerfreundlichkeitBeide Aufgaben erscheinen in der angeforderten StrukturAufgabe ausgelassen oder Format unbrauchbar

Ein Prompt für die Vorauswahl

Bewahren Sie die Bewertungsanweisungen in einer separaten Checkliste auf, die Sie auf die Antwort anwenden. Sie können einen anderen Agenten bitten, mögliche Fehler zu identifizieren, aber sein Urteil ist eine weitere zu prüfende Ausgabe. Consensus kann dabei helfen, die beobachteten Kompromisse nach dem ersten Vergleich zusammenzufassen. Geben Sie explizit die gekennzeichneten Ergebnisse und Ihre Punktzahlen an.

Extrahiere Aufgaben aus dieser Besprechungsnotiz: [zur Nutzung freigegebene Notiz]. Gib eine Tabelle mit Aufgabe, verantwortlicher Person, Frist und belegender Textstelle zurück. Verwende nur den bereitgestellten Text. Schreibe „unbekannt“, wenn Zuständigkeit oder Frist nicht genannt werden. Mache aus einem Vorschlag keine vereinbarte Zusage. Halte offene Fragen separat fest. Eingabe-ID: [Fall-ID].

Verwenden Sie die Auswahlliste für den nächsten Test

Fassen Sie die Fälle zusammen, die jeder Kandidat bearbeitet, seine kritischen Fehler und die noch unbeantworteten Fragen. Behalten Sie einen Kandidaten nur bei, wenn sein Verhalten den Mindestanforderungen der Funktion entspricht. Wenn keines zutrifft, schränken Sie die Funktion ein oder verbessern Sie den bereitgestellten Kontext, bevor Sie einen Gewinner auswählen.

Ein Integrationstest muss Modellendpunkt, Werkzeugzugriff, Systemanweisungen, Latenz, Nutzungskosten und Fehlerbehandlung gesondert prüfen. Colays Credits sind kein Kostenangebot für diese API-Nutzung. Beginnen Sie in Colay mit einem echten, deidentifizierten Fall, den Sie selbst bewerten können. Erweitern Sie den Vergleich nur, wenn dies Ihre Vorauswahl beeinflusst.

Antworten auf Ihre Fragen

Kann ich Modelle ohne API-Schlüssel vergleichen?

Ja, für den Endbenutzervergleich in Colay. Der Einbau dieser Modelle in Ihr eigenes Produkt ist eine separate Integration mit eigenem Zugang, eigenen Bedingungen und Kosten.

Ist das ein statistisch verlässlicher Benchmark?

Nein. Eine kleine manuelle Übung zeigt konkrete Verhaltensweisen und Fehler. Weitergehende Aussagen brauchen repräsentative Fälle, wiederholte Durchläufe und ein zur Entscheidung passendes Evaluierungsdesign.

Soll ich Consensus verwenden, um den Gewinner auszuwählen?

Bewerten Sie zunächst separate Ausgaben anhand Ihrer Akzeptanzregeln. Nutzen Sie die Synthese, um die Beweise zu organisieren und Ihre ursprünglichen Ergebnisse und menschlichen Entscheidungen sichtbar zu halten.

Quellen und Methodik

  1. Anthropic — Demystifying evals for AI agents

    Primäre technische Anleitung zur Unterscheidung zwischen Aufgaben und wiederholten Versuchen. Es wertet weder Colay aus noch validiert es die Beispielstichprobengröße.

Senden Sie Ihre nächste Frage an Colay

Wählen Sie ein Modell, verwenden Sie Auto oder bringen Sie mehrere Perspektiven mit Consensus zusammen.

Eigene Prompts vergleichen