Colay / Anleitungen

KI-Selbstsicherheit und menschliches Urteilsvermögen: Die Verantwortung für Entscheidungen behalten

Ein nützliches KI-Ergebnis sollte einer Person helfen, eine Entscheidung zu verstehen und nicht nur ein fertiges Dokument schneller zu akzeptieren. Die Herausforderung besteht darin, die eigenen Kriterien zu wahren, Einwände handlungsfähig zu machen und festzustellen, ob eine multiperspektivische Diskussion tatsächlich zu einer Verbesserung Ihrer Arbeit führt.

Externe Forschungsergebnisse und anschauliche Berechnungen sind keine Messungen der Colay-Leistung.

Was uns die Vertrauensforschung sagen kann

Eine CHI-2025-Studie von Microsoft Research und Carnegie Mellon befragte 319 Beschäftigte, die 936 KI-Anwendungsfälle beschrieben. Höheres Vertrauen in KI hing mit weniger selbstberichtetem kritischem Denken zusammen. Dies sind Zusammenhänge aus einer Befragung, kein Beweis dafür, dass KI einen Rückgang der Intelligenz verursacht. Lee et al., CHI 2025

Eine 2024 Nature Human Behaviour-Metaanalyse deckte 106 Experimente und 370 Effekte aus 2020–2023 Studien ab. Mensch-KI-Kombinationen schnitten im Durchschnitt schlechter ab als die besseren von beiden allein: Hedges’ g = −0.23, 95% CI −0.39 bis −0.07. Dieser standardisierte Effekt bedeutet keinen 23% Genauigkeitsverlust. Vaccaro et al., Nature Human Behaviour, 2024

Unsere Empfehlung ist, der menschlichen Aufsicht eine besondere Aufgabe zu geben. Eine Person sollte das Ziel definieren, die Kriterien auswählen, entscheidende Beweise prüfen und erklären, warum die Schlussfolgerung akzeptiert wird. Eine ausgefeilte Antwort einfach noch einmal zu lesen und sie zu genehmigen, ist ein zu vager Vorgang, um ihn zu bewerten. Die Anwesenheit einer Person ist weniger aussagekräftig als die Kontrollen, die diese Person tatsächlich durchführt.

Schreiben Sie Ihre Kriterien auf, bevor Sie die Antwort lesen

Bevor Sie eine Analyse anfordern, notieren Sie, was Sie auswählen, welche Einschränkungen obligatorisch sind und was Ihre Ansicht ändern würde. Bei der Auswahl einer Software kann das bedeuten, dass eine Integration erforderlich ist, eine akzeptable Einarbeitungszeit erforderlich ist und die Möglichkeit besteht, Ihre Daten zu exportieren. Diese kurze Notiz muss nicht unbedingt die richtige Antwort enthalten. Sein Zweck besteht darin, Ihre Kriterien zu bewahren, bevor ein attraktiver Außenrahmen entsteht.

Vergleichen Sie nach der Diskussion die Schlussfolgerung mit der Notiz. Wenn ein neues Kriterium auftaucht, identifizieren Sie, woher es kommt: eine tatsächliche Anforderung, eine neu entdeckte Einschränkung oder eine ansprechende Beschreibung? Eine Überarbeitung der Kriterien ist sinnvoll, wenn Sie den Grund dafür erläutern können. Die Aufzeichnung hilft dabei, Lernen von der stillen Übernahme der aktuellsten selbstbewussten Meinung zu unterscheiden.

Arbeitsbeispiel: eine Tabelle, die vollständiger aussieht, als sie ist

Stellen Sie sich ein fiktives Team vor, das Software für wöchentliche Berichte auswählt. Es vergleicht drei Optionen anhand von fünf Kriterien. Eine KI-Antwort vergibt Punkte und gibt einen Gewinner bekannt. Zwei Kriterien, das erforderliche Exportformat und eine bestimmte Integration, wurden jedoch nicht überprüft. Die Tabelle sieht fertig aus, obwohl entscheidende Eingabewerte noch unbekannt sind.

Markieren Sie diese Zellen als unbekannt, anstatt eine neutrale Bewertung zuzuweisen. Bitten Sie die Diskussion, die Entscheidung unter alternativen Werten zu testen: Was passiert, wenn der Export nicht verfügbar ist? Würde sich der Gewinner ändern, wenn die Einrichtung eine Woche dauert? Aus diesen Fragen entsteht ein kurzer Produktüberprüfungsplan. Die drei Optionen und fünf Kriterien sind Teil dieses Lehrbeispiels, keine Erkenntnisse über Colay-Kunden.

Eine Person testet dann den Export mit einer Beispieldatei und die Integration mit einem echten Workflow, bevor sie die Tabelle aktualisiert. Ändert sich die Wahl, kommt es auf den Grund an: Neue Beobachtungen sind eingetroffen. Bleibt es gleich, schafft die Prüfung dennoch eine vertretbare Erklärung für Kollegen. Ziel ist es, die Entscheidungsgrundlage zu verbessern und nicht die Häufigkeit zu maximieren, mit der Menschen die KI außer Kraft setzen.

Eine Consensus-Anfrage, die das menschliche Urteil sichtbar lässt

In Colay Consensus diskutieren Teilnehmer eine Anfrage, und ein Koordinator fasst das Ergebnis zusammen. Probieren Sie diese Anweisung: „Prüfen Sie zuerst die Kriterien. Benennen Sie unbekannte Eingabewerte. Zeigen Sie, welche Unbekannte die Wahl ändern könnte. Schlagen Sie die kleinste sinnvolle Überprüfung vor.“ Sie können außerdem darum bitten, in der abschließenden Antwort eine Alternative beizubehalten, die unter anderen Annahmen weiterhin sinnvoll ist. Dies ist eine empfohlene Vorgehensweise, keine durch Messungen belegte Produktgarantie.

Bitten Sie den Koordinator nicht, die Frage zu schließen, nur weil die meisten Antworten zustimmen. Fordern Sie den Zusammenhang zwischen Beweisen und Schlussfolgerungen an und halten Sie die wesentliche Unsicherheit sichtbar. Begründen Sie anschließend die Entscheidung mit Ihren eigenen Worten, ohne die Zusammenfassung zu kopieren. Wenn diese Erklärung ausschließlich darauf beruht, dass die Modelle übereinstimmen, kehren Sie zu den Eingaben zurück, die sie rechtfertigen sollten.

Messen Sie den Nutzen Ihrer eigenen Arbeit

Wählen Sie mehrere wiederkehrende Aufgaben aus und definieren Sie einen Fehler, bevor Sie Methoden vergleichen. Geben Sie einem Einzelmodelllauf und einer Diskussion die gleiche Aufgabe und das gleiche unterstützende Material. Untersuchen Sie konkrete Mängel wie einen nicht unterstützten Funktionsanspruch, eine falsche Berechnung oder eine übersehene zwingende Einschränkung. Erfassen Sie auch die Überprüfungszeit und den Guthabenverbrauch. Halten Sie diese Beobachtungen von dem Eindruck fern, dass die Antwort tiefer klingen würde.

Wenn möglich, bitten Sie einen Kollegen, anonymisierte Ausgaben zu bewerten, ohne zu wissen, welcher Modus jeweils erstellt wurde. Eine kleine interne Stichprobe kann nicht die universelle Produktüberlegenheit belegen, sie kann jedoch zeigen, wo die Diskussion in Ihrem Arbeitsablauf zusätzliche Zeit verdient. Achten Sie besonders auf einstimmige Fehler. Sie decken Einschränkungen auf, die eine erfolgreiche Demonstration möglicherweise unsichtbar machen würde.

Behalten Sie die Option bei, ohne Gewinner anzuhalten

Lassen Sie den Schluss zu, dass die Beweise unzureichend sind. Wenn ein Format unter allen Bedingungen einen Gewinner verlangt, fördert es das Schließen von Lücken. Bei einer kleinen reversiblen Aufgabe können Sie eine Annahme akzeptieren und später überprüfen. Notieren Sie für eine Folgeentscheidung die erforderliche Beobachtung, bevor Sie fortfahren. Der Aufgabeneigentümer sollte diesen Schwellenwert festlegen, anstatt ihn aus dem Ton der Antwort abzuleiten.

Schreiben Sie für Ihre nächste Arbeitsentscheidung Kriterien auf, bitten Sie um eine Diskussion, überprüfen Sie eine entscheidende Tatsache und erläutern Sie das Ergebnis selbst. Dadurch wird die Rolle des Menschen sichtbar. Consensus kann einen organisierten Ort für verschiedene Argumente bieten, während die Person, die die Entscheidung trifft, die Verantwortung für die Kriterien, Sachverhaltsprüfungen und eventuelle Maßnahmen behält.

Quellen und Methodik

  1. Lee et al., CHI 2025

    Microsoft Research und Carnegie Mellon; Umfrage, kein kausales Experiment.

  2. Vaccaro et al., Nature Human Behaviour, 2024

    Veröffentlicht am 28. Oktober 2024; Vorregistrierte Metaanalyse.

Senden Sie Ihre nächste Frage an Colay

Wählen Sie ein Modell, verwenden Sie Auto oder bringen Sie mehrere Perspektiven mit Consensus zusammen.

Colay öffnen