Colay / Guides

Testez Consensus par rapport au travail que vous devez réellement accomplir

Une évaluation utile demande si un flux de travail améliore vos livrables sous les contraintes que vous pouvez vous permettre. Cela ne commence pas par rassembler des exemples impressionnants. Comparez les mêmes tâches, décidez comment le succès sera noté avant de voir les réponses et préservez les échecs. Cela produit une décision que vous pouvez revoir au lieu d'un chiffre qui semble seulement précis.

Les résultats de recherches externes et les calculs illustratifs ne constituent pas des mesures des performances de Colay.

Choisissez la décision avant de choisir le score

La fonction Mesure du NIST AI RMF nécessite des ensembles de tests, des mesures, des incertitudes et une évaluation documentés dans des conditions ressemblant à celles d'un déploiement. Il fournit un cadre de mesure, et non un gagnant prescrit ou une certification d'un produit d'IA. NIST AI RMF: Measure

Écrivez votre règle d'adoption. Par exemple : utilisez le flux de travail révisé pour l'analyse des besoins s'il détecte davantage d'omissions importantes dans la même allocation de dépenses et ne dépasse pas un délai d'attente convenu. Il s'agit d'une règle proposée pour votre expérience. Décidez de ce qui est considéré comme important en énumérant des exemples concrets avant qu'un modèle ne produise une réponse.

Séparez l'exactitude factuelle de l'exhaustivité, de l'utilité et du style. Une réponse soignée qui invente une contrainte devrait échouer à une vérification factuelle même si les évaluateurs préfèrent son ton. Pour les tâches ouvertes, utilisez une courte rubrique avec des exemples ancrés et enregistrez les désaccords entre les évaluateurs humains. L'accord entre les juges est en soi quelque chose à inspecter et non à présumer.

Associez les tâches et contrôlez le budget

Créez un échantillon à partir de travaux réels : tâches ordinaires, cas difficiles, demandes ambiguës et exemples avec des informations manquantes. Conservez un ensemble distinct pour les invites de réglage. Exécutez chaque tâche d’évaluation via les deux flux de travail avec le même matériel source. Dissimulez les noms des flux de travail aux évaluateurs et randomisez l'ordre des réponses afin que la position et la marque ne décident pas de la comparaison.

Utilisez la même enveloppe de dépenses totale et le même délai d'exécution pour chaque flux de travail dans l'ensemble des tâches. Incluez chaque génération, étape de coordination, nouvelle tentative et appel d'outil dans la comptabilité. Une ligne de base à agent unique doit avoir une invite raisonnable et un accès aux mêmes informations pertinentes. Donner à un camp des tentatives supplémentaires en ne comptant que sa réponse finale annule la comparaison.

Les enveloppes égales ne nécessitent pas de gaspiller un budget inutilisé. Enregistrez les dépenses réelles et prédéfinissez ce qui se passe lorsqu'un flux de travail atteint son plafond : une tâche inachevée doit rester visible. Vous pouvez également effectuer une comparaison distincte de qualité égale pour estimer le coût, mais ne mélangez pas son résultat avec le test à budget égal.

Un petit échantillon nécessite un intervalle d'incertitude

NIST décrit l'intervalle de Wilson pour une proportion binomiale. Notre calcul pour 95 réussites dans 100 essais indépendants et représentatifs donne un intervalle de 95% de 88.82% – 97.85%, en utilisant z = 1.9599639845. Il s'agit d'observations illustratives, et non de mesures Colay. NIST: Confidence intervals for proportions

L’intervalle concerne le taux de réussite de la population de tâches définie, sous les hypothèses d’échantillonnage. Il ne représente pas la probabilité qu’une réponse particulière soit correcte. Il ne corrige pas non plus un échantillon biaisé. Répéter des demandes presque identiques issues d’un même document peut créer une dépendance, et tester seulement des brouillons faciles renseigne peu sur les analyses complexes.

N'annoncez pas qu'un score observé de 95% prouve un produit fiable à 95%. Enregistrez la date, les versions du modèle, les invites, la sélection des tâches, les exclusions, les règles de notation et le budget. Un modèle modifié ou une nouvelle répartition des tâches peut faire de l'ancienne estimation un mauvais indicateur pour le mois suivant.

Lisez les résultats appariés, pas seulement deux pourcentages

Considérez un autre résultat explicitement inventé sur les mêmes 100 tâches : les deux flux de travail réussissent 89, seul Consensus réussit 6, seul le flux de travail à agent unique réussit 1, et les deux échouent 4. Les totaux sont de 95 et 90 réussites. La différence par paire est de cinq tâches, mais les observations les plus informatives sont les sept cas où les flux de travail ne sont pas d'accord.

Pour ce tableau hypothétique, un test exact bilatéral de McNemar est conditionné à ces sept paires discordantes. Sous l’hypothèse d’une probabilité de victoire égale, sa valeur p est 2 × (1 + 7) ÷ 128 = 0.125. Elle n’atteindrait pas un seuil présélectionné de 0.05. Cela ne prouve pas l’équivalence ; cela montre pourquoi l’avance apparente exige davantage de preuves. Le chevauchement d’intervalles de confiance séparés ne remplace pas une analyse appariée.

Résultats hypothétiques appariés sur 100 tâches
RésultatTâches
Les deux réussissent89
Seul Consensus réussit6
Seul le processus à agent unique réussit1
Les deux échouent4

Transformez les résultats en une règle de fonctionnement limitée

Examinez chaque régression. Un flux de travail qui améliore de nombreux brouillons sans grand enjeu mais introduit une erreur factuelle grave peut ne pas satisfaire votre règle d’adoption. Étendez les catégories prometteuses avec de nouvelles tâches et gardez un jeu de test indépendant qui n’a pas servi à ajuster les consignes. Examiner régulièrement les résultats et s’arrêter au premier score séduisant peut exagérer les gains apparents.

Dans Colay Consensus, les agents discutent de la demande et un agent de coordination synthétise une conclusion. Évaluez ce livrable final et les efforts requis pour le vérifier. Enregistrez les crédits car les abonnements Colay ont des crédits et des limites. Publiez uniquement ce que votre test prend en charge : les tâches échantillonnées, la configuration testée, les compromis observés et l'incertitude. Aucun de ces exemples n'établit de référence Colay mesurée.

Sources et méthodologie

  1. NIST AI RMF: Measure

    Cadre d'évaluation.

  2. NIST: Confidence intervals for proportions

    Méthode de l'intervalle de Wilson.

Posez votre prochaine question à Colay

Choisissez un modèle, utilisez Auto ou rassemblez plusieurs perspectives avec Consensus.

Ouvrir Colay