Colay / Guides
Comparez les modèles d'IA en fonction des invites dont votre produit a réellement besoin
Avant de créer un pipeline d'évaluation, vous pouvez exécuter une petite comparaison structurée dans Colay. Donnez aux agents disponibles les mêmes entrées autorisées, inspectez leurs réponses séparées et enregistrez les exigences auxquelles ils répondent. Il s’agit d’une première sélection pratique sans écrire de code ni fournir de clés API du fournisseur ; il ne s'agit pas d'un système de benchmark automatisé ni d'une preuve que le modèle se comportera de manière identique dans votre produit.
Transformer une fonctionnalité en cas testables
Commencez par le résultat dont votre utilisateur a besoin, et non par un classement de modèle. Si la fonctionnalité extrait les éléments d'action, le succès signifie préserver le bon responsable, la bonne tâche et le bon délai tout en laissant les champs inconnus inconnus. Un résumé élégant qui invente un délai devrait échouer dans ce cas.
À titre d'ensemble de départ illustratif, préparez 12 exemples autorisés : 4 entrées ordinaires, 4 entrées ambiguës et 4 cas extrêmes. Ces chiffres constituent un exercice gérable et non une taille d’échantillon statistiquement validée. Supprimez les informations personnelles et confidentielles que vous n’êtes pas autorisé à partager. Conservez un résultat attendu ou une règle d'acceptation explicite à côté de chaque cas.
Exécutez une comparaison que vous pouvez interpréter
Le guide d'évaluation d'Anthropic distingue une tâche des essais répétés de cette tâche, car les résultats peuvent varier. Cet article applique cette distinction fondamentale à un exercice de sélection manuelle. Quelques réponses claires ne peuvent pas établir un taux d'échec de production.
Évitez de donner une invite corrigée à un candidat après qu'un autre ait déjà échoué. Si l'invite doit être améliorée, créez une nouvelle version et réexécutez chaque candidat dessus. Sinon, vous comparez des instructions ainsi que des modèles.
- Choisissez explicitement les agents candidats dans le catalogue actuel. N'utilisez pas Auto lorsque vous avez besoin de savoir quel candidat a répondu.
- Gardez le brief, le matériel source et le format demandé identiques. Utilisez Ask separately pour obtenir les premières réponses et conservez leurs étiquettes.
- Enregistrez la date, le nom de l'agent affiché, la version de l'invite et tous les paramètres visibles. Notez les réponses manquantes séparément des réponses incorrectes.
- Examinez chaque résultat par rapport aux règles avant de comparer la qualité de la prose. Répétez les cas importants ou ambigus et conservez chaque tentative, y compris les échecs.
Exemple : éléments d'action d'une note de réunion
Entrée fictive : "Mira enverra le brouillon mardi. L'équipe a encore besoin d'un responsable pour la révision des prix." Le résultat souhaité contient une tâche affectée et une tâche non affectée. Il n'attribue pas les deux à Mira et n'invente pas de date pour la révision des prix.
L'artefact utile est une fiche de cas, pas une capture d'écran de la plus belle réponse. Joignez le texte exact renvoyé à chaque ligne afin qu'un coéquipier puisse contester votre score. Séparez l'échec de formatage de l'échec factuel : une disposition de tableau réparable et un engagement inventé ont des conséquences différentes.
| Vérifier | Condition de réussite | Échec à consigner |
|---|---|---|
| Responsable | Mira est responsable uniquement du brouillon | Révision des prix attribuée sans preuve |
| Date limite | Mardi est l’échéance du brouillon | Échéance inventée pour la révision des prix |
| Champ inconnu | Le responsable de la tarification reste inconnu | Informations manquantes remplies silencieusement |
| Convivialité | Les deux tâches apparaissent dans la structure demandée | Tâche omise ou format inutilisable |
Une invite pour la première sélection
Conservez les instructions d'évaluation dans une liste de contrôle distincte que vous appliquerez à la réponse. Vous pouvez demander à un autre agent d'identifier d'éventuelles erreurs, mais son verdict est un autre résultat à inspecter. Le Consensus peut aider à résumer les compromis observés après la première comparaison ; fournissez explicitement les résultats étiquetés et vos scores.
Extrayez les éléments d’action de la note de réunion fournie : [note autorisée]. Renvoyez un tableau avec la tâche, le responsable, la date limite et un extrait à l'appui. Utilisez uniquement le texte fourni. Écrivez inconnu pour un responsable ou une date limite non précisée. Ne transformez pas une suggestion en un engagement convenu. Conservez les questions non résolues séparément. ID d'entrée : [ID de cas].
Utiliser la liste restreinte pour le prochain test
Résumez les dossiers traités par chaque candidat, ses échecs critiques et les questions encore sans réponse. Retenez un candidat uniquement si son comportement correspond aux exigences minimales de la fonctionnalité. Si aucun n'est qualifié, limitez la fonctionnalité ou améliorez le contexte fourni avant de sélectionner un gagnant.
Un essai d'intégration doit vérifier séparément le point de terminaison réel du modèle, l'accès aux outils, les instructions système, la latence, le coût d'utilisation et la gestion des échecs. Les crédits de Colay ne constituent pas un devis pour cette charge de travail API. Commencez dans Colay avec un cas réel et anonymisé que vous pouvez noter vous-même, puis développez-le uniquement lorsque la comparaison modifie votre liste restreinte.
Questions, réponses
Puis-je comparer des modèles sans clés API ?
Oui, pour la comparaison des utilisateurs finaux dans Colay. L'intégration de ces modèles dans votre propre produit constitue une intégration distincte avec son propre accès, ses propres conditions et coûts.
Est-ce une référence statistiquement fiable ?
Non. Un petit exercice manuel révèle des comportements et des échecs concrets. Des allégations plus larges nécessitent des cas représentatifs, des essais répétés et une conception d'évaluation adaptée à la décision.
Dois-je recourir au Consensus pour choisir le gagnant ?
Évaluez d'abord des résultats distincts par rapport à vos règles d'acceptation. Utilisez la synthèse pour organiser les preuves, en gardant visibles vos résultats originaux et vos décisions humaines.
Sources et méthodologie
- Anthropic — Demystifying evals for AI agents
Conseils d'ingénierie primaires pour la distinction entre les tâches et les essais répétés. Il n'évalue pas Colay et ne valide pas l'exemple de taille d'échantillon.
Posez votre prochaine question à Colay
Choisissez un modèle, utilisez Auto ou rassemblez plusieurs perspectives avec Consensus.