Colay / Guides

Mélange-d'Agents : une synthèse doit gagner sa valeur

Collecter plusieurs réponses d'IA est simple ; les transformer en un livrable cohérent et vérifiable est plus difficile. La recherche sur les mélanges d’agents fournit une raison de prendre la synthèse au sérieux, mais ses principaux pourcentages sont faciles à mal interpréter. Ici, nous examinons la mesure, distinguons la préférence de l'exactitude factuelle et proposons un moyen pratique d'évaluer le résultat final.

Les résultats de recherches externes et les calculs illustratifs ne constituent pas des mesures des performances de Colay.

Le résultat, la métrique et la réponse de référence

L’article de Wang et al. sur MoA de 2024 rapporte un taux de victoire corrigé pour la longueur de 65.1% sur les 805 consignes d’AlpacaEval 2.0, contre 57.5% pour GPT-4o (05/13). Les deux sont comparés à gpt-4-1106-preview. Cette mesure porte sur la préférence d’un juge IA, pas sur la proportion de faits corrects ni sur les performances de Colay. Wang et al., 2024

L’écart est de 7.6 points de pourcentage sur cette mesure. Il ne permet pas d’établir l’exactitude dans un contexte professionnel ni la proportion de clients qui choisiront un produit.

Pourquoi l'ajustement en fonction de la longueur est important

Dubois et al. ont introduit une version d’AlpacaEval avec contrôle de la longueur afin de corriger les préférences du juge automatique liées aux différences de longueur des réponses. Cet ajustement ne transforme pas le score en vérification de chaque affirmation factuelle. Dubois et al., Length-Controlled AlpacaEval, 2024

Dans votre propre comparaison, une longue synthèse peut sembler complète même lorsque les détails supplémentaires n'améliorent pas la décision. Donnez aux deux flux de travail la même limite d'espace et le même contenu requis. Notez ensuite séparément l’utilité, l’exactitude factuelle et la lisibilité. Un seul score combiné peut cacher un résultat dans lequel la présentation s'améliore tandis que la base de la recommandation s'affaiblit.

Préserver les conditions derrière chaque recommandation

Prenons un exemple hypothétique. Une réponse propose une mise en œuvre de deux semaines si les données sont prêtes ; un autre estime six semaines si le nettoyage est nécessaire. Une synthèse indiquant que la mise en œuvre prend quatre semaines semble équilibrée, mais ne représente aucun des deux scénarios. Une meilleure réponse préserve la branche et pose des questions sur l'état de préparation des données. La moyenne des déclarations détruit les informations utiles.

Pour cette raison, nous suggérons de traiter une allégation et ses conditions d'applicabilité comme une seule unité lors de la synthèse. Chaque recommandation nécessite une base, une limite et des éléments de preuve identifiables. Vous pouvez demander à un coordinateur une table de conflits, puis vérifier que la compression n'a pas supprimé une condition gênante. Une bonne édition facilite la compréhension des différences au lieu de les effacer.

Auditer ce qui a disparu entre les brouillons et le texte final

Supposons qu'un brief fournisseur contienne 12 conditions obligatoires. Dans un examen hypothétique, les réponses candidates couvrent collectivement les 12, mais la synthèse finale n'en conserve que neuf. La couverture des conditions requises est de 75%, même si le document final se lit mieux que n'importe quel brouillon. Il s'agit d'une mesure distincte qui n'a aucun lien avec le pourcentage AlpacaEval.

Énumérez les conditions obligatoires du brief, localisez chacune d'entre elles dans le texte final et notez les omissions. Ensuite, inspectez les affirmations introduites uniquement lors de la synthèse. Un nouveau chiffre ou une nouvelle promesse nécessite des preuves à l’appui. Si aucun support n’existe, étiquetez-le comme une hypothèse ou supprimez-le. Cela teste si le contenu utile a survécu au flux de travail, plutôt que de mesurer la finition du résultat.

Un audit hypothétique d'une synthèse finale
VérifierExemple de résultatAction
Conditions requises9 sur 12 conservéesRétablir trois omissions
Nouvelles affirmations numériques2 non étayéesVérifier ou supprimer
Hypothèses contestées1 masquéeAfficher la branche de décision

Utilisez une solide comparaison de modèle unique

Pour tester la valeur de plusieurs modèles dans votre travail, attribuez au flux de travail à modèle unique les mêmes briefs, sources et critères de notation préparés. Comparer un processus organisé à une requête imprudente sur une seule ligne confond la préparation des tâches et l’architecture. Enregistrez l'effort requis pour préparer les entrées et examiner les résultats, ainsi que l'utilisation du modèle et le temps d'attente.

Essayez à la fois une courte question factuelle et un mémo de décision plus long avec des alternatives. Ils ont besoin de critères de réussite différents. Le premier nécessite le soutien d’une affirmation précise ; ce dernier a également besoin d’une couverture des conditions importantes et d’une explication claire du choix. Si l'amélioration n'apparaît que dans les notes de décision, limitez les recommandations pratiques à ce type de travail.

Appliquer l’idée à Consensus sans lui attribuer ce score

Colay Consensus se termine également par une synthèse du coordinateur, mais cela ne le rend pas identique à la configuration du MoA étudiée. Cet article ne contient aucun benchmark Colay publié. Traitez le résultat externe comme une raison pour tester le flux de travail sur votre matériel, et non comme un score de qualité tout fait pour chaque exécution Consensus.

Demandez une conclusion en quatre parties : recommandation, preuves, désaccord non résolu et prochaine étape vérifiable. Fournissez une limite d’espace et une liste de conditions obligatoires. Examinez le résultat par rapport au brief et à ses sources. Le flux de travail joue un rôle utile lorsque vous pouvez identifier ce qu'il a préservé ou ajouté et la quantité de travail humain qui reste encore.

Sources et méthodologie

  1. Wang et al., 2024

    Tableau 2a ; section 3.1.

  2. Dubois et al., Length-Controlled AlpacaEval, 2024

    La métrique ajuste les préférences du juge du modèle pour la longueur de la réponse ; il ne s'agit pas d'un score d'exactitude factuelle.

Posez votre prochaine question à Colay

Choisissez un modèle, utilisez Auto ou rassemblez plusieurs perspectives avec Consensus.

Ouvrir Colay