Colay / Guides
Quand le débat entre modèles d’IA ajoute de la valeur à une réponse
Les arguments en faveur du Consensus commencent par une question testable : la discussion détecte-t-elle une erreur que la première réponse a manquée ? Plusieurs modèles peuvent apporter des observations utiles, mais le décompte des participants à lui seul ne prouve pas grand-chose. Cet article examine un résultat de recherche et le transforme en une méthode d'évaluation pratique, tout en séparant les expériences publiées des affirmations sur un produit particulier.
Les résultats de recherches externes et les calculs illustratifs ne constituent pas des mesures des performances de Colay.
Une petite expérience à lire attentivement
Dans la prépublication de Du et al. de 2023, antérieure à leur publication à ICML 2024, Bard a résolu 11 problèmes sur 20 de GSM8K, ChatGPT en a résolu 14 et le débat conjoint 17 : 55%, 70% et 85%. Ce sont les résultats de modèles précis sur un petit échantillon, pas des mesures de Colay. Du et al., 2023/ICML 2024
Trois bonnes réponses supplémentaires dans un échantillon de 20 questions constituent un signal et non un taux d'amélioration universel. Tester une autre langue, un autre modèle ou un autre document modifie les conditions.
Identifiez l'amélioration dont vous avez réellement besoin
Considérez une décision de lancement hypothétique avec trois options. Une réponse recommande l'itinéraire le plus rapide. Une seconde repère une dépendance vis-à-vis du fournisseur. Une troisième remarque que le calendrier estimé couvre le développement mais exclut l'approbation. Une synthèse utile corrige la portée de l'estimation et explique si cela modifie la recommandation. Le simple fait d'énumérer trois perspectives ne complète pas ce travail.
Le critère que nous suggérons est un changement dans la décision, pas une discussion impressionnante. Une contrainte manquante a-t-elle été récupérée ? Une unité incorrecte a-t-elle été réparée ? Le résultat a-t-il marqué une inconnue que la première réponse traitait comme un fait ? Si le seul changement est une réponse plus longue, le bénéfice reste à prouver. Ce critère fonctionne sur tous les produits et combinaisons de modèles.
Le nombre d'agents et la diversité des modèles sont des variables distinctes
ReConcile, publié sur ACL 2024, étudie un protocole distinct : différents modèles discutent des réponses et utilisent un vote pondéré en fonction de la confiance. Il évalue cet arrangement, plutôt que de valider chaque service qui coordonne plusieurs agents. Chen, Saha and Bansal, ACL 2024
Dans votre propre évaluation, distinguez le nombre de réponses candidates, les différences dans leurs approches de départ et la règle utilisée pour former une réponse finale. Trois rôles attribués à un modèle ne deviennent pas trois sources de connaissances indépendantes. Des noms de modèles différents n'établissent pas non plus d'erreurs indépendantes : chaque participant peut hériter de la même fausse prémisse de la demande.
Compter les régressions ainsi que les corrections
Voici un exemple hypothétique, pas un résultat de recherche. Sur 100 tâches présélectionnées, la réponse initiale est correcte sur 60. La discussion répare 14 mauvaises réponses mais transforme six bonnes réponses en mauvaises. Le résultat est 68 réponses correctes : un gain net de huit points de pourcentage. Signaler uniquement les 14 réparations masquerait une partie importante du résultat.
Examinez également les conséquences. Corriger une faute de frappe et perdre une contrainte budgétaire ont des coûts différents. Conservez la réponse initiale à côté de la réponse finale et notez pourquoi chaque affirmation importante a changé. Cela peut montrer où un flux de travail est utile même lorsque son score global évolue à peine. Pour les décisions aux conséquences importantes, un évaluateur qui comprend le sujet doit déterminer si ces changements sont justifiés.
| Transition | Nombre | Interprétation |
|---|---|---|
| Faux → correct | 14 | Corrections |
| Correct → faux | 6 | Régressions |
| Changement net | +8 | 68 réponses correctes au lieu de 60 |
Effectuez une comparaison petite mais juste
Choisissez des tâches réelles récentes avec un résultat acceptable établi. Notez les critères de notation, la limite de dépenses et le délai maximum acceptable avant de générer des réponses. Donnez aux deux flux de travail la même preuve. Ne sélectionnez pas uniquement les questions pour lesquelles le premier modèle a déjà échoué : cela ferait pencher la comparaison vers une deuxième tentative, que la discussion ait ou non contribué à quelque chose.
Examinez les résultats sans révéler le nom du flux de travail. Évaluez séparément l’exactitude, la couverture des contraintes importantes et la quantité de révision humaine. Conservez les échecs autant que les réussites. Si des collègues participent à l’évaluation, laissez-les noter les résultats indépendamment avant d’en discuter. Sinon, un accord lors de la révision peut masquer de réelles différences de compréhension de la tâche.
Appliquer la question à Colay Consensus
Dans Consensus, les agents participants discutent d'une tâche et un coordinateur produit une synthèse. Une requête pratique leur demande de comparer les alternatives par rapport à des critères explicites, d'identifier les hypothèses controversées et d'éviter de convertir les données manquantes en données fiables. Fournissez la base factuelle et demandez que les affirmations importantes soient liées à des passages particuliers de ce document. Vérifiez vous-même ces connexions.
Cet article ne rapporte pas d'amélioration mesurée de la précision de Colay. La recherche soutient l’investigation de la discussion lorsque des interprétations concurrentes sont importantes ; la valeur d'une exécution particulière dépend de sa production réelle. Préservez les désaccords non résolus dans le document final lorsque les preuves sont insuffisantes. Un résultat utile peut se terminer par une demande d'informations supplémentaires au lieu d'une approbation unanime.
Sources et méthodologie
- Du et al., 2023/ICML 2024
Section 3 : 20 problèmes de GSM8K.
- Chen, Saha and Bansal, ACL 2024
ReConcile : un protocole distinct utilisant divers modèles, discussions et votes pondérés en fonction de la confiance.
Posez votre prochaine question à Colay
Choisissez un modèle, utilisez Auto ou rassemblez plusieurs perspectives avec Consensus.