Colay / Guides

Quand les discussions entre modèles d’IA ne justifient pas le travail supplémentaire

Un argument crédible en faveur du Consensus doit inclure les situations dans lesquelles la discussion perd. Sinon, un exemple réussi devient une promotion plutôt qu'une base pour choisir un flux de travail. La recherche fournit des contre-exemples concrets. Ils aident à formuler une question utile : qu'est-ce que l'échange d'arguments ajoute au-delà de plusieurs tentatives distinctes, et quel est le coût de cet ajout ?

Les résultats de recherches externes et les calculs illustratifs ne constituent pas des mesures des performances de Colay.

Un cas concret où le vote a été plus performant

Debate or Vote, NeurIPS 2025, rapporte une précision de 94.00% pour le vote majoritaire avec cinq agents Qwen2.5-7B-Instruct sur 300 questions de GSM8K. Le débat décentralisé en deux tours obtient 88.67% ; en cinq tours, 83.33% (Tableau 1). Il s’agit d’une configuration de recherche précise, pas d’une évaluation de Colay ni d’une règle universelle. Debate or Vote, NeurIPS 2025

L'écart par rapport au débat en deux tours est de 5.33 points de pourcentage. Plus de discussions ne signifient pas automatiquement un meilleur résultat ; cela compare les méthodes collectives, et non la supériorité d'un modèle individuel.

Une alternative solide compte plus qu'un exemple frappant

Smit et al., ICML 2024, ont constaté que les stratégies de débat testées ne surpassaient pas de manière fiable l'auto-cohérence et d'autres alternatives fortes. Le réglage du protocole a modifié les résultats. Cela permet de tester des conditions spécifiques, plutôt que de rejeter la discussion dans tous les contextes. Smit et al., ICML 2024

Lorsque la première réponse est faible, presque tout effort supplémentaire peut sembler impressionnant. Comparez la discussion avec une demande individuelle bien spécifiée et avec des candidats séparés qui ne voient jamais les réponses des autres. Cela permet de distinguer l'avantage de générer davantage d'options de l'avantage de convaincre les participants les uns les autres de les réviser.

Perdre une objection correcte est un risque distinct

Imaginez une comparaison hypothétique de coûts. Un participant remarque que les chiffres mélangent des prix mensuels et annuels ; les autres les jugent directement comparables. La synthèse suit la majorité et omet l’avertissement sur les unités. Le problème n’est pas le manque de texte : la vérification nécessaire est apparue, puis a disparu lors de l’accord. Un tour supplémentaire ne la rétablit pas forcément.

Demandez que les objections importantes restent visibles jusqu'à ce qu'une source, un calcul ou une clarification explicite les résolve. Dans la réponse finale, recherchez la raison pour laquelle une objection a été rejetée. Dire que les participants étaient d’accord décrit la conversation plutôt que de prouver la décision. Lorsqu'un différend concerne un fait, la preuve devrait le régler plutôt que la confiance de la présentation.

Choisissez une règle d'arrêt avant de commencer

Décidez à l'avance à quoi ressemble un résultat suffisant. Par exemple : toutes les contraintes obligatoires sont couvertes, le calcul est vérifié, les faits contestés sont étayés par le matériel fourni et les inconnues restantes sont nommées. Une fois ces conditions remplies, continuer uniquement à obtenir un ton plus confiant n’a aucune valeur claire. Il s'agit d'une règle de flux de travail proposée, et non d'une garantie intégrée.

Si un autre échange répète les mêmes arguments, changez d'action : obtenez le document manquant, exécutez un test ou consultez la personne qui connaît le fait. Un nouveau message est utile lorsqu'il introduit de nouvelles informations vérifiables. Sans ces informations, une conversation peut se terminer sur un accord tandis que les preuves de la décision restent exactement là où elles ont commencé.

Prix du résultat acceptable supplémentaire

Dans une comparaison hypothétique, deux flux de travail traitent les mêmes 50 requêtes. Le premier produit 40 résultats acceptables pour 100 unités comptables ; le second produit 43 pour 220. Trois résultats acceptables supplémentaires coûtent 120 unités supplémentaires, soit 40 chacun. Il s'agit d'hypothèses arithmétiques illustratives, qui ne mesurent pas les coûts ou la précision de Colay.

La valeur de cet incrément dépend du travail effectué. Cela pourrait être inutile pour un brouillon interne et justifié pour une note de décision exigeante. Incluez le temps d’examen humain et les conséquences d’une erreur importante. Séparez les résultats observés des pertes supposées : collectez d'abord des mesures, puis étiquetez les hypothèses utilisées pour transformer ces observations en décision de dépenses.

Comparaison hypothétique de deux flux de travail
MesureFlux de travail AFlux de travail B
Demandes5050
Résultats acceptables4043
Coût, unités comptables100220
Coût incrémentiel par résultat supplémentaire—40

Où Consensus peut encore gagner un rôle

La discussion mérite d'être testée sur des travaux qui dépendent de logiques concurrentes : décisions de conception, exigences contradictoires et choix entre plusieurs approches réalisables. Essayez d'abord une méthode directe pour une opération simple avec un résultat facile à vérifier. Cette séquence permet de concentrer l'utilisation du crédit sur des tâches pour lesquelles la discussion pourrait sensiblement changer ce que vous ferez ensuite.

Dans Colay, les participants à Consensus discutent de la tâche et un coordinateur produit une synthèse. Le mode ne transforme pas l’accord en preuve et ne remplace pas la vérification externe. Gardez une réponse ordinaire à des fins de comparaison, demandez l'objection importante la plus forte et évaluez ce qui a changé. Si la qualité ne s'améliore pas ou si de nouvelles erreurs apparaissent, utilisez un processus plus simple pour cette classe de tâches.

Sources et méthodologie

  1. Debate or Vote, NeurIPS 2025

    Tableau 1 ; annexe A.2.

  2. Smit et al., ICML 2024

    Should we be going MAD? Compare le débat à des méthodes de référence solides de formulation de consignes et d’échantillonnage.

Posez votre prochaine question à Colay

Choisissez un modèle, utilisez Auto ou rassemblez plusieurs perspectives avec Consensus.

Ouvrir Colay