Colay / Guides

Lorsque plusieurs modèles d'IA partagent le même angle mort

Trois réponses correspondantes peuvent ressembler à trois contrôles. Cette interprétation dépend de la manière dont les réponses ont été produites. Si tous les participants s’appuient sur la même prémisse erronée, l’accord répète la prémisse au lieu de la tester. Pour juger d'un consensus sur l'IA, examinez les chemins menant à la réponse ainsi que la réponse elle-même.

Les résultats de recherches externes et les calculs illustratifs ne constituent pas des mesures des performances de Colay.

La similarité et l'exactitude sont des questions différentes

Artificial Hivemind, une étude NeurIPS 2025, a découvert une répétition au sein du modèle et une similarité entre les modèles dans les invites ouvertes. Ces invites admettent plusieurs réponses plausibles. Il s'agit d'une preuve de la diversité des réponses, et non d'une probabilité mesurée que les modèles partagent des erreurs factuelles. Artificial Hivemind, NeurIPS 2025

Imaginez une équipe produit demandant à plusieurs agents pourquoi les clients partent. Des explications similaires peuvent être correctes, à la mode ou empruntées à un brief incomplet. La question utile est de savoir quelle observation pourrait réfuter chaque explication. Sans ce test, des formulations différentes peuvent cacher une seule hypothèse sous-jacente, tandis qu'une formulation identique pourrait simplement refléter un fait évident.

L’analyse des méthodes d’ensemble de Dietterich explique pourquoi le vote peut bénéficier de classificateurs précis dont les erreurs diffèrent. Son calcul avec erreurs indépendantes est un modèle mathématique soumis à des hypothèses, pas une propriété automatiquement obtenue avec des modèles de noms différents. Dietterich: Ensemble Methods in Machine Learning

Un calcul avec des hypothèses volontairement simplifiées

Ce qui suit est notre exemple hypothétique de classification binaire, et non une expérience Colay. Supposons trois votants, une seule étiquette correcte, une probabilité d'erreur de 20% pour chaque électeur et un vote majoritaire sans discussion. Avec des erreurs indépendantes, une mauvaise majorité nécessite exactement deux ou trois erreurs. Sa probabilité est 3 × 0.2² × 0.8 + 0.2³ = 0.104, ou 10.4%.

Modifiez maintenant uniquement la structure de dépendance. Si les trois réussissent ou échouent toujours ensemble, la majorité a tort 20% du temps. Comme troisième cas construit, laissez la moitié des tâches utiliser ce mécanisme d’erreur partagée et l’autre moitié des erreurs indépendantes. Chaque votant a toujours un taux d'erreur de 20%, mais l'erreur majoritaire devient 0.5 × 20% + 0.5 × 10.4% = 15.2%.

Exemple construit : le même taux d'erreur individuel, des résultats communs différents
Relation supposéeErreur individuelleErreur majoritaire
Erreurs indépendantes20%10.4%
Moitié partagé, moitié indépendant20%15.2%
Erreurs entièrement partagées20%20%

Pourquoi une discussion n'est pas une expérience à vote majoritaire

Un coordinateur conversationnel peut accepter une objection minoritaire, combiner deux solutions partielles ou introduire une nouvelle erreur. Les participants peuvent également modifier leurs réponses après s’être lu. Le calcul ci-dessus ne peut donc pas prédire l’exactitude d’une discussion. Cela isole un problème : compter les résultats ne vous indique pas la quantité de preuves supplémentaires qu'ils contiennent.

Dans Colay Consensus, plusieurs agents discutent d'une demande et un agent coordinateur synthétise la conclusion. Ce flux de travail n'établit pas d'indépendance statistique entre les participants. Des réponses initiales séparées peuvent faciliter l'inspection des différences, mais même des réponses générées séparément peuvent partager des influences de formation, des documents fournis, des omissions ou des interprétations de la tâche.

Inspecter les dépendances avant d'ajouter des participants

Pour un examen concret, créez un petit registre de preuves. Enregistrez l’affirmation contestée, le document à l’appui, l’hypothèse reliant le document à la conclusion et un contre-exemple possible. Demandez à chaque évaluateur de remplir les champs manquants. Trois références au même communiqué restent une origine de preuve, même si trois sites Internet le reproduisent.

Attribuez des vérifications produisant des résultats observables différents. Une personne peut vérifier les calculs, une autre relier les citations aux passages sources, une autre rechercher les cas exclus du brief. Ce sont des méthodes de travail proposées, pas des garanties d’erreurs indépendantes. Leur intérêt est de voir si un participant a apporté une nouvelle vérification plutôt qu’une approbation supplémentaire.

  • Conservez une objection jusqu'à ce que ses preuves à l'appui aient été traitées.
  • Enregistrez les faits issus de l'invite et ceux qui ont été vérifiés de manière indépendante.
  • Préférez un contre-exemple démontré à un nombre sûr d'agents d'accord.

Mesurer les désaccords utiles

Sur les tâches dont les réponses sont connues, marquez où les deux agents échouent, où un seul échoue et où les deux réussissent. Examinez d’abord les échecs partagés : ils révèlent des lacunes qu’un autre participant similaire ne pourrait pas combler. Pour les tâches créatives, remplacez une seule étiquette d'exactitude par des exigences explicites, telles que des concepts distincts, une adéquation avec l'audience ou la couverture de contraintes concurrentes.

Arrêtez d'ajouter des participants lorsque les nouvelles réponses ne modifient plus les preuves, ne révèlent plus une contrainte ou n'améliorent plus un résultat testé. Les abonnements Colay ont des crédits et des limites, donc un accord répété a également un coût d'utilisation. Une discussion compacte qui préserve une objection décisive peut être plus utile qu'une longue discussion se terminant par une prose unanime mais non étayée.

Sources et méthodologie

  1. Artificial Hivemind, NeurIPS 2025

    Étude de génération ouverte.

  2. Dietterich: Ensemble Methods in Machine Learning

    Hypothèses d'ensemble classiques.

Posez votre prochaine question à Colay

Choisissez un modèle, utilisez Auto ou rassemblez plusieurs perspectives avec Consensus.

Ouvrir Colay