Colay / Guides
De nombreuses réponses d'un modèle ou des discussions entre modèles ?
Vous pouvez résoudre une question plusieurs fois et choisir la réponse la plus fréquente. Vous pouvez également demander aux participants de discuter de solutions concurrentes et de produire une synthèse. Les deux approches font appel à plus d’une tentative, mais elles testent des idées différentes. Comprendre cette distinction permet de décider plus facilement quelle partie du Consensus est utile pour un travail particulier.
Les résultats de recherches externes et les calculs illustratifs ne constituent pas des mesures des performances de Colay.
Ce que le document d'auto-cohérence a réellement mesuré
Wang et al., ICLR 2023, rapportent une précision de PaLM-540B sur GSM8K passant de 56.5% avec une chaîne de pensée et un décodage glouton à 74.4% avec l’auto-cohérence : 17.9 points de pourcentage. Les résultats sont la moyenne de 10 exécutions, avec 40 réponses échantillonnées par exécution. Ce sont des résultats de recherche, pas des mesures de Colay. Wang et al., ICLR 2023
Le jeu de test de GSM8K contient 1,319 problèmes de mathématiques élémentaires formulés en langage naturel. Il fournit des réponses finales vérifiables, sans représenter toutes les tâches de recherche, d’écriture ou de décision. GSM8K dataset, OpenAI
Une interprétation pratique est que la première réponse n'est pas nécessairement la meilleure réponse disponible à partir d'un modèle. La répétition consomme également des ressources. Une comparaison entre quarante tentatives et une tentative, sans tenir compte du coût, ne détermine pas quel flux de travail est préférable en fonction de votre limite de dépenses ou du temps d'attente acceptable.
Séparez trois opérations dans le flux de travail
Pour une évaluation pratique, distinguez la génération des candidats, l'évaluation des candidats et la composition finale. La génération détermine quelles solutions possibles deviennent disponibles. L'évaluation décide lesquels répondent aux exigences de la tâche. La composition produit une réponse utilisable pour le lecteur. Chaque opération peut être améliorée séparément, et le succès à une étape ne répare pas automatiquement un échec à une autre.
Une solution correcte peut déjà être présente mais perdre un vote. Alternativement, le bon candidat peut être sélectionné tandis que la prose finale supprime une condition essentielle. Conservez les réponses intermédiaires lors de l’évaluation d’un flux de travail. Sans elles, il est difficile de dire si vous avez besoin de plus de candidats, d'une meilleure règle de sélection ou d'instructions plus claires pour le coordinateur.
Quand la fréquence des réponses est informative
Considérons une question arithmétique hypothétique produisant cinq réponses : 42, 42, 42, 24 et 24. Le vote majoritaire sélectionne 42. Cette sélection est reproductible, mais l'exactitude dépend toujours du problème et du calcul. Si les trois réponses correspondantes confondent toutes les minutes avec les heures, le vote conserve la même erreur. La part des votes n'est pas automatiquement la probabilité qu'une réponse soit vraie.
Les questions ouvertes introduisent une difficulté antérieure : décider de ce qui constitue un accord. Deux réponses peuvent recommander le même produit pour des raisons incompatibles. Deux recommandations différentes peuvent toutes deux fonctionner sous des contraintes différentes. Avant de compter les correspondances, définissez le résultat dont vous avez besoin : une décision, ses conditions d'applicabilité, les faits requis et toute information restant manquante.
Pourquoi la discussion pourrait être utile pour votre tâche
Pour une question courte avec une réponse numérique, vérifier le calcul peut suffire. Une décision d'architecture logicielle bénéficie de la comparaison des hypothèses concernant l'échelle, la maintenance et les contraintes inconnues. Dans ce contexte, la discussion peut être évaluée pour sa capacité à révéler des prémisses incompatibles, plutôt que de simplement produire la recommandation la plus fréquemment répétée.
Supposons que deux participants recommandent des conceptions différentes car ils supposent des volumes de données différents. Une synthèse utile identifie le point auquel la préférence change. Demandez un compte rendu concis de ce qui est connu, de ce qui est supposé et quelle observation permettrait de régler le désaccord. Il s'agit de la méthode de conception de tâches que nous proposons, et non d'une garantie qu'un modèle découvrira toutes les dépendances.
Comparez les flux de travail sans changer la question
Définissez à l'avance un plafond de dépenses et une grille de notation partagée. Comparez une réponse ordinaire, des tentatives séparées avec une règle de sélection explicite et une discussion. Un nombre d’appels égal n’établit pas des coûts égaux : la longueur du contexte, la taille de la sortie et le choix du modèle comptent tous. Enregistrez les dépenses réelles et les retards en plus de la qualité, au lieu de traiter le travail supplémentaire comme une amélioration gratuite.
Un calcul hypothétique rend le compromis visible. Le flux de travail A produit 18 résultats acceptables à partir de 20 tâches pour 40 unités comptables. Le flux de travail B produit 19 pour 80 unités. Le résultat acceptable supplémentaire coûte 40 unités. Cela ne signifie pas que A soit préférable : la tâche supplémentaire réussie peut être particulièrement précieuse. Cela rend le coût de l'amélioration suffisamment explicite pour en discuter.
Ce que cela signifie pour Consensus à Colay
Colay Consensus utilise la discussion entre les participants et la synthèse d'un coordinateur. Les nombres d'autocohérence ne décrivent pas ce mode : un arrangement différent nécessite sa propre évaluation. Pour étudier les avantages, choisissez une tâche récurrente, fournissez les mêmes éléments factuels et conservez une réponse en mode ordinaire à côté du résultat du Consensus. Évaluez les deux par rapport aux critères établis au préalable.
Demandez le fondement de la recommandation, son objection importante la plus forte et les conditions qui la modifieraient. Vérifiez les sources et les calculs séparément. Lorsqu'une formule ou un test exécutable peut établir l'exactitude, utilisez cette vérification au lieu du nombre de participants d'accord. Plusieurs tentatives élargissent le bassin de candidats ; le flux de travail a toujours besoin d'une règle défendable pour accepter une réponse.
Sources et méthodologie
- Wang et al., ICLR 2023
Tableau 2 ; section 3.2.
- GSM8K dataset, OpenAI
Le jeu de test principal contient 1,319 problèmes de mathématiques élémentaires formulés en langage naturel.
Posez votre prochaine question à Colay
Choisissez un modèle, utilisez Auto ou rassemblez plusieurs perspectives avec Consensus.