Colay / Guias

Quando o debate entre modelos de IA agrega valor a uma resposta

A defesa do Consensus começa com uma pergunta testável: a discussão detecta um erro que a primeira resposta não percebeu? Vários modelos podem contribuir com observações úteis, mas a contagem de participantes por si só prova pouco. Este artigo examina o resultado de uma pesquisa e o transforma em um método de avaliação prático, mantendo os experimentos publicados separados das afirmações sobre um produto específico.

Resultados de pesquisas externas e cálculos ilustrativos não são medidas do desempenho do Colay.

Um pequeno experimento que vale a pena ler com atenção

No preprint de Du et al. de 2023, anterior à publicação na ICML 2024, Bard resolveu 11 de 20 problemas do GSM8K, ChatGPT resolveu 14 e o debate conjunto resolveu 17: 55%, 70% e 85%. São resultados de modelos específicos em uma amostra pequena, não medições do Colay. Du et al., 2023/ICML 2024

Três respostas corretas adicionais em uma amostra de 20 perguntas são um sinal, não uma taxa universal de melhoria. Testar outro idioma, modelo ou documento muda as condições.

Identifique a melhoria que você realmente precisa

Considere uma decisão de lançamento hipotética com três opções. Uma resposta recomenda o caminho mais rápido. Um segundo identifica uma dependência de fornecedor. Um terceiro observa que o cronograma estimado cobre o desenvolvimento, mas exclui a aprovação. Uma síntese útil corrige o âmbito da estimativa e explica se isso altera a recomendação. Apenas listar três perspectivas não conclui esse trabalho.

Nosso critério sugerido é uma mudança na decisão, não uma discussão impressionante. Uma restrição ausente foi recuperada? Uma unidade incorreta foi corrigida? O resultado rotulou uma incógnita que a primeira resposta tratou como um fato? Se a única mudança for uma resposta mais longa, o benefício permanece sem comprovação. Este critério funciona em combinações de produtos e modelos.

A contagem de agentes e a diversidade do modelo são variáveis separadas

ReConcile, publicado na ACL 2024, investiga um protocolo distinto: diferentes modelos discutem respostas e usam votação ponderada pela confiança. Avalia esse arranjo, em vez de validar cada serviço que coordena vários agentes. Chen, Saha and Bansal, ACL 2024

Em sua própria análise, diferencie o número de respostas candidatas, as diferenças nas abordagens iniciais e a regra usada para formar uma resposta final. Três papéis atribuídos a um modelo não se tornam três fontes de conhecimento independentes. Nomes de modelos diferentes também não estabelecem erros independentes: cada participante pode herdar a mesma premissa falsa da solicitação.

Contar regressões juntamente com correções

Aqui está um exemplo hipotético, não uma descoberta de pesquisa. Em 100 tarefas pré-selecionadas, a resposta inicial está correta em 60. A discussão repara 14 respostas erradas, mas transforma seis respostas corretas em erradas. O resultado são 68 respostas corretas: um ganho líquido de oito pontos percentuais. Relatar apenas os 14 reparos ocultaria uma parte substancial do resultado.

Examine também as consequências. Corrigir um erro de digitação e perder uma restrição orçamentária têm custos diferentes. Mantenha a resposta inicial ao lado da resposta final e registre por que cada afirmação relevante mudou. Isso pode mostrar onde um fluxo de trabalho ajuda, mesmo quando sua pontuação geral quase não muda. Para decisões consequentes, um revisor que entenda do assunto deve determinar se essas alterações são justificadas.

Avaliação hipotética em 100 tarefas
TransiçãoContagemInterpretação
Errado → correto14Correções
Correto → errado6Regressões
Alteração líquida+868 respostas corretas em vez de 60

Faça uma comparação pequena, mas justa

Escolha tarefas reais recentes com um resultado aceitável estabelecido. Anote os critérios de classificação, limite de gastos e atraso máximo aceitável antes de gerar respostas. Dê a ambos os fluxos de trabalho a mesma evidência. Não selecione apenas perguntas nas quais o primeiro modelo já falhou: isso inclinaria a comparação para qualquer segunda tentativa, independentemente de a discussão ter contribuído com alguma coisa.

Revise os resultados sem expor o nome do fluxo de trabalho. Pontue a exatidão, a cobertura das restrições relevantes e a quantidade de revisão humana separadamente. Preserve exemplos malsucedidos ao lado de sucessos. Se os colegas ajudarem a avaliar os resultados, deixe-os pontuar de forma independente antes de discuti-los. Caso contrário, a concordância na revisão pode ocultar diferenças genuínas na forma como as pessoas entendem a tarefa.

Aplique a pergunta ao Consensus no Colay

No Consensus, os agentes participantes discutem uma tarefa e um coordenador produz uma síntese. Um pedido prático pede-lhes que comparem alternativas com base em critérios explícitos, identifiquem pressupostos contestados e evitem converter dados em falta em confiança. Forneça a base factual e peça que afirmações importantes sejam ligadas a passagens específicas desse material. Revise você mesmo essas conexões.

Este artigo não relata uma melhoria medida na precisão do Colay. A pesquisa apoia a investigação da discussão quando interpretações concorrentes são importantes; o valor de uma execução específica depende de sua produção real. Preserve divergências não resolvidas no documento final quando as evidências forem insuficientes. Um resultado útil pode terminar com um pedido de mais informações em vez de uma aprovação unânime.

Fontes e metodologia

  1. Du et al., 2023/ICML 2024

    Seção 3: 20 problemas do GSM8K.

  2. Chen, Saha and Bansal, ACL 2024

    ReConcile: um protocolo distinto que usa diversos modelos, discussão e votação com base na confiança.

Traga sua próxima pergunta paro Colay

Escolha um modelo, use Auto ou reúna diversas perspectivas com Consensus.

Abrir Colay