Colay / Guias
Mistura de Agentes: uma síntese deve merecer seu valor
Coletar diversas respostas de IA é simples; transformá-las em um produto coerente e verificável é mais difícil. A pesquisa sobre mistura de agentes fornece uma razão para levar a síntese a sério, mas as porcentagens dos títulos são fáceis de serem mal interpretadas. Aqui examinamos a medição, distinguimos a preferência da precisão factual e propomos uma forma prática de avaliar o resultado final.
Resultados de pesquisas externas e cálculos ilustrativos não são medidas do desempenho do Colay.
O resultado, a métrica e a resposta de referência
O artigo de Wang et al. sobre MoA de 2024 relata uma taxa de vitórias ajustada pelo comprimento de 65.1% nas 805 instruções do AlpacaEval 2.0, contra 57.5% do GPT-4o (05/13). Ambos são comparados com gpt-4-1106-preview. Essa métrica mede a preferência de um avaliador de IA, não a proporção de fatos corretos nem o desempenho do Colay. Wang et al., 2024
A diferença é de 7.6 pontos percentuais nessa métrica. Ele não estabelece a precisão no trabalho ou a proporção de clientes que escolherão um produto.
Por que ajustar o comprimento é importante
Dubois et al. introduziram uma versão do AlpacaEval com controle de comprimento para ajustar as preferências do avaliador automático às diferenças de comprimento entre respostas. Esse ajuste não transforma a pontuação em uma auditoria de cada afirmação factual. Dubois et al., Length-Controlled AlpacaEval, 2024
Na sua própria comparação, uma síntese longa pode parecer completa mesmo quando os detalhes adicionais não melhoram a decisão. Dê a ambos os fluxos de trabalho o mesmo limite de espaço e conteúdo necessário. Em seguida, avalie a utilidade, a correção factual e a legibilidade separadamente. Uma única pontuação combinada pode ocultar um resultado em que a apresentação melhora enquanto a base da recomendação se torna mais fraca.
Preservar as condições por trás de cada recomendação
Considere um exemplo hipotético. Uma resposta propõe uma implementação de duas semanas se os dados estiverem prontos; outro estima seis semanas se a limpeza for necessária. Uma síntese que diz que a implementação demora quatro semanas parece equilibrada, mas não representa nenhum dos cenários. Uma resposta melhor preserva a ramificação e pergunta sobre a disponibilidade dos dados. A média das declarações destrói informações úteis.
Por esse motivo, sugerimos tratar uma afirmação e suas condições de aplicabilidade como uma unidade durante a síntese. Cada recomendação necessita de uma base, de um limite e de dados de entrada identificáveis. Você pode pedir a um coordenador uma tabela de conflitos e depois verificar se a compactação não removeu uma condição inconveniente. Uma boa edição torna as diferenças mais fáceis de entender, em vez de suavizá-las.
Audite o que desapareceu entre os rascunhos e o texto final
Suponha que um briefing do fornecedor contenha 12 condições obrigatórias. Numa revisão hipotética, as respostas candidatas cobrem coletivamente todas as 12, mas a síntese final preserva apenas nove. A cobertura das condições exigidas é de 75%, mesmo que o documento final seja melhor lido do que qualquer rascunho. Esta é uma medida separada e não tem conexão com a porcentagem AlpacaEval.
Liste as condições obrigatórias do briefing, localize cada uma delas no texto final e registre as omissões. Em seguida, inspecione as declarações introduzidas apenas durante a síntese. Um novo número ou promessa precisa de evidências de apoio. Se não existir suporte, rotule-o como uma suposição ou remova-o. Isso testa se o conteúdo útil sobreviveu ao fluxo de trabalho, em vez de medir o nível de acabamento do resultado.
| Verificar | Exemplo de resultado | Ação |
|---|---|---|
| Condições obrigatórias | 9 de 12 preservadas | Restaure três omissões |
| Novas declarações numéricas | 2 sem suporte | Verificar ou remover |
| Suposições contestadas | 1 oculto | Mostrar o ramo de decisão |
Use uma comparação forte de modelo único
Para testar o valor de vários modelos em seu trabalho, forneça ao fluxo de trabalho de modelo único o mesmo resumo preparado, fontes e critérios de classificação. Comparar um processo organizado com uma solicitação descuidada de uma linha confunde preparação de tarefas com arquitetura. Registre o esforço necessário para preparar entradas e revisar resultados, bem como o uso do modelo e o tempo de espera.
Tente uma pergunta factual curta e um memorando de decisão mais longo com alternativas. Eles precisam de critérios de sucesso diferentes. O primeiro requer apoio para uma afirmação específica; este último também necessita de cobertura das condições relevantes e de uma explicação clara da escolha. Se a melhoria aparecer apenas nos memorandos de decisão, mantenha a recomendação prática limitada a esse tipo de trabalho.
Aplique a ideia ao Consensus sem emprestar sua pontuação
Colay Consensus também termina com uma síntese do coordenador, mas isso não o torna idêntico à configuração do MoA pesquisada. Este artigo não contém nenhum benchmark Colay publicado. Trate o resultado externo como um motivo para testar o fluxo de trabalho do seu material, não como um índice de qualidade pronto para cada execução do Consensus.
Solicite uma conclusão com quatro partes: recomendação, evidência, desacordo não resolvido e a próxima etapa verificável. Forneça um limite de espaço e uma lista de condições obrigatórias. Revise o resultado em relação ao resumo e suas fontes. O fluxo de trabalho ganha um papel útil quando você consegue identificar o que foi preservado ou adicionado e quanto trabalho humano ainda resta.
Fontes e metodologia
- Wang et al., 2024
Tabela 2a; seção 3.1.
- Dubois et al., Length-Controlled AlpacaEval, 2024
A métrica ajusta as preferências do juiz-modelo quanto ao comprimento da resposta; não é uma pontuação de precisão factual.
Traga sua próxima pergunta paro Colay
Escolha um modelo, use Auto ou reúna diversas perspectivas com Consensus.