Colay / Guias
Teste o Consensus em relação ao trabalho que você realmente precisa realizar
Uma avaliação útil pergunta se um fluxo de trabalho melhora suas entregas sob restrições que você pode pagar. Não começa por recolher exemplos impressionantes. Compare as mesmas tarefas, decida como o sucesso será avaliado antes de ver as respostas e preserve as falhas. Isso produz uma decisão que você pode revisar em vez de um número que parece preciso.
Resultados de pesquisas externas e cálculos ilustrativos não são medidas do desempenho do Colay.
Escolha a decisão antes de escolher a pontuação
A função Measure do NIST AI RMF exige conjuntos de testes documentados, métricas, incerteza e avaliação em condições semelhantes à implantação. Fornece uma estrutura de medição, não um vencedor prescrito ou uma certificação de um produto de IA. NIST AI RMF: Measure
Anote sua regra de adoção. Por exemplo: use o fluxo de trabalho revisado para análise de requisitos se encontrar mais omissões relevantes dentro do mesmo orçamento de gastos e não exceder um tempo de espera acordado. Esta é uma regra proposta para seu experimento. Decida o que é considerado relevante listando exemplos concretos antes que qualquer modelo produza uma resposta.
Separe a correção factual da integridade, utilidade e estilo. Uma resposta polida que invente uma restrição deve falhar na verificação factual, mesmo que os revisores prefiram seu tom. Para tarefas abertas, use uma rubrica curta com exemplos ancorados e registre divergências entre revisores humanos. O acordo entre juízes é em si algo a ser inspecionado, e não assumido.
Combine as tarefas e controle o orçamento
Crie uma amostra do trabalho real: tarefas comuns, casos difíceis, solicitações ambíguas e exemplos com informações faltantes. Mantenha um conjunto separado para prompts de ajuste. Execute cada tarefa de avaliação em ambos os fluxos de trabalho com o mesmo material de origem. Oculte os nomes dos fluxos de trabalho dos avaliadores e randomize a ordem das respostas para que a posição e a marca não decidam a comparação.
Use o mesmo orçamento total e o mesmo prazo para cada fluxo de trabalho no conjunto de tarefas. Contabilize cada geração, etapa de coordenação, nova tentativa e chamada de ferramenta. O processo de referência com um agente deve ter um prompt adequado e acesso às mesmas informações relevantes. Dar tentativas extras a um lado e contar apenas sua resposta final invalida a comparação.
Orçamentos iguais não exigem desperdiçar o valor não utilizado. Registre os gastos reais e defina antecipadamente o que acontece quando um fluxo atinge seu limite: as tarefas incompletas devem permanecer visíveis. Você também pode fazer uma comparação separada com o mesmo nível de qualidade para estimar o custo, mas não misture seus resultados com os do experimento de orçamento igual.
Uma amostra pequena precisa de um intervalo de incerteza
O NIST descreve o intervalo de Wilson para uma proporção binomial. Nosso cálculo para 95 sucessos em 100 testes independentes e representativos fornece um intervalo de 95% de 88.82%–97.85%, usando z = 1.9599639845. Estas são observações ilustrativas, não medições de Colay. NIST: Confidence intervals for proportions
O intervalo diz respeito à taxa de sucesso da população de tarefas definida sob as suposições de amostragem. Não é uma probabilidade de que uma determinada resposta esteja correta. Também não pode reparar uma amostra tendenciosa. A repetição de solicitações quase idênticas de um documento pode criar dependência, e testar apenas rascunhos fáceis diz pouco sobre análises complexas.
Não anuncie que uma pontuação observada de 95% prova ser um produto 95% confiável. Registre a data, as versões do modelo, os prompts, a seleção de tarefas, as exclusões, as regras de pontuação e o orçamento. Uma mudança de modelo ou uma nova combinação de tarefas pode tornar a estimativa antiga um guia ruim para o próximo mês.
Leia os resultados pareados, não apenas duas porcentagens
Considere outro resultado explicitamente inventado nas mesmas 100 tarefas: ambos os fluxos de trabalho passam 89, apenas o Consensus passa 6, apenas o fluxo de trabalho de agente único passa 1 e ambos falham 4. Os totais são 95 e 90 sucessos. A diferença pareada é de cinco tarefas, mas as observações mais informativas são os sete casos em que os fluxos de trabalho discordam.
Para esta tabela hipotética, o teste exato bilateral de McNemar é condicionado àqueles sete pares discordantes. Sob a hipótese de igual probabilidade de vitória, seu valor p é 2 × (1 + 7) ÷ 128 = 0.125. Isso não atenderia a um limiar pré-selecionado de 0.05. Não prova equivalência; mostra por que a vantagem aparente precisa de mais evidências. A sobreposição de intervalos de confiança separados não substitui uma análise pareada.
| Resultado | Tarefas |
|---|---|
| Ambos passam | 89 |
| Só o Consensus passa | 6 |
| Só o fluxo com um agente passa | 1 |
| Ambos falham | 4 |
Transforme as descobertas em uma regra operacional limitada
Inspecione cada regressão. Um fluxo de trabalho que melhora muitos rascunhos de baixo impacto, mas introduz uma falha factual grave, pode não atender à sua regra de adoção. Expanda categorias promissoras com novas tarefas e mantenha um conjunto de validação que não moldou prompts. Inspecionar repetidamente os resultados e parar na primeira pontuação atraente pode exagerar os ganhos aparentes.
No Colay Consensus, os agentes discutem a solicitação e um agente coordenador sintetiza uma conclusão. Avalie a entrega final e o esforço necessário para verificá-la. Registre créditos porque as assinaturas do Colay têm créditos e limites. Publique apenas o que seu teste suporta: as tarefas amostradas, a configuração testada, as compensações observadas e a incerteza. Nenhum destes exemplos estabelece um benchmark medido do Colay.
Fontes e metodologia
- NIST AI RMF: Measure
Estrutura de avaliação.
- NIST: Confidence intervals for proportions
Método de intervalo de Wilson.
Traga sua próxima pergunta paro Colay
Escolha um modelo, use Auto ou reúna diversas perspectivas com Consensus.