Colay / Guias
Compare modelos de IA nas solicitações que seu produto realmente precisa
Antes de criar um pipeline de avaliação, você pode executar uma comparação pequena e estruturada no Colay. Dê aos agentes disponíveis as mesmas informações permitidas, inspecione suas respostas separadas e registre quais requisitos eles atendem. Esta é uma primeira triagem prática sem escrever código ou fornecer chaves de API do provedor; não é um executor de benchmark automatizado ou uma prova de que o modelo se comportará de forma idêntica em seu produto.
Transforme um recurso em casos testáveis
Comece com o resultado que seu usuário precisa, não com um ranking de modelos. Se o recurso extrai itens de ação, o sucesso significa preservar o responsável, a tarefa e o prazo corretos, deixando campos desconhecidos como desconhecidos. Um resumo elegante que invente um prazo deve falhar nesse caso.
Como um conjunto inicial ilustrativo, prepare 12 exemplos permitidos: 4 entradas comuns, 4 entradas ambíguas e 4 casos extremos. Esses números são um exercício administrável e não um tamanho de amostra estatisticamente validado. Remova informações pessoais e confidenciais que você não está autorizado a compartilhar. Mantenha um resultado esperado ou uma regra de aceitação explícita ao lado de cada caso.
Faça uma comparação que você possa interpretar
O guia de avaliação da Anthropic distingue uma tarefa de tentativas repetidas dessa tarefa porque os resultados podem variar. Este artigo aplica essa distinção básica a um exercício de triagem manual. Algumas respostas claras não podem estabelecer uma taxa de falha na produção.
Evite dar a um candidato uma solicitação corrigida depois que outro já tiver falhado. Se o prompt precisar de melhorias, crie uma nova versão e execute novamente todos os candidatos nela. Caso contrário, você estará comparando instruções e também modelos.
- Escolha explicitamente os agentes candidatos no catálogo atual. Não use Auto quando precisar saber qual candidato respondeu.
- Mantenha o resumo, o material de origem e o formato solicitado idênticos. Use Ask separately para as primeiras respostas e guarde seus rótulos.
- Registre a data, o nome do agente exibido, a versão do prompt e quaisquer configurações visíveis. Anote as respostas ausentes separadamente das respostas incorretas.
- Analise cada resultado em relação às regras antes de comparar a qualidade da prosa. Repita casos importantes ou ambíguos e retenha todas as tentativas, inclusive as falhas.
Exemplo: itens de ação de uma nota de reunião
Contribuição fictícia: "Mira enviará o rascunho na terça-feira. A equipe ainda precisa de um responsável para a revisão de preços." O resultado desejado contém uma tarefa atribuída e uma tarefa não atribuída. Ele não atribui ambos à Mira nem inventa uma data para a revisão de preços.
O artefato útil é uma ficha de caso, não uma captura de tela da melhor resposta. Anexe o texto exato retornado a cada linha para que um colega de equipe possa desafiar sua pontuação. Mantenha a falha de formatação separada da falha factual: um layout de tabela corrigível e um compromisso inventado têm consequências diferentes.
| Verificar | Condição de aprovação | Falha a registrar |
|---|---|---|
| Responsável | Mira é responsável apenas pelo rascunho | Revisão de preços atribuída sem evidências |
| Prazo | Terça-feira é o prazo do rascunho | Prazo de preço inventado |
| Campo desconhecido | O responsável pela revisão de preços continua desconhecido | Informações ausentes preenchidas silenciosamente |
| Usabilidade | Ambas as tarefas aparecem na estrutura solicitada | Tarefa omitida ou formato inutilizável |
Um prompt para a execução da triagem
Mantenha as instruções de avaliação em uma lista de verificação separada para aplicar à resposta. Você pode pedir a outro agente para identificar possíveis erros, mas seu veredicto é outra saída a ser inspecionada. O Consensus pode ajudar a resumir as vantagens e limitações observadas após a primeira comparação; forneça explicitamente os resultados rotulados e suas pontuações.
Extraia itens de ação da nota de reunião fornecida: [nota permitida]. Retorne uma tabela com tarefa, responsável, prazo e trecho de apoio. Use apenas o texto fornecido. Escreva desconhecido para um responsável ou prazo não especificado. Não transforme uma sugestão em um compromisso acordado. Preserve as questões não resolvidas separadamente. ID de entrada: [ID do caso].
Use a lista para o próximo teste
Resuma os casos tratados por cada candidato, suas falhas críticas e as questões ainda sem resposta. Reter um candidato somente se seu comportamento atender aos requisitos mínimos do recurso. Se nenhum deles se qualificar, restrinja o recurso ou melhore o contexto fornecido antes de selecionar um vencedor.
Um teste de integração deve verificar separadamente o endpoint real do modelo, o acesso à ferramenta, as instruções do sistema, a latência, o custo de uso e o tratamento de falhas. Os créditos de Colay não são uma cotação para essa carga de trabalho da API. Comece em Colay com um caso real e não identificado que você mesmo pode avaliar e expanda apenas quando a comparação mudar sua lista.
Perguntas respondidas
Posso comparar modelos sem chaves de API?
Sim, para comparação do usuário final em Colay. Construir esses modelos em seu próprio produto é uma integração separada com acesso, termos e custos próprios.
Este é um benchmark estatisticamente confiável?
Não. Um pequeno exercício manual revela comportamentos e falhas concretas. Reivindicações mais amplas exigem casos representativos, ensaios repetidos e um desenho de avaliação apropriado à decisão.
Devo usar o Consensus para escolher o vencedor?
Primeiro, classifique os resultados separados de acordo com suas regras de aceitação. Use a síntese para organizar as evidências, mantendo visíveis os resultados originais e a decisão humana.
Fontes e metodologia
- Anthropic — Demystifying evals for AI agents
Orientação primária de engenharia para a distinção entre tarefas e tentativas repetidas. Ele não avalia Colay nem valida o tamanho da amostra de exemplo.
Traga sua próxima pergunta paro Colay
Escolha um modelo, use Auto ou reúna diversas perspectivas com Consensus.