Colay / Guias

Compare modelos de IA nas solicitações que seu produto realmente precisa

Antes de criar um pipeline de avaliação, você pode executar uma comparação pequena e estruturada no Colay. Dê aos agentes disponíveis as mesmas informações permitidas, inspecione suas respostas separadas e registre quais requisitos eles atendem. Esta é uma primeira triagem prática sem escrever código ou fornecer chaves de API do provedor; não é um executor de benchmark automatizado ou uma prova de que o modelo se comportará de forma idêntica em seu produto.

Transforme um recurso em casos testáveis

Comece com o resultado que seu usuário precisa, não com um ranking de modelos. Se o recurso extrai itens de ação, o sucesso significa preservar o responsável, a tarefa e o prazo corretos, deixando campos desconhecidos como desconhecidos. Um resumo elegante que invente um prazo deve falhar nesse caso.

Como um conjunto inicial ilustrativo, prepare 12 exemplos permitidos: 4 entradas comuns, 4 entradas ambíguas e 4 casos extremos. Esses números são um exercício administrável e não um tamanho de amostra estatisticamente validado. Remova informações pessoais e confidenciais que você não está autorizado a compartilhar. Mantenha um resultado esperado ou uma regra de aceitação explícita ao lado de cada caso.

Faça uma comparação que você possa interpretar

O guia de avaliação da Anthropic distingue uma tarefa de tentativas repetidas dessa tarefa porque os resultados podem variar. Este artigo aplica essa distinção básica a um exercício de triagem manual. Algumas respostas claras não podem estabelecer uma taxa de falha na produção.

Evite dar a um candidato uma solicitação corrigida depois que outro já tiver falhado. Se o prompt precisar de melhorias, crie uma nova versão e execute novamente todos os candidatos nela. Caso contrário, você estará comparando instruções e também modelos.

  1. Escolha explicitamente os agentes candidatos no catálogo atual. Não use Auto quando precisar saber qual candidato respondeu.
  2. Mantenha o resumo, o material de origem e o formato solicitado idênticos. Use Ask separately para as primeiras respostas e guarde seus rótulos.
  3. Registre a data, o nome do agente exibido, a versão do prompt e quaisquer configurações visíveis. Anote as respostas ausentes separadamente das respostas incorretas.
  4. Analise cada resultado em relação às regras antes de comparar a qualidade da prosa. Repita casos importantes ou ambíguos e retenha todas as tentativas, inclusive as falhas.

Exemplo: itens de ação de uma nota de reunião

Contribuição fictícia: "Mira enviará o rascunho na terça-feira. A equipe ainda precisa de um responsável para a revisão de preços." O resultado desejado contém uma tarefa atribuída e uma tarefa não atribuída. Ele não atribui ambos à Mira nem inventa uma data para a revisão de preços.

O artefato útil é uma ficha de caso, não uma captura de tela da melhor resposta. Anexe o texto exato retornado a cada linha para que um colega de equipe possa desafiar sua pontuação. Mantenha a falha de formatação separada da falha factual: um layout de tabela corrigível e um compromisso inventado têm consequências diferentes.

Folha de pontuação manual para este caso fictício
VerificarCondição de aprovaçãoFalha a registrar
ResponsávelMira é responsável apenas pelo rascunhoRevisão de preços atribuída sem evidências
PrazoTerça-feira é o prazo do rascunhoPrazo de preço inventado
Campo desconhecidoO responsável pela revisão de preços continua desconhecidoInformações ausentes preenchidas silenciosamente
UsabilidadeAmbas as tarefas aparecem na estrutura solicitadaTarefa omitida ou formato inutilizável

Um prompt para a execução da triagem

Mantenha as instruções de avaliação em uma lista de verificação separada para aplicar à resposta. Você pode pedir a outro agente para identificar possíveis erros, mas seu veredicto é outra saída a ser inspecionada. O Consensus pode ajudar a resumir as vantagens e limitações observadas após a primeira comparação; forneça explicitamente os resultados rotulados e suas pontuações.

Extraia itens de ação da nota de reunião fornecida: [nota permitida]. Retorne uma tabela com tarefa, responsável, prazo e trecho de apoio. Use apenas o texto fornecido. Escreva desconhecido para um responsável ou prazo não especificado. Não transforme uma sugestão em um compromisso acordado. Preserve as questões não resolvidas separadamente. ID de entrada: [ID do caso].

Use a lista para o próximo teste

Resuma os casos tratados por cada candidato, suas falhas críticas e as questões ainda sem resposta. Reter um candidato somente se seu comportamento atender aos requisitos mínimos do recurso. Se nenhum deles se qualificar, restrinja o recurso ou melhore o contexto fornecido antes de selecionar um vencedor.

Um teste de integração deve verificar separadamente o endpoint real do modelo, o acesso à ferramenta, as instruções do sistema, a latência, o custo de uso e o tratamento de falhas. Os créditos de Colay não são uma cotação para essa carga de trabalho da API. Comece em Colay com um caso real e não identificado que você mesmo pode avaliar e expanda apenas quando a comparação mudar sua lista.

Perguntas respondidas

Posso comparar modelos sem chaves de API?

Sim, para comparação do usuário final em Colay. Construir esses modelos em seu próprio produto é uma integração separada com acesso, termos e custos próprios.

Este é um benchmark estatisticamente confiável?

Não. Um pequeno exercício manual revela comportamentos e falhas concretas. Reivindicações mais amplas exigem casos representativos, ensaios repetidos e um desenho de avaliação apropriado à decisão.

Devo usar o Consensus para escolher o vencedor?

Primeiro, classifique os resultados separados de acordo com suas regras de aceitação. Use a síntese para organizar as evidências, mantendo visíveis os resultados originais e a decisão humana.

Fontes e metodologia

  1. Anthropic — Demystifying evals for AI agents

    Orientação primária de engenharia para a distinção entre tarefas e tentativas repetidas. Ele não avalia Colay nem valida o tamanho da amostra de exemplo.

Traga sua próxima pergunta paro Colay

Escolha um modelo, use Auto ou reúna diversas perspectivas com Consensus.

Compare minhas solicitações