Colay / Guías
Compare modelos de IA según las indicaciones que su producto realmente necesita
Antes de crear un proceso de evaluación, puede ejecutar una comparación pequeña y estructurada en Colay. Proporcione a los agentes disponibles las mismas entradas permitidas, inspeccione sus respuestas por separado y registre qué requisitos cumplen. Esta es una primera evaluación práctica sin escribir código ni proporcionar claves API del proveedor; no es un sistema automatizado de pruebas comparativas ni una prueba de que el modelo se comportará de manera idéntica en su producto.
Convierta una función en casos comprobables
Comience con el resultado que su usuario necesita, no con una clasificación de modelos. Si la función extrae tareas pendientes, el éxito significa preservar el responsable, la tarea y la fecha límite correctos, dejando campos desconocidos desconocidos. Un resumen elegante que inventa una fecha límite debería fracasar en ese caso.
Como conjunto inicial ilustrativo, prepare 12 ejemplos permitidos: 4 entradas ordinarias, 4 entradas ambiguas y 4 casos extremos. Estos números son un ejercicio manejable, no un tamaño de muestra validado estadísticamente. Elimine la información personal y confidencial que no esté autorizado a compartir. Mantenga un resultado esperado o una regla de aceptación explícita al lado de cada caso.
Ejecute una comparación que pueda interpretar
La guía de evaluación de Anthropic distingue una tarea de las pruebas repetidas de esa tarea porque los resultados pueden variar. Este artículo aplica esa distinción básica a un ejercicio de selección manual. Unas pocas respuestas claras no pueden establecer una tasa de errores en producción.
Evite darle a un candidato una pregunta corregida después de que otro ya haya fallado. Si es necesario mejorar el mensaje, cree una nueva versión y vuelva a ejecutar todos los candidatos en ella. De lo contrario, estará comparando instrucciones y modelos.
- Elija los agentes candidatos explícitamente del catálogo actual. No utilice Auto cuando necesite saber qué candidato respondió.
- Mantenga idénticos el resumen, el material fuente y el formato solicitado. Utilice Ask separately para las primeras respuestas y conserve sus etiquetas.
- Registre la fecha, el nombre del agente mostrado, la versión del mensaje y cualquier configuración visible. Anote las respuestas faltantes por separado de las respuestas incorrectas.
- Revise cada resultado según las reglas antes de comparar la calidad de la prosa. Repita casos importantes o ambiguos y conserve todos los intentos, incluidos los fracasos.
Ejemplo: tareas pendientes de una nota de reunión
Datos ficticios: «Mira enviará el borrador el martes. Aún falta asignar a alguien la revisión de precios». El resultado debe contener una tarea asignada y otra sin responsable. No debe asignar ambas a Mira ni inventar una fecha para revisar los precios.
El artefacto útil es una hoja de caso, no una captura de pantalla de la mejor respuesta. Adjunte el texto exacto devuelto a cada fila para que un compañero de equipo pueda cuestionar su puntuación. Mantenga los errores de formato separados de los errores de contenido: un diseño de tabla reparable y un compromiso inventado tienen consecuencias diferentes.
| Comprobar | Condición de aprobación | Error que registrar |
|---|---|---|
| Responsable | Mira solo es responsable del borrador | Revisión de precios asignada sin evidencia |
| Fecha límite | El martes corresponde al borrador | Fecha límite de precios inventada |
| Campo desconocido | El responsable de revisar los precios sigue sin especificarse | La información faltante se completa de forma silenciosa |
| Usabilidad | Ambas tareas aparecen en la estructura solicitada | Tarea omitida o formato inutilizable |
Un mensaje para la ejecución de la evaluación
Mantenga las instrucciones de evaluación en una lista de verificación separada que aplique a la respuesta. Puede pedirle a otro agente que identifique posibles errores, pero su veredicto es otro resultado a inspeccionar. Consensus puede ayudar a resumir las ventajas y limitaciones observadas después de la primera comparación; proporcione explícitamente los resultados etiquetados y sus puntuaciones.
Extraiga los tareas pendientes de la nota de la reunión proporcionada: [nota permitida]. Devuelva una tabla con la tarea, el responsable, la fecha límite y un extracto de respaldo. Utilice únicamente el texto proporcionado. Escriba desconocido para un responsable o fecha límite no especificados. No convierta una sugerencia en un compromiso acordado. Conserve las preguntas no resueltas por separado. ID de entrada: [ID de caso].
Use la lista corta para la próxima prueba
Resuma los casos que maneja cada candidato, sus fallas críticas y las preguntas aún sin respuesta. Conserve un candidato solo si su comportamiento se ajusta a los requisitos mínimos de la característica. Si ninguno califica, limite la función o mejore el contexto proporcionado antes de seleccionar un ganador.
Una prueba de integración debe verificar por separado el endpoint real del modelo, el acceso a las herramientas, las instrucciones del sistema, la latencia, el costo de uso y el manejo de fallas. Los créditos de Colay no son una cotización para esa carga de trabajo de API. Comience en Colay con un caso real y desidentificado que pueda calificar usted mismo y luego amplíelo solo cuando la comparación cambie su lista corta.
Preguntas y respuestas
¿Puedo comparar modelos sin claves API?
Sí, para la comparación del usuario final en Colay. La integración de esos modelos en su propio producto es una integración separada con sus propias condiciones de acceso, uso y costes.
¿Es una evaluación comparativa estadísticamente fiable?
No. Un pequeño ejercicio manual revela comportamientos y fallos concretos. Las conclusiones más amplias requieren casos representativos, intentos repetidos y un diseño de evaluación apropiado para la decisión.
¿Debería utilizar Consensus para elegir al ganador?
Primero califique resultados separados según sus reglas de aceptación. Utilice la síntesis para organizar la evidencia, manteniendo visibles los resultados originales y la decisión humana.
Fuentes y metodología
- Anthropic — Demystifying evals for AI agents
Guía de ingeniería primaria para la distinción entre tareas y intentos repetidos. No evalúa Colay ni valida el tamaño de la muestra del ejemplo.
Envíe su próxima pregunta a Colay
Elija un modelo, utilice Auto o reúna varias perspectivas con Consensus.