Colay / Guías

Pruebe Consensus comparándolo con el trabajo que realmente necesita hacer

Una evaluación útil pregunta si un flujo de trabajo mejora sus entregables dentro de límites asumibles. No comienza por recopilar ejemplos impresionantes. Compare las mismas tareas, decida cómo puntuará el éxito antes de ver las respuestas y conserve los fallos. Así obtendrá una decisión que pueda revisar, en vez de una cifra que solo parezca precisa.

Los resultados de investigaciones externas y los cálculos ilustrativos no son mediciones del rendimiento de Colay.

Elija la decisión antes de elegir la puntuación

La función de medición de NIST AI RMF requiere conjuntos de pruebas, métricas, incertidumbre y evaluación documentados en condiciones que se asemejan a la implementación. Proporciona un marco de medición, no un ganador prescrito ni una certificación de un producto de IA. NIST AI RMF: Measure

Escriba su regla de adopción. Por ejemplo: utilice el flujo de trabajo revisado para el análisis de requisitos si encuentra más omisiones relevantes dentro de la misma asignación de gastos y no excede un tiempo de espera acordado. Esta es una regla propuesta para su experimento. Decida qué se considera relevante enumerando ejemplos concretos antes de que cualquier modelo produzca una respuesta.

Separe la corrección fáctica de la integridad, la utilidad y el estilo. Una respuesta refinada que inventa una restricción no debería pasar una verificación de hechos incluso si los revisores prefieren su tono. Para tareas abiertas, utilice una rúbrica breve con ejemplos concretos y registre los desacuerdos entre revisores humanos. El acuerdo entre jueces es en sí mismo algo que hay que inspeccionar, no asumir.

Empareja las tareas y controla el presupuesto

Cree una muestra a partir del trabajo real: tareas ordinarias, casos difíciles, solicitudes ambiguas y ejemplos en los que falta información. Mantenga un conjunto separado para las indicaciones de ajuste. Ejecute cada tarea de evaluación a través de ambos flujos de trabajo con el mismo material fuente. Oculte los nombres del flujo de trabajo de los evaluadores y aleatorice el orden de las respuestas para que la posición y la marca no decidan la comparación.

Utilice el mismo presupuesto total y el mismo plazo para cada flujo de trabajo en el conjunto de tareas. Contabilice cada generación, paso de coordinación, reintento y llamada a herramientas. El proceso de referencia con un solo agente debe tener unas instrucciones razonables y acceso a la misma información relevante. Dar a una parte intentos adicionales y contar solo su respuesta final invalida la comparación.

Asignar el mismo presupuesto no exige gastar el sobrante. Registre el gasto real y defina de antemano qué ocurre cuando un flujo de trabajo alcanza su límite: las tareas sin terminar deben quedar visibles. También puede realizar una comparación independiente con el mismo nivel de calidad para estimar el coste, pero no mezcle sus resultados con los del experimento a igual presupuesto.

Una muestra pequeña necesita un intervalo de incertidumbre

NIST describe el intervalo de Wilson para una proporción binomial. Nuestro cálculo de 95 éxitos en 100 ensayos independientes y representativos da un intervalo del 95% de 88.82%–97.85%, utilizando z = 1.9599639845. Son observaciones ilustrativas, no mediciones de Colay. NIST: Confidence intervals for proportions

El intervalo se refiere a la tasa de éxito de la población de tareas definida bajo los supuestos de muestreo. No es una probabilidad de que una respuesta particular sea correcta. Tampoco puede reparar una muestra sesgada. Repetir solicitudes casi idénticas de un documento puede crear dependencia, y probar solo borradores sencillos dice poco sobre análisis complejos.

No anuncie que una puntuación observada del 95% demuestra que un producto es 95% confiable. Registre la fecha, las versiones del modelo, las indicaciones, la selección de tareas, las exclusiones, las reglas de puntuación y el presupuesto. Un modelo modificado o una nueva combinación de tareas pueden hacer que la estimación anterior sea una mala guía para el próximo mes.

Lea los resultados emparejados, no solo dos porcentajes

Considere otro resultado inventado explícitamente en las mismas 100 tareas: ambos flujos de trabajo pasan 89, solo Consensus pasa 6, solo el flujo de trabajo de agente único pasa 1 y ambos fallan 4. Los totales son 95 y 90 éxitos. La diferencia pareada son cinco tareas, pero las observaciones más informativas son los siete casos en los que los flujos de trabajo no coinciden.

Para esta tabla hipotética, la prueba exacta bilateral de McNemar se condiciona a esos siete pares discordantes. Bajo el supuesto de igual probabilidad de victoria, su valor p es 2 × (1 + 7) ÷ 128 = 0.125. No alcanzaría un umbral preseleccionado de 0.05. Esto no demuestra equivalencia; muestra por qué la ventaja aparente necesita más evidencia. El solapamiento de intervalos de confianza separados no sustituye un análisis pareado.

Resultados emparejados hipotéticos en 100 tareas
ResultadoTareas
Ambos pasan89
Solo pasa Consensus6
Solo supera la prueba el proceso con un agente1
Ambos fallan4

Convertir los hallazgos en una regla operativa limitada

Inspeccione cada regresión. Un flujo de trabajo que mejora muchos borradores de bajo impacto pero introduce una falla fáctica grave puede no cumplir con su regla de adopción. Amplíe las categorías prometedoras con nuevas tareas y mantenga un conjunto de reservas que no haya dado forma a las indicaciones. Inspeccionar repetidamente los resultados y detenerse en la primera puntuación atractiva puede exagerar las ganancias aparentes.

En Consensus de Colay, los agentes debaten la solicitud y un agente coordinador sintetiza una conclusión. Evalúe el entregable final y el esfuerzo necesario para verificarlo. Registre los créditos consumidos porque las suscripciones de Colay tienen créditos y límites. Publique solo lo que su prueba respalde: las tareas de la muestra, la configuración probada, las ventajas y desventajas observadas y la incertidumbre. Este ejemplo no establece una medición del rendimiento de Colay.

Fuentes y metodología

  1. NIST AI RMF: Measure

    Marco de evaluación.

  2. NIST: Confidence intervals for proportions

    Método del intervalo de Wilson.

Envíe su próxima pregunta a Colay

Elija un modelo, utilice Auto o reúna varias perspectivas con Consensus.

Abrir Colay