Colay / Guías
Mezcla de agentes: una síntesis debe ganar su valor
Recopilar varias respuestas de IA es sencillo; convertirlas en resultados coherentes y verificables es más difícil. La investigación sobre mezclas de agentes proporciona una razón para tomar en serio la síntesis, pero sus porcentajes principales son fáciles de malinterpretar. Aquí examinamos la medición, distinguimos la preferencia de la precisión fáctica y proponemos una forma práctica de evaluar el resultado final.
Los resultados de investigaciones externas y los cálculos ilustrativos no son mediciones del rendimiento de Colay.
El resultado, la métrica y la respuesta de referencia
El artículo de Wang et al. sobre MoA de 2024 informa de una tasa de victorias ajustada por longitud del 65.1% en las 805 instrucciones de AlpacaEval 2.0, frente al 57.5% de GPT-4o (05/13). Ambos se comparan con gpt-4-1106-preview. Esta métrica mide la preferencia de un juez de IA, no la proporción de hechos correctos ni el rendimiento de Colay. Wang et al., 2024
La diferencia es de 7.6 puntos porcentuales en esa métrica. No establece la precisión en el lugar de trabajo ni la proporción de clientes que elegirán un producto.
Por qué es importante ajustar la longitud
Dubois et al. introdujeron una versión de AlpacaEval con control de longitud para ajustar las preferencias del juez automático a las diferencias de longitud entre respuestas. Ese ajuste no convierte la puntuación en una auditoría de cada afirmación factual. Dubois et al., Length-Controlled AlpacaEval, 2024
En su propia comparación, una síntesis larga puede parecer completa incluso cuando los detalles adicionales no mejoran la decisión. Proporcione a ambos flujos de trabajo el mismo límite de espacio y contenido requerido. Luego califique la utilidad, la corrección fáctica y la legibilidad por separado. Una única puntuación combinada puede ocultar un resultado en el que la presentación mejora mientras que la base de la recomendación se debilita.
Preservar las condiciones detrás de cada recomendación
Considere un ejemplo hipotético. Una respuesta propone una implementación de dos semanas si los datos están listos; otra estima seis semanas si es necesario limpiarlos. Una síntesis que indique cuatro semanas parece equilibrada, pero no representa ninguno de los escenarios. Una respuesta mejor mantiene ambas posibilidades y pregunta por el estado de los datos. Promediar las afirmaciones destruye información útil.
Por este motivo, sugerimos tratar una afirmación y sus condiciones de aplicabilidad como una unidad durante la síntesis. Cada recomendación necesita una base, un límite y evidencia de entrada identificable. Puede pedirle a un coordinador una tabla de conflictos y luego verificar que la compresión no haya eliminado una condición inconveniente. Una buena edición hace que las diferencias sean más fáciles de entender en lugar de suavizarlas.
Auditar lo que desapareció entre los borradores y el texto final
Supongamos que un resumen de un proveedor contiene 12 condiciones obligatorias. En una revisión hipotética, las respuestas candidatas cubren colectivamente las 12, pero la síntesis final conserva solo nueve. La cobertura de las condiciones requeridas es del 75%, incluso si el documento final se lee mejor que cualquier borrador. Esta es una medida separada y no tiene conexión con el porcentaje de AlpacaEval.
Enumere las condiciones obligatorias del escrito, ubique cada una en el texto final y registre las omisiones. A continuación, inspeccione las afirmaciones introducidas sólo durante la síntesis. Un nuevo número o promesa necesita evidencia que lo respalde. Si no existe soporte, etiquételo como una suposición o elimínelo. Esto prueba si el contenido útil sobrevivió al flujo de trabajo, en lugar de medir qué tan pulido se siente el resultado.
| Comprobar | Resultado de ejemplo | Acción |
|---|---|---|
| Condiciones requeridas | 9 de 12 conservadas | Restaurar tres omisiones |
| Nuevas afirmaciones numéricas | 2 sin respaldo | Verificar o eliminar |
| Supuestos controvertidos | 1 oculto | Mostrar la rama de decisión |
Utilice una comparación sólida de un solo modelo
Para probar el valor de varios modelos en su trabajo, proporcione al flujo de trabajo de un solo modelo el mismo resumen preparado, las mismas fuentes y criterios de calificación. Comparar un proceso organizado con una solicitud descuidada de una sola línea confunde la preparación de tareas con la arquitectura. Registre el esfuerzo necesario para preparar las entradas y revisar las salidas, así como el uso del modelo y el tiempo de espera.
Pruebe tanto con una breve pregunta objetiva como con un memorando de decisión más largo con alternativas. Necesitan diferentes criterios de éxito. El primero requiere respaldo para una afirmación concreta; este último también necesita cobertura de las condiciones relevantes y una explicación clara de la elección. Si la mejora aparece sólo en los memorandos de decisión, mantenga la recomendación práctica limitada a ese tipo de trabajo.
Aplicar la idea a Consensus sin tomar prestada su puntuación
Colay Consensus también termina con una síntesis del coordinador, pero eso no lo hace idéntico a la configuración del MoA investigada. Este artículo no contiene ninguna prueba comparativa de Colay publicada. Trate el resultado externo como una razón para probar el flujo de trabajo en su material, no como una puntuación de calidad ya preparada para cada ejecución de Consensus.
Solicite una conclusión con cuatro partes: recomendación, evidencia, desacuerdo no resuelto y el siguiente paso verificable. Proporcione un límite de espacio y una lista de condiciones obligatorias. Revise el resultado comparándolo con el escrito y sus fuentes. El flujo de trabajo adquiere un papel útil cuando puede identificar qué conservó o agregó y cuánto trabajo humano aún queda.
Fuentes y metodología
- Wang et al., 2024
Tabla 2a; sección 3.1.
- Dubois et al., Length-Controlled AlpacaEval, 2024
La métrica ajusta las preferencias del modelo evaluador según la longitud de la respuesta; no es una puntuación de exactitud factual.
Envíe su próxima pregunta a Colay
Elija un modelo, utilice Auto o reúna varias perspectivas con Consensus.