Colay / Guías

Cuando el debate entre modelos de IA añade valor a una respuesta

El caso de Consensus comienza con una pregunta comprobable: ¿la discusión detecta un error que la primera respuesta omitió? Varios modelos pueden aportar observaciones útiles, pero el recuento de participantes por sí solo demuestra poco. Este artículo examina el resultado de una investigación y lo convierte en un método de evaluación práctico, manteniendo los experimentos publicados separados de las afirmaciones sobre un producto en particular.

Los resultados de investigaciones externas y los cálculos ilustrativos no son mediciones del rendimiento de Colay.

Un pequeño experimento que vale la pena leer atentamente

En el preprint de Du et al. de 2023, anterior a su publicación en ICML 2024, Bard resolvió 11 de 20 problemas de GSM8K, ChatGPT resolvió 14 y el debate conjunto resolvió 17: 55%, 70% y 85%. Son resultados de modelos específicos en una muestra pequeña, no mediciones de Colay. Du et al., 2023/ICML 2024

Tres respuestas correctas adicionales en una muestra de 20 preguntas son una señal, no una tasa de mejora universal. Probar otro idioma, modelo o documento cambia las condiciones.

Identifique la mejora que realmente necesita

Considere una decisión de lanzamiento hipotética con tres opciones. Una respuesta recomienda la ruta más rápida. Un segundo detecta una dependencia de los proveedores. Un tercero observa que el cronograma estimado cubre el desarrollo pero excluye la aprobación. Una síntesis útil corrige el alcance de la estimación y explica si eso cambia la recomendación. Simplemente enumerar tres perspectivas no completa ese trabajo.

Nuestro criterio sugerido es un cambio en la decisión, no una discusión impresionante. ¿Se recuperó una restricción faltante? ¿Se reparó una unidad incorrecta? ¿El resultado etiquetó una incógnita que la primera respuesta trató como un hecho? Si el único cambio es una respuesta más larga, el beneficio aún no se ha demostrado. Este criterio se aplica a todos los productos y combinaciones de modelos.

El número de agentes y la diversidad de modelos son variables separadas

ReConcile, publicado en ACL 2024, investiga un protocolo distinto: diferentes modelos analizan las respuestas y utilizan la votación ponderada por la confianza. Evalúe ese acuerdo, en lugar de validar cada servicio que coordina varios agentes. Chen, Saha and Bansal, ACL 2024

En su propia revisión, distinga el número de respuestas candidatas, las diferencias en sus enfoques iniciales y la regla utilizada para formar una respuesta final. Tres roles asignados a un modelo no se convierten en tres fuentes de conocimiento independientes. Los diferentes nombres de modelos tampoco establecen errores independientes: cada participante puede heredar la misma premisa falsa de la solicitud.

Cuente las regresiones junto con las correcciones

Este es un ejemplo hipotético, no un resultado de una investigación. En 100 tareas preseleccionadas, la respuesta inicial es correcta en 60. La discusión repara 14 respuestas incorrectas pero cambia seis respuestas correctas por otras incorrectas. El resultado son 68 respuestas correctas: una ganancia neta de ocho puntos porcentuales. Informar únicamente de las 14 reparaciones ocultaría una parte importante del resultado.

Examine también las consecuencias. Corregir un error tipográfico y eliminar una restricción presupuestaria tienen costos diferentes. Mantenga la respuesta inicial al lado de la final y registre por qué cambió cada afirmación relevante. Esto puede mostrar dónde ayuda un flujo de trabajo incluso cuando su puntuación general apenas cambia. Para decisiones importantes, un revisor que comprenda el tema debe determinar si esos cambios están justificados.

Evaluación hipotética de 100 tareas
TransiciónCantidadInterpretación
Incorrecto → correcto14Correcciones
Correcto → incorrecto6Regresiones
Cambio neto+868 respuestas correctas en lugar de 60

Realice una comparación pequeña pero justa

Elija tareas reales recientes con un resultado aceptable establecido. Anote los criterios de calificación, el límite de gasto y el retraso máximo aceptable antes de generar respuestas. Ofrezca a ambos flujos de trabajo la misma evidencia. No seleccione solo preguntas en las que el primer modelo ya haya fallado: eso inclinaría la comparación hacia cualquier segundo intento, independientemente de si la discusión contribuyó en algo.

Revise los resultados sin revelar el nombre del flujo de trabajo. Evalúe por separado la corrección, la cobertura de las restricciones relevantes y la cantidad de revisión humana necesaria. Conserve los ejemplos fallidos junto con los éxitos. Si otros colegas ayudan a evaluar los resultados, deje que los puntúen de forma independiente antes de debatirlos. De lo contrario, el acuerdo durante la revisión puede ocultar diferencias reales en la interpretación de la tarea.

Aplique la pregunta a Consensus en Colay

En Consensus, los agentes participantes discuten una tarea y un coordinador produce una síntesis. Una solicitud práctica les pide que comparen alternativas con criterios explícitos, identifiquen supuestos en disputa y eviten convertir los datos faltantes en confianza. Proporcione la base fáctica y solicite que las afirmaciones importantes se conecten con pasajes particulares de ese material. Revise esas conexiones usted mismo.

Este artículo no informa una mejora medida en la precisión de Colay. La investigación apoya la evaluación de la discusión cuando las interpretaciones en competencia son importantes; el valor de una ejecución particular depende de su resultado real. Conserve los desacuerdos no resueltos en el documento final cuando las pruebas sean insuficientes. Un resultado útil puede terminar con una solicitud de más información en lugar de una aprobación unánime.

Fuentes y metodología

  1. Du et al., 2023/ICML 2024

    Sección 3: 20 problemas de GSM8K.

  2. Chen, Saha and Bansal, ACL 2024

    ReConcile: un protocolo distinto que utiliza diversos modelos, debates y votaciones ponderadas por la confianza.

Envíe su próxima pregunta a Colay

Elija un modelo, utilice Auto o reúna varias perspectivas con Consensus.

Abrir Colay