Colay / Guías

¿Muchas respuestas de un modelo o discusión entre modelos?

Puede resolver una pregunta varias veces y elegir la respuesta más frecuente. También puede pedir a los participantes que discutan soluciones en competencia y produzcan una síntesis. Ambos enfoques utilizan más de un intento, pero prueban ideas diferentes. Comprender esa distinción hace que sea más fácil decidir qué parte de Consensus es útil para un trabajo en particular.

Los resultados de investigaciones externas y los cálculos ilustrativos no son mediciones del rendimiento de Colay.

Lo que realmente midió el documento de autoconsistencia

Wang et al., ICLR 2023, informan de un aumento de la precisión de PaLM-540B en GSM8K del 56.5% con cadena de pensamiento y decodificación voraz al 74.4% con autoconsistencia: 17.9 puntos porcentuales. Los resultados son la media de 10 ejecuciones con 40 respuestas muestreadas por ejecución. Son resultados de investigación, no mediciones de Colay. Wang et al., ICLR 2023

El conjunto de prueba de GSM8K contiene 1,319 problemas de matemáticas elementales expresados en lenguaje natural. Ofrece respuestas finales verificables, sin representar todas las tareas de investigación, escritura o toma de decisiones. GSM8K dataset, OpenAI

Una interpretación práctica es que la primera respuesta no tiene por qué ser la mejor respuesta disponible de un modelo. La repetición también consume recursos. Una comparación entre cuarenta intentos y un intento, sin tener en cuenta el costo, no determina qué flujo de trabajo es preferible según su límite de gasto o tiempo de espera aceptable.

Separar tres operaciones en el flujo de trabajo

Para una evaluación práctica, distinga entre generación de candidatos, evaluación de candidatos y composición final. La generación determina qué posibles soluciones están disponibles. La evaluación decide cuáles cumplen con los requisitos de la tarea. La composición produce una respuesta útil para el lector. Cada operación se puede mejorar por separado y el éxito en una etapa no repara automáticamente una falla en otra.

Es posible que ya exista una solución correcta pero que pierda la votación. Alternativamente, se puede seleccionar al candidato adecuado mientras la prosa final elimina una condición esencial. Conserve respuestas intermedias al evaluar un flujo de trabajo. Sin ellos, es difícil saber si se necesitan más candidatos, una mejor regla de selección o una instrucción más clara para el coordinador.

Cuando la frecuencia de respuesta es informativa

Considere una pregunta aritmética hipotética que produce cinco respuestas: 42, 42, 42, 24 y 24. La votación mayoritaria selecciona 42. Esa selección es reproducible, pero la corrección aún depende del problema y del cálculo. Si las tres respuestas coincidentes confunden minutos con horas, la votación conserva el mismo error. El porcentaje de votos no es automáticamente la probabilidad de que una respuesta sea verdadera.

Las preguntas abiertas introducen una dificultad anterior: decidir qué se considera acuerdo. Dos respuestas pueden recomendar el mismo producto por motivos incompatibles. Dos recomendaciones diferentes podrían funcionar bajo diferentes restricciones. Antes de contar coincidencias, defina el resultado que necesita: una decisión, sus condiciones de aplicabilidad, los hechos requeridos y cualquier información que falte.

Por qué la discusión podría ser útil para su tarea

Para una pregunta breve con una respuesta numérica, comprobar el cálculo puede ser suficiente. Una decisión sobre la arquitectura de software se beneficia al comparar supuestos sobre escala, mantenimiento y restricciones desconocidas. En ese contexto, se puede evaluar la capacidad de la discusión para revelar premisas incompatibles, en lugar de simplemente producir la recomendación que se repite con más frecuencia.

Supongamos que dos participantes recomiendan diseños diferentes porque asumen volúmenes de datos diferentes. Una síntesis útil identifica el punto en el que cambia la preferencia. Pida una explicación compacta de lo que se sabe, lo que se supone y qué observación resolvería el desacuerdo. Este es nuestro método de diseño de tareas propuesto, no una garantía de que un modelo descubra todas las dependencias.

Comparar flujos de trabajo sin cambiar la pregunta

Establezca de antemano un límite de gasto y una rúbrica de evaluación común. Compare una respuesta ordinaria, intentos separados con una regla explícita de selección y un proceso de discusión. El mismo número de llamadas no implica el mismo coste: importan la longitud del contexto, el tamaño de la respuesta y el modelo elegido. Registre el gasto real y el tiempo de espera junto con la calidad, en vez de tratar el trabajo adicional como una mejora gratuita.

Un cálculo hipotético hace visible la compensación. El flujo de trabajo A produce 18 resultados aceptables de 20 tareas para 40 unidades contables. El flujo de trabajo B produce 19 para 80 unidades. El resultado aceptable adicional cuesta 40 unidades. Eso no significa que A sea preferible: la tarea adicional completada con éxito puede ser especialmente valiosa. Hace que el costo de la mejora sea lo suficientemente explícito como para discutirlo.

Qué significa esto para Consensus en Colay

Colay Consensus utiliza la discusión entre los participantes y la síntesis de un coordinador. Los números de autoconsistencia no describen ese modo: un arreglo diferente necesita su propia evaluación. Para investigar el beneficio, elija una tarea recurrente, proporcione el mismo material factual y mantenga una respuesta en modo ordinario junto al resultado de Consensus. Evalúe ambos según los criterios establecidos de antemano.

Pregunte por el fundamento de la recomendación, su objeción relevante más fuerte y las condiciones que la cambiarían. Verifique las fuentes y los cálculos por separado. Cuando una fórmula o una prueba ejecutable pueda establecer la corrección, utilice esa verificación en lugar del número de participantes que estén de acuerdo. Múltiples intentos amplían el grupo de candidatos; el flujo de trabajo todavía necesita una regla defendible para aceptar una respuesta.

Fuentes y metodología

  1. Wang et al., ICLR 2023

    Tabla 2; sección 3.2.

  2. GSM8K dataset, OpenAI

    El conjunto principal de prueba contiene 1,319 problemas de matemáticas elementales expresados en lenguaje natural.

Envíe su próxima pregunta a Colay

Elija un modelo, utilice Auto o reúna varias perspectivas con Consensus.

Abrir Colay