Colay / Руководства

Mixture-of-Agents: почему хороший синтез важнее суммы ответов

Собрать несколько ответов легко; получить из них цельный и проверяемый материал сложнее. Исследования Mixture-of-Agents дают повод серьёзно относиться к синтезу, но их известные проценты часто читают неверно. Разберём, что измерялось, почему предпочтение оценщика не равно фактической точности и как оценивать итог нескольких моделей в обычной работе.

Результаты сторонних исследований и учебные расчёты не являются замером качества Colay.

Результат, метрика и точка сравнения

В работе Wang и соавторов 2024 года MoA получил 65,1% length-controlled win rate на 805 инструкциях AlpacaEval 2.0; GPT-4o версии 05/13 — 57,5%. Оба сравнивались с gpt-4-1106-preview. Это метрика предпочтения AI-оценщика, а не доля правильных фактов и не результат Colay. Wang et al., 2024

Разница — 7,6 процентного пункта указанной метрики. Она не определяет точность на ваших рабочих задачах или долю клиентов, которые выберут продукт.

Почему поправка на длину важна

Dubois и соавторы предложили length-controlled AlpacaEval, чтобы корректировать предпочтения автоматического оценщика с учётом различий в длине ответов. Поправка на длину не превращает эту оценку в аудит каждого фактического утверждения. Dubois et al., Length-Controlled AlpacaEval, 2024

В собственном сравнении длинный итог может производить впечатление законченной работы, хотя добавленные подробности не помогают принять решение. Дайте обоим вариантам одинаковое ограничение объёма и одинаковый обязательный набор пунктов. Затем отдельно оцените полезность содержания, точность фактов и читаемость. Один общий балл скроет ситуацию, когда улучшилась подача, но ухудшились основания рекомендации.

Синтез должен сохранять условия применимости

Учебный пример: один ответ предлагает внедрение за две недели при готовых данных, другой — за шесть недель при необходимости их очистки. Итог «внедрение занимает четыре недели» выглядит согласованным, но не описывает ни один исходный сценарий. Правильнее сохранить развилку и уточнить состояние данных. Усреднение формулировок здесь уничтожает полезную информацию.

Именно поэтому мы предлагаем считать основным объектом синтеза утверждение вместе с его условиями. Для каждой рекомендации нужны основание, ограничение и источник входных данных. Координатору можно поручить составить таблицу конфликтов, но затем нужно проверить, не исчезло ли неудобное условие при сокращении. Хорошая редактура делает различия понятнее, а не стирает их ради плавного текста.

Проверьте, что потерялось между черновиками и итогом

Предположим, вы заранее определили 12 обязательных условий для выбора поставщика. В учебном примере исходные ответы вместе упомянули все 12, а итог сохранил только девять. Покрытие обязательных условий составляет 75%, даже если текст читается лучше каждого черновика. Это отдельная метрика, не связанная с процентами AlpacaEval.

Проверка проста: выпишите обязательные условия из брифа, найдите соответствующее место в итоговом тексте и отметьте пропуски. Затем проверьте утверждения, добавленные только на этапе синтеза. У нового числа или обещания должен быть источник. Если его нет, оставьте его гипотезой или уберите. Так вы оцениваете реальную передачу содержания, а не только приятность результата.

Учебный аудит итогового текста
ПроверкаРезультат примераДействие
Обязательные условия9 из 12 сохраненыВернуть три пропуска
Новые числа в итоге2 без основанияПроверить или убрать
Спорные предпосылки1 скрытаПоказать развилку

Сравнивайте с сильным одиночным ответом

Чтобы проверить собственную пользу нескольких моделей, дайте одиночной модели тот же подготовленный бриф, источники и критерии. Не сравнивайте аккуратно организованный процесс с небрежным запросом из одной строки. Полезность хорошего задания иначе легко принять за преимущество архитектуры. Отдельно зафиксируйте расходы на подготовку и проверку результата.

Попробуйте два вида задач: короткий фактологический ответ и развёрнутую записку с альтернативами. У них разные критерии успеха. В первом случае важнее доказательство конкретного утверждения; во втором — полнота существенных условий и понятность выбора. Если преимущество проявилось только на записках, ограничьте практическую рекомендацию этим типом работы.

Как применить идею к Consensus

Consensus в Colay тоже заканчивается синтезом координатора, но это не означает идентичность исследовательскому MoA. В этой статье нет опубликованного бенчмарка Colay. Используйте научный результат как причину проверить такой способ работы на своём материале, а не как готовую оценку качества любого запуска.

Попросите итог из четырёх частей: рекомендация, основания, нерешённые разногласия и следующий проверяемый шаг. Дайте ограничение объёма и перечень обязательных условий. После получения ответа сверяйте его с брифом и источниками. Ценность режима становится понятной, когда можно показать, какую полезную часть он сохранил или добавил и сколько ручной работы действительно осталось.

Источники и методология

  1. Wang et al., 2024

    Таблица 2a; раздел 3.1.

  2. Dubois et al., Length-Controlled AlpacaEval, 2024

    Поправка на длину ответов; метрика предпочтения, не фактической точности.

Задайте следующий вопрос в Colay

Выберите модель, используйте Auto или объедините несколько точек зрения с Consensus.

Открыть Colay