Colay / Руководства

Много ответов одной модели или обсуждение разных моделей?

Один запрос можно решить несколько раз, а затем выбрать самый частый ответ. Можно также поручить участникам обсудить разные решения и сформировать общий вывод. Оба подхода используют больше одной попытки, но проверяют разные гипотезы. Чтобы разумно применять Consensus, полезно понимать, какую часть пользы даёт повторное решение, а какую — обмен аргументами.

Результаты сторонних исследований и учебные расчёты не являются замером качества Colay.

Что показала работа о self-consistency

Wang и соавторы, ICLR 2023: на GSM8K точность PaLM-540B выросла с 56,5% при greedy chain-of-thought до 74,4% при self-consistency. Авторы использовали 40 вариантов ответа за запуск и усредняли 10 запусков. Прирост — 17,9 процентного пункта, а не измерение режима Colay. Wang et al., ICLR 2023

Тестовая часть GSM8K содержит 1 319 школьных текстовых задач по математике. Такой набор даёт проверяемый конечный ответ; он не представляет все задачи поиска, написания текстов или принятия решений. GSM8K dataset, OpenAI

Практический вывод здесь скромнее рекламного: первый полученный ответ не обязан быть лучшим доступным результатом. Но повторение стоит ресурсов. Если сравнить сорок попыток с одной и не учесть расход, останется неизвестным, какой рабочий процесс разумнее при вашем бюджете и допустимом времени ожидания.

Три операции, которые важно не смешивать

В прикладном тесте удобно различать получение кандидатов, их оценку и создание итогового текста. Получение кандидатов отвечает на вопрос, какие решения вообще появились. Оценка определяет, какое из них соответствует задаче. Синтез собирает понятный результат для человека. Эти операции можно улучшать отдельно, и ошибки одной не исправляются автоматически успехом другой.

Например, верное решение может уже присутствовать среди вариантов, но проиграть большинству. Или проверяющий может выбрать удачный вариант, а итоговый текст потеряет важное условие. Поэтому сохраняйте промежуточные ответы, когда оцениваете рабочий процесс. Иначе не получится понять, нужно ли больше вариантов, лучшее правило отбора или более точное задание координатору.

Когда частота ответа что-то объясняет

Учебный пример: пять решений арифметической задачи дают 42, 42, 42, 24 и 24. Голосование выбирает 42. Это правило воспроизводимо, но правильность определяется условием и расчётом. Если все три совпавших решения перепутали минуты и часы, большинство закрепит одну и ту же ошибку. Доля голосов сама по себе не является вероятностью истинности.

С открытым вопросом трудность начинается раньше: что считать одинаковым ответом? Два предложения могут рекомендовать один продукт по несовместимым причинам. А две разные рекомендации могут быть обе приемлемыми при разных ограничениях. Перед подсчётом совпадений задайте форму результата: решение, условия его применимости, обязательные факты и недостающие данные.

Почему обсуждение может быть полезно именно вам

Для короткой задачи с одним числом часто достаточно проверить расчёт. Для выбора архитектуры продукта полезнее сопоставить основания: какой вариант выдерживает нагрузку, какой легче сопровождать, какие ограничения пока неизвестны. В таком случае ценность обсуждения можно искать в обнаружении несовместимых предпосылок, а не только в выборе самого частого ответа.

Предположим, два агента рекомендуют разные решения из-за разных ожиданий по объёму данных. Хороший итог должен показать точку, после которой предпочтение меняется. Просите таблицу условий: что известно, что предполагается, какой факт решит спор. Это наша предлагаемая методика постановки задачи; она не гарантирует, что модель правильно обнаружит все зависимости.

Как сравнить подходы без подмены результата

Заранее ограничьте общий расход и задайте одну оценочную рубрику. Сравните обычный ответ, несколько самостоятельных попыток с понятным правилом выбора и обсуждение. Число обращений само по себе не выравнивает цену: объём контекста, длина ответа и выбранные модели различаются. В итоговой таблице нужны фактические расходы и задержка, а также качество.

Учебный расчёт: если вариант А даёт 18 приемлемых результатов из 20 за 40 условных единиц, а вариант Б — 19 за 80, дополнительный приемлемый результат обошёлся в 40 единиц. Это не рекомендация выбрать А: важность двадцатой задачи может перевесить расход. Просто стоимость улучшения теперь видна и может обсуждаться предметно.

Что означает это различие для Consensus в Colay

Consensus в Colay использует обсуждение участников и итог координатора. Числа из self-consistency не описывают этот режим: другая организация работы требует своей проверки. Если хотите оценить пользу, выберите повторяющуюся задачу, приложите одинаковую фактическую основу и сохраните ответ обычного режима рядом с итогом Consensus.

Попросите назвать основание выбора, существенное возражение и условия, при которых рекомендация изменится. Проверьте источники и расчёты отдельно. Если результат можно проверить формулой или тестом, используйте эту проверку, а не число согласившихся участников. Несколько попыток расширяют выбор; ответственность за критерий правильности всё равно остаётся в рабочем процессе.

Источники и методология

  1. Wang et al., ICLR 2023

    Таблица 2; раздел 3.2.

  2. GSM8K dataset, OpenAI

    Основная тестовая выборка: 1 319 школьных текстовых задач.

Задайте следующий вопрос в Colay

Выберите модель, используйте Auto или объедините несколько точек зрения с Consensus.

Открыть Colay