Colay / Руководства

Когда спор нейросетей добавляет ценность ответу

Обоснование Consensus начинается с проверяемого вопроса: помогает ли обсуждение найти ошибку, которую первоначальный ответ пропустил? У нескольких моделей может оказаться больше полезных замечаний, но число участников само по себе ничего не доказывает. Ниже разбираем исследовательский результат, переводим его в практический способ оценки и отделяем научные данные от обещаний конкретного продукта.

Результаты сторонних исследований и учебные расчёты не являются замером качества Colay.

Маленький эксперимент, который стоит прочитать внимательно

В препринте Du и соавторов 2023 года, предшествовавшем публикации ICML 2024, на 20 задачах GSM8K Bard решил 11, ChatGPT — 14, совместное обсуждение — 17. Это 55%, 70% и 85% на небольшой выборке. Здесь проверяли конкретные модели и задачи; результат не является измерением Colay. Du et al., 2023/ICML 2024

Три дополнительных верных ответа на 20 задачах — полезный сигнал, а не универсальная величина улучшения. Другой язык, модель или документ меняют условия проверки.

Что именно должно улучшаться в ответе

Представим учебную задачу: команда выбирает между тремя вариантами запуска. Первый ответ рекомендует самый быстрый вариант, второй замечает зависимость от подрядчика, третий уточняет, что срок включает только разработку, но не согласование. Полезный итог должен исправить границы расчёта и объяснить, как это влияет на выбор. Само перечисление трёх мнений ещё не решает задачу.

Поэтому мы предлагаем оценивать не выразительность дискуссии, а изменения в решении. Появилось ли пропущенное ограничение? Исправлена ли неверная единица измерения? Указано ли неизвестное, которое раньше выдавалось за факт? Если итог просто стал длиннее, польза обсуждения пока не установлена. Такой критерий можно применять к любому рабочему процессу с несколькими моделями.

Разные агенты и разные модели — разные условия

Работа ReConcile в ACL 2024 исследует отдельную схему: разные модели обсуждают ответы, после чего применяется голосование с учётом заявленной уверенности. Это другой протокол, а не подтверждение любого сервиса с несколькими агентами. Chen, Saha and Bansal, ACL 2024

В собственной проверке разделяйте три переменные: сколько ответов вы получили, насколько различаются их исходные подходы и как устроен итоговый выбор. Три роли у одной модели не означают три независимых источника знания. Но и разные названия моделей не доказывают независимость ошибок: участники могут опираться на одну неверную предпосылку из вашего запроса.

Считайте и исправления, и новые ошибки

Учебный пример, не данные исследования: на 100 заранее выбранных задачах одиночный ответ был верен в 60 случаях. После обсуждения исправились 14 ошибок, но испортились 6 правильных ответов. Итог — 68 верных ответов и чистый прирост 8 процентных пунктов. Отчёт только о 14 исправлениях скрывал бы существенную часть картины.

Дополнительно посмотрите на важность этих случаев. Исправленная опечатка и потерянное ограничение бюджета имеют разную цену. Храните исходный ответ рядом с итогом и объяснением изменения. Это позволит увидеть, полезен ли режим для вашей задачи, даже если общая оценка качества выросла совсем немного. Для ответственных решений проверку проводит человек, знающий предмет.

Учебная схема оценки на 100 задачах
ПереходКоличествоЗначение
Ошибка → верный ответ14Польза обсуждения
Верный ответ → ошибка6Потери после обсуждения
Чистое изменение+868 верных вместо 60

Как поставить небольшой, но честный тест

Возьмите недавние реальные задачи, для которых уже известен приемлемый результат. Заранее запишите критерии, лимит расходов и максимальное время ожидания. Дайте обоим режимам одинаковые исходные материалы. Не выбирайте только вопросы, на которых первая модель уже ошиблась: так вы заранее смещаете сравнение в пользу дополнительной попытки.

Проверяйте ответы без названия режима и отдельно учитывайте правильность, полноту существенных ограничений и объём ручной доработки. Сохраните неудачные случаи вместе с удачными. Если ответы оценивают несколько коллег, сначала предложите им работать отдельно: обсуждение оценок до выставления баллов может скрыть реальные расхождения в понимании задачи.

Как использовать это в Colay

В Consensus участники обсуждают задачу, а координатор формирует итог. Практичный запрос: сравнить варианты по заданным критериям, выделить спорные предпосылки и не превращать отсутствие данных в уверенный вывод. Приложите фактическую основу и попросите связать существенные утверждения с конкретными фрагментами материалов. Затем самостоятельно проверьте эти связи.

Мы не публикуем здесь измеренный прирост точности Colay. Исследования дают основание пробовать обсуждение там, где важна проверка альтернатив; полезность конкретного запуска нужно оценить на его результате. Сохраните нерешённый спор в итоговом документе, если доказательств недостаточно. Хороший результат может закончиться запросом дополнительных данных, а не единогласным решением.

Источники и методология

  1. Du et al., 2023/ICML 2024

    Раздел 3: 20 задач GSM8K.

  2. Chen, Saha and Bansal, ACL 2024

    ReConcile: отдельный протокол обсуждения и голосования разных моделей.

Задайте следующий вопрос в Colay

Выберите модель, используйте Auto или объедините несколько точек зрения с Consensus.

Открыть Colay