Colay / Руководства
Когда несколько нейросетей ошибаются одинаково
Три одинаковых ответа легко принять за три проверки. Однако значение такого совпадения зависит от того, как появились ответы. Если все участники опираются на неверную исходную посылку, согласие лишь повторяет её. Чтобы оценить общий вывод нейросетей, полезно изучить не только результат, но и основания, по которым каждый участник к нему пришёл.
Результаты сторонних исследований и учебные расчёты не являются замером качества Colay.
Сходство ответов и правильность — разные свойства
Работа Artificial Hivemind, NeurIPS 2025, обнаружила повторяемость внутри моделей и сходство между моделями на открытых запросах с несколькими допустимыми ответами. Это исследование разнообразия генераций, а не измерение вероятности совместных фактических ошибок. Artificial Hivemind, NeurIPS 2025
Представьте команду, которая спрашивает нескольких агентов, почему уходят клиенты. Похожие объяснения могут оказаться верными, привычными для отрасли или следовать из неполного брифа. Полезнее спросить, какое наблюдение опровергнет каждое объяснение. Без такой проверки разные формулировки могут скрывать одно предположение, а одинаковые формулировки — просто описывать очевидный факт.
Классический разбор ансамблей Диттериха связывает пользу голосования с качеством классификаторов и различием их ошибок. Расчёт для независимых ошибок действует при заданных математических условиях; разные названия моделей сами по себе этих условий не обеспечивают. Dietterich: Ensemble Methods in Machine Learning
Учебный расчёт с явными предположениями
Ниже наш условный пример бинарной классификации, а не эксперимент с Colay. Предположим, есть три участника, один правильный вариант, вероятность ошибки каждого равна 20%, а решение принимается большинством без обсуждения. При независимых ошибках неверное большинство возникает, если ошиблись ровно двое либо все трое. Вероятность равна 3 × 0,2² × 0,8 + 0,2³ = 0,104, то есть 10,4%.
Теперь изменим только связь между ошибками. Если все трое всегда ошибаются и отвечают верно одновременно, ошибка большинства составляет те же 20%. Для третьего искусственного случая допустим: на половине задач действует общий механизм ошибки, на другой половине ошибки независимы. У каждого участника по-прежнему 20% ошибок, но у большинства уже 0,5 × 20% + 0,5 × 10,4% = 15,2%.
Во всех трёх случаях мы сохранили индивидуальное качество участников. Изменился только способ, которым их ошибки совпадают. Поэтому одного показателя точности каждого агента недостаточно, чтобы вычислить точность группы. Сначала нужны данные о совместных результатах на одинаковых задачах; представленные проценты нельзя переносить на реальные модели без такого измерения.
| Предположение о связи | Ошибка участника | Ошибка большинства |
|---|---|---|
| Независимые ошибки | 20% | 10,4% |
| Половина общих, половина независимых | 20% | 15,2% |
| Полностью общие ошибки | 20% | 20% |
Обсуждение не сводится к голосованию
Координатор обсуждения может принять возражение меньшинства, объединить два неполных решения или добавить новую ошибку. Участники могут изменить позицию, прочитав чужие сообщения. Поэтому приведённая формула не предсказывает качество диалога. Она выделяет один важный вопрос: количество ответов не показывает, сколько новых оснований появилось для итогового решения.
В Colay Consensus несколько агентов обсуждают запрос, после чего координирующий агент собирает общий вывод. Такой процесс не подтверждает статистическую независимость участников. Отдельные первоначальные ответы помогают заметить расхождения, но и они могут зависеть от одинаковых документов, пропущенных условий, сходной интерпретации задания или общих влияний при обучении моделей.
Проверяйте основания до расширения группы
Для конкретного разбора заведите короткую таблицу доказательств. Внесите спорное утверждение, документ, который его поддерживает, предположение между документом и выводом, а также возможный контрпример. Попросите проверяющих заполнить пробелы. Три ссылки на перепечатки одного пресс-релиза остаются одним происхождением сведений, даже если страницы находятся на разных сайтах.
Распределите проверки так, чтобы у каждой был наблюдаемый результат. Один участник проверяет арифметику, другой находит исходные цитаты, третий ищет в брифе исключённые случаи. Это предложенный рабочий приём, а не гарантия независимых ошибок. Его польза в другом: становится видно, выполнил ли участник новую проверку или просто поддержал уже написанный ответ.
Например, при оценке плана запуска арифметическая проверка может подтвердить бюджет, а проверка ограничений обнаружить пропущенное согласование. Две проверки полезны именно потому, что отвечают на разные вопросы. Добавление ещё одного общего отзыва о качестве плана не заменит проверку этого согласования и не даст основания удалить неудобное возражение.
- Сохраняйте возражение, пока его основание не разобрано.
- Различайте факты из задания и сведения, которые действительно проверили.
- Оценивайте показанный контрпример отдельно от числа согласившихся агентов.
Измеряйте полезные расхождения
На задачах с известным ответом отмечайте, где оба агента ошиблись, где ошибся только один и где оба справились. Сначала исследуйте общие провалы: они показывают пробелы, которые ещё один похожий участник может не устранить. Для творческих задач вместо единственного правильного ответа используйте явные требования: различие концепций, соответствие аудитории или охват противоречащих ограничений.
Останавливайте расширение обсуждения, когда новые сообщения перестают добавлять факты, выявлять ограничения или улучшать проверяемый результат. Подписки Colay используют кредиты и лимиты, поэтому повторяющееся согласие тоже расходует доступный объём. Короткое обсуждение, сохранившее одно решающее возражение, может быть полезнее длинного единодушного текста без достаточных оснований.
Источники и методология
- Artificial Hivemind, NeurIPS 2025
Исследование ответов на открытые запросы.
- Dietterich: Ensemble Methods in Machine Learning
Предположения классической модели ансамблей.
Задайте следующий вопрос в Colay
Выберите модель, используйте Auto или объедините несколько точек зрения с Consensus.