Colay / Руководства

Проверяйте Consensus на той работе, которую нужно выполнить

Полезная оценка показывает, улучшает ли процесс ваши результаты при приемлемых ограничениях. Она начинается не с подборки эффектных примеров. Сравните одинаковые задачи, определите успех до просмотра ответов и сохраните неудачные случаи. Тогда результатом станет решение, которое можно перепроверить, а не точная на вид цифра без понятной области применимости.

Результаты сторонних исследований и учебные расчёты не являются замером качества Colay.

Сначала решение, затем показатель

Функция Measure в NIST AI RMF предусматривает документирование выборок, метрик, неопределённости и проверку в условиях, похожих на применение. Это рамка измерения, а не указание победителя и не сертификация отдельного AI-продукта. NIST AI RMF: Measure

Запишите правило внедрения. Например: использовать обсуждение при анализе требований, если оно находит больше существенных пропусков при том же доступном бюджете и не превышает согласованного времени ожидания. Это предлагаемое условие вашего эксперимента. Определите существенный пропуск через несколько конкретных примеров до того, как модели начнут отвечать.

Разделите фактическую правильность, полноту, полезность и стиль. Убедительный текст с выдуманным ограничением должен провалить проверку фактов, даже если его тон нравится оценщику. Для открытых задач подготовьте короткую шкалу с примерами и сохраняйте разногласия человеческих проверяющих. Их согласие тоже нужно изучать, а не считать гарантированным.

Сопоставьте задачи и условия расхода

Соберите выборку из реальной работы: обычные задачи, сложные случаи, неоднозначные запросы и задания с недостающей информацией. Отложите отдельный набор для настройки промптов. Каждую тестовую задачу выполните обоими способами с одинаковыми исходными материалами. Скройте названия режимов от оценщиков и меняйте порядок ответов, чтобы бренд и позиция не влияли на выбор.

Выделите каждому процессу одинаковый общий бюджет и одинаковый срок выполнения набора задач. Учитывайте все генерации, работу координатора, повторные попытки и обращения к инструментам. У одиночного агента должен быть разумный промпт и доступ к тем же существенным сведениям. Если одной стороне разрешили больше попыток, а посчитали только финальный ответ, сравнение уже неравное.

Равный бюджет не требует искусственно тратить остаток. Сохраняйте реальный расход и заранее определите последствия исчерпания лимита: незавершённая задача должна остаться в результатах. Отдельно можно сравнить стоимость достижения одинакового качества, но такой эксперимент отвечает на другой вопрос. Не объединяйте его итог с результатом проверки при равном бюджете.

Если задачи сильно различаются по размеру, фиксируйте категории и ограничения заранее. Иначе одна длинная задача может поглотить доступный объём и скрыть различия на остальных. Сначала выберите схему, похожую на реальное использование: общий недельный лимит либо лимиты по категориям. Затем одинаково примените эту схему к обеим сторонам.

Небольшой выборке нужен интервал неопределённости

NIST описывает интервал Уилсона для биномиальной доли. Наш расчёт для 95 успехов в 100 независимых представительных испытаниях даёт 95%-й интервал 88,82%–97,85% при z = 1,9599639845. Это учебные наблюдения, не измерения Colay. NIST: Confidence intervals for proportions

Интервал относится к доле успеха в определённой совокупности задач при принятых предположениях о выборке. Это не вероятность правильности конкретного ответа. Он также не исправляет смещённую выборку. Почти одинаковые запросы по одному документу могут зависеть друг от друга, а проверка только простых черновиков мало говорит о сложной аналитике.

Нельзя объявлять, что наблюдаемые 95% доказывают надёжность продукта на уровне 95%. Сохраните дату, версии моделей, промпты, правила отбора и исключения задач, критерии оценки и бюджет. После обновления модели или изменения состава запросов старая оценка может плохо описывать следующий месяц работы.

Смотрите на парные исходы

Рассмотрим ещё один явно придуманный результат на тех же 100 задачах: оба процесса справились с 89, только Consensus — с 6, только одиночный агент — с 1, оба ошиблись в 4. Получаются 95 и 90 успешных ответов. Разница равна пяти задачам, но особенно информативны семь случаев, в которых результаты разошлись.

Для этой условной таблицы двусторонний точный тест Мак-Немара рассматривает семь несовпадающих пар. При равной вероятности победы его p-значение составляет 2 × (1 + 7) ÷ 128 = 0,125. Заранее выбранный порог 0,05 не пройден. Это не доказывает равенство процессов: наблюдаемому преимуществу нужны дополнительные подтверждения. Пересечение отдельных доверительных интервалов не заменяет парный анализ.

Придуманные парные результаты на 100 задачах
ИсходКоличество задач
Оба справились89
Справился только Consensus6
Справился только одиночный агент1
Оба ошиблись4

Превратите результат в ограниченное рабочее правило

Разберите каждое ухудшение. Процесс, улучшающий много несущественных черновиков, но создающий одну серьёзную фактическую ошибку, может не пройти условие внедрения. Добавляйте свежие задачи в перспективные категории и сохраняйте контрольный набор, который не использовался для настройки промптов. Постоянное наблюдение за результатами с остановкой на первом привлекательном показателе способно завысить впечатление от выигрыша.

В Colay Consensus агенты обсуждают запрос, затем координирующий агент собирает заключение. Оценивайте именно итоговый материал и усилия, нужные для его проверки. Записывайте кредиты: у подписок Colay есть кредиты и лимиты. Публикуйте только то, что поддерживает эксперимент: состав задач, конфигурацию, наблюдаемые компромиссы и неопределённость. Примеры этой статьи не являются измеренным бенчмарком Colay.

Источники и методология

  1. NIST AI RMF: Measure

    Рамка оценки AI-систем.

  2. NIST: Confidence intervals for proportions

    Метод расчёта интервала Уилсона.

Задайте следующий вопрос в Colay

Выберите модель, используйте Auto или объедините несколько точек зрения с Consensus.

Открыть Colay