Colay / Руководства
Проверяйте Consensus на той работе, которую нужно выполнить
Полезная оценка показывает, улучшает ли процесс ваши результаты при приемлемых ограничениях. Она начинается не с подборки эффектных примеров. Сравните одинаковые задачи, определите успех до просмотра ответов и сохраните неудачные случаи. Тогда результатом станет решение, которое можно перепроверить, а не точная на вид цифра без понятной области применимости.
Результаты сторонних исследований и учебные расчёты не являются замером качества Colay.
Сначала решение, затем показатель
Функция Measure в NIST AI RMF предусматривает документирование выборок, метрик, неопределённости и проверку в условиях, похожих на применение. Это рамка измерения, а не указание победителя и не сертификация отдельного AI-продукта. NIST AI RMF: Measure
Запишите правило внедрения. Например: использовать обсуждение при анализе требований, если оно находит больше существенных пропусков при том же доступном бюджете и не превышает согласованного времени ожидания. Это предлагаемое условие вашего эксперимента. Определите существенный пропуск через несколько конкретных примеров до того, как модели начнут отвечать.
Разделите фактическую правильность, полноту, полезность и стиль. Убедительный текст с выдуманным ограничением должен провалить проверку фактов, даже если его тон нравится оценщику. Для открытых задач подготовьте короткую шкалу с примерами и сохраняйте разногласия человеческих проверяющих. Их согласие тоже нужно изучать, а не считать гарантированным.
Сопоставьте задачи и условия расхода
Соберите выборку из реальной работы: обычные задачи, сложные случаи, неоднозначные запросы и задания с недостающей информацией. Отложите отдельный набор для настройки промптов. Каждую тестовую задачу выполните обоими способами с одинаковыми исходными материалами. Скройте названия режимов от оценщиков и меняйте порядок ответов, чтобы бренд и позиция не влияли на выбор.
Выделите каждому процессу одинаковый общий бюджет и одинаковый срок выполнения набора задач. Учитывайте все генерации, работу координатора, повторные попытки и обращения к инструментам. У одиночного агента должен быть разумный промпт и доступ к тем же существенным сведениям. Если одной стороне разрешили больше попыток, а посчитали только финальный ответ, сравнение уже неравное.
Равный бюджет не требует искусственно тратить остаток. Сохраняйте реальный расход и заранее определите последствия исчерпания лимита: незавершённая задача должна остаться в результатах. Отдельно можно сравнить стоимость достижения одинакового качества, но такой эксперимент отвечает на другой вопрос. Не объединяйте его итог с результатом проверки при равном бюджете.
Если задачи сильно различаются по размеру, фиксируйте категории и ограничения заранее. Иначе одна длинная задача может поглотить доступный объём и скрыть различия на остальных. Сначала выберите схему, похожую на реальное использование: общий недельный лимит либо лимиты по категориям. Затем одинаково примените эту схему к обеим сторонам.
Небольшой выборке нужен интервал неопределённости
NIST описывает интервал Уилсона для биномиальной доли. Наш расчёт для 95 успехов в 100 независимых представительных испытаниях даёт 95%-й интервал 88,82%–97,85% при z = 1,9599639845. Это учебные наблюдения, не измерения Colay. NIST: Confidence intervals for proportions
Интервал относится к доле успеха в определённой совокупности задач при принятых предположениях о выборке. Это не вероятность правильности конкретного ответа. Он также не исправляет смещённую выборку. Почти одинаковые запросы по одному документу могут зависеть друг от друга, а проверка только простых черновиков мало говорит о сложной аналитике.
Нельзя объявлять, что наблюдаемые 95% доказывают надёжность продукта на уровне 95%. Сохраните дату, версии моделей, промпты, правила отбора и исключения задач, критерии оценки и бюджет. После обновления модели или изменения состава запросов старая оценка может плохо описывать следующий месяц работы.
Смотрите на парные исходы
Рассмотрим ещё один явно придуманный результат на тех же 100 задачах: оба процесса справились с 89, только Consensus — с 6, только одиночный агент — с 1, оба ошиблись в 4. Получаются 95 и 90 успешных ответов. Разница равна пяти задачам, но особенно информативны семь случаев, в которых результаты разошлись.
Для этой условной таблицы двусторонний точный тест Мак-Немара рассматривает семь несовпадающих пар. При равной вероятности победы его p-значение составляет 2 × (1 + 7) ÷ 128 = 0,125. Заранее выбранный порог 0,05 не пройден. Это не доказывает равенство процессов: наблюдаемому преимуществу нужны дополнительные подтверждения. Пересечение отдельных доверительных интервалов не заменяет парный анализ.
| Исход | Количество задач |
|---|---|
| Оба справились | 89 |
| Справился только Consensus | 6 |
| Справился только одиночный агент | 1 |
| Оба ошиблись | 4 |
Превратите результат в ограниченное рабочее правило
Разберите каждое ухудшение. Процесс, улучшающий много несущественных черновиков, но создающий одну серьёзную фактическую ошибку, может не пройти условие внедрения. Добавляйте свежие задачи в перспективные категории и сохраняйте контрольный набор, который не использовался для настройки промптов. Постоянное наблюдение за результатами с остановкой на первом привлекательном показателе способно завысить впечатление от выигрыша.
В Colay Consensus агенты обсуждают запрос, затем координирующий агент собирает заключение. Оценивайте именно итоговый материал и усилия, нужные для его проверки. Записывайте кредиты: у подписок Colay есть кредиты и лимиты. Публикуйте только то, что поддерживает эксперимент: состав задач, конфигурацию, наблюдаемые компромиссы и неопределённость. Примеры этой статьи не являются измеренным бенчмарком Colay.
Источники и методология
- NIST AI RMF: Measure
Рамка оценки AI-систем.
- NIST: Confidence intervals for proportions
Метод расчёта интервала Уилсона.
Задайте следующий вопрос в Colay
Выберите модель, используйте Auto или объедините несколько точек зрения с Consensus.