Colay / Руководства

Сравните ИИ-модели на задачах, которые действительно нужны вашему продукту

Перед разработкой системы оценки можно провести небольшой структурированный прогон в Colay. Передайте доступным агентам одинаковые разрешённые данные, изучите отдельные ответы и отметьте выполненные требования. Это первичный отбор без написания кода и собственных API-ключей провайдеров. Он не заменяет автоматизированный бенчмарк и не доказывает, что модель будет вести себя точно так же внутри вашего продукта.

Превратите фичу в проверяемые примеры

Начните с результата для пользователя, а не с рейтинга моделей. Если фича извлекает поручения, успешный ответ сохраняет исполнителя, задачу и срок, а неизвестные поля оставляет неизвестными. Красивое резюме с придуманным дедлайном должно провалить такую проверку.

Для учебного первого набора подготовьте 12 разрешённых примеров: 4 обычных, 4 неоднозначных и 4 пограничных. Это удобный объём упражнения, а не статистически обоснованный размер выборки. Уберите личные и конфиденциальные сведения, которые нельзя передавать. Рядом с каждым примером сохраните ожидаемый результат или явное правило приёмки.

Проведите сравнение, которое можно объяснить

Руководство Anthropic по оценке различает задачу и повторные попытки её выполнения, поскольку ответы могут меняться. Здесь этот принцип применён к ручному первичному отбору. Несколько удачных ответов не позволяют определить частоту ошибок в production.

Не исправляйте промпт только для одного кандидата после неудачи другого. Если инструкция требует улучшения, создайте новую версию и повторите её для всех кандидатов. Иначе вы сравниваете одновременно модели и разные условия.

  1. Явно выберите агентов из актуального каталога. Не используйте Auto, когда важно знать, какой кандидат ответил.
  2. Сохраните одинаковыми бриф, исходные данные и формат результата. Первые ответы получите через Ask separately и сохраните их подписи.
  3. Запишите дату, отображаемое имя агента, версию промпта и видимые настройки. Отсутствующий ответ отмечайте отдельно от неверного.
  4. Проверьте каждый результат по правилам, прежде чем сравнивать стиль. Повторите важные или неоднозначные примеры и сохраните все попытки, включая неудачные.

Пример: поручения из заметки о встрече

Вымышленные данные: «Мира отправит черновик во вторник. Для проверки цен ещё нужно найти ответственного». В нужном результате есть одна задача с исполнителем и одна без него. Нельзя назначить обе Мире или придумать срок проверки цен.

Полезный итог — карточка теста, а не скриншот самого приятного ответа. Приложите точный текст результата к каждой строке, чтобы коллега мог оспорить оценку. Ошибку оформления отделяйте от фактической: неудобную таблицу и выдуманное обязательство исправляют по-разному.

Лист ручной оценки для вымышленного примера
ПроверкаУсловие успехаКакую ошибку записать
ИсполнительМира отвечает только за черновикПроверка цен назначена без основания
СрокВторник относится к черновикуПридуман срок проверки цен
Неизвестное полеИсполнитель проверки цен неизвестенПробел в данных незаметно заполнен
УдобствоОбе задачи есть в нужной структуреЗадача пропущена или формат непригоден

Промпт для первого прогона

Правила оценки храните отдельным списком и применяйте к ответу. Можно попросить другого агента найти возможные ошибки, но его заключение тоже требует проверки. После первого сравнения Consensus поможет обобщить наблюдаемые различия: явно передайте подписанные результаты и свои оценки.

Извлеки поручения из заметки о встрече: [разрешённый текст]. Верни таблицу: задача, исполнитель, срок, подтверждающий фрагмент. Используй только переданный текст. Если исполнитель или срок не указаны, напиши неизвестно. Не превращай предложение в согласованное обязательство. Нерешённые вопросы сохрани отдельно. Идентификатор примера: [ID].

Используйте короткий список для следующей проверки

Сведите примеры, с которыми справился каждый кандидат, критичные ошибки и оставшиеся вопросы. Оставляйте кандидата, только если его поведение соответствует минимальным требованиям фичи. Если не подошёл никто, сузьте задачу или улучшите исходный контекст до выбора победителя.

При интеграции отдельно проверяются фактический endpoint модели, инструменты, системная инструкция, задержки, стоимость использования и обработка сбоев. Кредиты Colay не являются сметой API-нагрузки. Начните в Colay с одного реального обезличенного примера, который можете оценить сами, и расширяйте набор, когда сравнение влияет на выбор.

Вопросы и ответы

Можно сравнить модели без API-ключей?

Да, в пользовательском сценарии Colay. Встраивание моделей в собственный продукт — отдельная интеграция со своими условиями доступа и расходами.

Это статистически надёжный бенчмарк?

Нет. Небольшой ручной прогон показывает конкретные особенности и ошибки. Для широких выводов нужны представительные примеры, повторные попытки и подходящий план оценки.

Стоит поручить Consensus выбрать победителя?

Сначала оцените отдельные ответы по своим правилам приёмки. Используйте синтез для организации свидетельств, сохраняя исходные результаты и решение человека.

Источники и методология

  1. Anthropic — Demystifying evals for AI agents

    Первичное инженерное руководство о различии задач и повторных попыток. Оно не оценивает Colay и не подтверждает размер выборки из примера.

Задайте следующий вопрос в Colay

Выберите модель, используйте Auto или объедините несколько точек зрения с Consensus.

Сравнить свои промпты