Colay / Посібники
Порівняйте моделі ШІ на запитах, які справді потрібні вашому продукту
Перш ніж будувати систему оцінювання, проведіть невелике структуроване порівняння в Colay. Надайте доступним агентам однакові вхідні дані, якими маєте право ділитися, перевірте їхні окремі відповіді та зафіксуйте, які вимоги вони виконують. Це практична попередня перевірка без коду та ключів API постачальників. Вона не замінює автоматизоване тестування й не доводить, що модель так само працюватиме у вашому продукті.
Перетворіть функцію на перевірювані тестові випадки
Почніть із результату, потрібного користувачеві, а не з рейтингу моделей. Якщо функція витягує завдання, успіх означає правильно зберегти відповідального, саме завдання й термін, а невідомі поля залишити невідомими. Гарно написане резюме з вигаданим терміном має провалити цей тест.
Для ілюстративного початкового набору підготуйте 12 дозволених до використання прикладів: 4 звичайні, 4 неоднозначні та 4 граничні. Це посильна навчальна вправа, а не статистично обґрунтований обсяг вибірки. Видаліть особисту й конфіденційну інформацію, якою не маєте права ділитися. Для кожного випадку запишіть очікуваний результат або чіткий критерій прийнятності.
Виконайте порівняння, яке можна інтерпретувати
Посібник Anthropic з оцінювання розрізняє завдання та повторні спроби його виконання, оскільки результати можуть відрізнятися. У цій статті цю базову відмінність застосовано до ручної перевірки. Кілька вдалих відповідей не дають змоги визначити частоту помилок у робочому продукті.
Не давайте одному кандидату виправлений запит після того, як інший уже провалив тест. Якщо запит треба поліпшити, створіть нову версію та повторіть її для всіх кандидатів. Інакше ви порівнюєте не лише моделі, а й різні інструкції.
- Явно виберіть агентів-кандидатів із поточного каталогу. Не використовуйте Auto, якщо потрібно знати, який саме кандидат відповів.
- Зберігайте ідентичний бриф, вихідний матеріал і необхідний формат. Використовуйте Ask separately для перших відповідей і зберігайте їхні мітки.
- Запишіть дату, відображену назву агента, версію запиту та видимі налаштування. Відсутність відповіді фіксуйте окремо від неправильної відповіді.
- Перш ніж порівнювати якість прози, перевірте кожен результат відповідно до правил. Повторюйте важливі чи неоднозначні випадки та зберігайте кожну спробу, включно з невдалими.
Приклад: дії з нотатки наради
Вигадані вхідні дані: «Mira надішле чернетку у вівторок. Команді ще потрібно визначити відповідального за перегляд цін». Бажаний результат містить одне завдання з відповідальним і одне без нього. Він не призначає Mira відповідальною за перегляд цін і не вигадує термін для цього завдання.
Корисний результат — протокол тестового випадку, а не знімок екрана найкращої відповіді. Додайте до кожного рядка точний текст відповіді, щоб колега міг перевірити вашу оцінку. Відокремлюйте помилки форматування від фактичних помилок: незручна таблиця та вигадане зобов’язання мають різні наслідки.
| Критерій | Умова успішного проходження | Помилка, яку слід зафіксувати |
|---|---|---|
| Відповідальний | Mira відповідає лише за чернетку | Перегляд цін призначено без доказів |
| Дедлайн | Вівторок — термін надсилання чернетки | Вигадано термін перегляду цін |
| Невідоме поле | Відповідальний за перегляд цін залишається невідомим | Відсутні дані заповнено без застережень |
| Придатність до використання | Обидва завдання відображаються в запитаній структурі | Завдання пропущено або формат непридатний для використання |
Запит для тесту
Зберігайте критерії оцінювання в окремому контрольному списку, за яким перевірятимете відповідь. Можна попросити іншого агента знайти можливі помилки, але його висновок теж потребує перевірки. Після першого порівняння Consensus може допомогти узагальнити виявлені компроміси; явно надайте йому відповіді з мітками та свої оцінки.
Витягни завдання з наданих нотаток зустрічі: [нотатки, якими можна ділитися]. Поверни таблицю: завдання, відповідальний, термін і уривок, що це підтверджує. Використовуй лише наданий текст. Якщо відповідального або термін не зазначено, напиши «невідомо». Не перетворюй пропозицію на узгоджене зобов’язання. Невирішені питання винеси окремо. Ідентифікатор вхідних даних: [ID випадку].
Використайте короткий список для наступного тесту
Підсумуйте, з якими випадками справляється кожен кандидат, які критичні помилки допускає і які питання лишаються відкритими. Залишайте кандидата у списку, лише якщо його поведінка відповідає мінімальним вимогам функції. Якщо жоден не підходить, звузьте функцію або поліпште наданий контекст, перш ніж обирати переможця.
Під час пробної інтеграції окремо перевірте фактичну кінцеву точку моделі, доступ до інструментів, системні інструкції, затримку, вартість використання й обробку помилок. Кредити Colay не є оцінкою вартості такого навантаження на API. Почніть у Colay з одного реального знеособленого випадку, який можете оцінити самі, й розширюйте набір лише тоді, коли це впливає на вибір кандидатів.
Відповіді на запитання
Чи можна порівнювати моделі без ключів API?
Так, для ручного порівняння через інтерфейс Colay. Вбудовування моделей у ваш продукт потребує окремої інтеграції з власними умовами доступу й витратами.
Чи є це статистично надійним тестом?
Ні. Невелика ручна вправа виявляє конкретну поведінку й помилки. Для ширших висновків потрібні репрезентативні випадки, повторні спроби та оцінювання, що відповідає вашому рішенню.
Чи слід використовувати Consensus для вибору переможця?
Спочатку оцініть окремі результати відповідно до ваших правил прийняття. Використовуйте синтез, щоб упорядкувати докази, зберігаючи видимими ваші початкові результати та рішення людини.
Джерела та методологія
- Anthropic — Demystifying evals for AI agents
Першоджерело з інженерними рекомендаціями щодо відмінності між завданнями й повторними спробами. Воно не оцінює Colay і не підтверджує обсяг вибірки з цього прикладу.
Задайте своє наступне запитання Colay
Виберіть модель, скористайтеся Auto або об'єднайте кілька точок зору за допомогою Consensus.