Colay / Посібники

Перевірте Consensus щодо роботи, яку вам справді потрібно виконати

Корисна оцінка запитує, чи робочий процес покращує ваші результати за обмежень, які ви можете собі дозволити. Вона не починається зі збору вражаючих прикладів. Порівнюйте однакові завдання, вирішуйте, як буде оцінюватися успіх, перш ніж побачити відповіді, і зберігайте невдачі. Це створює рішення, яке можна переглянути замість числа, яке лише виглядає точним.

Результати зовнішніх досліджень та ілюстративні розрахунки не є вимірюванням ефективності Colay.

Визначте рішення, перш ніж обирати показник

Функція NIST AI RMF Measure вимагає документованих тестових наборів, показників, невизначеності та оцінки в умовах, схожих на розгортання. Він надає систему вимірювання, а не встановленого переможця чи сертифікацію продукту ШІ. NIST AI RMF: Measure

Запишіть правило впровадження. Наприклад: використовувати процес із перевіркою для аналізу вимог, якщо він знаходить більше суттєвих пропусків у межах того самого бюджету й не перевищує погодженого часу очікування. Це запропоноване правило експерименту. Визначте суттєвість на конкретних прикладах ще до отримання відповідей моделей.

Відокремте правдивість фактів від повноти, корисності та стилю. Відшліфована відповідь, яка винаходить обмеження, не повинна пройти фактичну перевірку, навіть якщо рецензенти віддають перевагу її тону. Для відкритих завдань використовуйте коротку рубрику з прив’язаними прикладами та записуйте розбіжності між рецензентами. Угода між суддями сама по собі є предметом перевірки, а не припущенням.

Поєднуйте завдання та контролюйте бюджет

Створіть зразок із реальної роботи: звичайні завдання, складні випадки, неоднозначні запити та приклади з відсутньою інформацією. Зберігайте окремий набір для підказок налаштування. Проведіть кожне завдання з оцінки в обох робочих процесах з однаковим вихідним матеріалом. Приховайте назви робочих процесів від оцінювачів і рандомізуйте порядок відповідей, щоб позиція та бренд не вирішували порівняння.

Використовуйте той самий загальний пакет витрат і той самий кінцевий термін виконання для кожного робочого процесу в наборі завдань. Включайте в облік кожну генерацію, крок координації, повторну спробу та виклик інструменту. Базовий рівень для одного агента повинен мати розумну підказку та доступ до тієї самої відповідної інформації. Надання одній стороні додаткових спроб із підрахунком лише її остаточної відповіді втрачає порівняння.

Однаковий бюджетний ліміт не зобов’язує витрачати невикористаний залишок. Фіксуйте фактичні витрати й заздалегідь визначте, що відбудеться після досягнення ліміту: незавершене завдання має залишатися видимим. Можна також провести окреме порівняння за однакової якості для оцінки вартості, але не змішуйте його результат з експериментом за однакового бюджету.

Невелика вибірка потребує інтервалу невизначеності

NIST описує інтервал Вільсона для біноміальної пропорції. Наш розрахунок для 95 успіхів у 100 незалежних репрезентативних випробуваннях дає 95% інтервал 88.82%–97.85%, використовуючи z = 1.9599639845. Це ілюстративні спостереження, а не вимірювання Colay. NIST: довірчі інтервали для часток

Інтервал стосується частки успіхів у визначеній сукупності завдань за прийнятих припущень щодо вибірки. Це не ймовірність правильності конкретної відповіді. Він також не виправляє упереджену вибірку. Повторення майже однакових запитів за одним документом може створити залежність, а тестування лише простих чернеток мало говорить про складний аналіз.

Не оголошуйте, що спостережуваний показник 95% доводить надійність продукту на 95%. Записуйте дату, версії моделі, підказки, вибір завдань, виключення, правила підрахунку балів і бюджет. Змінена модель або нова суміш завдань можуть зробити стару оцінку поганим орієнтиром на наступний місяць.

Прочитайте парні результати, а не лише два відсотки

Розгляньмо ще один явно вигаданий результат для тих самих 100 завдань: обидва процеси успішні в 89, лише Consensus — у 6, лише процес з одним агентом — в 1, а обидва неуспішні в 4. Загалом це 95 і 90 успіхів. Парна різниця — п’ять завдань, але найінформативнішими є сім випадків із різними результатами.

Для цієї сконструйованої таблиці двосторонній точний тест МакНемара розглядає умовний розподіл за фіксованої кількості пар із різними результатами — семи. За рівної ймовірності виграшу його p-value становить 2 × (1 + 7) ÷ 128 = 0.125. Це не відповідатиме попередньо вибраному порогу 0.05. Це не доводить еквівалентність; це показує, чому очевидна перевага потребує додаткових доказів. Перекриття окремих довірчих інтервалів не замінює парний аналіз.

Гіпотетичні парні результати для 100 завдань
РезультатЗавдання
Обидва проходять89
Проходить лише Consensus6
Проходить лише один агент1
Обидва неуспішні4

Перетворіть висновки на обмежене діюче правило

Перевірте кожне погіршення. Процес, що вдосконалює багато малозначущих чернеток, але додає одну серйозну фактичну помилку, може не відповідати правилу впровадження. Розширюйте перспективні категорії новими завданнями й зберігайте контрольний набір, який не використовували для налаштування запитів. Постійний перегляд результатів із зупинкою на першій привабливій оцінці може перебільшити видимі переваги.

У Colay Consensus агенти обговорюють запит, а агент-координатор формує висновок. Оцінюйте кінцевий результат і зусилля для його перевірки. Фіксуйте витрати кредитів, адже підписки Colay мають кредити та ліміти. Публікуйте лише те, що підтверджує тест: відібрані завдання, перевірену конфігурацію, спостережувані компроміси та невизначеність. Цей приклад не встановлює виміряного показника якості Colay.

Джерела та методологія

  1. NIST AI RMF: Measure

    Рамка оцінювання.

  2. NIST: довірчі інтервали для часток

    Метод інтервалів Вільсона.

Задайте своє наступне запитання Colay

Виберіть модель, скористайтеся Auto або об'єднайте кілька точок зору за допомогою Consensus.

Відкрити Colay