Colay / Посібники

Багато відповідей від однієї моделі чи обговорення між моделями?

Ви можете вирішити запитання кілька разів і вибрати найчастішу відповідь. Ви також можете попросити учасників обговорити конкуруючі рішення та зробити синтез. Обидва підходи використовують більше ніж одну спробу, але вони перевіряють різні ідеї. Розуміння цієї різниці полегшує рішення, яка частина Consensus є корисною для певної роботи.

Результати зовнішніх досліджень та ілюстративні розрахунки не є вимірюванням ефективності Colay.

Що насправді вимірювала стаття про самоузгодженість

Wang та співавтори, ICLR 2023, повідомляють про зростання точності PaLM-540B на GSM8K із 56.5% за жадібного декодування ланцюжка міркувань до 74.4% із самоузгодженістю: на 17.9 відсоткового пункту. Результати усереднено за 10 прогонами з 40 згенерованими відповідями в кожному. Це дослідницькі результати, а не вимірювання Colay. Wang et al., ICLR 2023

Тестова частина GSM8K містить 1,319 текстових задач з елементарної математики. Вона має перевірні кінцеві відповіді й не відображає всі дослідницькі, письмові завдання або завдання з ухвалення рішень. Набір даних GSM8K, OpenAI

Практична інтерпретація полягає в тому, що перша відповідь не обов’язково повинна бути найкращою відповіддю, доступною з моделі. Повторення також споживає ресурси. Порівняння між сорока спробами та однією спробою без урахування вартості не визначає, який робочий процес є кращим відповідно до вашого ліміту витрат або прийнятного часу очікування.

Розділіть три операції в робочому процесі

Для практичної оцінки розрізняйте створення варіантів відповіді, їх оцінювання та формування остаточного тексту. Генерація визначає, які можливі розв’язки з’являться. Оцінювання встановлює, які з них відповідають вимогам. Остаточне формування створює придатну для читача відповідь. Кожну операцію можна вдосконалювати окремо, і успіх на одному етапі не виправляє автоматично помилки іншого.

Правильне рішення може вже бути присутнім, але втратити голосування. Крім того, правильний кандидат може бути обраний, тоді як остаточна проза не має істотної умови. Зберігайте проміжні відповіді під час оцінювання робочого процесу. Без них важко визначити, чи потрібно вам більше кандидатів, краще правило відбору чи чіткіша інструкція для координатора.

Якщо частота відповідей є інформативною

Розглянемо гіпотетичне арифметичне запитання, яке дає п’ять відповідей: 42, 42, 42, 24 і 24. Більшість голосів обирає 42. Цей вибір можна відтворити, але правильність залежить від проблеми та розрахунку. Якщо всі три відповідні відповіді плутають хвилини з годинами, голосування зберігає ту саму помилку. Частка голосів не означає автоматично ймовірність того, що відповідь правильна.

Відкриті запитання викликають давнішу складність: вирішити, що вважається згодою. Дві відповіді можуть рекомендувати той самий продукт з несумісних причин. Дві різні рекомендації можуть працювати за різних обмежень. Перш ніж підраховувати збіги, визначте потрібний результат: рішення, умови його застосування, необхідні факти та будь-яку інформацію, якої не вистачає.

Чому обговорення може бути корисним для вашого завдання

Для короткого запитання з однією цифровою відповіддю перевірити обчислення може бути достатньо. Рішення щодо архітектури програмного забезпечення виграє від порівняння припущень щодо масштабу, обслуговування та невідомих обмежень. У цьому налаштуванні обговорення можна оцінити на його здатність виявляти несумісні передумови, а не просто виробляти рекомендацію, яка найчастіше повторюється.

Припустімо, що два учасники рекомендують різні дизайни, оскільки вони припускають різні обсяги даних. Корисний синтез визначає точку, в якій змінюється перевага. Попросіть стислий виклад того, що відомо, що передбачається та яке спостереження могло б вирішити розбіжності. Це запропонований нами метод проєктування завдань, а не гарантія того, що модель виявить кожну залежність.

Порівняйте робочі процеси, не змінюючи питання

Заздалегідь установіть максимальну межу витрат і спільну оцінку. Порівняйте звичайну відповідь, окремі спроби з явним правилом вибору та обговорення. Рівна кількість викликів не встановлює рівних витрат: довжина контексту, розмір виведення та вибір моделі мають значення. Записуйте фактичні витрати та затримки, окрім якості, замість того, щоб розглядати додаткову роботу як безкоштовне вдосконалення.

Гіпотетичний розрахунок робить компроміс видимим. Робочий процес А дає 18 прийнятних результатів із 20 завдань для 40 облікових одиниць. Робочий процес B створює 19 для 80 одиниць. Додатковий прийнятний результат коштує 40 одиниць. Це не означає, що A є кращим: надзвичайно успішне завдання може бути особливо цінним. Це робить вартість покращення достатньо чіткою для обговорення.

Що це означає для Consensus у Colay

Colay Consensus використовує обговорення між учасниками та синтез координатора. Числа самоузгодженості не описують цей режим: інша домовленість потребує власної оцінки. Щоб дослідити переваги, виберіть повторюване завдання, надайте той самий фактичний матеріал і збережіть відповідь звичайного режиму поряд із результатом Consensus. Оцініть обидва за попередньо встановленими критеріями.

Запитайте про основу рекомендації, її найсильніші суттєві заперечення та умови, які можуть її змінити. Перевірте джерела та розрахунки окремо. Якщо формула або виконуваний тест можуть встановити правильність, використовуйте цю перевірку замість кількості узгоджених учасників. Багаторазові спроби розширити пул кандидатів; робочий процес усе ще потребує обґрунтованого правила для прийняття відповіді.

Джерела та методологія

  1. Wang et al., ICLR 2023

    Таблиця 2; розділ 3.2.

  2. Набір даних GSM8K, OpenAI

    Основна частина тесту містить 1,319 текстових задач з елементарної математики.

Задайте своє наступне запитання Colay

Виберіть модель, скористайтеся Auto або об'єднайте кілька точок зору за допомогою Consensus.

Відкрити Colay