Colay / Посібники
Коли обговорення ШІ додає цінності відповіді
Справа на користь Consensus починається із запитання, яке можна перевірити: чи виявлено обговоренням помилку, яку пропустила перша відповідь? Кілька моделей можуть внести корисні спостереження, але сам підрахунок учасників мало що доводить. У цій статті розглядається результат дослідження та перетворюється на практичний метод оцінки, водночас зберігаючи опубліковані експерименти окремо від тверджень щодо конкретного продукту.
Результати зовнішніх досліджень та ілюстративні розрахунки не є вимірюванням ефективності Colay.
Невеликий експеримент, який варто уважно прочитати
У препринті Du та співавторів 2023 року, що передував публікації на ICML 2024, Bard розв’язав 11 із 20 задач GSM8K, ChatGPT — 14, а спільне обговорення — 17: 55%, 70% і 85%. Це результати конкретних моделей на невеликій вибірці, а не вимірювання Colay. Du et al., 2023/ICML 2024
Три додаткові правильні відповіді у зразку з 20 запитань є сигналом, а не загальною швидкістю покращення. Тестування іншої мови, моделі чи документа змінює умови.
Визначте покращення, яке вам дійсно потрібно
Розглянемо гіпотетичне рішення щодо запуску з трьома варіантами. Одна відповідь рекомендує найшвидший маршрут. Другий помічає залежність від постачальника. Третій зауважує, що передбачуваний графік охоплює розробку, але виключає затвердження. Корисний синтез коригує обсяг оцінки та пояснює, чи змінює це рекомендацію. Просте перерахування трьох точок зору не завершить цю роботу.
Нашим запропонованим критерієм є зміна рішення, а не вражаюче обговорення. Чи було відновлено відсутнє обмеження? Чи була виправлена неправильна одиниця? Чи результат позначив невідоме, що перша відповідь розглядалася як факт? Якщо єдиною зміною є довша відповідь, користь залишається недоведеною. Цей критерій працює для різних продуктів і комбінацій моделей.
Кількість агентів і різноманітність моделей є окремими змінними
ReConcile, опублікований на ACL 2024, досліджує окремий протокол: різні моделі обговорюють відповіді та використовують голосування, зважене на основі довіри. Він оцінює цю домовленість, а не перевіряє кожну службу, яка координує кілька агентів. Chen, Saha and Bansal, ACL 2024
У вашому власному перегляді розрізняйте кількість варіантів відповідей, відмінності в їхніх початкових підходах і правило, використане для формування остаточної відповіді. Три ролі, призначені одній моделі, не стають трьома незалежними джерелами знань. Різні назви моделей також не створюють незалежних помилок: кожен учасник може успадкувати ту саму помилкову передумову із запиту.
Порахуйте регресії разом із виправленнями
Це гіпотетичний приклад, а не результат дослідження. Серед 100 попередньо вибраних завдань початкова відповідь є правильною для 60. Обговорення виправляє 14 неправильних відповідей, але змінює шість правильних відповідей на неправильні. У результаті 68 правильних відповідей: чистий приріст у вісім процентних пунктів. Повідомлення лише про 14 виправлень приховує істотну частину результату.
Також перевіряйте наслідки. Виправлення друкарської помилки та втрата бюджетного обмеження мають різну ціну. Зберігайте початкову відповідь поруч із кінцевою й записуйте, чому змінилося кожне суттєве твердження. Це може показати користь процесу навіть за майже незмінної загальної оцінки. Для рішень із серйозними наслідками обґрунтованість змін має визначати перевіряльник, який розуміє предмет.
| Перехід | Кількість | Тлумачення |
|---|---|---|
| Неправильно → правильно | 14 | Виправлення |
| Правильно → неправильно | 6 | Регресії |
| Чиста зміна | +8 | 68 правильно замість 60 |
Проведіть невелике, але справедливе порівняння
Виберіть нещодавні реальні завдання зі встановленим прийнятним результатом. Запишіть критерії оцінювання, ліміт витрат і максимально прийнятну затримку перед тим, як генерувати відповіді. Надайте обом робочим процесам однакові докази. Не вибирайте лише ті питання, які перша модель вже не впоралася: це схилить порівняння в бік будь-якої другої спроби, незалежно від того, чи внесли обговорення щось.
Перевіряйте результати, не розкриваючи назви робочого процесу. Окремо оцінюйте правильність, дотримання суттєвих обмежень і обсяг ручного доопрацювання. Зберігайте невдалі приклади поряд з успішними. Якщо колеги допомагають оцінювати результати, нехай спочатку виставлять оцінки незалежно, а потім обговорять їх. Інакше згода оцінювачів може приховати справжні відмінності в розумінні завдання.
Застосуйте запитання до Colay Consensus
У Consensus учасники обговорюють завдання, а координатор узагальнює результат. Практичний запит просить порівняти альтернативи за явними критеріями, визначити спірні припущення й не підміняти відсутні дані впевненістю. Надайте фактичну основу й попросіть пов’язати важливі твердження з конкретними уривками цього матеріалу. Перевірте ці зв’язки самостійно.
Ця стаття не повідомляє про виміряне покращення точності Colay. Дослідження підтримує розслідування дискусії, коли конкуруючі інтерпретації мають значення; вартість конкретного циклу залежить від його фактичного випуску. Зберігайте невирішені розбіжності в остаточному документі, якщо доказів недостатньо. Корисний результат може завершитися запитом додаткової інформації замість одностайного схвалення.
Джерела та методологія
- Du et al., 2023/ICML 2024
Розділ 3: 20 задач GSM8K.
- Chen, Saha and Bansal, ACL 2024
ReConcile: окремий протокол, що використовує різноманітні моделі, обговорення та голосування, зважене на основі довіри.
Задайте своє наступне запитання Colay
Виберіть модель, скористайтеся Auto або об'єднайте кілька точок зору за допомогою Consensus.