Colay / Посібники
Mixture-of-Agents: синтез має виправдати свою цінність
Зібрати декілька відповідей ШІ є простим; перетворити їх на послідовний результат, який можна перевірити, важче. Дослідження суміші агентів дає підстави серйозно ставитися до синтезу, але його відсоткові заголовки легко зрозуміти неправильно. Тут ми досліджуємо вимірювання, відрізняємо перевагу від фактичної точності та пропонуємо практичний спосіб оцінки кінцевого результату.
Результати зовнішніх досліджень та ілюстративні розрахунки не є вимірюванням ефективності Colay.
Результат, показник і контрольна відповідь
У статті Wang та співавторів про MoA за 2024 рік наведено частку перемог із поправкою на довжину 65.1% на 805 інструкціях AlpacaEval 2.0 проти 57.5% для GPT-4o (05/13). Обидва варіанти порівнюють із gpt-4-1106-preview. Це вимірює перевагу, яку надає ШІ-оцінювач, а не частку правильних фактів чи результативність Colay. Wang et al., 2024
Різниця становить 7.6 відсоткових пунктів за цим показником. Він не визначає точність на робочому місці чи частку клієнтів, які виберуть продукт.
Чому коригування довжини має значення
Dubois та співавтори запровадили AlpacaEval із поправкою на довжину, щоб скоригувати переваги автоматичного оцінювача з урахуванням різниці довжини відповідей. Така поправка не перетворює оцінку на перевірку кожного фактичного твердження. Dubois et al., Length-Controlled AlpacaEval, 2024
У вашому власному порівнянні довгий синтез може здаватися завершеним, навіть якщо додаткові деталі не покращують рішення. Надайте обом робочим процесам однаковий ліміт простору та необхідний вміст. Потім оцініть корисність, правдивість фактів і читабельність окремо. Один об’єднаний бал може приховати результат, у якому презентація покращується, а основа рекомендації стає слабшою.
Зберігайте умови, що стоять за кожною рекомендацією
Розглянемо гіпотетичний приклад. Одна відповідь пропонує впровадження протягом двох тижнів, якщо дані будуть готові; інший оцінює шість тижнів, якщо очищення необхідне. Синтез про те, що впровадження займає чотири тижні, звучить збалансовано, але не відповідає жодному зі сценаріїв. Краща відповідь зберігає гілку та запитує про готовність даних. Усереднення тверджень знищує корисну інформацію.
Тому під час синтезу ми пропонуємо розглядати твердження та умови його застосування як одне ціле. Кожна рекомендація потребує основи, меж застосовності та простежуваних доказів із вхідних матеріалів. Попросіть координатора скласти таблицю суперечностей, а потім перевірте, чи скорочення не прибрало незручну умову. Якісне редагування допомагає зрозуміти відмінності, а не згладжує їх.
Аудит того, що зникло між чернетками та остаточним текстом
Припустімо, що опис постачальника містить 12 обов’язкових умов. Під час гіпотетичного огляду відповіді кандидатів разом охоплюють усі 12, але остаточний синтез зберігає лише дев’ять. Покриття обов’язкових умов становить 75%, навіть якщо остаточний документ читається краще, ніж будь-яка чернетка. Це окремий показник, який не пов’язаний із відсотком AlpacaEval.
Перелічіть обов’язкові умови з брифа, знайдіть кожну в остаточному тексті та запишіть пропуски. Далі перевірте твердження, введені лише під час синтезу. Нове число чи обіцянка потребують підтверджуючих доказів. Якщо підтримки немає, позначте це як припущення або видаліть. Це перевіряє, чи корисний вміст витримав робочий процес, замість того, щоб оцінити, наскільки відшліфованим виглядає результат.
| Перевірка | Приклад результату | Дія |
|---|---|---|
| Обов'язкові умови | 9 з 12 збережено | Відновити три пропуски |
| Нові числові твердження | 2 непідтверджені | Підтвердити або видалити |
| Спірні припущення | 1 приховано | Показати гілку прийняття рішень |
Використовуйте потужне порівняння однієї моделі
Щоб перевірити цінність кількох моделей у вашій роботі, надайте робочому процесу з однією моделлю той самий підготовлений бриф, джерела та критерії оцінювання. Порівняння організованого процесу з необережним однорядковим запитом змішує підготовку завдання з архітектурою. Записуйте зусилля, необхідні для підготовки вхідних даних і перегляду вихідних даних, а також використання моделі та час очікування.
Спробуйте коротке фактичне запитання й довшу записку про рішення з альтернативами. Для них потрібні різні критерії успіху. Перше потребує підтвердження конкретного твердження; друга — також охоплення суттєвих умов і чіткого пояснення вибору. Якщо покращуються лише записки про рішення, обмежте практичну рекомендацію цим видом роботи.
Застосуйте ідею до Consensus, не запозичуючи її оцінку
Colay Consensus також завершується синтезом координатора, але це не робить його ідентичним дослідженій конфігурації MoA. У цій статті немає опублікованого тесту Colay. Сприймайте зовнішній результат як причину перевірити робочий процес на вашому матеріалі, а не як готовий показник якості для кожного запуску Consensus.
Подайте запит на висновок із чотирьох частин: рекомендація, докази, невирішена суперечка та наступний крок, який можна перевірити. Вкажіть ліміт місця та перелік обов’язкових умов. Перевірте результат зі зведенням та його джерелами. Робочий процес відіграє корисну роль, коли ви можете визначити, що він зберіг або додав і скільки роботи людини ще залишилося.
Джерела та методологія
- Wang et al., 2024
Таблиця 2a; розділ 3.1.
- Dubois et al., Length-Controlled AlpacaEval, 2024
Метрика коригує уподобання моделі-судді щодо довжини відповіді; це не оцінка фактичної точності.
Задайте своє наступне запитання Colay
Виберіть модель, скористайтеся Auto або об'єднайте кілька точок зору за допомогою Consensus.