Colay / Посібники

Якщо кілька моделей штучного інтелекту мають ту саму сліпу зону

Три збігаються відповіді можуть виглядати як три перевірки. Таке тлумачення залежить від того, як були отримані відповіді. Якщо кожен учасник покладається на ту саму помилкову передумову, угода повторює передумову замість того, щоб перевіряти її. Щоб оцінити консенсус ШІ, перевірте маршрути до відповіді, а також саму відповідь.

Результати зовнішніх досліджень та ілюстративні розрахунки не є вимірюванням ефективності Colay.

Подібність і правильність – різні питання

Artificial Hivemind, дослідження NeurIPS 2025, виявило повторення всередині моделей і подібність між моделями на відкритих запитах. Такі запити допускають кілька правдоподібних відповідей. Це свідчення щодо різноманітності відповідей, а не виміряна ймовірність того, що моделі роблять однакові фактичні помилки. Artificial Hivemind, NeurIPS 2025

Уявіть, що команда продукту запитує кількох агентів, чому клієнти йдуть. Подібні пояснення можуть бути правильними, модними або запозиченими з неповного брифу. Корисне запитання полягає в тому, яке спостереження могло б спростувати кожне пояснення. Без цього тесту різні формулювання можуть приховувати одне основне припущення, тоді як ідентичні формулювання можуть просто відображати очевидний факт.

Груповий аналіз Діетріха пояснює, чому голосування може отримати користь від точних класифікаторів із різними помилками. Його обчислення незалежної помилки є умовною математичною моделлю, а не властивістю, автоматично наданою за допомогою різних імен моделей. Dietterich: Ensemble Methods in Machine Learning

Розрахунок із навмисно спрощеними припущеннями

Нижче — наш гіпотетичний приклад бінарної класифікації, а не експеримент Colay. Припустімо, є три учасники голосування, одна правильна мітка, ймовірність помилки 20% у кожного та голосування більшістю без обговорення. За незалежних помилок хибна більшість виникає, коли помиляються рівно двоє або всі троє. Ймовірність дорівнює 3 × 0.2² × 0.8 + 0.2³ = 0.104, або 10.4%.

Тепер змініть лише структуру залежності. Якщо всі три завжди досягають успіху чи невдачі разом, більшість помиляється 20% випадків. Як третій сконструйований випадок, нехай половина завдань використовує цей спільний механізм помилок, а половина використовує незалежні помилки. Кожен виборець має коефіцієнт помилок 20%, але помилка більшості становить 0.5 × 20% + 0.5 × 10.4% = 15.2%.

Створений приклад: той самий індивідуальний коефіцієнт помилок, різні спільні результати
Припущений зв'язокОкрема помилкаПомилка більшості
Незалежні помилки20%10.4%
Наполовину спільно, наполовину незалежно20%15.2%
Повністю спільні помилки20%20%

Чому обговорення не є експериментом більшості голосів

Координатор розмови може прийняти заперечення меншості, поєднати два часткових рішення або ввести нову помилку. Учасники також можуть змінювати свої відповіді після прочитання один одного. Тому наведені вище обчислення не можуть передбачити точність обговорення. Він виділяє одну проблему: підрахунок результатів не скаже вам, скільки додаткових доказів вони містять.

У Colay Consensus кілька агентів обговорюють запит, а координуючий агент синтезує висновок. Цей робочий процес не забезпечує статистичної незалежності між учасниками. Окремі початкові відповіді можуть полегшити перевірку відмінностей, але навіть окремо згенеровані відповіді можуть мати спільні чинники: вплив навчання моделей, надані документи, пропуски чи тлумачення завдання.

Перевірте залежності перед додаванням учасників

Для конкретної перевірки створіть невеликий реєстр доказів. Запишіть спірне твердження, документ на його підтвердження, припущення, що пов’язує документ із висновком, і можливий контрприклад. Попросіть кожного перевіряльника заповнити пропущені поля. Три посилання на один пресреліз залишаються одним джерелом доказів, навіть якщо його відтворюють три сайти.

Призначайте перевірки з різними спостережуваними результатами. Один перевіряльник може перевірити арифметику, інший — знайти цитати в першоджерелах, третій — відшукати в брифі виключені випадки. Це запропоновані способи роботи, а не гарантії незалежності помилок. Їхня цінність у тому, що видно, чи додав учасник нову перевірку, а не просто ще раз погодився.

  • Зберігайте заперечення, доки не буде розглянуто підтверджуючі докази.
  • Запишіть, які факти надійшли з підказки, а які були перевірені незалежно.
  • Віддавайте перевагу продемонстрованому контрприкладу, ніж впевненій кількості погоджувальних агентів.

Виміряйте корисну розбіжність

У завданнях із відомими відповідями позначте, де не справляються обидва агенти, де не вдається лише один, а де вдаються обидва. Спочатку розслідуйте спільні несправності: вони виявляють прогалини, які інший подібний учасник може не виправити. Для творчих завдань замініть одну мітку правильності чіткими вимогами, як-от чіткі концепції, відповідність аудиторії або охоплення конкуруючих обмежень.

Припиніть додавання учасників, коли нові відповіді більше не змінюють докази, не виявляють обмежень або покращують перевірений результат. Підписки на Colay мають кредити та ліміти, тому повторна угода також передбачає вартість використання. Компактне обговорення, яке зберігає одне вирішальне заперечення, може бути кориснішим, ніж довге обговорення, яке завершується одностайним, але безпідставним прозою.

Джерела та методологія

  1. Artificial Hivemind, NeurIPS 2025

    Дослідження генерації відкритих відповідей.

  2. Dietterich: Ensemble Methods in Machine Learning

    Припущення про класичний ансамбль.

Задайте своє наступне запитання Colay

Виберіть модель, скористайтеся Auto або об'єднайте кілька точок зору за допомогою Consensus.

Відкрити Colay