Упс! Не вдала спроба:(
Будь ласка, спробуйте ще раз.

Більшість бенчмарків AI-видимості вимірюють шум, а не реальність

0
5 хвилин читання

Оскільки компанії дедалі більше покладаються на AI-системи, такі як ChatGPT, Gemini та Perplexity, щоб впливати на рішення клієнтів, виникає нове питання: як насправді правильно вимірювати видимість бренду в AI-середовищі?

Сьогодні багато компаній оцінюють свою присутність у відповідях AI, тестуючи кілька запитів або зберігаючи скриншоти відповідей моделей. Інші запускають один і той самий prompt десятки разів, припускаючи, що більша кількість повторень автоматично забезпечує більш надійний результат.

Згідно з новим дослідженням команди Rankfor.ai, обидва підходи мають суттєві обмеження.

Їхнє дослідження «Where Does the Noise Come From? A Variance-Components Decomposition of Non-Determinism in LLM Brand Answers» застосовує теорію узагальнюваності (Generalizability Theory) — статистичний підхід, який широко використовується в психометрії — для аналізу того, що саме спричиняє варіативність відповідей великих мовних моделей щодо брендів.

Замість питання, чи є мовні моделі детермінованими, дослідження розглядає більш практичну проблему:

Куди організаціям варто інвестувати бюджет на вимірювання, щоб отримати найбільш надійну картину AI-видимості?

Однієї відповіді недостатньо

Один із головних висновків дослідження полягає в тому, що одна відповідь AI-моделі майже не дає надійної інформації про загальну позицію бренду.

Окрема відповідь відображає те, що модель згенерувала в конкретний момент часу, але водночас залежить від випадковості, мови запиту, формулювання prompt та особливостей конкретної моделі.

Тому використання одного скриншота як доказу AI-видимості компанії може призвести до хибних висновків.

Дослідники стверджують, що AI-бенчмаркінг повинен базуватися на систематичному вимірюванні, а не на окремих прикладах.

Повторення prompt має обмежену цінність

Багато практиків вважають, що багаторазовий запуск одного й того самого prompt є найкращим способом підвищити точність вимірювання.

Дослідження показує протилежне.

Підписуйтеся на наші соцмережі

Повторні виконання дійсно зменшують випадкову варіативність, але після кількох повторів додаткове покращення стає мінімальним.

Замість значних інвестицій у повторення однакових запитів дослідники можуть отримати більше корисної інформації, розширюючи різноманітність тестування.

Мова суттєво змінює результати

Серед усіх факторів, які аналізувалися, мова виявилася одним із найбільших джерел систематичної варіації.

Одна й та сама компанія може отримати суттєво різні відповіді залежно від того, чи користувач ставить запит англійською, німецькою, польською або іншою мовою.

Це означає, що тестування лише англійською мовою не може точно відображати AI-видимість бренду на міжнародних ринках.

Для організацій, які працюють у кількох країнах, багатомовне оцінювання стає не додатковою опцією, а необхідною частиною процесу вимірювання.

AI-видимість — це проблема вимірювання

Дослідження одночасно аналізувало кілька факторів, включаючи:

  • мову;
  • AI-модель;
  • формулювання prompt;
  • повторні виконання запитів.

Замість того щоб розглядати їх окремо, дослідники оцінили, який внесок кожен фактор робить у загальну варіативність результатів.

Результати показують, що ширше покриття різних мов і моделей часто дає більше інформації, ніж просте збільшення кількості повторних prompt.

Це має практичне значення для команд, які створюють системи AI-бенчмаркінгу або AI-observability.

За обмеженого бюджету на API якість експериментального дизайну стає такою ж важливою, як і розмір вибірки.

Чому це важливо для AI Direct Sales

Результати дослідження також мають важливі наслідки для концепції AI Direct Sales.

Дедалі частіше покупці звертаються до AI-систем, щоб:

  • отримати рекомендації щодо програмного забезпечення;
  • порівняти постачальників;
  • пояснити відмінності між продуктами;
  • сформувати короткий список варіантів,

ще до того, як вони відвідають сайт компанії або зв'яжуться з продавцем.

Якщо організації хочуть зрозуміти свою видимість у цьому AI-підсиленому процесі купівлі, їм потрібне статистично надійне вимірювання.

Один prompt або кілька скриншотів не можуть точно показати, як часто компанія рекомендується в різних мовах, AI-моделях та користувацьких контекстах.

Надійне вимірювання стає необхідною умовою для розуміння того, як AI впливає на процес прийняття рішень про покупку.

Новий підхід до AI-бенчмаркінгу

У міру того як AI стає дедалі важливішим інтерфейсом між компаніями та клієнтами, якість вимірювання стає такою ж важливою, як і якість самих моделей.

Дослідження Rankfor.ai показує, що надійний AI-бенчмаркінг — це не просто питання збору більшої кількості відповідей.

Він потребує розуміння джерел варіативності та створення експериментів, які вимірюють сигнал, а не шум.

Повний текст дослідження:

«Where Does the Noise Come From? A Variance-Components Decomposition of Non-Determinism in LLM Brand Answers» https://arxiv.org/abs/2607.13304

Якщо ви хочете поділитися з читачами SPEKA власним досвідом, розповісти свою історію чи опублікувати колонку на важливу для вас тему, долучайтеся. Відтепер ви можете зареєструватися на сайті SPEKA і самостійно опублікувати свій пост.
0
Icon 0

Підписуйтеся на наші соцмережі