Який ШІ найкраще розуміє українську: Мінцифра запускає перший національний рейтинг LLM

5 хвилин читання

Центр компетенцій WINWIN AI при Мінцифрі спільно з Українським католицьким університетом та ініціативою lang-uk запустив Ukrainian LLM Leaderboard — відкритий рейтинг великих мовних моделей, який оцінює якість їхньої роботи саме українською мовою.

Про це повідомляє Мінцифра.

Мінцифра запускає перший національний рейтинг LLM

Ініціатори проєкту хочуть відійти від ситуації, коли розробники обирають модель на основі маркетингових презентацій великих технологічних компаній.

Читайте також: Кіберзлочинці дедалі частіше використовують штучний інтелект, щоб атакувати підлітків в інтернеті. Зловмисники маскуються під розробників відеоігор, службу підтримки, друзів і навіть створюють фейкові інтимні зображення. 

Тепер їх можна порівнювати за результатами реальних тестів.

Чому українську для ШІ потрібно тестувати окремо

Більшість популярних тестів для великих мовних моделей традиційно орієнтуються на англійську. Українська в глобальних бенчмарках часто представлена значно слабше, а окремі завдання можуть перевірятися за допомогою перекладу.

Проблема в тому, що такий підхід не показує повної картини.

Модель може чудово працювати англійською, але при переході на українську допускати російські кальки, помилки у відмінках, неприродні конструкції або фактичні помилки.

Для звичайного користувача це може бути просто неприємністю. Але для державних сервісів, банків, бізнесу чи освітніх продуктів помилка ШІ може мати значно серйозніші наслідки.

Саме тому розробники Ukrainian LLM Leaderboard вирішили перевіряти моделі безпосередньо українською.

Що перевіряє Ukrainian LLM Leaderboard

Тестування охоплює різні типи завдань, які наближені до реального використання штучного інтелекту.

Підписуйтеся на наші соцмережі

Зокрема, моделі повинні:

  • перекладати та переказувати тексти;
  • стисло викладати великі масиви інформації;
  • знаходити відповіді у документах;
  • розв'язувати логічні задачі;
  • виконувати математичні обчислення;
  • працювати зі складними інструкціями;
  • проходити тести на рівні шкільної програми та ЗНО.

Таким чином, рейтинг оцінює не лише те, наскільки грамотно модель пише українською, а й наскільки добре вона здатна використовувати мову для вирішення різних практичних завдань.

Результати та код відкрили для всіх

Одна з ключових особливостей проєкту — відкритість.

Результати тестування, код та дані доступні громадськості на платформі Hugging Face. Це дозволяє користувачам не просто подивитися на місце конкретної моделі в рейтингу, а й ознайомитися з методологією оцінювання.

За словами аспіранта УКУ та керівника розробки мовної моделі Lapa Юрія Паніва, завданням проєкту було з'ясувати, наскільки добре сучасні великі мовні моделі насправді працюють з українською, а також визначити їхні сильні та слабкі сторони.

Після появи великих мовних моделей було незрозуміло, як добре вони працюють для української мови.
Юрій Панів

За його словами, лідерборд має допомогти бізнесу вибирати моделі для конкретних завдань, а дослідникам — отримати спільну систему координат для подальшої роботи.

До створення рейтингу долучили українських NLP-дослідників

Методологію Ukrainian LLM Leaderboard розробили експерти Українського католицького університету та спільноти lang-uk — Юрій Панів і Дмитро Чаплінський.

Команда працює з українською мовою та технологіями обробки природної мови понад десять років. Серед напрямів їхньої роботи — створення масивів українських текстів та інструментів для навчання мовних моделей.

Розробники також використовували підходи, які раніше застосовували під час створення української мовної моделі Lapa LLM.

Навіщо рейтинг потрібен державі та бізнесу

Ukrainian LLM Leaderboard може бути корисним не лише дослідникам та розробникам ШІ.

Для державного сектору рейтинг потенційно стане інструментом вибору моделей для цифрових сервісів. Бізнес зможе порівнювати якість різних моделей перед інтеграцією у власні продукти.

Це особливо актуально на тлі швидкого поширення генеративного ШІ.

Штучний інтелект уже використовується у фінансових сервісах, державних продуктах, пошуку інформації, підтримці клієнтів та корпоративних системах. І в усіх цих випадках важливо не просто отримати відповідь, а переконатися, що модель правильно зрозуміла український контекст.

За його словами, якщо ШІ використовується у сервісах для мільйонів людей, рішення щодо вибору моделей мають базуватися на даних, а не на маркетингових обіцянках.

Рейтинг планують розширювати

Нинішня версія Ukrainian LLM Leaderboard — лише початок.

Команда планує додати нові категорії оцінювання. Серед них — робота із зображеннями, етичність моделей та вартість використання ШІ українською мовою.

Окрему увагу планують приділити державному сектору.

Моделі тестуватимуть на завданнях, пов'язаних з адміністративними процедурами та нормативними документами. Також оцінюватимуть безпечність роботи ШІ з персональними даними.

Це може перетворити український лідерборд із простої таблиці порівняння мовних моделей на окремий стандарт оцінювання ШІ для українського ринку.

Порівняння мовних моделей доступне за посиланням