Мінцифра запустила перший рейтинг ШІ, який тестує моделі українською

Україна отримала власний інструмент для оцінювання великих мовних моделей — Ukrainian LLM Leaderboard. Він показує, наскільки добре штучний інтелект розуміє і використовує українську мову на практиці.
Центр компетенцій WINWIN AI при Міністерстві цифрової трансформації спільно з Українським католицьким університетом та спільнотою lang-uk презентував Ukrainian LLM Leaderboard. Це відкритий рейтинг великих мовних моделей, який оцінює їхню роботу саме українською мовою.
Ініціатива покликана змінити підхід до вибору ШІ-моделей: замість орієнтації на маркетингові презентації розробників, можна буде порівнювати реальні результати тестів.
Більшість міжнародних бенчмарків для мовних моделей зосереджені на англійській мові. Українська в них представлена слабко, а частина завдань перекладається, що не дає повної картини. Модель може чудово працювати англійською, але українською припускатися російських кальок, помилок у відмінках чи неприродних конструкцій. Для пересічного користувача це може бути лише незручністю, але для державних сервісів, банків чи освітніх продуктів такі помилки можуть мати серйозні наслідки.
Тестування охоплює завдання, наближені до реального використання ШІ: переклад і переказ текстів, стислий виклад великих обсягів інформації, пошук відповідей у документах, розв'язання логічних і математичних задач, виконання складних інструкцій, а також проходження тестів рівня шкільної програми та ЗНО. Тож рейтинг оцінює не лише грамотність моделі, а й її здатність використовувати мову для практичних завдань.
Усі результати, код і дані оприлюднені на платформі Hugging Face, тож користувачі можуть ознайомитися з методологією оцінювання. Аспірант УКУ та керівник розробки мовної моделі Lapa Юрій Панів зазначив, що завданням проєкту було з'ясувати, наскільки добре сучасні моделі працюють з українською, і визначити їхні сильні та слабкі сторони. Лідерборд має допомогти бізнесу обирати моделі для конкретних потреб, а дослідникам — отримати спільну систему координат.
Методологію розробили експерти УКУ та lang-uk Юрій Панів і Дмитро Чаплінський, які понад десять років працюють з українською мовою та NLP-технологіями. Вони використали підходи, що застосовувалися під час створення української моделі Lapa LLM.
Рейтинг може стати інструментом для державного сектору під час вибору моделей для цифрових сервісів, а бізнес зможе порівнювати якість різних моделей перед інтеграцією у власні продукти. Це особливо актуально з огляду на швидке поширення генеративного ШІ у фінансах, державних продуктах, клієнтській підтримці та корпоративних системах.
Команда планує розширювати лідерборд: додати категорії оцінювання роботи із зображеннями, етичності моделей та вартості використання ШІ українською. Окрему увагу приділять державному сектору — тестуватимуть моделі на завданнях з адміністративними процедурами, нормативними документами та безпечності роботи з персональними даними. Це може перетворити український рейтинг на стандарт оцінювання ШІ для українського ринку.
Читайте також
Ще в розділі «Освіта»
- Український інститут нацпам’яті створює церемонію гідного прощання зі зношеними прапорами
- Окупанти вводять військову підготовку в школах на захоплених територіях
- Мікотоксини знайшли в усіх рослинних замінниках м'яса: що це означає
- «Пакунок школяра» на Харківщині: понад 5 тисяч родин уже отримали виплати
- Окупанти вводять обов'язкову військову підготовку у школах Криму






