Некомерційна дослідницька спільнота, що розробляє відкриті LLM, датасети та бенчмарки для української мови
NLPForUA (NLP for Ukraine) — некомерційна дослідницька спільнота, заснована у 2019 році з метою «принести найновіші досягнення штучного інтелекту, глибокого навчання та обробки природної мови в Україну» через відкриті ресурси для української мови. Організація підтримує кілька окремих, але пов'язаних проєктів: UA-LLM — фреймворк для адаптації, донавчання, оцінювання й використання великих мовних моделей для широкого спектра українськомовних NLP-задач; ZNO / ZNO-Eval — структуровані тестові завдання й бенчмарк на основі українського ЗНО (зовнішнього незалежного оцінювання) для перевірки reasoning-здатностей LLM українською мовою (охоплює українську мову й літературу, історію України, математику, географію); UA-Code-Bench — бенчмарк із 500 задач конкурентного програмування українською мовою і 5500 оціненими рішеннями від провідних LLM (створено у співпраці з платформою Eolymp Basecamp); DUMY — мультидоменний датасет для reasoning українською.
Команда публікує донавчені варіанти Llama 3.1/3.2 та Gemma-2 під формат українських іспитових завдань (chain-of-thought донавчання), а також веде рецензовану наукову роботу: стаття «ZNO-Eval: Benchmarking reasoning capabilities of large language models in Ukrainian» була представлена на міжнародній конференції у вересні 2024 року та опублікована на arXiv у січні 2025 (arXiv:2501.06715), а супровідна робота «Empowering Smaller Models: Tuning LLaMA and Gemma with Chain-of-Thought for Ukrainian Exam Tasks» доступна на ResearchGate. UA-Code-Bench описано в окремому блог-пості на HuggingFace (автор Микита Сиром'ятников, спільно з іншими учасниками спільноти) і супроводжується препринтом.
Докази реального використання: на HuggingFace-сторінці організації датасети мають помітні для ніші показники завантажень — ua-code-bench (~7.5k завантажень, 29 лайків), multilingual-repo-qa (~9.4k завантажень, 50 лайків), dumy-zno-ukrainian-math-history-geo-r1-o1 (~3.3k завантажень, 41 лайк) — усі оновлювалися протягом останнього місяця станом на дослідження. Моделі (донавчені Llama/Gemma під ЗНО) мають скромні показники — одиниці-десятки завантажень кожна. На GitHub організація має кілька активно підтримуваних репозиторіїв: UA-LLM (13 зірок), ZNO (10 зірок, оновлено травень 2025), DUMY (1 зірка, травень 2025) та новий SiMAL (лютий 2026) — DSL для моделювання ПЗ, оптимізований під LLM-токени, що показує продовження активності організації і у 2026 році. Організація базується в Україні (за даними GitHub) і згадується в кураторському списку ресурсів «awesome-ukrainian-nlp».
Застереження: це дослідницька некомерційна спільнота, а не комерційна компанія — немає клієнтів, інвестраундів чи комерційного продукту в класичному сенсі. Показники завантажень моделей (на відміну від датасетів) низькі. Проте на відміну від стандартного випадку «research-only» (одинична академічна стаття без реального використання — як виключена раніше Vuyko Mistral із 0 завантажень), тут є багаторічна історія підтримки (з 2019 року), кілька окремих датасетів із тисячами завантажень і десятками лайків, кілька рецензованих публікацій на міжнародних конференціях та активність, що триває дотепер (2026 рік) — це достатньо для проходження гейту 2 (реальний продукт) як скромного, але справжнього внеску в українську NLP-інфраструктуру.
Дослідження оновлено: