A catalog of AI products and platforms built in or for Ukraine.

← Back to all tools

NLPForUA

Live

Некомерційна дослідницька спільнота, що розробляє відкриті LLM, датасети та бенчмарки для української мови

Infrastructure & platformsCompanyUkrainian

Research

NLPForUA (NLP for Ukraine) — некомерційна дослідницька спільнота, заснована у 2019 році з метою «принести найновіші досягнення штучного інтелекту, глибокого навчання та обробки природної мови в Україну» через відкриті ресурси для української мови. Організація підтримує кілька окремих, але пов'язаних проєктів: UA-LLM — фреймворк для адаптації, донавчання, оцінювання й використання великих мовних моделей для широкого спектра українськомовних NLP-задач; ZNO / ZNO-Eval — структуровані тестові завдання й бенчмарк на основі українського ЗНО (зовнішнього незалежного оцінювання) для перевірки reasoning-здатностей LLM українською мовою (охоплює українську мову й літературу, історію України, математику, географію); UA-Code-Bench — бенчмарк із 500 задач конкурентного програмування українською мовою і 5500 оціненими рішеннями від провідних LLM (створено у співпраці з платформою Eolymp Basecamp); DUMY — мультидоменний датасет для reasoning українською.

Команда публікує донавчені варіанти Llama 3.1/3.2 та Gemma-2 під формат українських іспитових завдань (chain-of-thought донавчання), а також веде рецензовану наукову роботу: стаття «ZNO-Eval: Benchmarking reasoning capabilities of large language models in Ukrainian» була представлена на міжнародній конференції у вересні 2024 року та опублікована на arXiv у січні 2025 (arXiv:2501.06715), а супровідна робота «Empowering Smaller Models: Tuning LLaMA and Gemma with Chain-of-Thought for Ukrainian Exam Tasks» доступна на ResearchGate. UA-Code-Bench описано в окремому блог-пості на HuggingFace (автор Микита Сиром'ятников, спільно з іншими учасниками спільноти) і супроводжується препринтом.

Докази реального використання: на HuggingFace-сторінці організації датасети мають помітні для ніші показники завантажень — ua-code-bench (~7.5k завантажень, 29 лайків), multilingual-repo-qa (~9.4k завантажень, 50 лайків), dumy-zno-ukrainian-math-history-geo-r1-o1 (~3.3k завантажень, 41 лайк) — усі оновлювалися протягом останнього місяця станом на дослідження. Моделі (донавчені Llama/Gemma під ЗНО) мають скромні показники — одиниці-десятки завантажень кожна. На GitHub організація має кілька активно підтримуваних репозиторіїв: UA-LLM (13 зірок), ZNO (10 зірок, оновлено травень 2025), DUMY (1 зірка, травень 2025) та новий SiMAL (лютий 2026) — DSL для моделювання ПЗ, оптимізований під LLM-токени, що показує продовження активності організації і у 2026 році. Організація базується в Україні (за даними GitHub) і згадується в кураторському списку ресурсів «awesome-ukrainian-nlp».

Застереження: це дослідницька некомерційна спільнота, а не комерційна компанія — немає клієнтів, інвестраундів чи комерційного продукту в класичному сенсі. Показники завантажень моделей (на відміну від датасетів) низькі. Проте на відміну від стандартного випадку «research-only» (одинична академічна стаття без реального використання — як виключена раніше Vuyko Mistral із 0 завантажень), тут є багаторічна історія підтримки (з 2019 року), кілька окремих датасетів із тисячами завантажень і десятками лайків, кілька рецензованих публікацій на міжнародних конференціях та активність, що триває дотепер (2026 рік) — це достатньо для проходження гейту 2 (реальний продукт) як скромного, але справжнього внеску в українську NLP-інфраструктуру.

Research updated:

Name
NLPForUA
Type
Company
Short description
Некомерційна дослідницька спільнота, що розробляє відкриті LLM, датасети та бенчмарки для української мови
Sector
Infrastructure & platforms
Origin
Ukrainian
Description
NLPForUA (NLP for Ukraine) — некомерційна дослідницька спільнота, заснована 2019 року, що просуває обробку природної мови для української мови через відкриті моделі, датасети та бенчмарки. Основні проєкти: UA-LLM (фреймворк для адаптації й донавчання LLM під українську мову), ZNO/ZNO-Eval (структуровані завдання й бенчмарк на основі українського ЗНО для оцінки reasoning-здатностей LLM), UA-Code-Bench (500 задач із конкурентного програмування українською з 5500 оціненими рішеннями) та DUMY (мультидоменний датасет для reasoning). Команда публікує донавчені варіанти Llama та Gemma під українські іспитові завдання та веде рецензовані публікації (ZNO-Eval представлено на міжнародній конференції та опубліковано на arXiv).
Target users
Дослідники NLP, розробники LLM-застосунків українською мовою, команди, що донавчають/оцінюють моделі на україномовних задачах
Access
Відкритий код і дані (GitHub, HuggingFace), безкоштовно
Stage
Активна з 2019 року; кілька підтримуваних репозиторіїв і датасетів, останні оновлення — 2026 рік
Status
Live
Why included
ШІ — сам продукт: організація розробляє й публікує LLM-моделі, датасети та бенчмарки для української мови, а не додає ШІ до стороннього продукту. Реальне використання: датасети мають тисячі завантажень на HuggingFace (ua-code-bench ~7.5k, multilingual-repo-qa ~9.4k, dumy ~3.3k) і десятки лайків, кілька підтримуваних GitHub-репозиторіїв (UA-LLM, ZNO, DUMY, SiMAL) з активністю по 2026 рік, рецензовані публікації на міжнародній конференції (ZNO-Eval, arXiv 2501.06715) — це відрізняє організацію від одноразового академічного артефакту без завантажень (як виключений раніше Vuyko Mistral). Продукт орієнтований виключно на українську мову: ЗНО — українська система іспитів, увесь корпус і бенчмарки — україномовні. Власна домівка: організаційні сторінки на HuggingFace та GitHub (модель-картки й датасет-картки визнаються власною домівкою за критеріями каталогу).
Notes
Судження: це радше дослідницька некомерційна організація, ніж комерційний продукт, але на відміну від стандартної категорії «research-only» (університетська стаття без реального використання), тут є кілька років підтримуваної роботи, кілька окремих датасетів/моделей із тисячами завантажень і рецензовані публікації на міжнародних конференціях — тому кваліфіковано як реальний, хай і скромний за масштабом, продукт (гейт 2 пройдено). Рейтинг помірний через відсутність комерційних клієнтів, фінансування чи бойового застосування.
Needs review
No