Спільнота та інфраструктура NLP для української мови
Lang-uk — відкрита волонтерська спільнота розробників, лінгвістів і дослідників, яка з 2016 року займається обробкою природної мови (NLP) для української мови. Власний сайт lang.org.ua (українська та англійська версії) живий і без змін описує чотири напрями роботи: збір текстових корпусів (UberText 2.0, BrUK, корпус законів), укладання словників і газетирів, публікація готових моделей (word2vec, GloVe, LexVec, NER на базі MITIE, флеш-моделі flair-uk-pos/ner, roberta-large-ner-uk, electra-base-ukrainian-cased) та мікросервіси (токенізація, лематизація через nlp_uk/dict_uk, визначення мови WILD, оцінка зв'язності тексту) — усе підтверджено власним контентом сторінок /about/ та /services/.
Організація на HuggingFace (huggingface.co/lang-uk) наразі має 24 моделі й 21 датасет: перекладач Dragoman, моделі граматичної корекції OmniGEC-Fluency-8B/12B (травень 2025), ukr-clip-vit-h-14 для zero-shot класифікації зображень (жовтень 2025), electra-base-ukrainian-cased-discriminator (січень 2025), датасети WikiEdits-MultiGEC, perestoroha-ocr, FiftyFiveShades (53,5 млн записів). Ключовий поточний проєкт — Ukrainian LLM Leaderboard (HuggingFace Space, статус Running), який порівнює провідні українськомовні LLM (Lapa LLM, MamayLM, Gemma, Llama, Qwen) за перекладом, сумаризацією, питаннями-відповідями, міркуванням; супровідний датасет результатів оновлено 4 червня 2026, а лідерборд у грудні 2025 згадала галузева редакція dev.ua у статті про створення розробниками Lapa LLM спільно з командою MamayLM інструменту оцінки українськомовних моделей.
GitHub-організація lang-uk налічує 59 репозиторіїв і залишається активною станом на липень 2026: репозиторії extractomat, tokenize-uk і choppa оновлені 5-6 липня 2026 — тобто буквально за тиждень до цього перегляду. Це не комерційний продукт із клієнтами чи фінансуванням, а спільнотна дослідницька інфраструктура — тому традиційних бізнес-метрик немає. Проте домен та GitHub-організація живі й підтримуються майже 10 років, ресурси активно застосовуються іншими командами, що будують українські мовні продукти (Lapa LLM, MamayLM), а результати цитуються в науковій літературі (ACL UNLP) та галузевих медіа. Ризик той самий, що й раніше, — брак стабільного фінансування/штату (усе тримається на волонтерах), футер сайту досі датовано 2016-2023, тоді як HuggingFace/GitHub-артефакти оновлюються значно активніше.
Research updated: