Каталог AI-продуктів і платформ, створених в Україні або для України.

← Назад до всіх інструментів

lang-uk

Працює

Спільнота та інфраструктура NLP для української мови

Інфраструктура та платформиПлатформаУкраїнська

Дослідження

Lang-uk — відкрита волонтерська спільнота розробників, лінгвістів і дослідників, яка з 2016 року займається обробкою природної мови (NLP) для української мови. Власний сайт lang.org.ua (українська та англійська версії) живий і без змін описує чотири напрями роботи: збір текстових корпусів (UberText 2.0, BrUK, корпус законів), укладання словників і газетирів, публікація готових моделей (word2vec, GloVe, LexVec, NER на базі MITIE, флеш-моделі flair-uk-pos/ner, roberta-large-ner-uk, electra-base-ukrainian-cased) та мікросервіси (токенізація, лематизація через nlp_uk/dict_uk, визначення мови WILD, оцінка зв'язності тексту) — усе підтверджено власним контентом сторінок /about/ та /services/.

Організація на HuggingFace (huggingface.co/lang-uk) наразі має 24 моделі й 21 датасет: перекладач Dragoman, моделі граматичної корекції OmniGEC-Fluency-8B/12B (травень 2025), ukr-clip-vit-h-14 для zero-shot класифікації зображень (жовтень 2025), electra-base-ukrainian-cased-discriminator (січень 2025), датасети WikiEdits-MultiGEC, perestoroha-ocr, FiftyFiveShades (53,5 млн записів). Ключовий поточний проєкт — Ukrainian LLM Leaderboard (HuggingFace Space, статус Running), який порівнює провідні українськомовні LLM (Lapa LLM, MamayLM, Gemma, Llama, Qwen) за перекладом, сумаризацією, питаннями-відповідями, міркуванням; супровідний датасет результатів оновлено 4 червня 2026, а лідерборд у грудні 2025 згадала галузева редакція dev.ua у статті про створення розробниками Lapa LLM спільно з командою MamayLM інструменту оцінки українськомовних моделей.

GitHub-організація lang-uk налічує 59 репозиторіїв і залишається активною станом на липень 2026: репозиторії extractomat, tokenize-uk і choppa оновлені 5-6 липня 2026 — тобто буквально за тиждень до цього перегляду. Це не комерційний продукт із клієнтами чи фінансуванням, а спільнотна дослідницька інфраструктура — тому традиційних бізнес-метрик немає. Проте домен та GitHub-організація живі й підтримуються майже 10 років, ресурси активно застосовуються іншими командами, що будують українські мовні продукти (Lapa LLM, MamayLM), а результати цитуються в науковій літературі (ACL UNLP) та галузевих медіа. Ризик той самий, що й раніше, — брак стабільного фінансування/штату (усе тримається на волонтерах), футер сайту досі датовано 2016-2023, тоді як HuggingFace/GitHub-артефакти оновлюються значно активніше.

Дослідження оновлено:

Назва
lang-uk
Тип
Платформа
Короткий опис
Спільнота та інфраструктура NLP для української мови
Сектор
Інфраструктура та платформи
Походження
Українська
Опис
Відкрита волонтерська спільнота розробників, лінгвістів і дослідників, яка з 2016 року збирає корпуси української мови (UberText 2.0, BrUK), готує моделі (word2vec/fastText, NER, POS-теггери, граматичні корекції OmniGEC, перекладач Dragoman) і підтримує Ukrainian LLM Leaderboard для оцінки моделей українською. Моделі та датасети публікуються на HuggingFace, код — на GitHub.
Цільові користувачі
Розробники та дослідники NLP, ML-команди, що будують продукти українською мовою (включно з творцями Lapa LLM, MamayLM)
Доступ
Відкритий доступ: моделі, датасети та код на сайті, GitHub і HuggingFace
Стадія
Спільнота з майже 10-річною історією, активна станом на 2025-2026 (лідерборд, участь у розвитку Lapa LLM)
Статус
Працює
Чому включено
Ядро продукту — обробка саме української мови (NLP/AI); моделі, корпуси й лідерборд активно використовуються розробниками та дослідниками, які створюють українські мовні продукти. Власна домашня сторінка lang.org.ua жива, GitHub- та HuggingFace-акаунти активні.
Потребує перевірки
Ні