Каталог AI-продуктів і платформ, створених в Україні або для України.

← Назад до всіх інструментів

Modern-LiBERTa

Працює

Перший україномовний енкодер із довгим контекстом

Інфраструктура та платформиІнструментІноземна

Дослідження

Modern-LiBERTa — перший відкритий україномовний трансформер-енкодер архітектури ModernBERT із підтримкою довгого контексту до 8 192 токенів. Модель розробив Микола Галтюк (аспірант AGH University of Krakow, Польща) разом із науковим керівником Олександром Смивинським-Полем; результати представлено на четвертому Workshop on Ukrainian Natural Language Processing (UNLP 2025) при конференції ACL у Відні в липні 2025 року.

Технічна основа: Modern-LiBERTa є результатом континуального попереднього навчання ModernBERT Large із новим україномовним токенайзером на корпусі Kobza — найбільшому публічно доступному корпусі, що містить близько 60 млрд унікальних україномовних токенів із 97 млн документів із різних веб-джерел і пройшов ретельну дедуплікацію. Завдяки цьому модель вперше для україномовних енкодерів здатна обробляти тексти завдовжки до 8 192 токенів — у 16 разів більше, ніж попередні LiBERTa та LiBERTa v2 (по 512 токенів). На стандартних україномовних бенчмарках модель показує конкурентоспроможні результати: NER-UK — 91,66 F1, WikiANN (uk) — 93,37 F1, UD POS — 98,78 точність.

Докази актуальності для українського ринку: модель орієнтована виключно на українську мову та є третім поколінням лінійки LiBERTa — кожна версія публікувалась у рецензованих академічних матеріалах (UNLP 2024, 2025). Модель включена до спільнотного curated-списку awesome-ukrainian-nlp. Станом на повторну перевірку 17.07.2026 підтверджено ті самі три зовнішні похідні дообчені моделі: дві для синтаксичного розбору (автор KoichiYasuoka, задача Universal Dependencies) та одна для виявлення маніпуляцій в україномовних текстах (olehmell/ukr-manipulation-detector-modern-liberta). Наявність зовнішніх дообчень підтверджує реальне практичне використання поза рамками академічного проєкту.

Ризики та застереження: загальний масштаб traction лишається дуже скромним і незмінним відносно попередньої перевірки — 25 завантажень на місяць із HuggingFace Hub, 4 вподобайки, жодних задокументованих комерційних впроваджень чи корпоративних клієнтів, жодних нових релізів чи анонсів за останні 4 дні. Автори — дослідники польського університету (AGH Krakow); продукт орієнтований на Україну за предметом, а не за місцем розробки (в каталозі позначено як «Іноземна, орієнтована на Україну»). Попри скромний traction, Modern-LiBERTa залишається важливим фундаментальним внеском в NLP-інфраструктуру для українського ринку — зокрема для RAG-систем і семантичного пошуку.

Дослідження оновлено:

Назва
Modern-LiBERTa
Тип
Інструмент
Короткий опис
Перший україномовний енкодер із довгим контекстом
Сектор
Інфраструктура та платформи
Походження
Іноземна, орієнтована на Україну
Опис
Перший україномовний трансформер-енкодер типу ModernBERT із підтримкою контексту до 8 192 токенів. Навчений на корпусі Kobza (60 млрд токенів) і перевершує попередні україномовні BERT-моделі на більшості NLP-бенчмарків. Підходить для семантичного пошуку, RAG, класифікації та NER.
Цільові користувачі
Розробники NLP-додатків, дослідники, компанії, що будують RAG-системи для українського ринку
Доступ
open-source (HuggingFace)
Стадія
open-source модель
Статус
Працює
Чому включено
Перша україномовна модель-енкодер із довгим контекстом — ключовий блок RAG-інфраструктури під українську мову; має власну модель-карту як офіційну сторінку.
Нотатки
Автори — дослідники AGH University of Krakow (Польща); модель цілеспрямовано орієнтована на українську мову. Відкрита модель, не компанія.
Потребує перевірки
Ні