Перший україномовний енкодер із довгим контекстом
Modern-LiBERTa — перший відкритий україномовний трансформер-енкодер архітектури ModernBERT із підтримкою довгого контексту до 8 192 токенів. Модель розробив Микола Галтюк (аспірант AGH University of Krakow, Польща) разом із науковим керівником Олександром Смивинським-Полем; результати представлено на четвертому Workshop on Ukrainian Natural Language Processing (UNLP 2025) при конференції ACL у Відні в липні 2025 року.
Технічна основа: Modern-LiBERTa є результатом континуального попереднього навчання ModernBERT Large із новим україномовним токенайзером на корпусі Kobza — найбільшому публічно доступному корпусі, що містить близько 60 млрд унікальних україномовних токенів із 97 млн документів із різних веб-джерел і пройшов ретельну дедуплікацію. Завдяки цьому модель вперше для україномовних енкодерів здатна обробляти тексти завдовжки до 8 192 токенів — у 16 разів більше, ніж попередні LiBERTa та LiBERTa v2 (по 512 токенів). На стандартних україномовних бенчмарках модель показує конкурентоспроможні результати: NER-UK — 91,66 F1, WikiANN (uk) — 93,37 F1, UD POS — 98,78 точність.
Докази актуальності для українського ринку: модель орієнтована виключно на українську мову та є третім поколінням лінійки LiBERTa — кожна версія публікувалась у рецензованих академічних матеріалах (UNLP 2024, 2025). Модель включена до спільнотного curated-списку awesome-ukrainian-nlp. Станом на повторну перевірку 17.07.2026 підтверджено ті самі три зовнішні похідні дообчені моделі: дві для синтаксичного розбору (автор KoichiYasuoka, задача Universal Dependencies) та одна для виявлення маніпуляцій в україномовних текстах (olehmell/ukr-manipulation-detector-modern-liberta). Наявність зовнішніх дообчень підтверджує реальне практичне використання поза рамками академічного проєкту.
Ризики та застереження: загальний масштаб traction лишається дуже скромним і незмінним відносно попередньої перевірки — 25 завантажень на місяць із HuggingFace Hub, 4 вподобайки, жодних задокументованих комерційних впроваджень чи корпоративних клієнтів, жодних нових релізів чи анонсів за останні 4 дні. Автори — дослідники польського університету (AGH Krakow); продукт орієнтований на Україну за предметом, а не за місцем розробки (в каталозі позначено як «Іноземна, орієнтована на Україну»). Попри скромний traction, Modern-LiBERTa залишається важливим фундаментальним внеском в NLP-інфраструктуру для українського ринку — зокрема для RAG-систем і семантичного пошуку.
Research updated: