A catalog of AI products and platforms built in or for Ukraine.

← Back to all tools

speech-uk

Live

Некомерційна ініціатива відкритих моделей і датасетів для української мовленнєвої AI (STT/TTS)

Voice & speechPlatformUkrainian

Research

speech-uk — некомерційна ініціатива, що розробляє та підтримує відкриті моделі й датасети для мовленнєвих технологій української мови: розпізнавання мовлення (STT) і синтез мовлення (TTS). Ініціативу очолює Єгор Смоляков (Yehor Smoliakov, GitHub-нік egorsmkv); формальна організація на HuggingFace об'єднує понад 30 моделей (варіанти W2V-BERT/wav2vec2, Whisper, StyleTTS2, RAD-TTS++, Squeezeformer, KenLM для мовних моделей) та 32 датасети, включно з великими корпусами на кшталт VoA (~390 год) та YODAS2 (~400 год), а також лідерборди для порівняння якості STT/TTS-систем.

Докази реальної тяги суттєві як на open-source стандарти: супутній GitHub-репозиторій egorsmkv/speech-recognition-uk має 439 зірок і 23 форки, 323+ коміти, активні issue-трекери. Флагманська модель w2v-xls-r-uk має понад 630 000 завантажень на HuggingFace — показник, що на порядки перевищує типові українські відкриті моделі в каталозі (для порівняння, Lapa LLM, вже прийнята в каталог із рейтингом 6, має ~714 завантажень на місяць). Поточна рекомендована модель w2v-bert-uk-v2.1 має 277 завантажень, whisper-large-v3-turbo-quantized-uk — 437; ці числа менші, але означають активне поточне використання найновіших версій, а не лише історичний артефакт. Розробка триває безперервно: нові моделі й оновлення з'являлися впродовж 2025 року і продовжуються у 2026-му (squeezeformer-sm оновлено 2 квітня 2026, w2v-bert-v3 — 17 квітня 2026), що підтверджує статус живого, підтримуваного проєкту, а не покинутого дослідницького артефакту.

Ініціатива також надає інструменти для продакшн-використання: Rust-пакет w2v-bert-uk на crates.io, квантизовані та ONNX-варіанти моделей для розгортання на CPU/GPU, PyPI-пакет ukrainian-tts (бібліотека tts_uk) з готовими голосами (Тетяна, Лада, Микита). Спільнота підтримується через активні Discord- і Telegram-канали (окремо для розпізнавання й синтезу мовлення), приймаються донати через монобанку.

Застереження: попри організаційну назву "ініціатива", фактично проєкт тримається переважно на одному активному розробнику (Єгор Смоляков), без публічно підтвердженого фінансування, іменованих комерційних клієнтів чи впроваджень у конкретних продуктах третіх сторін — це радше інфраструктурний внесок для спільноти, ніж комерційний продукт. Утім, за критеріями каталогу відкриті картки моделей на HuggingFace визнаються як власна домівка продукту (гейт 4), а масштаб реального використання (завантаження, зірки, безперервна підтримка) чітко відрізняє це від академічної статті без застосування чи покинутого прототипу — тому продукт проходить усі чотири гейти включення.

Research updated:

Name
speech-uk
Type
Platform
Short description
Некомерційна ініціатива відкритих моделей і датасетів для української мовленнєвої AI (STT/TTS)
Sector
Voice & speech
Origin
Ukrainian
Description
speech-uk — некомерційна ініціатива на чолі з Єгором Смоляковим, що розробляє й підтримує відкриті моделі та датасети для розпізнавання (STT) і синтезу (TTS) української мови. Організація на HuggingFace об'єднує понад 30 моделей (W2V-BERT, Whisper-варіанти, StyleTTS2, RAD-TTS++, Squeezeformer) і 32 датасети, а супутній GitHub-репозиторій speech-recognition-uk (439 зірок, 23 форки) слугує довідником інструментів для розробників.
Target users
Розробники голосових і мовленнєвих застосунків для української мови: дослідники ASR/TTS, стартапи й компанії, що потребують української транскрипції чи синтезу мовлення, спільнота відкритого коду
Access
Відкриті ваги на HuggingFace (Apache-2.0/MIT), безкоштовно; демо-простори (Spaces) для тестування STT/TTS у браузері; пакети для продакшн-використання (Rust crate w2v-bert-uk, ONNX/квантизовані версії); підтримка через Discord/Telegram
Stage
Активна розробка з 2022–2023 років, безперервні релізи через 2025–2026 (наприклад, squeezeformer-sm оновлено у квітні 2026, w2v-bert-v3 — квітень 2026); флагманська модель w2v-xls-r-uk має понад 630 000 завантажень на HuggingFace, поточна рекомендована w2v-bert-uk-v2.1 — 277, whisper-large-v3-turbo-quantized-uk — 437
Status
Live
Why included
Відкриті моделі реально завантажують і використовують (600k+ завантажень флагманської моделі, 439 зірок на GitHub, Rust-пакет для продакшн-інтеграції), розробка триває безперервно роками — це не академічна стаття без застосування, а підтримувана інфраструктура для української мовленнєвої AI; AI-моделі й датасети — це весь продукт.
Notes
Тип platform: організація-парасолька, що об'єднує 30+ моделей і 32 датасети. Модель w2v-bert-uk-v2.1 (флагманська поточна STT-модель ініціативи) уже має власний запис у каталозі (rating 5) — пов'язана через parent_id. Одноосібний ключовий мейнтейнер (Єгор Смоляков, як і в GitHub-репо egorsmkv), але з активною спільнотою (Discord/Telegram) та широким використанням завантажень моделей; аналогічний прецедент — Lapa LLM (rating 6), тут докази ширшого використання (у 4-5 разів більше зірок на GitHub, на порядки більше завантажень флагманської моделі w2v-xls-r-uk).
Needs review
No