Корпус UberText
Ми назбирали та упорядкували значний (більше 6ГБ) обсяг текстів українських періодичних видань й продовжуємо розширювати наш архів. Наша мета — довести його розмір до мільярда слів.
Саме ці тексти ми використовуємо для обчислення наших Word Embeddings. На жаль, ліцензійні обмеження деяких видань не дозволяють нам публікувати ці тексти без змін.
Щоб надати публічний доступ до цього масиву даних ми зробили токенізацію усіх текстів на речення та слова, а потім перемішали речення у випадковому порядку. Таким чином, будь-хто зможе використати ці тексти для обчислення статистичних моделей що працюють на рівні речень. Ми також публікуємо лематизовану версію цих текстів окремим архівом. Для токенізації та лематизації текстів ми використовували пакет nlp-uk від Андрія Рисіна та ініціативи БРУК
В архіві зібрані речення з текстів наступних видань:
- Українська правда
- ТОВ "УНІАН"
- ГО «Громадське телебачення»
- ПрАТ «Телерадіокомпанія “Люкс”», "Zaxid.net"
- ООО «Кореспондент»
- Експрес
- «ZN.UA»
- ПП «Україна Молода»
- ПрАТ «Видавничий Дім «Високий Замок»
- Бровари - Маєш право знати
- Тиждень.ua
Скачати
| Корпус | Кількість токенів | Кількість речень | Завантажити | Завантажити лематизовану версію |
|---|---|---|---|---|
| Новини | 461451019 | 31021650 | 1.1GB | 951MB |
| Вікіпедія | 185645357 | 15786948 | 403MB | 371MB |
| Художня література | 18323509 | 1811548 | 41MB | 38MB |
| Уберкорпус | 665419885 | 48620146 | 1.6GB | 1.5GB |
До відома правовласників:
- Ми розповсюджуємо тексти у вигляді перемішаних речень, що унеможливлює відновлення повного тексту.
- Тексти розповсюджуються на умовах Fair Use (чесне використання) для потреб наукового та статистичного аналізу.
- Ми не є прибутковою організацією, та не отримуємо за наведені матеріали будь якої користі.
- Якщо у вас є зауваження до текстів, що ми виклали, будь ласка, напишіть нам на [email protected]