Корпус UberText

Ми назбирали та упорядкували значний (більше 6ГБ) обсяг текстів українських періодичних видань й продовжуємо розширювати наш архів. Наша мета — довести його розмір до мільярда слів.

Саме ці тексти ми використовуємо для обчислення наших Word Embeddings. На жаль, ліцензійні обмеження деяких видань не дозволяють нам публікувати ці тексти без змін.

Щоб надати публічний доступ до цього масиву даних ми зробили токенізацію усіх текстів на речення та слова, а потім перемішали речення у випадковому порядку. Таким чином, будь-хто зможе використати ці тексти для обчислення статистичних моделей що працюють на рівні речень. Ми також публікуємо лематизовану версію цих текстів окремим архівом. Для токенізації та лематизації текстів ми використовували пакет nlp-uk від Андрія Рисіна та ініціативи БРУК

В архіві зібрані речення з текстів наступних видань:

Скачати

Корпус  Кількість токенів Кількість речень Завантажити Завантажити лематизовану версію
Новини 461451019 31021650 1.1GB 951MB
Вікіпедія 185645357 15786948 403MB 371MB
Художня література 18323509 1811548 41MB 38MB
Уберкорпус 665419885 48620146 1.6GB 1.5GB

До відома правовласників:

  • Ми розповсюджуємо тексти у вигляді перемішаних речень, що унеможливлює відновлення повного тексту.
  • Тексти розповсюджуються на умовах Fair Use (чесне використання) для потреб наукового та статистичного аналізу.
  • Ми не є прибутковою організацією, та не отримуємо за наведені матеріали будь якої користі.
  • Якщо у вас є зауваження до текстів, що ми виклали, будь ласка, напишіть нам на [email protected]