Datasets

Every Prompt

A million prompts generated from structured web data (How-to, FAQ, recipes and more).

Постійне посилання

Автори
Дмитро Чаплинський
Ліцензія
MIT
Посилання
Hugging Face
MMZNO — multimodal benchmark from ZNO tests

Multimodal benchmark for evaluating models on Ukrainian external independent testing (ZNO) tasks.

Постійне посилання

Автори
Юрій Панів, Артур Кюлян, Дмитро Чаплинський, Микола Хандога, Антон Полішко, Тетяна Бас, Guillermo Gabrielli
Ліцензія
MIT
Multi30k Extended translation dataset

Extended Ukrainian version of the Multi30k dataset for multimodal machine translation.

Постійне посилання

Автори
Nataliia Saichyshyna, Daniil Maksymenko, Oleksii Turuta, Andriy Yerokhin, Andrii Babii, Olena Turuta; фільтрація та контроль якості — Юрій Панів
Ліцензія
Apache-2.0
ParaCrawl 3M English-Ukrainian parallel corpus

Three million filtered English-Ukrainian parallel sentence pairs based on ParaCrawl.

Постійне посилання

Автори
Дмитро Чаплинський
Посилання
Hugging Face
UACuisine — Ukrainian recipes dataset

A dataset of Ukrainian culinary recipes.

Постійне посилання

Автори
Юрій Панів, Артур Кюлян, Дмитро Чаплинський, Микола Хандога, Антон Полішко, Тетяна Бас, Guillermo Gabrielli
UberText-NER-Silver

Silver-standard NER dataset, automatically annotated over UberText 2.0 texts.

Постійне посилання

Автори
Владислав Радченко, Назарій Друщак
Ліцензія
Apache-2.0
Посилання
Hugging Face
Recruitment datasets (Djinni)

Anonymized candidate profiles and job descriptions from Djinni, in English and Ukrainian.

Постійне посилання

Автори
Назарій Друщак, Мар'яна Романишин
Ліцензія
MIT
OmniGEC corpora for grammatical error correction

Corpora for training GEC models: Wikipedia edits, Reddit and UberText data.

Постійне посилання

Автори
Роман Ковальчук, Мар'яна Романишин, Петро Іванюк
Ліцензія
MIT
Ukrainian hypernymy pairs

A dataset of hypernym-hyponym pairs for Ukrainian.

Постійне посилання

Автори
Наталія Романишин
Посилання
Hugging Face