Datasets
Every Prompt
A million prompts generated from structured web data (How-to, FAQ, recipes and more).
MMZNO — multimodal benchmark from ZNO tests
Multimodal benchmark for evaluating models on Ukrainian external independent testing (ZNO) tasks.
Автори
Юрій Панів, Артур Кюлян, Дмитро Чаплинський, Микола Хандога, Антон Полішко, Тетяна Бас, Guillermo Gabrielli
Ліцензія
MIT
Multi30k Extended translation dataset
Extended Ukrainian version of the Multi30k dataset for multimodal machine translation.
Автори
Nataliia Saichyshyna, Daniil Maksymenko, Oleksii Turuta, Andriy Yerokhin, Andrii Babii, Olena Turuta; фільтрація та контроль якості — Юрій Панів
Ліцензія
Apache-2.0
ParaCrawl 3M English-Ukrainian parallel corpus
Three million filtered English-Ukrainian parallel sentence pairs based on ParaCrawl.
Автори
Дмитро Чаплинський
Посилання
Hugging Face
UACuisine — Ukrainian recipes dataset
A dataset of Ukrainian culinary recipes.
Автори
Юрій Панів, Артур Кюлян, Дмитро Чаплинський, Микола Хандога, Антон Полішко, Тетяна Бас, Guillermo Gabrielli
UberText-NER-Silver
Silver-standard NER dataset, automatically annotated over UberText 2.0 texts.
Recruitment datasets (Djinni)
Anonymized candidate profiles and job descriptions from Djinni, in English and Ukrainian.
Автори
Назарій Друщак, Мар'яна Романишин
Ліцензія
MIT
OmniGEC corpora for grammatical error correction
Corpora for training GEC models: Wikipedia edits, Reddit and UberText data.
Автори
Роман Ковальчук, Мар'яна Романишин, Петро Іванюк
Ліцензія
MIT
Ukrainian hypernymy pairs
A dataset of hypernym-hyponym pairs for Ukrainian.
Автори
Наталія Романишин
Посилання
Hugging Face