Датасети

Every Prompt — датасет промптів

Мільйон промптів, згенерованих зі структурованих даних вебу (How-to, FAQ, рецепти тощо).

Постійне посилання

Автори
Дмитро Чаплинський
Ліцензія
MIT
Посилання
Hugging Face
MMZNO — мультимодальний бенчмарк на базі ЗНО

Мультимодальний бенчмарк для оцінки моделей на завданнях зовнішнього незалежного оцінювання (ЗНО).

Постійне посилання

Автори
Юрій Панів, Артур Кюлян, Дмитро Чаплинський, Микола Хандога, Антон Полішко, Тетяна Бас, Guillermo Gabrielli
Ліцензія
MIT
Multi30k Extended — датасет перекладу

Розширена українська версія датасету Multi30k для мультимодального машинного перекладу.

Постійне посилання

Автори
Nataliia Saichyshyna, Daniil Maksymenko, Oleksii Turuta, Andriy Yerokhin, Andrii Babii, Olena Turuta; фільтрація та контроль якості — Юрій Панів
Ліцензія
Apache-2.0
ParaCrawl 3M — паралельний корпус en-uk

Три мільйони відфільтрованих паралельних англійсько-українських речень на основі ParaCrawl.

Постійне посилання

Автори
Дмитро Чаплинський
Посилання
Hugging Face
UACuisine — датасет українських рецептів

Датасет українських кулінарних рецептів.

Постійне посилання

Автори
Юрій Панів, Артур Кюлян, Дмитро Чаплинський, Микола Хандога, Антон Полішко, Тетяна Бас, Guillermo Gabrielli
UberText-NER-Silver — срібний NER-датасет

Срібний NER-датасет, автоматично розмічений на текстах UberText 2.0.

Постійне посилання

Автори
Владислав Радченко, Назарій Друщак
Ліцензія
Apache-2.0
Посилання
Hugging Face
Датасети вакансій та кандидатів (Djinni)

Анонімізовані профілі кандидатів та описи вакансій із сервісу Djinni, англійською та українською.

Постійне посилання

Автори
Назарій Друщак, Мар'яна Романишин
Ліцензія
MIT
Корпуси OmniGEC для виправлення помилок

Корпуси для тренування GEC-моделей: правки з Вікіпедії, Reddit та UberText.

Постійне посилання

Автори
Роман Ковальчук, Мар'яна Романишин, Петро Іванюк
Ліцензія
MIT
Пари гіперонімів української мови

Датасет пар гіперонім-гіпонім для української мови.

Постійне посилання

Автори
Наталія Романишин
Посилання
Hugging Face