Датасети
Every Prompt — датасет промптів
Мільйон промптів, згенерованих зі структурованих даних вебу (How-to, FAQ, рецепти тощо).
MMZNO — мультимодальний бенчмарк на базі ЗНО
Мультимодальний бенчмарк для оцінки моделей на завданнях зовнішнього незалежного оцінювання (ЗНО).
Автори
Юрій Панів, Артур Кюлян, Дмитро Чаплинський, Микола Хандога, Антон Полішко, Тетяна Бас, Guillermo Gabrielli
Ліцензія
MIT
Multi30k Extended — датасет перекладу
Розширена українська версія датасету Multi30k для мультимодального машинного перекладу.
Автори
Nataliia Saichyshyna, Daniil Maksymenko, Oleksii Turuta, Andriy Yerokhin, Andrii Babii, Olena Turuta; фільтрація та контроль якості — Юрій Панів
Ліцензія
Apache-2.0
ParaCrawl 3M — паралельний корпус en-uk
Три мільйони відфільтрованих паралельних англійсько-українських речень на основі ParaCrawl.
Автори
Дмитро Чаплинський
Посилання
Hugging Face
UACuisine — датасет українських рецептів
Датасет українських кулінарних рецептів.
Автори
Юрій Панів, Артур Кюлян, Дмитро Чаплинський, Микола Хандога, Антон Полішко, Тетяна Бас, Guillermo Gabrielli
UberText-NER-Silver — срібний NER-датасет
Срібний NER-датасет, автоматично розмічений на текстах UberText 2.0.
Датасети вакансій та кандидатів (Djinni)
Анонімізовані профілі кандидатів та описи вакансій із сервісу Djinni, англійською та українською.
Автори
Назарій Друщак, Мар'яна Романишин
Ліцензія
MIT
Корпуси OmniGEC для виправлення помилок
Корпуси для тренування GEC-моделей: правки з Вікіпедії, Reddit та UberText.
Автори
Роман Ковальчук, Мар'яна Романишин, Петро Іванюк
Ліцензія
MIT
Пари гіперонімів української мови
Датасет пар гіперонім-гіпонім для української мови.
Автори
Наталія Романишин
Посилання
Hugging Face