Сервіси
Веб-сервіс (Docker image) створений з метою здійснення наступних операцій обробки україномовних текстів:
- Оцінка когерентності тексту (розмір тексту має складати мінімум 3 речення).
- Виділення іменних груп.
- Пошук кореферентних пар (тестовий варіант).
Веб-сервіс реалізований у вигляді REST API. Обробка даних відбувається шляхом відправки POST-запитів на відповідні адреси:
- Оцінка когерентності тексту: /api/get_coherence
- Виділення іменних груп: /api/get_phrases
- Пошук кореферентних пар: /api/get_coreferent_clusters
Вхідний формат тіла запиту (JSON): {"text": "<:text>"}. Відповідь від серверу повертається у форматі JSON залежно від точки доступу.
Веб-сервіс створений Артемом Крамовим
Лідерборд великих мовних моделей на українських бенчмарках: метрики якості та порівняння моделей.
Мікросервіс NER дозволяє здійснити NER-розмітку токенізованого тексту з використанням моделей, натренованих з допомогою бібліотеки MITIE для української, російської та англійської мов (в залежності від вибору відповідного Dockerfile при запуску сервісу). Мікросервіс розробив Михайло Чалий.
Приклад HTTP-запиту:
$ curl -X POST -H "Content-Type: application/json" -d '{ "tokens": ["Несе","Галя","воду",",","Коромисло","гнеться" ]}' http://localhost:8080/
Мікросервіс на основі бібліотеки NLP_UK дає змогу виконати лематизацію вхідного тексту за словником dict_uk, яка також включає його токенізацію. Мікросервіс розробив Андрій Рисін.
Приклад HTTP-запиту:
$ curl -X POST -H "Content-Type: application/json" -d "{'text': 'Сьогодні у продажі. 12-те зібрання творів 1969 р. І. П. Котляревського.'}" http://localhost:8080/lemmatize/
Мікросервіс WILD дозволяє розпізнати мову вхідного тексту з переліку 156 мов, які використовуються в інтернеті, за допомогою бібліотеки wiki-lang-detect.
Приклад HTTP-запиту:
$ curl -X POST -H "Content-Type: application/json" -d "{'text': 'Несе Галя'}" http://localhost:8080/
Мікросервіс токенізації українських текстів на базі бібліотеки tokenize-uk.