Word embeddings (Word2Vec, GloVe, LexVec)

На базі зібраних нами корпусів новин, статей, художньої літератури, законів та юридичних текстів ми обчислили найпоширеніши word embeddings: Word2Vec (та його покращену версію LexVec) й GloVe. Ми вирішили опублікувати ці моделі, тому що їх обчислення займає доволі багато часу та серверних ресурсів.

Ми створили окремі моделі для кожної категорії текстів з 300d векторами. Ми також обчислили їх для лематизованих версій тих самих корпусів. Якщо вам потрібні інші налаштування моделей — скористайтеся корпусами, що ми підготували, та обчисліть моделі згідно ваших потреб.

За допомоги Тетяни Кодлюк для оцінки якості побудованих векторів були створені тестові набори, аналогичні тим, які існували для англійської мови.
Також були проведені оцінки якості, їх результати можна подивтись тут.

Параметри word2vec для малих корпусів (художня література):

./word2vec_standalone.py -size 300 -negative 7 -window 4 -threads 6 -min_count 10 -iter 5 -alpha 0.030

Параметри lexvec для малих корпусів (художня література):

./lexvec -dim 300 -verbose 2 -negative 7 -subsample 1e-3 -window 4 -threads 6 -minfreq 10 -iterations 5 -alpha 0.030

Параметри GloVe для малих корпусів (художня література):

MEMORY=4.0
VOCAB_MIN_COUNT=10
VECTOR_SIZE=300
MAX_ITER=15
WINDOW_SIZE=9
BINARY=2
NUM_THREADS=12
X_MAX=10:

Для великих корпусів minfreq дорівнює 25