python work2vec词向量应用方法汇总
前期工作可参阅:
1.python work2vec词向量训练可参考
2.可参考
work2vec词向量应用汇总(词语相似度、集合相似度、词向量计算等)
在已经获取模型的前提下可以进行:
-
1.获取每个词的词向量
model[computer] # raw numpy vector of a word
-
2支持词语的加减运算。(实际中可能只有少数例子比较符合)
model.most_similar(positive=[woman, king], negative=[man])
-
3计算两个词之间的余弦距离
model.similarity("好", "还行")
-
4计算余弦距离最接近“word”的10个词,或topn个词
model.most_similar("word")
model.similar_by_word(贪污, topn =100) 最接近的100个词
-
5计算两个集合之间的余弦似度
当出现某个词语不在这个训练集合中的时候,会报错 list_sim1 = model.n_similarity(list1, list2)
-
6.选出集合中不同类的词语
model.doesnt_match("breakfast cereal dinner lunch".split())
