余弦相似性计算及python代码实现过程解析

站长资源 2024/11/25 佚名

2 0 1

A：西米喜欢健身

B：超超不爱健身，喜欢打游戏

step1:分词

A：西米／喜欢／健身

B：超超／不／喜欢／健身，喜欢／打／游戏

step2:列出两个句子的并集

西米／喜欢／健身／超超／不／打／游戏

step3:计算词频向量

A：[1,1,1,0,0,0,0]

B：[0,1,1,1,1,1,1]

step4:计算余弦值

余弦值越大，证明夹角越小，两个向量越相似。

step5:python代码实现

import jieba
import jieba.analyse
def words2vec(words1=None, words2=None):
 v1 = []
 v2 = []
 tag1 = jieba.analyse.extract_tags(words1, withWeight=True)
 tag2 = jieba.analyse.extract_tags(words2, withWeight=True)
 tag_dict1 = {i[0]: i[1] for i in tag1}
 tag_dict2 = {i[0]: i[1] for i in tag2}
 merged_tag = set(tag_dict1.keys()) | set(tag_dict2.keys())
 for i in merged_tag:
  if i in tag_dict1:
   v1.append(tag_dict1[i])
  else:
   v1.append(0)
  if i in tag_dict2:
   v2.append(tag_dict2[i])
  else:
   v2.append(0)
 return v1, v2
def cosine_similarity(vector1, vector2):
 dot_product = 0.0
 normA = 0.0
 normB = 0.0
 for a, b in zip(vector1, vector2):
  dot_product += a * b
  normA += a ** 2
  normB += b ** 2
 if normA == 0.0 or normB == 0.0:
  return 0
 else:
  return round(dot_product / ((normA**0.5)*(normB**0.5)) * 100, 2)  
def cosine(str1, str2):
 vec1, vec2 = words2vec(str1, str2)
 return cosine_similarity(vec1, vec2)
print(cosine('阿克苏苹果', '阿克苏苹果'))

以上就是本文的全部内容，希望对大家的学习有所帮助，也希望大家多多支持。

余弦,相似性,计算,python

广告合作：本站广告合作请联系QQ：858582 申请时备注：广告合作（否则不回）
免责声明：本站资源来自互联网收集,仅供用于学习和交流,请遵循相关法律法规,本站一切资源不代表本站立场,如有侵权、后门、不妥请联系本站删除！

评论“余弦相似性计算及python代码实现过程解析”

暂无评论...

www.wwsws.com 伏龙阁资源网

39,976影音资源

44,792技术资源

21,817软件资源

651,128站长资源

更新日志

2024年11月25日

余弦相似性计算及python代码实现过程解析

python2与python3爬虫中get与post对比解析

python中class的定义及使用教程

评论“余弦相似性计算及python代码实现过程解析”

更新日志

友情链接