使用tf*idf实现对文档集合的检索-创新互联
步骤:
为西工等地区用户提供了全套网页设计制作服务,及西工网站建设行业解决方案。主营业务为做网站、网站制作、西工网站设计,以传统方式定制建设网站,并提供域名空间备案等一条龙服务,秉承以专业、用心的态度为用户提供真诚的服务。我们深信只要达到每一位用户的要求,就会得到认可,从而选择与我们长期合作。这样,我们也可以走得更远!读取三篇文档1.txt,2.txt,3.txt,里边的内容分别为“this is php”,“this is html html”,“this is java”
分词,并统计词频tf
计算文档频率df
计算每篇文档的特征向量
计算搜索词与文档的夹角余弦值
'; echo '第'.($i+1).'篇文档的相似度:'.$_cos[$i]; } arsort($_cos); foreach($_cos as $_key=>$_value){ echo '
'; echo '最符合的结果为第'.($_key+1).'篇文档'; break; } ?>
在浏览器运行的结果:
第1篇文档的特征向量: (0,0,1.09861228867,0,0)
第2篇文档的特征向量: (0,0,0,2.19722457734,0)
第3篇文档的特征向量: (0,0,0,0,1.09861228867)
第1篇文档的相似度:0
第2篇文档的相似度:0
第3篇文档的相似度:0.235702260396
最符合的结果为第3篇文档
另外有需要云服务器可以了解下创新互联cdcxhl.cn,海内外云服务器15元起步,三天无理由+7*72小时售后在线,公司持有idc许可证,提供“云服务器、裸金属服务器、高防服务器、香港服务器、美国服务器、虚拟主机、免备案服务器”等云主机租用服务以及企业上云的综合解决方案,具有“安全稳定、简单易用、服务可用性高、性价比高”等特点与优势,专为企业上云打造定制,能够满足用户丰富、多元化的应用场景需求。
当前名称:使用tf*idf实现对文档集合的检索-创新互联
网站网址:http://scpingwu.com/article/cogjgh.html