首页 > 代码库 > 统计英文文档频率前n单词
统计英文文档频率前n单词
#coding:utf-8 #!/usr/bin/python2.6 def statistic_eng_text(): ‘‘‘统计出英文文档中高频词汇‘‘‘ cnt = Counter() np = os.path.join(get_project_path(),‘doc‘,‘jack lodon.txt‘) ff = open(np,‘r‘) words = ff.read() format_text = re.split(‘[\s\ \\,\;\.\!\n]+‘,words) for w in format_text:#比较的时候注意了大小写,其中有一个 the是以大写字母开始的,所以在notepad中统计出来了,而在代码中没有统计出来 cnt[w.lower()] += 1#这里需要把单词进行一个转换,避免大小写导致的不匹配 print cnt.most_common(5) if __name__ == ‘__main__‘: statistic_eng_text()
统计英文文档频率前n单词
声明:以上内容来自用户投稿及互联网公开渠道收集整理发布,本网站不拥有所有权,未作人工编辑处理,也不承担相关法律责任,若内容有误或涉及侵权可进行投诉: 投诉/举报 工作人员会在5个工作日内联系你,一经查实,本站将立刻删除涉嫌侵权内容。