统计英文文档频率前n单词

首页 > 代码库 > 统计英文文档频率前n单词

统计英文文档频率前n单词

2024-10-25 23:38:39 207人阅读

#coding:utf-8
#!/usr/bin/python2.6


def statistic_eng_text():
    ‘‘‘统计出英文文档中高频词汇‘‘‘
    cnt = Counter()
    np = os.path.join(get_project_path(),‘doc‘,‘jack lodon.txt‘)
    ff = open(np,‘r‘)
    words = ff.read()
    format_text = re.split(‘[\s\ \\,\;\.\!\n]+‘,words)

    for w in format_text:#比较的时候注意了大小写，其中有一个 the是以大写字母开始的，所以在notepad中统计出来了，而在代码中没有统计出来

        cnt[w.lower()] += 1#这里需要把单词进行一个转换，避免大小写导致的不匹配
    print cnt.most_common(5)

if __name__ == ‘__main__‘:
    statistic_eng_text()

统计英文文档频率前n单词

声明：以上内容来自用户投稿及互联网公开渠道收集整理发布，本网站不拥有所有权，未作人工编辑处理，也不承担相关法律责任，若内容有误或涉及侵权可进行投诉：投诉/举报工作人员会在5个工作日内联系你，一经查实，本站将立刻删除涉嫌侵权内容。

联系
我们

首页 > 代码库 > 统计英文文档频率前n单词

统计英文文档频率前n单词

看完仍有疑问？有类似问题直接问程序猿