功能 1)：分词

jieba.cut方法接受两个输入参数: 1) 第一个参数为需要分词的字符串 2）cut_all参数用来控制是否采用全模式
jieba.cut_for_search方法接受一个参数：需要分词的字符串,该方法适合用于搜索引擎构建倒排索引的分词，粒度比较细
注意：待分词的字符串可以是gbk字符串、utf-8字符串或者unicode
jieba.cut以及jieba.cut_for_search返回的结构都是一个可迭代的generator，可以使用for循环来获得分词后得到的每一个词语(unicode)，也可以用list(jieba.cut(...))转化为list

 1 #encoding=utf-8
 2 import jieba
 3 
 4 seg_list = jieba.cut("我来到北京清华大学",cut_all=True)
 5 print "Full Mode:", "/ ".join(seg_list) #全模式
 6 
 7 seg_list = jieba.cut("我来到北京清华大学",cut_all=False)
 8 print "Default Mode:", "/ ".join(seg_list) #精确模式
 9 
10 seg_list = jieba.cut("他来到了网易杭研大厦") #默认是精确模式
11 print ", ".join(seg_list)
12 
13 seg_list = jieba.cut_for_search("小明硕士毕业于中国科学院计算所，后在日本京都大学深造") #搜索引擎模式
14 print ", ".join(seg_li

output

【全模式】: 我/ 来到/ 北京/ 清华/ 清华大学/ 华大/ 大学

【精确模式】: 我/ 来到/ 北京/ 清华大学

【新词识别】：他, 来到, 了, 网易, 杭研, 大厦    (此处，“杭研”并没有在词典中，但是也被Viterbi算法识别出来了)

【搜索引擎模式】： 小明, 硕士, 毕业, 于, 中国, 科学, 学院, 科学院, 中国科学院, 计算, 计算所, 后, 在, 日本, 京都, 大学, 日本京都大学,

功能 2) ：添加自定义词典

jieba笔记

声明：以上内容来自用户投稿及互联网公开渠道收集整理发布，本网站不拥有所有权，未作人工编辑处理，也不承担相关法律责任，若内容有误或涉及侵权可进行投诉：投诉/举报工作人员会在5个工作日内联系你，一经查实，本站将立刻删除涉嫌侵权内容。

联系
我们

首页 > 代码库 > jieba笔记

jieba笔记

功能 1)：分词

功能 2) ：添加自定义词典

看完仍有疑问？有类似问题直接问程序猿