forked from fxsjy/jieba
-
Notifications
You must be signed in to change notification settings - Fork 0
/
Changelog
126 lines (91 loc) · 4.25 KB
/
Changelog
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
2013-07-01: version 0.31
1. 修改了代码缩进格式,遵循PEP8标准
2. 支持Jython解析器,感谢 @piaolingxue
3. 修复中英混合词汇不能识别数字在前词语的Bug
4. 部分代码重构,感谢 @chao78787
5. 多进程并行分词模式下自动检测CPU个数设置合适的进程数,感谢@linkerlin
6. 修复了0.3版中jieba.extra_tags方法对whoosh模块的错误依赖
2013-07-01: version 0.30
==========================
1) 新增jieba.tokenize方法,返回每个词的起始位置
2) 新增ChineseAnalyzer,用于支持whoosh搜索引擎
3)添加了更多的中英混合词汇
4)修改了一些py文件的加载方法,从而支持py2exe,cxfree打包为exe
2013-06-17: version 0.29.1
==========================
1) 优化了viterbi算法的代码,分词速度提升15%
2) 去除了词典中的一些低质词
2013-06-07: version 0.29
==========================
1) 提升了finalseg子模块命名体识别的准确度
2) 修正了一些badcase
2013-06-01: version 0.28.4
==========================
1) 修正了一些badcase
2) add wraps decorator, by @cloudaice
3) unittest, by @cloudaice
2013-05-02: version 0.28.3
==========================
1) 修正了临时cache文件生成在pypy解析器下出错的问题
2013-04-28: version 0.28.2
==========================
1) 修正了initialize函数默认参数绑定的bug.
2013-04-27: version 0.28
========================
1) 新增词典lazy load功能,用户可以在'import jieba'后再改变词典的路径. 感谢hermanschaaf
2) 显示词典加载异常时错误的词条信息. 感谢neuront
3) 修正了词典被vim编辑后会加载失败的bug. 感谢neuront
2013-04-22: version 0.27
========================
1) 新增并行分词功能,可以在多核计算机上显著提高分词速度
2) 修正了“的”字频过高引起的bug;修正了对小数点和下划线的处理
3) 修正了python2.6存在的兼容性问题
2013-04-07: version 0.26
========================
1) 改进了对标点符号的处理,之前的版本会过滤掉所有的标点符号;
2) 允许用户在自定义词典中添加词性;
3) 改进了关键词提取的功能jieba.analyse.extract_tags;
4) 修复了一个在pypy解释器下运行的bug.
2013-02-18: version 0.25
========================
1)支持繁体中文的分词
2)修正了多python进程时生成cache文件失败的bug
2012-12-28: version 0.24
========================
1) 解决了没有标点的长句子分词效果差的问题,问题在于连续的小概率乘法可能会导致浮点下溢或为0.
2) 修复了0.23的全模式下英文分词的bug
2012-12-12: version 0.23
========================
1) 修复了之前版本不能识别中英混合词语的问题
2012-11-28: version 0.22
========================
1) 新增jieba.cut_for_search方法, 该方法在精确分词的基础上对“长词”进行再次切分,适用于搜索引擎领域的分词,比精确分词模式有更高的召回率。
2) 开始支持Python3.x版。 之前一直是只支持Python2.x系列,从这个版本起有一个单独的jieba3k
2012-11-23: version 0.21
========================
1) 修复了全模式分词中散字过多的问题
2) 用户自定义词典函数load_userdict支持file-like object作为输入
2012-11-06: version 0.20
========================
1) 新增词性标注功能
2012-10-25: version 0.19
========================
1) 提升了模块加载的速度
2) 增加了用户自定义词典的接口
2012-10-16: version 0.18
========================
1) 增加关键词提取功能
2012-10-12: version 0.17
========================
1) 将词典文件dict.txt排序后存储,提升了Trie树构建速度,使得组件初始化时间缩短了10%;
2) 增强了人名词语的训练,增强了未登录人名词语的识别能力
2012-10-09: version 0.16
========================
1)将求最优切分路径的记忆化递归搜索算法改用循环实现,使分词速度提高了15%
2) 修复了Viterbi算法实现上的一个Bug
2012-10-07: version 0.14
========================
1) 结巴分词被发布到了pypi,用户可以通过easy_install或者pip快速安装该组件;
2) 合并了搜狗开源词库2006版,删除了一些低频词
3) 优化了代码,缩短了程序初始化时间。
4) 增加了在线效果演示