首页 > 代码库 > Lucene段合并的参数估计

Lucene段合并的参数估计

使用lucene默认的TieredMergePolicy,索引更新时最大会占用多少硬盘,要看mergepolicy何时触发merge。
从代码中可以看出,只有当eligible.size() >= allowedSegCountInt时才触发。
eligible是大小不超过阈值的段集合,allowedSegCountInt计算如下,设segsPerTier为a,maxMergeAtOnce为b,bytesLeft(以M为单位)每次减去2b, 2(a^2)(b^2),...(等比数列),allowedSegCountInt就加上a,直到bytesLeft减到0为止 >由此算出:
n <= log(ab,1-bytesLeft(1-ab)/2b)
allowedSegCountInt = ceil(a*log(ab,1-bytesLeft(1-ab)/2b)),
使用默认的设置a=10,b=10,如果bytesLeft=10000(10G),则allowedSegCountInt=24,也就是说只有小段数量超过24时才触发merge。
保持ab乘积不变,a(segsPerTier)越小越容易触发合并。

Lucene段合并的参数估计