首页 > 代码库 > Lucene41PostingWriter源码分析

Lucene41PostingWriter源码分析

原来看lucene4.0的posting格式(http://blog.csdn.net/jollyjumper/article/details/30017581),发现这还是比较简单的VInt格式,据说VInt压缩解压都不错(medium),但解压时分支太多打乱CPU流水线因而不够高效,流行的索引压缩有很多,for,simple9,simple16,PForDelta是比较流行的一种,发现lucene 4.1就实现了一个for编码的postings format。从lucene nightly build(lucene ci)结果上看,这个change对于常见的boolean and query qps有大约20%的提升。

tip文件中保存的TermState有以下几个状态:

docStartFP和上个termstate.docStartFP的差值,

payStartFP的差值,

singletonDocID(只有一个doc时才保存,不然是-1),

lastPosBlockOffset(上一个pos块的位置),

skipoffset

4.0中除了向tip,tim文件中写入内容外,就是向freq和prox两个文件输出。doc delta,doc freq是往doc文件输出,pos向pos文件中输出,payload,offset向pay文件中输出。

doc文件中每加128个doc,缓存对应doc delta buffer和freq buffer,使用for encoding写入doc文件(ForUtil),最后生育的不足128个的doc按照vint写入。

添加position时,同样时每128个position一个block,posDeltaBuffer写入pos文件中,payloadLengthbuffer同样一个block写入payload文件中,接着跟着payload长度(vint)和payload数组,然后是offsetStartDeltaBuffer和offsetLengthBuffer,因此offset在这个版本中归入payload中。