全文检索luceneword_如何用java的lucene对数据库进行全文检索

『壹』全文检索工具有哪些

1. Lucene

Lucene的开发语言是java，也是Java家族中最为出名的一个开源搜索引擎，在Java世界中已经是标准的全文检索程序，它提供了完整的查询引擎和索引引擎，没有中文分词引擎，需要自己去实现，因此用Lucene去做一个搜素引擎需要自己去架构.另外它不支持实时搜索，但linkedin和twitter有分别对Lucene改进的实时搜素. 其中Lucene有一个C++移植版本叫CLucene，CLucene因为使用C++编写，所以理论上要比lucene快.
2. Sphinx

Sphinx是一个用C++语言写的开源搜索引擎，也是现在比较主流的搜索引擎之一，在建立索引的事件方面比Lucene快50%，但是索引文件比Lucene要大一倍，因此Sphinx在索引的建立方面是空间换取事件的策略，在检索速度上，和lucene相差不大，但检索精准度方面Lucene要优于Sphinx，另外在加入中文分词引擎难度方面，Lucene要优于Sphinx.其中Sphinx支持实时搜索，使用起来比较简单方便.
3. Xapian

Xapian是一个用C++编写的全文检索程序，它的api和检索原理和lucene在很多方面都很相似，算是填补了lucene在C++中的一个空缺.
4. Nutch

Nutch是一个用java实现的开源的web搜索引擎，包括爬虫crawler，索引引擎，查询引擎. 其中Nutch是基于Lucene的，Lucene为Nutch提供了文本索引和搜索的API.

对于应该使用Lucene还是使用Nutch，应该是如果你不需要抓取数据的话，应该使用Lucene，最常见的应用是：你有数据源，需要为这些数据提供一个搜索页面，在这种情况下，最好的方式是直接从数据库中取出数据，并用Lucene API建立索引.
5. DataparkSearch

DataparkSearch是一个用C语言实现的开源的搜索引擎. 其中网页排序是采用神经网络模型. 其中支持HTTP，HTTPS，FTP，NNTP等下载网页.包括索引引擎，检索引擎和中文分词引擎(这个也是唯一的一个开源的搜索引擎里有中文分词引擎).能个性化定制搜索结果，拥有完整的日志记录.
6. Zettair

Zettair是根据Justin Zobel的研究成果为基础的全文检索实验系统.它是用C语言实现的. 其中Justin Zobel在全文检索领域很有名气，是业界第一个系统提出倒排序索引差分压缩算法的人，倒排列表的压缩大大提高了检索和加载的性能，同时空间膨胀率也缩小到相当优秀的水平. 由于Zettair是源于学术界，代码是由RMIT University的搜索引擎组织写的，因此它的代码简洁精炼，算法高效，是学习倒排索引经典算法的非常好的实例. 其中支持linux，windows，mac os等系统.
7. Indri

Indri是一个用C语言和C++语言写的全文检索引擎系统，是由University of Massachusetts和Carnegie Mellon University合作推出的一个开源项目. 特点是跨平台，API接口支持Java，PHP，C++.
来自网络。

『贰』哪位java高手可以告我如何实现对每一个word文档进行全文检索

首先通过POI读取word，然后用lucene创建索引，索引结构：name：文件名，text：内容。创建好索引之后，搜索，然后统计搜索结果。
POI读取word参考：
http://poi.apache.org/hwpf/index.html
http://www.laokboke.net/2011/10/29/java-poi-word/
lucene参考：
http://lucene.apache.org/
http://www.ibm.com/developerworks/cn/java/j-lo-lucene1/

代码自己写的肯定是最符合需要的。
如果有问题可以随时交流，我以前也做过用lucene处理类似问题的。

『叁』 Lucene doc 文件格式详解

本文及后面关于Lucene的文章所采用的lucene 版本为8.1.0.

doc 文件主要用于保存term的倒排表信息，包括docId倒排链及term在docId的term freq信息等。倒排链是Lucene 进行全文检索的核心数据结构，请特别关注这个数据结构

请参考 Lucene tim文件格式详解第三部分

文件头部分主要内容为标识此文件类型为 Lucene50PostingsWriterDoc , 源码部分在 Lucene50PostingsWriter 的123行，主要内容如下

开始本部分阅读时，请注意一个在第3部分得到的结果及含义, 现在开始分析该部分内容

下面为term的doc信息。主要逻辑是: 对于term的doc freq = 1的term来说，doc文件不保存这个term的doc信息，而是在 tim 文件中保存，doc 文件只保存doc freq > 1的term。在范例中，只有nice的doc freq > 1, 故只保存nice的doc倒排链

关于其它term(term freq = 1)的编码方式，请参考 tim 文件相应的格式内容

footer区主要有以下内容

『肆』如何用java的lucene对数据库进行全文检索

lucene是一个公用的全文索引组件，它的目标是把各种各样格式的数据转化成lucene特有的索引文件格式，这样才能通过lucene的高速检索机制进行全文检索。

你的数据来源可以是关系数据库，可以是word、execl、txt文档，可以是html网页，对于这些数据源，你必须将它们内部的数据读取出来，并封装成lucene的document实例，之后让lucene帮你构建索引。

举个例子：你的有一个用户数据库，里面存储了几十万的用户信息，你现在要对这个数据库进行全文索引，那么你要做的事情是：

1.写一段传统的JDBC程序，讲每条的用户信息从数据库读取出来
2.针对每条用户记录，建立一个lucene document
Document doc = new Document();
并根据你的需要，将用户信息的各个字段对应luncene document中的field 进行添加，如：
doc.add(new Field("NAME","USERNAME", Field.Store.YES,Field.Index.UN_TOKENIZED));
然后将该条doc加入到索引中，如： luceneWriter.addDocument(doc);
这样就建立了lucene的索引库
3.编写对索引库的搜索程序（看lucene文档），通过对lucene的索引库的查找，你可以快速找到对应记录的ID
4.通过ID到数据库中查找相关记录

上面阐述了lucene的大体用法，不知道是不是说的很清楚。

热点内容

淘宝网络电话叫什么发布：2025-04-29 04:20:45 浏览：231

编程要读哪些书发布：2025-04-29 04:11:59 浏览：134

如何在手机上新建文件夹里添文件发布：2025-04-29 03:58:15 浏览：292

先锋w10刷安卓系统发布：2025-04-29 03:47:40 浏览：787

java设置过期日期发布：2025-04-29 03:42:38 浏览：114

新版本抖音怎么看我的数据比例发布：2025-04-29 03:42:02 浏览：946

什么是3G网络3G的发展史发布：2025-04-29 03:33:59 浏览：269

如何使用ps把图片的文件大小弄小发布：2025-04-29 03:33:14 浏览：880

安卓系统根目录文件夹发布：2025-04-29 03:31:53 浏览：900

手表怎么设置蜂窝网络发布：2025-04-29 03:21:49 浏览：51

旧爱勾搭app还有吗发布：2025-04-29 03:19:32 浏览：141

日外语言编程软件哪个好发布：2025-04-29 03:18:57 浏览：950

小论文发表了但是数据错误怎么办发布：2025-04-29 03:13:53 浏览：952

注册表禁止启动程序运行发布：2025-04-29 03:08:58 浏览：705

网络优化总体流程图发布：2025-04-29 03:02:22 浏览：735

前端程序员简历模板发布：2025-04-29 03:02:15 浏览：706

蜂巢积木编程机器人怎么样发布：2025-04-29 03:00:34 浏览：561

微信小程序tips 发布：2025-04-29 02:57:34 浏览：117

油印文件有哪些发布：2025-04-29 02:57:32 浏览：854

java线程买票案例发布：2025-04-29 02:57:31 浏览：672

导航:首页 > 文件教程 > 全文检索luceneword

全文检索luceneword

与全文检索luceneword相关的资料

友情链接