lucene介绍

作者：853530960_eafb59 | 来源：互联网 | 2023-07-24 14:20

lLucene是apache软件基金会4jakarta项目组的一个子项目，是一个开发源代码的全文检索引擎工具包。它是一个很强大的搜索库，能轻易的将搜索功能加入到任何程序中。能对文档

　　lLucene是apache软件基金会4 jakarta项目组的一个子项目，是一个开发源代码的全文检索引擎工具包。它是一个很强大的搜索库，能轻易的将搜索功能加入到任何程序中。能对文档搜索，文档内信息搜索或相关文档进行搜索等操作，源码由java实现，是一个成熟，卡原的检索工具。

　　lucene的整体架构如下：

　　　　　　　　　　　　技术分享

　　从图中，我们可以看出，主要分为两个大步骤，一个是建立索引的过程，一个是通过关键字查找索引搜索的过程。

　　索引过程，可以从DB，web，文件系统等来源抓取原始数据，对该数据通过以某种方式，对某些内容，建立索引文档。

　　搜索过程，通过对用户搜索的关键字，通过分词等构造得到查询关键字的索引，进而从索引库中找到相关内容。

从构建索引和搜索两个过程，来介绍lucene的使用。

首先，得了解使用lucene的几个基本类。

　　索引过程：

　　1，indexWirter

　　indexWriter是写索引的关键组件。这个类负责创建，打开或关闭索引，并想索引中写入内容。不过IndexWrier需要一个空间来储存内容，这个由Directory完成。

　　2，Directory

　　directory描述了lucene的储存路径。每个directory对应一个索引库。

　　3，Analysis

　　该类是对文档索引之前的操作，文档再索引之前会经过分词器的处理，比如一行“hello world"，对空格处理的分词器就将该内容分成两个部分”hello“，”world",大写也有可能会都变成小写。这一些在索引之前的一些操作由分词器来操作。

　　4,Field

　　该类是保存一个文档中的的基本单位，也可以理解为一个文档中的一个属性。lucene中有不同的Field类，比如字符串类型，整型等，同时Field还有很多设置选项，比如该Field是否存储，是否被索引，已经存储格式等。是Document中携带信息单元。

　　5，document

　　document字面上意思就是一个文档，一个document是索引保存记录的基本单位，索引中保存的位置什么的就是document的位置信息，和db比较，可以理解为一个表中的一行记录。它代表一些域Field的集合。

　　下面是一个索引过程的基本代码（lucene版本5.4.1）

            Analyzer analyzer = new SimpleAnalyzer();

            IndexWriterConfig config = new IndexWriterConfig(analyzer);
            config.setRAMBufferSizeMB(bufferMB);
            config.setMaxBufferedDocs(bufferSize);

            String path = "D:\\repositoryName";
            Directory index = FSDirectory.open(Paths.get(path));
            IndexWriter writer = new IndexWriter(index, config);

            for (int i = 0; i <100; i++) {
                Document doc = new Document();
                doc.add(newStringField("msid", record.getMsid(),
                        Field.Store.YES));
                doc.add(new StringField("city", record.getCity(),
                        Field.Store.YES));
                writer.add(doc);

            }
            writer.close();

　　检索过程：

　　1，Term

　　Term是搜索功能的基本单元，和构建索引过程的Field类似，不过Field可能会被分词成几个单元。term包含的是搜索的字段名称，以及对应搜索的内容。

　　2，IndexReader,indexSearcher

　　indexReader与indexWriter想对应。indexWriter是对索引的写入，而indexReader是对索引的读取。indexSearcher则是在indexReader上构建的一个搜索入口对象。

　　3，Query

　　query指的就是查询，query是指的查询的条件，有一个或多个Term构成。同时query有很多子类，分别对应不同类型，不同范围的查询。

　　4，TopDocs

　　topDocs是查询结果集，indexSearcher查询条件query得到的结果。包含的是结果document的id。

　　搜索过程基本代码：

        String path ="D:\\repositoryName";
        Directory index = FSDirectory.open(Paths.get(path));
        IndexReader reader = DirectoryReader.open(index);
        
        IndexSearcher searcher = new IndexSearcher(reader);
        
        Query query = new TermQuery(new Term("msid","ttt"));
        List retList = new ArrayList();
        
        TopScoreDocCollector collector = TopScoreDocCollector.create(maxResultCount);
        searcher.search(query, collector);
        
          ScoreDoc[] hits = collector.topDocs().scoreDocs;
          
        for(int i=0;ii) {
              int docId = hits[i].doc;

              Document document = searcher.doc(docId);
              String msid = document.get("msid");
        }
        
        reader.close();

以上是lucene的一个最基本的功能构建索引与搜索的简单代码，能快速入手使用。

lucene介绍

推荐阅读

php
Framework7：构建跨平台移动应用的高效框架

Framework7 是一个开源免费的框架，适用于开发混合移动应用（原生与HTML混合）或iOS&Android风格的Web应用。此外，它还可以作为原型开发工具，帮助开发者快速创建应用原型。 ... [详细]

蜡笔小新 2024-11-12 14:47:56
php
CMD 批处理脚本示例

本文介绍了如何使用 CMD 批处理脚本进行文件操作，包括将指定目录下的 PHP 文件重命名为 HTML 文件，并将这些文件复制到另一个目录。 ... [详细]

蜡笔小新 2024-11-12 14:26:04
php
Spark中使用map或flatMap将DataSet[A]转换为DataSet[B]时Schema变为Binary的问题及解决方案

本文探讨了在使用Spark的map或flatMap算子将一个数据集转换为另一个数据集时，遇到的Schema变为Binary的问题，并提供了详细的解决方案。 ... [详细]

蜡笔小新 2024-11-12 08:06:20
php
秒建一个后台管理系统？用这5个开源免费的Java项目就够了

秒建一个后台管理系统？用这5个开源免费的Java项目就够了 ... [详细]

蜡笔小新 2024-11-12 03:21:33
php
MySQL查询执行流程详解

MySQL的查询执行流程涉及多个关键组件，包括连接器、查询缓存、分析器和优化器。在服务层，连接器负责建立与客户端的连接，查询缓存用于存储和检索常用查询结果，以提高性能。分析器则解析SQL语句，生成语法树，而优化器负责选择最优的查询执行计划。这一流程确保了MySQL能够高效地处理各种复杂的查询请求。 ... [详细]

蜡笔小新 2024-11-11 16:48:32
php
使用Jsoup解析并遍历HTML文档结构

使用Jsoup解析并遍历HTML文档时，该库能够高效地生成一个清晰、规范的解析树，即使源HTML文档存在格式问题。Jsoup具备强大的容错能力，能够处理多种异常情况，如未闭合的标签等，确保解析结果的准确性和完整性。 ... [详细]

蜡笔小新 2024-11-11 21:30:03
php
未加载符号表，请使用“file”命令加载目标文件以进行调试。

在使用Eclipse进行调试时，如果遇到未解析的断点（unresolved breakpoint）并显示“未加载符号表，请使用‘file’命令加载目标文件以进行调试”的错误提示，这通常是因为调试器未能正确加载符号表。解决此问题的方法是通过GDB的`file`命令手动加载目标文件，以便调试器能够识别和解析断点。具体操作为在GDB命令行中输入 `(gdb) file `。这一步骤确保了调试环境能够正确访问和解析程序中的符号信息，从而实现有效的调试。 ... [详细]

蜡笔小新 2024-11-11 18:21:47
input
LeetCode 有效回文串 II：深入解析与优化算法

在 LeetCode 的“有效回文串 II”问题中，给定一个非空字符串 `s`，允许删除最多一个字符。本篇深入解析了如何判断删除一个字符后，字符串是否能成为回文串，并提出了高效的优化算法。通过详细的分析和代码实现，本文提供了多种解决方案，帮助读者更好地理解和应用这一算法。 ... [详细]

蜡笔小新 2024-11-11 17:40:42
php
系统数据实体验证异常：多个实体验证失败的错误处理与分析

在使用MVC和EF框架进行数据保存时，遇到了 `System.Data.Entity.Validation.DbEntityValidationException` 错误，表明存在一个或多个实体验证失败的情况。本文详细分析了该错误的成因，并提出了有效的处理方法，包括检查实体属性的约束条件、调试日志的使用以及优化数据验证逻辑，以确保数据的一致性和完整性。 ... [详细]

蜡笔小新 2024-11-11 16:54:45
php
装饰者模式（Decorator）：一种灵活的对象结构设计模式

装饰者模式（Decorator）是一种灵活的对象结构设计模式，旨在为单个对象动态地添加功能，而无需修改原有类的结构。通过封装对象并提供额外的行为，装饰者模式比传统的继承方式更加灵活和可扩展。例如，可以在运行时为特定对象添加边框或滚动条等特性，而不会影响其他对象。这种模式特别适用于需要在不同情况下动态组合功能的场景。 ... [详细]

蜡笔小新 2024-11-11 16:36:53
input
【Python 实战：汇率转换器 v1.02】

本项目通过Python编程实现了一个简单的汇率转换器v1.02。主要内容包括：1. Python的基本语法元素：（1）缩进：用于表示代码的层次结构，是Python中定义程序框架的唯一方式；（2）注释：提供开发者说明信息，不参与实际运行，通常每个代码块添加一个注释；（3）常量和变量：用于存储和操作数据，是程序执行过程中的重要组成部分。此外，项目还涉及了函数定义、用户输入处理和异常捕获等高级特性，以确保程序的健壮性和易用性。 ... [详细]

蜡笔小新 2024-11-11 16:34:26
php
Autofac高级应用实例解析

本文详细解析了Autofac在高级应用场景中的具体实现，特别是如何通过注册泛型接口的类来优化依赖注入。示例代码展示了如何使用 `builder.RegisterAssemblyTypes` 方法，结合 `typeof(IEventHandler).Assembly` 和 `Where` 过滤条件，动态注册所有符合条件的类，从而简化配置并提高代码的可维护性。此外，文章还探讨了这一方法在复杂系统中的实际应用及其优势。 ... [详细]

蜡笔小新 2024-11-11 15:48:02
php
华为云对象存储系统配置指南

本指南详细介绍了如何利用华为云对象存储服务构建视频点播（VoD）平台。通过结合开源技术如Ceph、WordPress、PHP和Nginx，用户可以高效地实现数据存储、内容管理和网站搭建。主要内容涵盖华为云对象存储系统的配置步骤、性能优化及安全设置，为开发者提供全面的技术支持。 ... [详细]

蜡笔小新 2024-11-11 14:29:52
php
VS2019 在创建 Windows 恢复点时出现卡顿问题及解决方法

在使用 Visual Studio 2019 时，有时会在创建 Windows 恢复点时遇到卡顿问题。这可能是由于频繁的自动更新导致的，每次更新文件大小可能达到 1-2GB。尽管现代网络速度较快，但这些更新仍可能对系统性能产生影响。本文将探讨该问题的原因，并提供有效的解决方法，帮助用户提升开发效率。 ... [详细]

蜡笔小新 2024-11-11 13:52:39
php
飞秋软件的OA消息接口服务系统

为了提升单位内部沟通效率，我们开发了一套飞秋软件与OA系统的消息接口服务系统。该系统能够将OA系统中的审批、通知等信息自动同步至飞秋平台，确保员工在使用飞秋进行日常沟通的同时，也能及时获取OA系统的各类重要信息，从而实现无缝对接，提高工作效率。 ... [详细]

蜡笔小新 2024-11-11 13:44:09

853530960_eafb59

这个家伙很懒，什么也没留下！

Tags | 热门标签

RankList | 热门文章