热门标签 | HotTags
当前位置:  开发笔记 > 编程语言 > 正文

Solr第一讲——概述与入门

一、solr介绍1.什么是solrSolr是Apache下的一个顶级开源项目,采用Java开发,它是基于Lucene的全文搜索服务器。Solr可以独立运行在Jetty、Tomcat等这些Se

一、solr介绍

  1.什么是solr

  Solr 是Apache下的一个顶级开源项目,采用Java开发,它是基于Lucene的全文搜索服务器Solr可以独立运行在Jetty、Tomcat等这些Servlet容器中。

  Solr提供了比Lucene更为丰富的查询语言,同时实现了可配置、可扩展,并对索引、搜索性能进行了优化

  实现方案: 

    索引流程:solr客户端(浏览器、java程序)可以向solr服务端发送POST请求,请求内容是包含Field等信息的一个xml文档,通过该文档,solr实现对索引的维护(增删改)

    搜索流程:solr客户端(浏览器、java程序)可以向solr服务端发送GET请求,solr服务器返回一个xml文档。

    Solr同样没有视图渲染的功能

   2.solr和lucene的区别

  Lucene是一个开放源代码的全文检索引擎工具包,它不是一个完整的全文检索应用。Lucene仅提供了完整的查询引擎和索引引擎,目的是为软件开发人员提供一个简单易用的工具包,以方便的在目标系统中实现全文检索的功能,或者以Lucene为基础构建全文检索应用。

   Solr的目标是打造一款企业级的搜索引擎系统,它是基于Lucene一个搜索引擎服务,可以独立运行,通过Solr可以非常快速的构建企业的搜索引擎,通过Solr也可以高效的完成站内搜索功能。

   

  最核心得区别是由工具包变成了独立服务,并且索引管理更加方便,可以集群!

二、solr安装配置

  1.下载

  Solr和lucene的版本是同步更新的,最新的版本是5.2.1

  本课程使用的版本:4.10.3

    下载地址:http://archive.apache.org/dist/lucene/solr/

    下载版本:4.10.3

  Linux下需要下载lucene-4.10.3.tgz,windows下需要下载lucene-4.10.3.zip。 

    下载lucene-4.10.3.zip并解压:

  官网:https://lucene.apache.org/

  

   各目录概述如下:

  

  2.安装配置

  solr 需要运行在一个Servlet容器中,Solr4.10.3要求jdk使用1.7以上,Solr默认提供Jetty(java写的Servlet容器),本教程使用Tocmat作为Servlet容器。

  SolrCore的配置

    1.SolrCore和SolrHome

    SolrHome是Solr运行的主目录,该目录中包括了多个SolrCore目录。SolrCore目录中包含了运行Solr实例所有的配置文件和数据文件,Solr实例就是SolrCore

    一个SolrHome可以包括多个SolrCore(Solr实例),每个SolrCore提供单独的搜索和索引服务。  

    每一个solrcore都可以单独对外提供搜索和索引服务。

    多个solrcore之间没有关系。

    2.solr界面简介

  

    Dashboard 

      仪表盘,显示了该Solr实例开始启动运行的时间、版本、系统资源、jvm等信息。

     Logging

      Solr运行日志信息

     Cloud     

      Cloud即SolrCloud,即Solr云(集群),当使用Solr Cloud模式运行时会显示此菜单

     Core Admin

      Solr Core的管理界面。在这里可以添加SolrCore实例

     java properties

      Solr在JVM 运行环境中的属性信息,包括类路径、文件编码、jvm内存设置等信息。

     Tread Dump

       显示Solr Server中当前活跃线程信息,同时也可以跟踪线程运行栈信息。

    Core selector(重点)

      Analysis(重点)

      

      通过此界面可以测试索引分析器和搜索分析器的执行情况。

      注:solr中,分析器是绑定在域的类型中的

      dataimport

      可以定义数据导入处理器,从关系数据库将数据导入到Solr索引库中。

      默认没有配置,需要手工配置。   

    Document(重点)  

      通过/update表示更新索引,solr默认根据id(唯一约束)域来更新Document的内容,如果根据id值搜索不到id域则会执行添加操作,如果找到则更新

      通过此菜单可以创建索引、更新索引、删除索引等操作,界面如下:

      

     Query(重点)   

    通过/select执行搜索索引,必须指定“q”查询条件方可搜索。

    

 

  solr的详细配置与教程请参见 易百教程:http://www.yiibai.com/solr/apache_solr_on_windows_environment.html#article-start

               solr中国:https://www.solr.cc/blog/

三、solr的基本使用  

  1.schema文件  

  在schema.xml文件中,主要配置了solrcore的一些数据信息,包括Field和FieldType的定义等信息,

  在solr中Field和FieldType都需要先定义后使用

  注意:solr的各版本差异导致文件位置等可能会发生变化,比如这里搜索到的其中一个位置是(具体各文件待阅读文档):

    

 

  实例讲解:

    Field:定义Field

  <field name="title" type="text_simple" indexed="true" stored="true" multiValued="true"/>

  其中:(与lucene的概念是基本相通的)

      name——指定域的名称

    type——指定域的类型(用哪个分词器等)

    indexed——是否索引

    stored——是否存储

    multiValued——是否多值(比如商品信息中一个商品有多张图片,一个Field像存储多个值的话,必须将multiValued设置为true

  dynamicField:动态域

 <dynamicField name="*_i"  type="int"    indexed="true"  stored="true"/> 

  Name——指定动态域的命名规则,此例中匹配i为后缀的

   uniqueKey:唯一键

<uniqueKey>iduniqueKey>

  其中的id是在Field标签中已经定义好的域名,而且该域要设置为requiredtrue 

  一个schema.xml文件中必须有且仅有一个唯一键

   copyField:复制域

 

<copyField source="cat" dest="text"/>

  Source:要复制的源域的域名

  Dest:目标域的域名

  由dest指的的目标域,必须设置multiValued为true。

  可以通过复制将多个域复制到一个域进行操作

   FieldType:定义域的类型

 <fieldType name="text_general" class="solr.TextField" positionIncrementGap="100">
<analyzer type="index">
<tokenizer class="solr.StandardTokenizerFactory"/>
<filter class="solr.StopFilterFactory" ignoreCase="true" words="stopwords.txt" />

<filter class="solr.LowerCaseFilterFactory"/>
analyzer>
<analyzer type="query">
<tokenizer class="solr.StandardTokenizerFactory"/>
<filter class="solr.StopFilterFactory" ignoreCase="true" words="stopwords.txt" />
<filter class="solr.SynonymGraphFilterFactory" synonyms="synonyms.txt" ignoreCase="true" expand="true"/>
<filter class="solr.LowerCaseFilterFactory"/>
analyzer>
fieldType>

        name——指定域的名称

    class——指定域的类型对应的solr类型

    analyzer——指定分析器

    tokenizer——分词器

    filter——过滤器

  2.中文分词器

  使用IKAnalyzer中文分析器

  基本步骤: 

     第一步:把IKAnalyzer2012FF_u1.jar添加到solr/WEB-INF/lib目录下。

    第二步:复制IKAnalyzer的配置文件和自定义词典和停用词词典到solr的classpath下。

    第三步:在schema.xml中添加一个自定义的fieldType,使用中文分析器。


<fieldType name="text_ik" class="solr.TextField">
<analyzer class="org.wltea.analyzer.lucene.IKAnalyzer"/>
fieldType>

    //这里的TextField与Lucene的TextField还是有差别的

    第四步:定义field,指定fieldtype属性为text_ik


<field name="title_ik" type="text_ik" indexed="true" stored="true" />
<field name="content_ik" type="text_ik" indexed="true" stored="false" multiValued="true"/>

 


推荐阅读
  • Java在运行已编译完成的类时,是通过java虚拟机来装载和执行的,java虚拟机通过操作系统命令JAVA_HOMEbinjava–option来启 ... [详细]
  • 这是原文链接:sendingformdata许多情况下,我们使用表单发送数据到服务器。服务器处理数据并返回响应给用户。这看起来很简单,但是 ... [详细]
  • 本文介绍了Web学习历程记录中关于Tomcat的基本概念和配置。首先解释了Web静态Web资源和动态Web资源的概念,以及C/S架构和B/S架构的区别。然后介绍了常见的Web服务器,包括Weblogic、WebSphere和Tomcat。接着详细讲解了Tomcat的虚拟主机、web应用和虚拟路径映射的概念和配置过程。最后简要介绍了http协议的作用。本文内容详实,适合初学者了解Tomcat的基础知识。 ... [详细]
  • 本文介绍了在Linux下安装和配置Kafka的方法,包括安装JDK、下载和解压Kafka、配置Kafka的参数,以及配置Kafka的日志目录、服务器IP和日志存放路径等。同时还提供了单机配置部署的方法和zookeeper地址和端口的配置。通过实操成功的案例,帮助读者快速完成Kafka的安装和配置。 ... [详细]
  • Java程序设计第4周学习总结及注释应用的开发笔记
    本文由编程笔记#小编为大家整理,主要介绍了201521123087《Java程序设计》第4周学习总结相关的知识,包括注释的应用和使用类的注释与方法的注释进行注释的方法,并在Eclipse中查看。摘要内容大约为150字,提供了一定的参考价值。 ... [详细]
  • 如何提高PHP编程技能及推荐高级教程
    本文介绍了如何提高PHP编程技能的方法,推荐了一些高级教程。学习任何一种编程语言都需要长期的坚持和不懈的努力,本文提醒读者要有足够的耐心和时间投入。通过实践操作学习,可以更好地理解和掌握PHP语言的特异性,特别是单引号和双引号的用法。同时,本文也指出了只走马观花看整体而不深入学习的学习方式无法真正掌握这门语言,建议读者要从整体来考虑局部,培养大局观。最后,本文提醒读者完成一个像模像样的网站需要付出更多的努力和实践。 ... [详细]
  • Week04面向对象设计与继承学习总结及作业要求
    本文总结了Week04面向对象设计与继承的重要知识点,包括对象、类、封装性、静态属性、静态方法、重载、继承和多态等。同时,还介绍了私有构造函数在类外部无法被调用、static不能访问非静态属性以及该类实例可以共享类里的static属性等内容。此外,还提到了作业要求,包括讲述一个在网上商城购物或在班级博客进行学习的故事,并使用Markdown的加粗标记和语句块标记标注关键名词和动词。最后,还提到了参考资料中关于UML类图如何绘制的范例。 ... [详细]
  • 本文介绍了使用AJAX的POST请求实现数据修改功能的方法。通过ajax-post技术,可以实现在输入某个id后,通过ajax技术调用post.jsp修改具有该id记录的姓名的值。文章还提到了AJAX的概念和作用,以及使用async参数和open()方法的注意事项。同时强调了不推荐使用async=false的情况,并解释了JavaScript等待服务器响应的机制。 ... [详细]
  • 如何用UE4制作2D游戏文档——计算篇
    篇首语:本文由编程笔记#小编为大家整理,主要介绍了如何用UE4制作2D游戏文档——计算篇相关的知识,希望对你有一定的参考价值。 ... [详细]
  • 本文介绍了在Mac上搭建php环境后无法使用localhost连接mysql的问题,并通过将localhost替换为127.0.0.1或本机IP解决了该问题。文章解释了localhost和127.0.0.1的区别,指出了使用socket方式连接导致连接失败的原因。此外,还提供了相关链接供读者深入了解。 ... [详细]
  • 标题: ... [详细]
  • 闭包一直是Java社区中争论不断的话题,很多语言都支持闭包这个语言特性,闭包定义了一个依赖于外部环境的自由变量的函数,这个函数能够访问外部环境的变量。本文以JavaScript的一个闭包为例,介绍了闭包的定义和特性。 ... [详细]
  • 本文介绍了RxJava在Android开发中的广泛应用以及其在事件总线(Event Bus)实现中的使用方法。RxJava是一种基于观察者模式的异步java库,可以提高开发效率、降低维护成本。通过RxJava,开发者可以实现事件的异步处理和链式操作。对于已经具备RxJava基础的开发者来说,本文将详细介绍如何利用RxJava实现事件总线,并提供了使用建议。 ... [详细]
  • 本文介绍了一个React Native新手在尝试将数据发布到服务器时遇到的问题,以及他的React Native代码和服务器端代码。他使用fetch方法将数据发送到服务器,但无法在服务器端读取/获取发布的数据。 ... [详细]
  • 上图是InnoDB存储引擎的结构。1、缓冲池InnoDB存储引擎是基于磁盘存储的,并将其中的记录按照页的方式进行管理。因此可以看作是基于磁盘的数据库系统。在数据库系统中,由于CPU速度 ... [详细]
author-avatar
qqq
这个家伙很懒,什么也没留下!
PHP1.CN | 中国最专业的PHP中文社区 | DevBox开发工具箱 | json解析格式化 |PHP资讯 | PHP教程 | 数据库技术 | 服务器技术 | 前端开发技术 | PHP框架 | 开发工具 | 在线工具
Copyright © 1998 - 2020 PHP1.CN. All Rights Reserved | 京公网安备 11010802041100号 | 京ICP备19059560号-4 | PHP1.CN 第一PHP社区 版权所有