zoukankan      html  css  js  c++  java
  • Solr学习总结(八)IK 中文分词的配置和使用

    最近,很多朋友问我solr 中文分词配置的问题,都不知道怎么配置,怎么使用,原以为很简单,没想到这么多朋友都有问题,所以今天就总结总结中文分词的配置吧。

      有的时候,用户搜索的关键字,可能是一句话,不是很规范。所以在 Solr 中查询出的时候,就需要将用户输入的关键字进行分词。

      目前有很多优秀的中文分词组件。本篇只以  IKAnalyzer 分词为例,讲解如何在 solr  中及集成中文分词,使用 IKAnalyzer的原因 IK 比其他中文分词维护的勤快,和 Solr 集成也相对容易。具体就不多介绍,这里直接solr 集成 IK 的方法。

      1. 首先,下载IKAnalyzer下载

        注意:以前老的IK 不支持Solr 5.3的版本 ,请注意下载最新的。

      2. 将ik的相关文件 拷贝到 webappssolrWEB-INFlib 目录下

      3. 在 solr_homemycore1confschema.xml 增加如下配置

    <!– 我添加的IK分词 –> <fieldType name=text_ik class=solr.TextField> <analyzer type=index isMaxWordLength=false class=org.wltea.analyzer.lucene.IKAnalyzer/> <analyzer type=query isMaxWordLength=true class=org.wltea.analyzer.lucene.IKAnalyzer/> </fieldType>

       同时,把需要分词的字段,设置为text_ik,

     
      <field name=id type=int indexed=true stored=true required=true multiValued=false /> <field name=name type=text_ik indexed=true stored=true required=true multiValued=false /> <field name=title type=text_ik indexed=true stored=true required=true multiValued=false /> <field name=category type=int indexed=true stored=true required=true multiValued=false /> <field name=content type=text_ik indexed=true stored=true required=true multiValued=false /> <field name=price type=double indexed=true stored=true required=true multiValued=false /> <field name=color type=string indexed=true stored=true required=true multiValued=false /> <field name=orderBy type=int indexed=true stored=true required=true multiValued=false /> <field name=updatetime type=date indexed=true stored=true required=true multiValued=false />
     

      4. 重启服务

        注意:如果之前已经创建了索引,需要将之前的索引删掉,重新创建分词后的索引。

      5. 在admin后台, analysis 下查看分词效果

        1. 中文分词效果

        

        2. 索引查询效果

        

      6. 配置IKAnalyzer分词器的扩展词典,停止词词典

        1. 将 文件夹下的IKAnalyzer.cfg.xml , ext.dic和stopword.dic 三个文件 复制到/webapps/solr/WEB-INF/classes 目录下,并修改IKAnalyzer.cfg.xml

     
        <?xml version=1.0 encoding=UTF-8?>     <!DOCTYPE properties SYSTEM http://java.sun.com/dtd/properties.dtd>     <properties>      <comment>IK Analyzer 扩展配置</comment>      <!–用户可以在这里配置自己的扩展字典 –>     <entry key=ext_dict>ext.dic;</entry>      <!–用户可以在这里配置自己的扩展停止词字典–>     <entry key=ext_stopwords>stopword.dic;</entry>     </properties>
     

        2. 在ext.dic 里增加自己的扩展词典,例如,婴儿奶粉3段

         

        注意:  记得将stopword.dic,ext.dic的编码方式为UTF-8 无BOM的编码方式。 

  • 相关阅读:
    第二次冲刺 站立会议7
    第二次冲刺 站立会议6
    第二次冲刺 站立会议5
    第二次冲刺 站立会议4
    第二次冲刺 站立会议3
    第二次冲刺 站立会议2
    第二次冲刺 站立会议1
    第一次冲刺 站立会议9
    第一次冲刺 站立会议8
    第一次冲刺 站立会议7
  • 原文地址:https://www.cnblogs.com/gangzhucoll/p/12778348.html
Copyright © 2011-2022 走看看