热门标签 | HotTags
当前位置:  开发笔记 > 编程语言 > 正文

mysqlfulltext中文_mysql5.6InnoDB全文索引FULLTEXT中文解决方案base64

mysql5.6innlDB在CHAR、VARCHAR、TEXT类型的列上可以定义全文索引,但因为无法中文分词所以对中文的支持很差,但从MySQL5.7

mysql5.6 innlDB 在CHAR、VARCHAR、TEXT类型的列上可以定义全文索引,但因为无法中文分词所以对中文的支持很差,但从MySQL5.7开始,MySQL内置了ngram全文检索插件,用来支持中文分词,并且对MyISAM和InnoDB引擎有效。

在没法升级5.7的情况下,5.6有变通的办法,就是将整句的中文拆分成单个汉字,并按urlencode、区位码、base64、拼音等进行编码使之以"字母+数字"的方式存储于数据库中。转换完达到如下的效果:

20180320121340671929.png

存储的是将汉字编码后的结果,用空格连起来,这样就可以使用5.6的全文索引来进行搜索,注意的是要将搜索的内容也先同样编码再进行搜索。

下面给出一种基于base64的汉字变换方式

/**

* 关键词整理函数(用作mysql的全文索引制作的搜索)

* 1.将字符串全角转半角、去空格、大写转小写、分成单个字符并base64编码、最后用空格连接类,方便mysql索引,做搜索关键字

* 2.将数字转全角做索引区分标识,全角数字为标识专用

**/

function keywords($str){//全角转半角

$str = strtr($str,[‘1‘ => ‘1‘,‘2‘ => ‘2‘,‘3‘ => ‘3‘,‘4‘ => ‘4‘,‘5‘ => ‘5‘,‘6‘ => ‘6‘,‘7‘ => ‘7‘,‘8‘ => ‘8‘,‘9‘ => ‘9‘,‘0‘ => ‘0‘,

‘A‘ => ‘A‘,‘B‘ => ‘B‘,‘C‘ => ‘C‘,‘D‘ => ‘D‘,‘E‘ => ‘E‘,‘F‘ => ‘F‘,‘G‘ => ‘G‘,‘H‘ => ‘H‘,‘I‘ => ‘I‘,‘J‘ => ‘J‘,‘K‘ => ‘K‘,‘L‘ => ‘L‘,‘M‘ => ‘M‘,‘N‘ => ‘N‘,‘O‘ => ‘O‘,‘P‘ => ‘P‘,‘Q‘ => ‘Q‘,‘R‘ => ‘R‘,‘S‘ => ‘S‘,‘T‘ => ‘T‘,‘U‘ => ‘U‘,‘V‘ => ‘V‘,‘W‘ => ‘W‘,‘X‘ => ‘X‘,‘Y‘ => ‘Y‘,‘Z‘ => ‘Z‘,

‘a‘ => ‘a‘,‘b‘ => ‘b‘,‘c‘ => ‘c‘,‘d‘ => ‘d‘,‘e‘ => ‘e‘,‘f‘ => ‘f‘,‘g‘ => ‘g‘,‘h‘ => ‘h‘,‘i‘ => ‘i‘,‘j‘ => ‘j‘,‘k‘ => ‘k‘,‘l‘ => ‘l‘,‘m‘ => ‘m‘,‘n‘ => ‘n‘,‘o‘ => ‘o‘,‘p‘ => ‘p‘,‘q‘ => ‘q‘,‘r‘ => ‘r‘,‘s‘ => ‘s‘,‘t‘ => ‘t‘,‘u‘ => ‘u‘,‘v‘ => ‘v‘,‘w‘ => ‘w‘,‘x‘ => ‘x‘,‘y‘ => ‘y‘,‘z‘ => ‘z‘,

‘~‘ => ‘~‘,‘`‘ => ‘`‘,‘!‘ => ‘!‘,‘@‘ => ‘@‘,‘#‘ => ‘#‘,‘$‘ => ‘$‘,‘%‘ => ‘%‘,‘^‘ => ‘^‘,‘&‘ => ‘&‘,‘*‘ => ‘*‘,‘(‘ => ‘(‘,‘)‘ => ‘)‘,‘_‘ => ‘_‘,‘-‘ => ‘-‘,‘+‘ => ‘+‘,‘=‘ => ‘=‘,

‘{‘ => ‘{‘,‘}‘ => ‘}‘,‘[‘ => ‘[‘,‘]‘ => ‘]‘,‘|‘ => ‘|‘,‘\‘ => ‘\\‘,‘:‘ => ‘:‘,‘;‘ => ‘;‘,‘"‘ => ‘"‘,‘'‘ => ‘\‘‘,

‘<‘ => ‘ ‘,‘,‘>‘ => ‘>‘,‘.‘ => ‘.‘,‘?‘ => ‘?‘,‘/‘ => ‘/‘,‘ ‘ => ‘ ‘]);//去空格

$str = str_replace(‘ ‘,‘‘,$str);//大写转小写

$str = strtolower($str);//数字统一格式为阿拉伯数字

$str = strtr($str,[‘零‘ => 0,‘一‘ => 1,‘二‘ => 2,‘三‘ => 3,‘四‘ => 4,‘五‘ => 5,‘六‘ => 6,‘七‘ => 7,‘八‘ => 8,‘九‘ => 9]);//分成单个字符并base64编码

$str_len = strlen($str);//获取关键字集合

$arr &#61;[];$str_len &#61; mb_strlen($str);for($i &#61; 0;$i <$str_len;&#43;&#43; $i){$keyword &#61; strtr(base64_encode(mb_substr($str,$i,1)),‘&#43;/&#61;‘,‘abc‘);if(!in_array($keyword,$arr)){ //去除重复的关键字

$arr[] &#61; $keyword;

}

}return $arr;

}

例如将字符串 ‘小明小红是朋友‘ 输入改函数&#xff0c;返回的结果是数组如下

array(6) {

[0]&#61;>

string(4) "5bCP"[1]&#61;>

string(4) "5piO"[2]&#61;>

string(4) "57qi"[3]&#61;>

string(4) "5piv"[4]&#61;>

string(4) "5pyL"[5]&#61;>

string(4) "5YaL"}

分别对应相应的汉字&#xff0c;注意小明和小红都有小这个字&#xff0c;所以去掉重复的字&#xff0c;只有六个编码。

然后用空格将数组连起来

$keywords &#61; implode(‘ ‘,keywords($keyword));

将$keywords 存入数据库。

进阶&#xff1a;

如果匹配的关键词包含一些常用的字&#xff0c;会出现大量的结果。

例如搜索书名 霸道总裁&#xff0c;可能会出现&#xff0c;裁缝&#xff0c;总经理&#xff0c;这样的结果

全文搜索是按照相关度从高到底返回的结果&#xff0c;可以只去去前面一些相关度较高的结果。

或者先查询出相关度最高是多少(相关度是一个数值)&#xff0c;然后除以二&#xff0c;限定结果的相关度都大于这个最大相关度的一半。

参考

//通过最大相关度/2过滤一部分无关结果//查询出最大相关度是多少

$score &#61; $this->sql(‘xs.nh‘)->query(‘SELECT MATCH(keywords_base) AGAINST (?) AS score FROM nh ORDER BY score DESC LIMIT 1‘,[$keywords]);//构造查询语句

$this->where[‘MATCH(keywords_base) AGAINST‘] &#61; [$keywords,‘> ‘.$score[0][‘score‘] / 2];



推荐阅读
  • 本文详细介绍了 PHP 中对象的生命周期、内存管理和魔术方法的使用,包括对象的自动销毁、析构函数的作用以及各种魔术方法的具体应用场景。 ... [详细]
  • MySQL Decimal 类型的最大值解析及其在数据处理中的应用艺术
    在关系型数据库中,表的设计与SQL语句的编写对性能的影响至关重要,甚至可占到90%以上。本文将重点探讨MySQL中Decimal类型的最大值及其在数据处理中的应用技巧,通过实例分析和优化建议,帮助读者深入理解并掌握这一重要知识点。 ... [详细]
  • 网站访问全流程解析
    本文详细介绍了从用户在浏览器中输入一个域名(如www.yy.com)到页面完全展示的整个过程,包括DNS解析、TCP连接、请求响应等多个步骤。 ... [详细]
  • 本文介绍了在 Spring Boot 中使用 JPA 进行数据删除操作时遇到的 SQL 错误及其解决方法。错误表现为:删除操作失败,原因是无法打开 JPA EntityManager 以进行事务处理。 ... [详细]
  • 本文介绍如何使用 Python 的 DOM 和 SAX 方法解析 XML 文件,并通过示例展示了如何动态创建数据库表和处理大量数据的实时插入。 ... [详细]
  • 解决Bootstrap DataTable Ajax请求重复问题
    在最近的一个项目中,我们使用了JQuery DataTable进行数据展示,虽然使用起来非常方便,但在测试过程中发现了一个问题:当查询条件改变时,有时查询结果的数据不正确。通过FireBug调试发现,点击搜索按钮时,会发送两次Ajax请求,一次是原条件的请求,一次是新条件的请求。 ... [详细]
  • 如何在Java中使用DButils类
    这期内容当中小编将会给大家带来有关如何在Java中使用DButils类,文章内容丰富且以专业的角度为大家分析和叙述,阅读完这篇文章希望大家可以有所收获。D ... [详细]
  • php更新数据库字段的函数是,php更新数据库字段的函数是 ... [详细]
  • 开机自启动的几种方式
    0x01快速自启动目录快速启动目录自启动方式源于Windows中的一个目录,这个目录一般叫启动或者Startup。位于该目录下的PE文件会在开机后进行自启动 ... [详细]
  • 本文详细介绍了MySQL数据库的基础语法与核心操作,涵盖从基础概念到具体应用的多个方面。首先,文章从基础知识入手,逐步深入到创建和修改数据表的操作。接着,详细讲解了如何进行数据的插入、更新与删除。在查询部分,不仅介绍了DISTINCT和LIMIT的使用方法,还探讨了排序、过滤和通配符的应用。此外,文章还涵盖了计算字段以及多种函数的使用,包括文本处理、日期和时间处理及数值处理等。通过这些内容,读者可以全面掌握MySQL数据库的核心操作技巧。 ... [详细]
  • 在尝试对 QQmlPropertyMap 类进行测试驱动开发时,发现其派生类中无法正常调用槽函数或 Q_INVOKABLE 方法。这可能是由于 QQmlPropertyMap 的内部实现机制导致的,需要进一步研究以找到解决方案。 ... [详细]
  • PTArchiver工作原理详解与应用分析
    PTArchiver工作原理及其应用分析本文详细解析了PTArchiver的工作机制,探讨了其在数据归档和管理中的应用。PTArchiver通过高效的压缩算法和灵活的存储策略,实现了对大规模数据的高效管理和长期保存。文章还介绍了其在企业级数据备份、历史数据迁移等场景中的实际应用案例,为用户提供了实用的操作建议和技术支持。 ... [详细]
  • 在Python中,通过实现一个便捷的函数来解码Base64编码的数据,并将其转换为数组形式。该函数能够将Base64字符串解码为字节数组,便于进一步处理。例如,可以使用如下代码片段进行解码:`base64_decode_array('6gAAAOsAAAD')`。这为处理二进制数据提供了高效且简洁的方法。 ... [详细]
  • 本文记录了 JavaScript 中正则表达式的使用方法和常见操作,包括匹配、替换、搜索等。 ... [详细]
  • 本文介绍了一种在ANSI C中动态分配二维数组的方法。通过创建指针数组并为每个指针分配连续空间,可以灵活地管理内存。文章还讨论了一些常见的错误和注意事项。 ... [详细]
author-avatar
手机用户2502873667
这个家伙很懒,什么也没留下!
PHP1.CN | 中国最专业的PHP中文社区 | DevBox开发工具箱 | json解析格式化 |PHP资讯 | PHP教程 | 数据库技术 | 服务器技术 | 前端开发技术 | PHP框架 | 开发工具 | 在线工具
Copyright © 1998 - 2020 PHP1.CN. All Rights Reserved | 京公网安备 11010802041100号 | 京ICP备19059560号-4 | PHP1.CN 第一PHP社区 版权所有