热门标签 | HotTags
当前位置:  开发笔记 > 编程语言 > 正文

MLlearning(2)——simHash算法

这篇文章主要讲simHash算法。这是一种LSH(Locality-SensitiveHashing,局部敏感哈希)的简单实现。它是广泛用于数据去重的算法,可以用于相似网站、图片的

  这篇文章主要讲simHash算法。这是一种LSH(Locality-Sensitive Hashing,局部敏感哈希)的简单实现。它是广泛用于数据去重的算法,可以用于相似网站、图片的检索。而且当两个样本差别并不大时,算法仍能起效。值得一提的是,该算法的时空复杂度不存在与维度有关的项,所以不会遭遇维度灾难,也可以在维数较高时优化kNN算法。

特征

  此算法(LSH)具有双重性,它们似乎是相悖的:

  • 对于几组不同的特征,hash相同(即冲突)的可能性要尽可能小。这也是hash基本的特征。
  • 对于几组相似的特征(即特征空间中距离小)的特征,hash相同或相似的可能性要尽可能大。这是LSH所具有的特征。

simHash实现

  simHash是LSH的其中一种对于字符串的简单实现。操作步骤如下:

  • 定义一个数代表hash,数的二进制位数可选,一般选择32bit或64bit。同时定义一个与该数位数相同的整形向量v。
  • 分割输入字符串,可以按字符数分割,也可以按空格分割。
  • 对于每个分割出来的字符串做普通hash,记hash出的值为k。约定num[i]代表num的第i位的二进制值。则对k的每位i,若k[i]>0,则v[i]+=weight,否则v[i]-=weight,weight代表该子串的权值。
  • 对于向量v的每一项,若该项大于0,则simHash的相应位置1,否则置0

  这样就可以得出一个字符串的simHash值,时间复杂度为O(|s|)。

子串相似判定

  定义两个字符串相似,即|hammingDist(simHash(str1),simHash(str2))|<=k,k是最大容忍的不同位数,hammingDist为计算两个整数海明距离的函数。海明距离即为两个整数二进制中编码不同的位数。

  根据经验,k一般取3。而海明距离的计算有一种快速的方法,给出C的实现。这种统计二进制中1的个数的算法叫平行算法,本文不再详述。

static int bitCount(unsigned int n){
    n=(n &0x55555555)+((n>>1)&0x55555555);
    n=(n &0x33333333)+((n>>2)&0x33333333);
    n=(n &0x0f0f0f0f)+((n>>4)&0x0f0f0f0f);
    n=(n &0x00ff00ff)+((n>>8)&0x00ff00ff);
    n=(n &0x0000ffff)+((n>>16)&0x0000ffff);
    return n;
}

int hammingDist(unsigned int a,unsigned int b){
    return bitCount(a^b);
}

查找工作

  查找新元素与已知集元素是否相似有两种方法。

  1. 时间复杂度为O(N)——线性查找算法
  2. 时间复杂度为O([C(3,32)+C(2,32)+C(1,32)]k)=O(5488k)——组合算法。

  光算出simHash值并没有太大的作用,因为判断新元素与已知集的中元素是否相似仍需较长的时间。尤其是数据量很大的时候。这时可以用一定的预处理算法优化第一种算法。

  假设k=3。优化的方法如下,将32bit或64bit(下文以32bit为例)的hash值平均分为4段。根据抽屉原理,两个字符串的hash中必有1段中没有不同的位。于是可以将每个元素hash的4个8bit作为键均预存储到表中,值为hash的完整值。查找时,只需比较新字符串hash的4个8bit表中的所有完整hash并判断海明距离是否小于等于3。这样优化后,时间复杂度降至O(4k)=O(4*n/(2^9-1))≈O(n/128),虽然仍为线性复杂度,但已经快了不少。

整体实现

  整个simHash系统的实现(C++版本)我已开源至github:https://github.com/Darksun2010/MLlearning/tree/master/LSH

MLlearning(2)——simHash算法


推荐阅读
  • 本文面向非计算机专业背景的编程爱好者,介绍如何仅使用基础的C语言知识——二维数组和结构体,无需掌握复杂的数据结构如链表,即可编写一款经典的贪食蛇游戏。通过本教程,您将了解游戏开发的基本原理和实现方法。 ... [详细]
  • 本文详细介绍了如何在Linux系统上安装和配置单节点的Redis服务,包括下载、解压、编译安装以及启动服务的具体步骤。 ... [详细]
  • 解析 HTTP 头 'Vary: Accept-Encoding' 的作用与重要性
    本文详细探讨了 'Vary: Accept-Encoding' HTTP 头的作用,即指导缓存系统(如代理服务器和 CDN)根据不同的编码需求存储和提供适当的资源版本,确保不同类型的客户端能够接收到适合自己的内容。 ... [详细]
  • 本文探讨了Lua中元表和元方法的使用,通过具体的代码示例展示了如何利用这些特性来实现类似C语言中的运算符重载功能。 ... [详细]
  • 本文介绍了在Android Studio中通过代码和配置文件两种方法来移除Activity的标题栏,并讨论了当Activity继承自AppCompatActivity时的特殊处理方法。 ... [详细]
  • 本周六上午11点左右到达公司,回顾了一周的行业动态并完成了昨日的任务。下午主要解决了Axis2缓存问题以及DBS和KMS的相关技术难题。由于服务替换导致平台访问错误,经过多方查找未能解决,最终决定暂时搁置。此外,还分享了与朋友之间的沟通障碍及个人成长的思考。 ... [详细]
  • Pandas中使用sort_values方法进行数据排序
    本文介绍了如何利用Python的Pandas库中的sort_values方法对DataFrame对象进行排序。首先通过Numpy库生成随机数据,然后详细解释了DataFrame的创建过程及其参数,并重点探讨了sort_values方法的使用技巧。 ... [详细]
  • Python与Java在Appium中的应用:混合APP自动化测试方法详解
    本文详细探讨了如何使用Python和Java语言结合Appium框架进行混合APP的自动化测试,特别针对面试中常见的问题进行了整理和解答。 ... [详细]
  • 13、单向链表
    头文件:LinkList.hLinkList.cmain.cVS2 ... [详细]
  • UVA 401 - 镜像回文字符串
    本题探讨了如何判断一个字符串是否为普通回文、镜像回文或两者都不是。通过特定的字符映射表来实现字符串的镜像转换,并根据转换后的结果进行分类。 ... [详细]
  • 抽象工厂模式 c++
    抽象工厂模式包含如下角色:AbstractFactory:抽象工厂ConcreteFactory:具体工厂AbstractProduct:抽象产品Product:具体产品https ... [详细]
  • 本文通过一个具体的例子,展示如何利用枚举思想来解决特定的算术表达式构建问题,即通过插入不同的运算符(加、减、乘、除)使给定数字序列满足特定条件。 ... [详细]
  • 代码生成器实战教程:提升编程效率的利器
    本系列文章旨在通过一系列实践案例,详细介绍如何利用代码生成器提高开发效率。本文将引导您完成从下载安装到实际应用的全过程。 ... [详细]
  • 本文探讨了SQLAlchemy ORM框架中如何利用外键和关系(relationship)来建立表间联系,简化复杂的查询操作。通过示例代码详细解释了relationship的定义、使用方法及其与外键的相互作用。 ... [详细]
  • Flask中路由的基础定义与应用
    本文介绍了如何在Flask框架中通过装饰器为视图函数指定访问路径,并详细讲解了带参数路由及指定请求方法的实现方式。 ... [详细]
author-avatar
朱森博其实一直在想你
这个家伙很懒,什么也没留下!
PHP1.CN | 中国最专业的PHP中文社区 | DevBox开发工具箱 | json解析格式化 |PHP资讯 | PHP教程 | 数据库技术 | 服务器技术 | 前端开发技术 | PHP框架 | 开发工具 | 在线工具
Copyright © 1998 - 2020 PHP1.CN. All Rights Reserved | 京公网安备 11010802041100号 | 京ICP备19059560号-4 | PHP1.CN 第一PHP社区 版权所有