数据挖掘（2）：关联规则FpGrowth算法

作者：BOSS | 来源：互联网 | 2023-09-12 16:24

http:blog.jobbole.com90125原文出处：fengfenggirl（也爱数据挖掘）欢迎分享原创到伯乐头条上一篇介绍了关

http://blog.jobbole.com/90125/

原文出处&＃xff1a; fengfenggirl&＃xff08;&＃64;也爱数据挖掘&＃xff09; 欢迎分享原创到伯乐头条

上一篇介绍了关联规则挖掘的一些基本概念和经典的Apriori算法&＃xff0c;Aprori算法利用频繁集的两个特性&＃xff0c;过滤了很多无关的集合&＃xff0c;效率提高不少&＃xff0c;但是我们发现Apriori算法是一个候选消除算法&＃xff0c;每一次消除都需要扫描一次所有数据记录&＃xff0c;造成整个算法在面临大数据集时显得无能为力。今天我们介绍一个新的算法挖掘频繁项集&＃xff0c;效率比Aprori算法高很多。

FpGrowth算法通过构造一个树结构来压缩数据记录&＃xff0c;使得挖掘频繁项集只需要扫描两次数据记录&＃xff0c;而且该算法不需要生成候选集合&＃xff0c;所以效率会比较高。我们还是以上一篇中用的数据集为例&＃xff1a;

TID	Items
T1	{牛奶,面包}
T2	{面包,尿布,啤酒,鸡蛋}
T3	{牛奶,尿布,啤酒,可乐}
T4	{面包,牛奶,尿布,啤酒}
T5	{面包,牛奶,尿布,可乐}

一、构造FpTree

FpTree是一种树结构&＃xff0c;树结构定义如下&＃xff1a;

  public  class  FpNode {
     String idName;// id号
     List children;// 孩子结点
     FpNode parent;// 父结点
     FpNode next;// 下一个id号相同的结点
     long  count;// 出现次数
 }
 

树的每一个结点代表一个项&＃xff0c;这里我们先不着急看树的结构&＃xff0c;我们演示一下FpTree的构造过程&＃xff0c;FpTree构造好后自然明白了树的结构。假设我们的最小绝对支持度是3。

Step 1&＃xff1a;扫描数据记录&＃xff0c;生成一级频繁项集&＃xff0c;并按出现次数由多到少排序&＃xff0c;如下所示&＃xff1a;

Item	Count
牛奶	4
面包	4
尿布	4
啤酒	3

可以看到&＃xff0c;鸡蛋和可乐没有出现在上表中&＃xff0c;因为可乐只出现2次&＃xff0c;鸡蛋只出现1次&＃xff0c;小于最小支持度&＃xff0c;因此不是频繁项集&＃xff0c;根据Apriori定理&＃xff0c;非频繁项集的超集一定不是频繁项集&＃xff0c;所以可乐和鸡蛋不需要再考虑。

Step 2&＃xff1a;再次扫描数据记录&＃xff0c;对每条记录中出现在Step 1产生的表中的项&＃xff0c;按表中的顺序排序。初始时&＃xff0c;新建一个根结点&＃xff0c;标记为null&＃xff1b;

1&＃xff09;第一条记录&＃xff1a;{牛奶,面包}&＃xff0c;按Step 1表过滤排序得到依然为{牛奶,面包}&＃xff0c;新建一个结点&＃xff0c;idName为{牛奶}&＃xff0c;将其插入到根节点下&＃xff0c;并设置count为1&＃xff0c;然后新建一个{面包}结点&＃xff0c;插入到{牛奶}结点下面&＃xff0c;插入后如下所示&＃xff1a;

2&＃xff09;第二条记录&＃xff1a;{面包,尿布,啤酒,鸡蛋}&＃xff0c;过滤并排序后为&＃xff1a;{面包,尿布,啤酒}&＃xff0c;发现根结点没有包含{面包}的儿子&＃xff08;有一个{面包}孙子但不是儿子&＃xff09;&＃xff0c;因此新建一个{面包}结点&＃xff0c;插在根结点下面&＃xff0c;这样根结点就有了两个孩子&＃xff0c;随后新建{尿布}结点插在{面包}结点下面&＃xff0c;新建{啤酒}结点插在{尿布}下面&＃xff0c;插入后如下所示&＃xff1a;

3&＃xff09;第三条记录&＃xff1a;{牛奶,尿布,啤酒,可乐}&＃xff0c;过滤并排序后为&＃xff1a;{牛奶,尿布,啤酒}&＃xff0c;这时候发现根结点有儿子{牛奶}&＃xff0c;因此不需要新建结点&＃xff0c;只需将原来的{牛奶}结点的count加1即可&＃xff0c;往下发现{牛奶}结点有一个儿子{尿布}&＃xff0c;于是新建{尿布}结点&＃xff0c;并插入到{牛奶}结点下面&＃xff0c;随后新建{啤酒}结点插入到{尿布}结点后面。插入后如下图所示&＃xff1a;

4&＃xff09;第四条记录&＃xff1a;{面包,牛奶,尿布,啤酒}&＃xff0c;过滤并排序后为&＃xff1a;{牛奶&＃xff0c;面包,尿布,啤酒}&＃xff0c;这时候发现根结点有儿子{牛奶}&＃xff0c;因此不需要新建结点&＃xff0c;只需将原来的{牛奶}结点的count加1即可&＃xff0c;往下发现{牛奶}结点有一个儿子{面包}&＃xff0c;于是也不需要新建{面包}结点&＃xff0c;只需将原来{面包}结点的count加1&＃xff0c;由于这个{面包}结点没有儿子&＃xff0c;此时需新建{尿布}结点&＃xff0c;插在{面包}结点下面&＃xff0c;随后新建{啤酒}结点&＃xff0c;插在{尿布}结点下面&＃xff0c;插入后如下图所示&＃xff1a;

5&＃xff09;第五条记录&＃xff1a;{面包,牛奶,尿布,可乐}&＃xff0c;过滤并排序后为&＃xff1a;{牛奶&＃xff0c;面包,尿布}&＃xff0c;检查发现根结点有{牛奶}儿子&＃xff0c;{牛奶}结点有{面包}儿子&＃xff0c;{面包}结点有{尿布}儿子&＃xff0c;本次插入不需要新建结点只需更新count即可&＃xff0c;示意图如下&＃xff1a;

按照上面的步骤&＃xff0c;我们已经基本构造了一棵FpTree&＃xff08;Frequent Pattern Tree&＃xff09;&＃xff0c;树中每天路径代表一个项集&＃xff0c;因为许多项集有公共项&＃xff0c;而且出现次数越多的项越可能是公公项&＃xff0c;因此按出现次数由多到少的顺序可以节省空间&＃xff0c;实现压缩存储&＃xff0c;另外我们需要一个表头和对每一个idName相同的结点做一个线索&＃xff0c;方便后面使用&＃xff0c;线索的构造也是在建树过程形成的&＃xff0c;但为了简化FpTree的生成过程&＃xff0c;我没有在上面提到&＃xff0c;这个在代码有体现的&＃xff0c;添加线索和表头的Fptree如下&＃xff1a;

至此&＃xff0c;整个FpTree就构造好了&＃xff0c;在下面的挖掘过程中我们会看到表头和线索的作用。

二、利用FpTree挖掘频繁项集

FpTree建好后&＃xff0c;就可以进行频繁项集的挖掘&＃xff0c;挖掘算法称为FpGrowth&＃xff08;Frequent Pattern Growth&＃xff09;算法&＃xff0c;挖掘从表头header的最后一个项开始。

1&＃xff09;此处即从{啤酒}开始&＃xff0c;根据{啤酒}的线索链找到所有{啤酒}结点&＃xff0c;然后找出每个{啤酒}结点的分支&＃xff1a;{牛奶&＃xff0c;面包&＃xff0c;尿布&＃xff0c;啤酒&＃xff1a;1}&＃xff0c;{牛奶&＃xff0c;尿布&＃xff0c;啤酒:1}&＃xff0c;{面包&＃xff0c;尿布&＃xff0c;啤酒:1}&＃xff0c;其中的“1”表示出现1次&＃xff0c;注意&＃xff0c;虽然{牛奶}出现4次&＃xff0c;但{牛奶&＃xff0c;面包&＃xff0c;尿布&＃xff0c;啤酒}只同时出现1次&＃xff0c;因此分支的count是由后缀结点{啤酒}的count决定的&＃xff0c;除去{啤酒}&＃xff0c;我们得到对应的前缀路径{牛奶&＃xff0c;面包&＃xff0c;尿布&＃xff1a;1}&＃xff0c;{牛奶&＃xff0c;尿布:1}&＃xff0c;{面包&＃xff0c;尿布:1}&＃xff0c;根据前缀路径我们可以生成一颗条件FpTree&＃xff0c;构造方式跟之前一样&＃xff0c;此处的数据记录变为&＃xff1a;

TID	Items
T1	{牛奶&＃xff0c;面包&＃xff0c;尿布}
T2	{牛奶&＃xff0c;尿布}
T3	{面包&＃xff0c;尿布}

绝对支持度依然是3&＃xff0c;构造得到的FpTree为&＃xff1a;

构造好条件树后&＃xff0c;对条件树进行递归挖掘&＃xff0c;当条件树只有一条路径时&＃xff0c;路径的所有组合即为条件频繁集&＃xff0c;假设{啤酒}的条件频繁集为{S1,S2,S3}&＃xff0c;则{啤酒}的频繁集为{S1&＃43;{啤酒},S2&＃43;{啤酒},S3&＃43;{啤酒}}&＃xff0c;即{啤酒}的频繁集一定有相同的后缀{啤酒}&＃xff0c;此处的条件频繁集为&＃xff1a;{{}&＃xff0c;{尿布}}&＃xff0c;于是{啤酒}的频繁集为{{啤酒}{尿布&＃xff0c;啤酒}}。

2&＃xff09;接下来找header表头的倒数第二个项{尿布}的频繁集&＃xff0c;同上可以得到{尿布}的前缀路径为&＃xff1a;{面包&＃xff1a;1}&＃xff0c;{牛奶&＃xff1a;1}&＃xff0c;{牛奶&＃xff0c;面包&＃xff1a;2}&＃xff0c;条件FpTree的数据集为&＃xff1a;

TID	Items
T1	{面包}
T2	{牛奶}
T3	{牛奶&＃xff0c;面包}
T4	{牛奶&＃xff0c;面包}

注意{牛奶&＃xff0c;面包&＃xff1a;2}&＃xff0c;即{牛奶&＃xff0c;面包}的count为2&＃xff0c;所以在{牛奶&＃xff0c;面包}重复了两次&＃xff0c;这样做的目的是可以利用之前构造FpTree的算法来构造条件Fptree&＃xff0c;不过这样效率会降低&＃xff0c;试想如果{牛奶&＃xff0c;面包}的count为20000&＃xff0c;那么就需要展开成20000条记录&＃xff0c;然后进行20000次count更新&＃xff0c;而事实上只需要对count更新一次到20000即可。这是实现上的优化细节&＃xff0c;实践中当注意。构造的条件FpTree为&＃xff1a;

这颗条件树已经是单一路径&＃xff0c;路径上的所有组合即为条件频繁集&＃xff1a;{{}&＃xff0c;{牛奶}&＃xff0c;{面包}&＃xff0c;{牛奶&＃xff0c;面包}}&＃xff0c;加上{尿布}后&＃xff0c;又得到一组频繁项集{{尿布}&＃xff0c;{牛奶&＃xff0c;尿布}&＃xff0c;{面包&＃xff0c;尿布}&＃xff0c;{牛奶&＃xff0c;面包&＃xff0c;尿布}}&＃xff0c;这组频繁项集一定包含一个相同的后缀&＃xff1a;{尿布}&＃xff0c;并且不包含{啤酒}&＃xff0c;因此这一组频繁项集与上一组不会重复。

重复以上步骤&＃xff0c;对header表头的每个项进行挖掘&＃xff0c;即可得到整个频繁项集&＃xff0c;可以证明&＃xff08;严谨的算法和证明可见参考文献[1]&＃xff09;&＃xff0c;频繁项集即不重复也不遗漏。

程序的实现代码还是放在我的github上&＃xff0c;这里看一下运行结果&＃xff1a;

  绝对支持度&＃xff1a; 3
 频繁项集&＃xff1a; 
 面包 尿布     3
 尿布 牛奶     3
 牛奶     4
 面包 牛奶     3
 尿布 啤酒     3
 面包     4
 

另外我下载了一个购物篮的数据集&＃xff0c;数据量较大&＃xff0c;测试了一下FpGrowth的效率还是不错的。FpGrowth算法的平均效率远高于Apriori算法&＃xff0c;但是它并不能保证高效率&＃xff0c;它的效率依赖于数据集&＃xff0c;当数据集中的频繁项集的没有公共项时&＃xff0c;所有的项集都挂在根结点上&＃xff0c;不能实现压缩存储&＃xff0c;而且Fptree还需要其他的开销&＃xff0c;需要存储空间更大&＃xff0c;使用FpGrowth算法前&＃xff0c;对数据分析一下&＃xff0c;看是否适合用FpGrowth算法。

下一篇将介绍&＃xff0c;关联规则的评价标准&＃xff0c;欢迎持续关注。

参考文献&＃xff1a;

[1].Han jia wei, Pei Jan等 Mining Frequent Patterns without Candidate Generation: A Frequent-Pattern Tree Approach.2004

推荐阅读

process
FP-Growth 和 K-Means 学习报告

最近学习了数据挖掘常用的两种算法：FP-Growth和K-Means。现在把我的学习结果分享给大家。以下是本文的目录，大家可以根据需要跳过一些章节：1.FP-Grow ... [详细]

蜡笔小新 2024-09-28 09:23:32
ip
gbdt伪代码,GBDT是什么意思

文章目录1.解释一下GBDT算法的过程1.1Boosting思想1.2GBDT原来是这么回事2.梯度提升和梯度下降的区别和联系是什么？3.GBDT的优点和局限性有哪 ... [详细]

蜡笔小新 2024-09-27 13:22:27
ip
深度强化学习Policy Gradient基本实现

全文共2543个字，2张图，预计阅读时间15分钟。基于值的强化学习算法的基本思想是根据当前的状态，计算采取每个动作的价值，然 ... [详细]

蜡笔小新 2024-09-25 17:01:10
python
kafkamanager(cmak)安装及使用

1.软件下载kafka-manager工具目前改名为cmak,下载地址为：https:github.comyahooCMAKreleasestag3.0.0.5现在 ... [详细]

蜡笔小新 2024-09-30 14:31:10
python
ROC曲线原理及Python实现

受试者工作特征曲线（receiveroperatingcharacteristiccurve，简称ROC曲线），是比较两个分类模型好坏的可视化工具ROC曲线的作用：1.较容易地查出 ... [详细]

蜡笔小新 2024-09-30 12:36:58
python
python自学教程哪里好,python比较好的教程

本文目录一览：1、想学python去哪里比较好？ ... [详细]

蜡笔小新 2024-09-30 11:08:52
io
想搞清楚zlib,minizip,infozip,libbzip2这些库之间的关系.

是不是zlib是这些库的压缩算法的实现库，而这么多库它们只是在打包的时候使用了zlib进行压缩而已.而具体的打包格式就有ZIP，BZIP2,GZ之分?但是在我们在用gz压缩时候通常之前 ... [详细]

蜡笔小新 2024-09-29 17:00:30
python
漫画：位运算系列篇（只出现一次的数字）

今天是小浩算法“365刷题计划”第62天。仍然分享一道关于位运算颇为简单的题型，同时，从明天开始将会提高难度，大家做好准备。01PARTS ... [详细]

蜡笔小新 2024-09-27 15:07:38
io
找到的电脑软件

1、Everything：速度最快最好用的文件搜索工具，可以基于文件名极速搜索、瞬间定位文件，所有匹配的文件或文件夹都会实时显示，Windows7之后为减少硬盘占用，在关闭索引功能后不能得到“即搜既 ... [详细]

蜡笔小新 2024-09-27 14:25:17
ip
计算机网络四

大三上结束之际，从网上找来一些关于计算机网络的知识作为总结，本文四篇笔记全部转自猪头任（博客地址：http:www.cnbl ... [详细]

蜡笔小新 2024-09-26 20:26:13
ip
百度_音频转文字

手机49kbps转换比特率256Kpbs{‘corpus_no’:‘7045177033217452815’,‘err_msg’:‘success.’,‘err_no’:0,‘re ... [详细]

蜡笔小新 2024-09-26 17:35:21
io
One Stage目标检测

在计算机视觉中，目标检测是一个难题。在大型项目中，首先需要先进行目标检测，得到对应类别和坐标后，才进行之后的各种分析。如人脸识别，通常是首先人脸检测，得到人脸的目标框，再对此目标框 ... [详细]

蜡笔小新 2024-09-25 10:55:17
list
R语言基础_数据导入&保存

数据分析文件常用的储存格式为CSV(.csv)和EXCEL(.xlsx)，其余文 ... [详细]

蜡笔小新 2024-09-25 10:28:05
main
参会必备｜ ETHDenver 2023 周边活动日程一览

ForesightNews整理了ETHDenver2023日程及其周边活动供读者参考。整理： ... [详细]

蜡笔小新 2024-09-25 00:59:24
ip
TCP/IPLinux数据链路层的包解析

Linux数据链路层的包解析仅以此文作为学习笔记，初学者，如有错误欢迎批评指正，但求轻喷。一般而言，Linux系统截获数据包后，会通过协议栈，按照TCPIP层次进行解析，那我们如何 ... [详细]

蜡笔小新 2024-09-24 17:49:40

BOSS

这个家伙很懒，什么也没留下！

Tags | 热门标签

RankList | 热门文章