当前位置: 开发笔记 > 编程语言 > 正文

Spark贝叶斯分类算法

作者：mobiledu2502920413 | 来源：互联网 | 2024-09-28 21:04

一、贝叶斯定理数学基础我们都知道条件概率的数学公式形式为即B发生的条件下A发生的概率等于A和B同时发生的概率除以B发生的概率。根据此公式变换，得到贝叶斯公式：即贝叶斯定律是关于随机

　　一、贝叶斯定理数学基础

　　我们都知道条件概率的数学公式形式为

　　技术分享即B发生的条件下A发生的概率等于A和B同时发生的概率除以B发生的概率。

　　根据此公式变换，得到贝叶斯公式：技术分享即贝叶斯定律是关于随机事件A和B的条件概率（或边缘概率）的一则定律。通常，事件A在事件B发生的条件溪的概率，与事件B在事件A的条件下的概率是不一样的，而贝叶斯定律就是描述二者之间的关系的。

　　更进一步将贝叶斯公式进行推广，假设事件A发生的概率是由一系列的因素(A1,A2,A3,...An)决定的，则事件A的全概率公式为：

　　技术分享

　　二、朴素贝叶斯分类

　　朴素贝叶斯分类是一种十分简单的分类算法，其思想基础是：对于给定的待分类项，求解在此项出现的条件下各个类别出现的概率，哪个最大，就认为此待分类项就属于哪个类别。

　　假设V=(v1,v2,v3....vn)是一个待分项，而vn为V的每个特征向量；

　　 B=(b1,b2,b3...bn)是一个分类集合，bn为每个具体的分类；

　　　　如果需要测试某个Vn归属于B集合中的哪个具体分类，则需要计算P(bn|V)，即在V发生的条件下，归属于b1,b2,b3,....bn中哪个可能性最大。即：

　　　　技术分享

　　　　因此，这个问题转换成求每个待分项分配到集合中具体分类的概率是多少。而这个·具体概率的求法可以使用贝叶斯定律。

　　　　技术分享

　　　　经过变换得出：

　　　　技术分享

　　三、MLlib对应的API

　　1、贝叶斯分类伴生对象NativeBayes,原型：

object NaiveBayes extends scala.AnyRef with scala.Serializable {
  def train(input : org.apache.spark.rdd.RDD[org.apache.spark.mllib.regression.LabeledPoint]) : org.apache.spark.mllib.classification.NaiveBayesModel = { /* compiled code */ }
  def train(input : org.apache.spark.rdd.RDD[org.apache.spark.mllib.regression.LabeledPoint], lambda : scala.Double) : org.apache.spark.mllib.classification.NaiveBayesModel = { /* compiled code */ }
}

　　其主要定义了训练贝叶斯分类模型的train方法，其中input为训练样本，lambda为平滑因子参数。

　　2、train方法，其是NativeBayes对象的静态方法，根据设置的朴素贝叶斯分类参数新建朴素贝叶斯分类类，并执行run方法进行训练。

　　3、朴素贝叶斯分类类NaiveBayes,原型：

class NaiveBayes private (private var lambda : scala.Double) extends scala.AnyRef with scala.Serializable with org.apache.spark.Logging {
  def this() = { /* compiled code */ }
  def setLambda(lambda : scala.Double) : org.apache.spark.mllib.classification.NaiveBayes = { /* compiled code */ }
  def run(data : org.apache.spark.rdd.RDD[org.apache.spark.mllib.regression.LabeledPoint]) : org.apache.spark.mllib.classification.NaiveBayesModel = { /* compiled code */ }
}

　　4、run方法，该方法主要计算先验概率和条件概率。首先对所有样本数据进行聚合，以label为key，聚合同一个label的特征features，得到所有label的统计(label，features之和),然后根据label统计数据，再计算p(i),和theta(i)(j)，最后，根据类别标签列表、类别先验概率、各类别下的每个特征的条件概率生成贝叶斯模型。

　　先验概率并取对数p(i)=log(p(yi))=log((i类别的次数+平滑因子)/(总次数+类别数*平滑因子)）)

　　各个特征属性的条件概率，并取对数

　　theta(i)(j)=log(p(ai|yi))=log(sumTermFreqs(j)+平滑因子)-thetaLogDenom

　　其中，theta(i)(j)是类别i下特征j的概率，sumTermFreqs(j)是特征j出现的次数，thetaLogDenom一般分2种情况，如下：

　　　　1.多项式模型

　　　　　　thetaLogDenom=log(sumTermFreqs.values.sum+ numFeatures* lambda)

　　　　　　其中，sumTermFreqs.values.sum类别i的总数，numFeatures特征数量，lambda平滑因子

　　　　2.伯努利模型

　　　　　　thetaLogDenom=log(n+2.0*lambda)

　　5、aggregated:对所有样本进行聚合统计，统计没个类别下的每个特征值之和及次数。

　　6、pi表示各类别·的·先验概率取自然对数的值

　　7、theta表示各个特征在各个类别中的条件概率值

　　8、predict:根据模型的先验概率、条件概率，计算样本属于每个类别的概率，取最大项作为样本的类别

　　9、贝叶斯分类模型NaiveBayesModel包含参数：类别标签列表(labels)、类别先验概率(pi)、各个特征在各个类别中的条件概率(theta)。

　　四、使用示例

　　1、样本数据:

import org.apache.spark.mllib.classification.NaiveBayes
import org.apache.spark.mllib.linalg.Vectors
import org.apache.spark.mllib.util.MLUtils
import org.apache.spark.{SparkConf, SparkContext}

object Bayes {
  def main(args: Array[String]): Unit = {
    val conf=new SparkConf().setAppName("BayesDemo").setMaster("local")
    val sc=new SparkContext(conf)
    //读取样本数据，此处使用自带的处理数据方式·
    val data=MLUtils.loadLabeledPoints(sc,"d://bayes.txt")
    //训练贝叶斯模型
    val model=NaiveBayes.train(data,1.0)
    //model.labels.foreach(println)
    //model.pi.foreach(println)
    val test=Vectors.dense(0,0,100)
    val res=model.predict(test)
    println(res)//输出结果为2.0
  }
}

import org.apache.log4j.{Level, Logger}
import org.apache.spark.mllib.classification.NaiveBayes
import org.apache.spark.mllib.linalg.Vectors
import org.apache.spark.mllib.regression.LabeledPoint
import org.apache.spark.{SparkConf, SparkContext}

object Bayes {
  def main(args: Array[String]): Unit = {
    //创建spark对象
    val cOnf=new SparkConf().setAppName("BayesDemo").setMaster("local")
    val sc=new SparkContext(conf)
    Logger.getRootLogger.setLevel(Level.WARN)
    //读取样本数据
    val data=sc.textFile("d://bayes.txt")//读取数据
    val demo=data.map{ line=>//处理数据
      val parts=line.split(‘,‘)//分割数据·
      LabeledPoint(parts(0).toDouble,//标签数据转换
        Vectors.dense(parts(1).split(‘ ‘).map(_.toDouble)))//向量数据转换
    }
    //将样本数据分为训练样本和测试样本
    val sp=demo.randomSplit(Array(0.6,0.4),seed = 11L)//对数据进行分配
    val train=sp(0)//训练数据
    val testing=sp(1)//测试数据
    //建立贝叶斯分类模型，并进行训练
    val model=NaiveBayes.train(train,lambda = 1.0)

    //对测试样本进行测试
    val pre=testing.map(p=>(model.predict(p.features),p.label))//验证模型
    val prin=pre.take(20)
    println("prediction"+"\t"+"label")
    for(i<- 0 to prin.length-1){
      println(prin(i)._1+"\t"+prin(i)._2)
    }
　　　　val accuracy=1.0 *pre.filter(x=>x._1==x._2).count()//计算准确度

println(accuracy)

}
 }

Spark 贝叶斯分类算法

推荐阅读

object
解析JSON格式文本并处理数据

本文介绍如何使用阿里云的fastjson库解析包含时间戳、IP地址和参数等信息的JSON格式文本，并进行数据处理和保存。 ... [详细]

蜡笔小新 2024-12-26 16:06:09
object
Python学习笔记：使用pydoc工具查询文档

本文介绍了在Windows环境下使用pydoc工具的方法，并详细解释了如何通过命令行和浏览器查看Python内置函数的文档。此外，还提供了关于raw_input和open函数的具体用法和功能说明。 ... [详细]

蜡笔小新 2024-12-26 17:05:56
uri
QUIC协议：快速UDP互联网连接

QUIC（Quick UDP Internet Connections）是谷歌开发的一种旨在提高网络性能和安全性的传输层协议。它基于UDP，并结合了TLS级别的安全性，提供了更高效、更可靠的互联网通信方式。 ... [详细]

蜡笔小新 2024-12-28 12:33:18
sum
深入理解OAuth认证机制

本文介绍了OAuth认证协议的核心概念及其工作原理。OAuth是一种开放标准，旨在为第三方应用提供安全的用户资源访问授权，同时确保用户的账户信息（如用户名和密码）不会暴露给第三方。 ... [详细]

蜡笔小新 2024-12-28 12:07:46
sum
CSS 布局：液态三栏混合宽度布局

本文介绍了如何使用 CSS 实现液态的三栏布局，其中各栏具有不同的宽度设置。通过调整容器和内容区域的属性，可以实现灵活且响应式的网页设计。 ... [详细]

蜡笔小新 2024-12-28 02:40:28
shell
Linux 自动化安装脚本详解

本文介绍了一款用于自动化部署 Linux 服务的 Bash 脚本。该脚本不仅涵盖了基本的文件复制和目录创建，还处理了系统服务的配置和启动，确保在多种 Linux 发行版上都能顺利运行。 ... [详细]

蜡笔小新 2024-12-27 16:33:32
schema
MySQL中枚举类型的所有可能值获取方法

本文介绍了一种在MySQL数据库中查询枚举（ENUM）类型字段所有可能取值的方法，帮助开发者更好地理解和利用这一数据类型。 ... [详细]

蜡笔小新 2024-12-27 10:36:44
range
使用 NSTimer 实现倒计时功能

本文介绍如何使用 NSTimer 实现倒计时功能，详细讲解了初始化方法、参数配置以及具体实现步骤。通过示例代码展示如何创建和管理定时器，确保在指定时间间隔内执行特定任务。 ... [详细]

蜡笔小新 2024-12-26 19:08:19
ip
2023 ARM嵌入式系统全国技术巡讲

2023 ARM嵌入式系统全国技术巡讲旨在分享ARM公司在半导体知识产权(IP)领域的最新进展。作为全球领先的IP提供商，ARM在嵌入式处理器市场占据主导地位，其产品广泛应用于90%以上的嵌入式设备中。此次巡讲将邀请来自ARM、飞思卡尔以及华清远见教育集团的行业专家，共同探讨当前嵌入式系统的前沿技术和应用。 ... [详细]

蜡笔小新 2024-12-28 11:58:48
ip
国内BI工具迎战国际巨头Tableau，稳步崛起

尽管商业智能（BI）工具在中国的普及程度尚不及国际市场，但近年来，随着本土企业的持续创新和市场推广，国内主流BI工具正逐渐崭露头角。面对国际品牌如Tableau的强大竞争，国内BI工具通过不断优化产品和技术，赢得了越来越多用户的认可。 ... [详细]

蜡笔小新 2024-12-28 11:12:44
function
深入理解 Oracle 存储函数：计算员工年收入

本文介绍如何使用 Oracle 存储函数查询特定员工的年收入。我们将详细解释存储函数的创建过程，并提供完整的代码示例。 ... [详细]

蜡笔小新 2024-12-28 09:49:42
object
新浪笔试题

1:有如下一段程序：packagea.b.c;publicclassTest{privatestaticinti0;publicintgetNext(){return ... [详细]

蜡笔小新 2024-12-27 19:32:17
object
实现密码输入框的掩码设置

本文介绍如何在应用程序中使用文本输入框创建密码输入框，并通过设置掩码来隐藏用户输入的内容。我们将详细解释代码实现，并提供专业的补充说明。 ... [详细]

蜡笔小新 2024-12-27 02:22:09
object
从JDE系统中提取完整字典数据

本文介绍如何通过SQL查询从JDE（JD Edwards）系统中提取所有字典数据，涵盖关键表的关联和字段选择。具体包括F0004和F0005系列表的数据提取方法。 ... [详细]

蜡笔小新 2024-12-26 21:04:46
object
启动MySQL服务的命令行步骤

本文详细介绍了如何通过命令行启动MySQL服务，包括打开命令提示符窗口、进入MySQL的bin目录、输入正确的连接命令以及注意事项。文中还提供了更多相关命令的资源链接。 ... [详细]

蜡笔小新 2024-12-26 20:16:36

mobiledu2502920413

这个家伙很懒，什么也没留下！

Tags | 热门标签

RankList | 热门文章