热门标签 | HotTags
当前位置:  开发笔记 > 编程语言 > 正文

机器学习(七):主成分分析PCA降维_Python

六、PCA主成分分析(降维)github地址:https:github.comlawlite19MachineLearning_Python全部代码1、用处数据压缩(Data

六、PCA主成分分析(降维)

  • github地址:https://github.com/lawlite19/MachineLearning_Python
  • 全部代码

1、用处

  • 数据压缩(Data Compression),使程序运行更快
  • 可视化数据,例如3D-->2D
  • ……

2、2D–>1D,nD–>kD

  • 如下图所示,所有数据点可以投影到一条直线,是投影距离的平方和(投影误差)最小
    这里写图片描述
  • 注意数据需要归一化处理
  • 思路是找1向量u,所有数据投影到上面使投影距离最小
  • 那么nD-->kD就是找k个向量$${u^{(1)}},{u^{(2)}} \ldots {u^{(k)}}$$,所有数据投影到上面使投影误差最小
    • eg:3D–>2D,2个向量$${u^{(1)}},{u^{(2)}}$$就代表一个平面了,所有点投影到这个平面的投影误差最小即可

3、主成分分析PCA与线性回归的区别

  • 线性回归是找xy的关系,然后用于预测y
  • PCA是找一个投影面,最小化data到这个投影面的投影误差

4、PCA降维过程

  • 数据预处理(均值归一化)

    • 公式:$${\rm{x}}_j^{(i)} = {{{\rm{x}}_j^{(i)} - {u_j}} \over {{s_j}}}$$
    • 就是减去对应feature的均值,然后除以对应特征的标准差(也可以是最大值-最小值)
    • 实现代码:
       # 归一化数据
      def featureNormalize(X):
      '''(每一个数据-当前列的均值)/当前列的标准差'''
      n = X.shape[1]
      mu = np.zeros((1,n));
      sigma = np.zeros((1,n))

      mu = np.mean(X,axis=0)
      sigma = np.std(X,axis=0)
      for i in range(n):
      X[:,i] = (X[:,i]-mu[i])/sigma[i]
      return X,mu,sigma
  • 计算协方差矩阵Σ(Covariance Matrix):$$\Sigma  = {1 \over m}\sum\limits_{i = 1}^n {{x^{(i)}}{{({x^{(i)}})}^T}} $$
    • 注意这里的Σ和求和符号不同
    • 协方差矩阵对称正定(不理解正定的看看线代)
    • 大小为nxn,nfeature的维度
    • 实现代码:

      Sigma = np.dot(np.transpose(X_norm),X_norm)/m # 求Sigma
  • 计算Σ的特征值和特征向量
    • 可以是用svd奇异值分解函数:U,S,V = svd(Σ)
    • 返回的是与Σ同样大小的对角阵S(由Σ的特征值组成)[注意matlab中函数返回的是对角阵,在python中返回的是一个向量,节省空间]
    • 还有两个**酉矩阵**U和V,且$$\Sigma  = US{V^T}$$
    • 这里写图片描述
    • 注意svd函数求出的S是按特征值降序排列的,若不是使用svd,需要按特征值大小重新排列U
  • 降维

    • 选取U中的前K列(假设要降为K维)
    • 这里写图片描述
    • Z就是对应降维之后的数据
    • 实现代码:
       # 映射数据
      def projectData(X_norm,U,K):
      Z = np.zeros((X_norm.shape[0],K))

      U_reduce = U[:,0:K] # 取前K个
      Z = np.dot(X_norm,U_reduce)
      return Z
  • 过程总结:
    • Sigma = X'*X/m
    • U,S,V = svd(Sigma)
    • Ureduce = U[:,0:k]
    • Z = Ureduce'*x

5、数据恢复

  • 因为:$${Z^{(i)}} = U_{reduce}^T*{X^{(i)}}$$
  • 所以:$${X_{approx}} = {(U_{reduce}^T)^{ - 1}}Z$$ (注意这里是X的近似值)
  • 又因为Ureduce为正定矩阵,【正定矩阵满足:$$A{A^T} = {A^T}A = E$$,所以:$${A^{ - 1}} = {A^T}$$】,所以这里:
  • $${X_{approx}} = {(U_{reduce}^{ - 1})^{ - 1}}Z = {U_{reduce}}Z$$
  • 实现代码:
    # 恢复数据 
def recoverData(Z,U,K):
X_rec = np.zeros((Z.shape[0],U.shape[0]))
U_recude = U[:,0:K]
X_rec = np.dot(Z,np.transpose(U_recude)) # 还原数据(近似)
return X_rec

6、主成分个数的选择(即要降的维度)

  • 如何选择
    • 投影误差(project error):$${1 \over m}\sum\limits_{i = 1}^m {||{x^{(i)}} - x_{approx}^{(i)}|{|^2}} $$
    • 总变差(total variation):$${1 \over m}\sum\limits_{i = 1}^m {||{x^{(i)}}|{|^2}} $$
    • 误差率(error ratio):$${{{1 \over m}\sum\limits_{i = 1}^m {||{x^{(i)}} - x_{approx}^{(i)}|{|^2}} } \over {{1 \over m}\sum\limits_{i = 1}^m {||{x^{(i)}}|{|^2}} }} \le 0.01$$,则称99%保留差异性
    • 误差率一般取1%,5%,10%
  • 如何实现
    • 若是一个个试的话代价太大
    • 之前U,S,V = svd(Sigma),我们得到了S,这里误差率error ratio:
      $$error{\kern 1pt} \;ratio = 1 - {{\sum\limits_{i = 1}^k {{S_{ii}}} } \over {\sum\limits_{i = 1}^n {{S_{ii}}} }} \le threshold$$
    • 可以一点点增加K尝试。

7、使用建议

  • 不要使用PCA去解决过拟合问题Overfitting,还是使用正则化的方法(如果保留了很高的差异性还是可以的)
  • 只有在原数据上有好的结果,但是运行很慢,才考虑使用PCA

8、运行结果

  • 2维数据降为1维
    • 要投影的方向
      这里写图片描述
    • 2D降为1D及对应关系
      这里写图片描述
  • 人脸数据降维
    • 原始数据
      这里写图片描述
    • 可视化部分U矩阵信息
      这里写图片描述
    • 恢复数据
      这里写图片描述

9、使用scikit-learn库中的PCA实现降维

  • 导入需要的包:
#-*- coding: utf-8 -*-
# Author:bob
# Date:2016.12.22
import numpy as np
from matplotlib import pyplot as plt
from scipy import io as spio
from sklearn.decomposition import pca
from sklearn.preprocessing import StandardScaler
  • 归一化数据
    '''归一化数据并作图'''
scaler = StandardScaler()
scaler.fit(X)
x_train = scaler.transform(X)
  • 使用PCA模型拟合数据,并降维
    • n_components对应要将的维度
    '''拟合数据'''
K=1 # 要降的维度
model = pca.PCA(n_compOnents=K).fit(x_train) # 拟合数据,n_components定义要降的维度
Z = model.transform(x_train) # transform就会执行降维操作
  • 数据恢复
    • model.components_会得到降维使用的U矩阵
    '''数据恢复并作图'''
Ureduce = model.components_ # 得到降维用的Ureduce
x_rec = np.dot(Z,Ureduce) # 数据恢复

推荐阅读
  • 扫描线三巨头 hdu1928hdu 1255  hdu 1542 [POJ 1151]
    学习链接:http:blog.csdn.netlwt36articledetails48908031学习扫描线主要学习的是一种扫描的思想,后期可以求解很 ... [详细]
  • 本文详细介绍了Java中org.w3c.dom.Text类的splitText()方法,通过多个代码示例展示了其实际应用。该方法用于将文本节点在指定位置拆分为两个节点,并保持在文档树中。 ... [详细]
  • 深入理解Redis的数据结构与对象系统
    本文详细探讨了Redis中的数据结构和对象系统的实现,包括字符串、列表、集合、哈希表和有序集合等五种核心对象类型,以及它们所使用的底层数据结构。通过分析源码和相关文献,帮助读者更好地理解Redis的设计原理。 ... [详细]
  • Python处理Word文档的高效技巧
    本文详细介绍了如何使用Python处理Word文档,涵盖从基础操作到高级功能的各种技巧。我们将探讨如何生成文档、定义样式、提取表格数据以及处理超链接和图片等内容。 ... [详细]
  • golang常用库:配置文件解析库/管理工具viper使用
    golang常用库:配置文件解析库管理工具-viper使用-一、viper简介viper配置管理解析库,是由大神SteveFrancia开发,他在google领导着golang的 ... [详细]
  • 深入解析JVM垃圾收集器
    本文基于《深入理解Java虚拟机:JVM高级特性与最佳实践》第二版,详细探讨了JVM中不同类型的垃圾收集器及其工作原理。通过介绍各种垃圾收集器的特性和应用场景,帮助读者更好地理解和优化JVM内存管理。 ... [详细]
  • 本文介绍了如何使用JQuery实现省市二级联动和表单验证。首先,通过change事件监听用户选择的省份,并动态加载对应的城市列表。其次,详细讲解了使用Validation插件进行表单验证的方法,包括内置规则、自定义规则及实时验证功能。 ... [详细]
  • 数据库内核开发入门 | 搭建研发环境的初步指南
    本课程将带你从零开始,逐步掌握数据库内核开发的基础知识和实践技能,重点介绍如何搭建OceanBase的开发环境。 ... [详细]
  • 本文详细介绍了Java编程语言中的核心概念和常见面试问题,包括集合类、数据结构、线程处理、Java虚拟机(JVM)、HTTP协议以及Git操作等方面的内容。通过深入分析每个主题,帮助读者更好地理解Java的关键特性和最佳实践。 ... [详细]
  • This document outlines the recommended naming conventions for HTML attributes in Fast Components, focusing on readability and consistency with existing standards. ... [详细]
  • 题目Link题目学习link1题目学习link2题目学习link3%%%受益匪浅!-----&# ... [详细]
  • 本文详细介绍了 Java 中 org.apache.xmlbeans.SchemaType 类的 getBaseEnumType() 方法,提供了多个代码示例,并解释了其在不同场景下的使用方法。 ... [详细]
  • 本文详细介绍了在企业级项目中如何优化 Webpack 配置,特别是在 React 移动端项目中的最佳实践。涵盖资源压缩、代码分割、构建范围缩小、缓存机制以及性能优化等多个方面。 ... [详细]
  • Windows 7 64位系统下Redis的安装与PHP Redis扩展配置
    本文详细介绍了在Windows 7 64位操作系统中安装Redis以及配置PHP Redis扩展的方法,包括下载、安装和基本使用步骤。适合对Redis和PHP集成感兴趣的开发人员参考。 ... [详细]
  • 程序员们欢呼雀跃:微软正式推出GitHub安卓版应用预览版,新增暗黑模式支持
    近日,GitHub正式发布了面向Android用户的移动应用预览版,这一消息让众多程序员兴奋不已。新版本不仅支持暗黑模式,还优化了用户体验,为开发者提供了更加便捷的代码管理和协作工具。此前,GitHub已为iOS用户推出了相应的移动应用,此次Android版的发布进一步扩大了其在移动开发领域的影响力。 ... [详细]
author-avatar
zwjy2018
这个家伙很懒,什么也没留下!
PHP1.CN | 中国最专业的PHP中文社区 | DevBox开发工具箱 | json解析格式化 |PHP资讯 | PHP教程 | 数据库技术 | 服务器技术 | 前端开发技术 | PHP框架 | 开发工具 | 在线工具
Copyright © 1998 - 2020 PHP1.CN. All Rights Reserved | 京公网安备 11010802041100号 | 京ICP备19059560号-4 | PHP1.CN 第一PHP社区 版权所有