Stanford机器学习第九讲.聚类

作者：爱着你心却痛_534 | 来源：互联网 | 2023-10-15 16:17

原文：http:blog.csdn.netabcjenniferarticledetails7914952本栏目（Machinelearning）包括单参数的线性回归、多参数的线性

原文：http://blog.csdn.net/abcjennifer/article/details/7914952

本栏目（Machine learning）包括单参数的线性回归、多参数的线性回归、Octave Tutorial、Logistic Regression、Regularization、神经网络、机器学习系统设计、SVM（Support Vector Machines 支持向量机）、聚类、降维、异常检测、大规模机器学习等章节。内容大多来自Standford公开课machine learning中Andrew老师的讲解和其他书籍的借鉴。（https://class.coursera.org/ml/class/index）

第九讲. 聚类——Clustering

===============================

（一）、什么是无监督学习？

（二）、KMeans聚类算法

（三）、Cluster问题的(distortion)cost function

（四）、如何选择初始化时的类中心

（五）、聚类个数的选择

=====================================

（一）、什么是无监督学习

之前的几章我们只涉及到有监督学习，本章中，我们通过讨论另一种Machine learning方式：无监督学习。首先呢，我们来看一下有监督学习与无监督学习的区别。

给定一组数据(input，target)为Z=(X，Y)。

有监督学习：最常见的是regression & classification。

regression：Y是实数vector。回归问题，就是拟合(X，Y)的一条曲线，使得下式cost function L最小。

技术分享

classification：Y是一个finite number，可以看做类标号。分类问题需要首先给定有label的数据训练分类器，故属于有监督学习过程。分类问题中，cost function L(X,Y)是X属于类Y的概率的负对数。

技术分享，其中f_i(X)=P(Y=i | X);

技术分享

无监督学习：无监督学习的目的是学习一个function f，使它可以描述给定数据的位置分布P(Z)。包括两种：density estimation & clustering.

density estimation就是密度估计，估计该数据在任意位置的分布密度
clustering就是聚类，将Z聚集几类（如K-Means），或者给出一个样本属于每一类的概率。由于不需要事先根据训练数据去train聚类器，故属于无监督学习。
PCA和很多deep learning算法都属于无监督学习。

好了，大家理解了吧，unsupervised learning也就是不带类标号的机器学习。

练习：

技术分享

=====================================

（二）、K-Means聚类算法

KMeans是聚类算法的一种，先来直观的看一下该算法是怎样聚类的。给定一组数据如下图所示，K-Means算法的聚类流程如图：

技术分享

图中显示了Kmeans聚类过程，给定一组输入数据{x(1),x(2),...,x(n)}和预分类数k，算法如下：

技术分享

首先随机指定k个类的中心U1~Uk，然后迭代地更新该centroid。

其中，C(i)表示第i个数据离那个类中心最近，也就是将其判定为属于那个类，然后将这k各类的中心分别更新为所有属于这个类的数据的平均值。

=====================================

（三）、Cluster问题的(distortion)cost function

在supervised learning中我们曾讲过cost function，类似的，在K-means算法中同样有cost function，我们有时称其为distortion cost function.

如下图所示，J(C,U)就是我们要minimize的function.

技术分享

即最小化所有数据与其聚类中心的欧氏距离和。

再看上一节中我们讲过的KMeans算法流程，第一步为固定类中心U，优化C的过程：

技术分享

第二步为优化U的过程：

技术分享

这样进行迭代，就可以完成cost function J的优化。

练习：

技术分享

这里大家注意，回归问题中有可能因为学习率设置过大产生随着迭代次数增加，cost function反倒增大的情况。但聚类是不会产生这样的问题的，因为每一次聚类都保证了使J下降，且无学习率做参数。

=====================================

（四）、如何选择初始化时的类中心

在上面的kmeans算法中，我们提到可以用randomly的方法选择类中心，然而有时效果并不是非常好，如下图所示：

技术分享

fig.1. original data

对于上图的这样一组数据，如果我们幸运地初始化类中心如图2，

技术分享

fig.2. lucky initialization

技术分享

fig.3. unfortunate initialization

但如果将数据初始化中心选择如图3中的两种情况，就悲剧了！最后的聚类结果cost function也会比较大。针对这个问题，我们提出的solution是，进行不同initialization（50~1000次），每一种initialization的情况分别进行聚类，最后选取cost function J(C,U)最小的作为聚类结果。

=====================================

（五）、聚类个数的选择

How to choose the number of clusters? 这应该是聚类问题中一个头疼的part，比如KMeans算法中K的选择。本节就来解决这个问题。

最著名的一个方法就是elbow-method，做图k-J(cost function)如下：

技术分享

若做出的图如上面左图所示，那么我们就找图中的elbow位置作为k的选定值，如果像右图所示并无明显的elbow点呢，大概就是下图所示的数据分布：

技术分享

这种情况下需要我们根据自己的需求来进行聚类，比如Tshirt的size，可以聚成{L,M,S}三类，也可以分为{XL，L，M，S，XS}5类。需要大家具体情况具体分析了~

练习：

技术分享

==============================================

小结

本章讲述了Machine learning中的又一大分支——无监督学习，其实大家对无监督学习中的clustering问题应该很熟悉了，本章中讲到了几个significant points就是elbow 方法应对聚类个数的选择和聚类中心初始化方法，值得大家投入以后的应用。

Stanford机器学习---第九讲. 聚类

推荐阅读

js
几何画板展示电场线与等势面的交互关系

几何画板是一款功能强大的物理教学软件，具备丰富的绘图和度量工具。它不仅能够模拟物理实验过程，还能通过定量分析揭示物理现象背后的规律，尤其适用于难以在实际实验中展示的内容。本文将介绍如何使用几何画板演示电场线与等势面之间的关系。 ... [详细]

蜡笔小新 2024-12-27 10:46:07
sum
深入理解OAuth认证机制

本文介绍了OAuth认证协议的核心概念及其工作原理。OAuth是一种开放标准，旨在为第三方应用提供安全的用户资源访问授权，同时确保用户的账户信息（如用户名和密码）不会暴露给第三方。 ... [详细]

蜡笔小新 2024-12-28 12:07:46
sum
2023 ARM嵌入式系统全国技术巡讲

2023 ARM嵌入式系统全国技术巡讲旨在分享ARM公司在半导体知识产权(IP)领域的最新进展。作为全球领先的IP提供商，ARM在嵌入式处理器市场占据主导地位，其产品广泛应用于90%以上的嵌入式设备中。此次巡讲将邀请来自ARM、飞思卡尔以及华清远见教育集团的行业专家，共同探讨当前嵌入式系统的前沿技术和应用。 ... [详细]

蜡笔小新 2024-12-28 11:58:48
post
新浪笔试题

1:有如下一段程序：packagea.b.c;publicclassTest{privatestaticinti0;publicintgetNext(){return ... [详细]

蜡笔小新 2024-12-27 19:32:17
get
深入理解Cookie与Session会话管理

本文详细介绍了如何通过HTTP响应和请求处理浏览器的Cookie信息，以及如何创建、设置和管理Cookie。同时探讨了会话跟踪技术中的Session机制，解释其原理及应用场景。 ... [详细]

蜡笔小新 2024-12-27 18:20:43
get
Linux 自动化安装脚本详解

本文介绍了一款用于自动化部署 Linux 服务的 Bash 脚本。该脚本不仅涵盖了基本的文件复制和目录创建，还处理了系统服务的配置和启动，确保在多种 Linux 发行版上都能顺利运行。 ... [详细]

蜡笔小新 2024-12-27 16:33:32
get
在Linux系统中配置并启动ActiveMQ

本文详细介绍了如何在Linux环境中安装和配置ActiveMQ，包括端口开放及防火墙设置。通过本文，您可以掌握完整的ActiveMQ部署流程，确保其在网络环境中正常运行。 ... [详细]

蜡笔小新 2024-12-27 14:38:54
get
CSS 布局：液态三栏混合宽度布局

本文介绍了如何使用 CSS 实现液态的三栏布局，其中各栏具有不同的宽度设置。通过调整容器和内容区域的属性，可以实现灵活且响应式的网页设计。 ... [详细]

蜡笔小新 2024-12-28 02:40:28
utf-8
Linux 系统启动故障排除指南：MBR 和 GRUB 问题

本文详细介绍了 Linux 系统启动过程中常见的 MBR 扇区和 GRUB 引导程序故障及其解决方案，涵盖从备份、模拟故障到恢复的具体步骤。 ... [详细]

蜡笔小新 2024-12-27 20:40:29
utf-8
通过类型和标签选择元素

本文介绍了如何使用jQuery根据元素的类型（如复选框）和标签名（如段落）来获取DOM对象。这有助于更高效地操作网页中的特定元素。 ... [详细]

蜡笔小新 2024-12-27 19:44:14
timezone
PHP 5.2.5 安装与配置指南

本文详细介绍了 PHP 5.2.5 的安装和配置步骤，帮助开发者解决常见的环境配置问题，特别是上传图片时遇到的错误。通过本教程，您可以顺利搭建并优化 PHP 运行环境。 ... [详细]

蜡笔小新 2024-12-27 19:05:41
timezone
Xcode 中多行代码缩进技巧

本文介绍如何在 Xcode 中使用快捷键和菜单命令对多行代码进行缩进，包括右缩进和左缩进的具体操作方法。 ... [详细]

蜡笔小新 2024-12-27 17:52:34
timezone
如何在WPS Office for Mac中调整Word文档的文字排列方向

本文将详细介绍如何使用最新版WPS Office for Mac调整Word文档中的文字排列方向。通过这些步骤，用户可以轻松更改文本的水平或垂直排列方式，以满足不同的排版需求。 ... [详细]

蜡笔小新 2024-12-27 12:34:14
rsa
使用Windows批处理脚本监控并重启Java应用程序

本文介绍如何通过Windows批处理脚本定期检查并重启Java应用程序，确保其持续稳定运行。脚本每30分钟检查一次，并在需要时重启Java程序。同时，它会将任务结果发送到Redis。 ... [详细]

蜡笔小新 2024-12-27 10:44:39
select
MySQL中枚举类型的所有可能值获取方法

本文介绍了一种在MySQL数据库中查询枚举（ENUM）类型字段所有可能取值的方法，帮助开发者更好地理解和利用这一数据类型。 ... [详细]

蜡笔小新 2024-12-27 10:36:44

爱着你心却痛_534

这个家伙很懒，什么也没留下！

Tags | 热门标签

RankList | 热门文章