九种聚类算法,探索无监督机器学习

今天,我想和大家分享一下机器学习中常见的无监督学习聚类方法

在无监督学习中,我们的数据并不带有任何标签,因此在无监督学习中要做的就是将这一系列无标签的数据输入到算法中,然后让算法找到一些隐含在数据中的结构,通过下图中的数据,可以找到的一个结构就是数据集中的点可以分成两组分开的点集(簇),能够圈出这些簇(cluster)的算法,就叫做聚类算法(clustering algorithm)。

九歌 九歌

九歌–人工智能诗歌写作系统

九歌 93 查看详情 九歌

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

九种聚类算法,探索无监督机器学习

聚类算法的应用

九种聚类算法,探索无监督机器学习

市场分割:将数据库中客户的信息根据市场进行不同的分组,从而实现对其分别销售或者根据不同的市场进行服务改进。社交网络分析:通过邮件最频繁联系的人及其最频繁联系的人来找到一个关系密切的群体。组织计算机集群:在数据中心里,计算机集群经常一起协同工作,可以用它来重新组织资源、重新布局网络、优化数据中心以及通信数据。了解银河系的构成:利用这些信息来了解一些天文学的知识。

聚类分析的目标是将观测值划分为组(“簇”),以便分配到同一簇的观测值之间的成对差异往往小于不同簇中的观测值之间的差异。聚类算法分为三种不同的类型:组合算法、混合建模和模式搜索。

常见的几种聚类算法有:

K-Means ClusteringHierarchical ClusteringAgglomerative ClusteringAffinity PropagationMean Shift ClusteringBisecting K-MeansDBSCANOPTICSBIRCH

K-means

K-means 算法是目前最流行的聚类方法之一。

K-means 是由贝尔实验室的 Stuart Lloyd 在 1957 年提出来的,最开始是用于脉冲编码调制,直到 1982 年才将该算法对外公布。1965 年,Edward W.Forgy 发布了相同的算法,因此 K-Means 有时被称为 Lloyd-Forgy。

聚类问题通常需要处理一组未经标记的数据集,并且需要一个算法来自动将这些数据分成有紧密关系的子集或簇。目前,最流行和广泛应用的聚类算法是K均值算法

直观理解 K 均值算法:

九种聚类算法,探索无监督机器学习

假如有一个无标签的数据集(上图左),并且我们想要将其分为两个簇,现在执行 K 均值算法,具体操作如下:

第一步,随机生成两个点(因为想要将数据聚成两类)(上图右),这两个点叫做聚类中心(cluster centroids)。第二步,进行 K 均值算法的内循环。K 均值算法是一个迭代算法,它会做两件事情,第一个是簇分配(cluster assignment),第二个是移动聚类中心(move centroid)。

内循环的第一步是要进行簇分配,也就是说,遍历每一个样本,再根据每一个点到聚类中心距离的远近将其分配给不同的聚类中心(离谁近分配给谁),对于本例而言,就是遍历数据集,将每个点染成红色或蓝色。

内循环的第二步是将聚类中心移动,使得红色和蓝色的聚类中心分别移动到它们所属点的平均位置

将所有的点根据与新的聚类中心距离的远近进行新的簇分配,并且不断循环此过程,直到聚类中心的位置不再随着迭代而改变,同时点的颜色也不再发生改变。这时可以说K均值已经完成了聚合。这个算法在找出数据中的两个簇方面表现相当出色

九种聚类算法,探索无监督机器学习

K-Means算法的优点:

简单易懂,计算速度较快,适用于大规模数据集。

缺点:

例如对于非球形簇的处理能力较差,容易受到初始簇心的选择影响,需要预先指定簇的数量K等。此外,当数据点之间存在噪声或者离群点时,K-Means算法可能会将它们分配到错误的簇中。

Hierarchical Clustering

层次聚类是按照某个层次对样本集进行聚类的操作。这里的层次指的实际上是某种距离的定义

聚类的最终目的是减少分类的数量,因此在行为上类似于从叶子节点向根节点逐步靠近的树状图过程,这种行为也被称为“自下而上”

更通俗的,层次聚类是将初始化的多个类簇看做树节点,每一步迭代,都是将两两相近的类簇合并成一个新的大类簇,如此反复,直至最终只剩一个类簇(根节点)。

层次聚类策略分为两种基本范式:聚集型(自下而上)和分裂型(自上而下)。

与层次聚类相反的是分裂聚类,也称为DIANA(Divise Analysis),其行为过程为“自上而下”

K-means算法的结果取决于选择搜索的聚类数量和起始配置的分配。而相反,层次聚类方法则不需要这样的规范。相反,它们要求用户根据两组观察值之间的成对差异性来指定(不相交)观察组之间的差异性度量。顾名思义,层次聚类方法产生一个层次结构表示,其中每个层次的集群都是通过合并下一个较低级别的集群而创建的。在最低级别,每个集群包含一个观察值。在最高级别,只有一个集群包含所有的数据

优点:

距离和规则的相似度容易定义,限制少;不需要预先制定聚类数;可以发现类的层次关系;可以聚类成其它形状。

缺点:

计算复杂度太高;奇异值也能产生很大影响;算法很可能聚类成链状。

Agglomerative Clustering

重写后的内容为:凝聚层次聚类(Agglomerative Clustering)是一种自底向上的聚类算法,它将每个数据点看作一个初始簇,并逐步合并它们以形成更大的簇,直到满足停止条件。在该算法中,每个数据点最初被视为一个单独的簇,然后逐步合并簇,直到所有数据点合并为一个大簇

优点:

适用于不同形状和大小的簇,且不需要事先指定聚类数目。该算法也可以输出聚类层次结构,便于分析和可视化。

缺点:

计算复杂度较高,尤其是在处理大规模数据集时,需要消耗大量的计算资源和存储空间。该算法对初始簇的选择也比较敏感,可能会导致不同的聚类结果。

Affinity Propagation

修改后的内容:亲和传播算法(AP)通常被翻译为亲和力传播算法或者邻近传播算法

Affinity Propagation 是一种基于图论的聚类算法,旨在识别数据中的”exemplars”(代表点)和”clusters”(簇)。与 K-Means 等传统聚类算法不同,Affinity Propagation 不需要事先指定聚类数目,也不需要随机初始化簇心,而是通过计算数据点之间的相似性得出最终的聚类结果。

优点:

不需要制定最终聚类族的个数已有的数据点作为最终的聚类中心,而不是新生成一个簇中心。模型对数据的初始值不敏感。对初始相似度矩阵数据的对称性没有要求。相比与 k-centers 聚类方法,其结果的平方差误差较小。

缺点:

该算法的计算复杂度较高,需要大量的存储空间和计算资源;对于噪声点和离群点的处理能力较弱。

Mean Shift Clustering

平移聚类是一种基于密度的非参数聚类算法,其基本思想是通过寻找数据点密度最大的位置(称为“局部最大值”或“高峰”),来识别数据中的群集。该算法的核心在于对每个数据点进行局部密度估计,并将密度估计结果用于计算数据点移动的方向和距离

优点:

不需要指定簇的数目,且对于形状复杂的簇也有很好的效果。算法还能够有效地处理噪声数据。

缺点:

计算复杂度较高,尤其是在处理大规模数据集时,需要消耗大量的计算资源和存储空间;该算法还对初始参数的选择比较敏感,需要进行参数调整和优化。

Bisecting K-Means

Bisecting K-Means 是一种基于 K-Means 算法的层次聚类算法,其基本思想是将所有数据点划分为一个簇,然后将该簇分成两个子簇,并对每个子簇分别应用 K-Means 算法,重复执行这个过程,直到达到预定的聚类数目为止。

算法首先将所有数据点视为一个初始簇,然后对该簇应用K-Means算法,将该簇分成两个子簇,并计算每个子簇的误差平方和(SSE)。然后,选择误差平方和最大的子簇,并将其再次分成两个子簇,重复执行这个过程,直到达到预定的聚类数目为止。

优点:

具有较高的准确性和稳定性,能够有效地处理大规模数据集,并且不需要指定初始聚类数目。该算法还能够输出聚类层次结构,便于分析和可视化。

缺点:

计算复杂度较高,尤其是在处理大规模数据集时,需要消耗大量的计算资源和存储空间。此外该算法对初始簇的选择也比较敏感,可能会导致不同的聚类结果。

DBSCAN

基于密度的空间聚类算法DBSCAN(Density-Based Spatial Clustering of Applications with Noise)是一种典型的具有噪声的聚类方法

密度的方法具有不依赖于距离的特点,而是依赖于密度。因此,它能够克服基于距离的算法只能发现“球形”聚簇的缺点

DBSCAN算法的核心思想是:对于一个给定的数据点,如果它的密度达到一定的阈值,则它属于一个簇中;否则,它被视为噪声点。

优点:

这类算法能克服基于距离的算法只能发现“类圆形”(凸)的聚类的缺点;可发现任意形状的聚类,且对噪声数据不敏感;不需要指定类的数目 cluster;算法中只有两个参数,扫描半径 (eps)和最小包含点数(min_samples)。

缺点:

计算复杂度,不进行任何优化时,算法的时间复杂度是O(N^{2}),通常可利用R-tree,k-d tree, ball;tree索引来加速计算,将算法的时间复杂度降为O(Nlog(N));受eps影响较大。在类中的数据分布密度不均匀时,eps较小时,密度小的cluster会被划分成多个性质相似的cluster;eps较大时,会使得距离较近且密度较大的cluster被合并成一个cluster。在高维数据时,因为维数灾难问题,eps的选取比较困难;依赖距离公式的选取,由于维度灾害,距离的度量标准不重要;不适合数据集集中密度差异很大的,因为eps和metric选取很困难。

OPTICS

OPTICS(Ordering Points To Identify the Clustering Structure)是一种基于密度的聚类算法,它能够自动确定簇的数量,同时也能够发现任意形状的簇,并且能够处理噪声数据

OPTICS 算法的核心思想是根据给定数据点计算其与其他点之间的距离,以确定其在密度上的可达性,并构建一个基于密度的距离图。然后,通过扫描该距离图,自动确定簇的数量,并对每个簇进行划分

优点:

能够自动确定簇的数量,并能够处理任意形状的簇,并能够有效地处理噪声数据。该算法还能够输出聚类层次结构,便于分析和可视化。

缺点:

计算复杂度较高,尤其是在处理大规模数据集时,需要消耗大量的计算资源和存储空间。该算法对于密度差异较大的数据集,可能会导致聚类效果不佳。

BIRCH

BIRCH(平衡迭代降低和层次聚类)是一种基于层次聚类的聚类算法,它能够高效地处理大规模数据集,并且对于任何形状的簇都能够取得良好的效果

BIRCH算法的核心思想是:透過對數據集進行分層聚類,逐步減小數據規模,最終得到簇結構。BIRCH算法採用一種類似於B樹的結構,稱為CF樹,它可以快速地插入和刪除子簇,並且可以自動平衡,從而確保簇的質量和效率

优点:

能够快速处理大规模数据集,并且对于任意形状的簇都有较好的效果。该算法对于噪声数据和离群点也有较好的容错性。

缺点:

对于密度差异较大的数据集,可能会导致聚类效果不佳;对于高维数据集的效果也不如其他算法。

以上就是九种聚类算法,探索无监督机器学习的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/454163.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
上一篇 2025年11月8日 00:41:11
下一篇 2025年11月8日 00:42:08

相关推荐

  • 人工智能如何将数据中心转变为可持续性的动力

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 数据中心历来是许多技术进步的支柱,现在面临的不仅仅是基础设施提供商的问题。人工智能的快速发展凸显了数据中心迫切需要更加敏捷、创新和协作,为这个新时代提供动力。 人工智能和机器学习的蓬勃发展,加上…

    2025年12月2日 科技
    000
  • 如何通过人工智能(AI)和机器学习应对零售劳动力和执行方面的挑战

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 斑马技术大中华区技术总监 程宁 面对不断增长的需求,零售团队人员数量及具体运营执行是否能及时匹%ignore_a_1%,正成为零售商们不得不面临的挑战。零售团队人员的短缺将使商店难以正常运营。当…

    2025年12月2日
    000
  • 用于数据增强的十个Python库

    数据增强是人工智能和机器学习领域的一项关键技术。它涉及到创建现有数据集的变体,提高模型性能和泛化。python是一种流行的ai和ml语言,它提供了几个强大的数据增强库。在本文中,我们将介绍数据增强的十个python库,并为每个库提供代码片段和解释。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索…

    2025年12月1日 科技
    000
  • 机器学习算法中的特征筛选问题

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 机器学习算法中的特征筛选问题 在机器学习领域中,特征筛选是一个非常重要的问题,它的目标是从大量的特征中选择出对预测任务最有用的特征。通过特征筛选可以降低维度,减少计算复杂度,提高模型的准确性和解…

    2025年12月1日 科技
    000
  • 解决不均衡数据集的分类方法有哪些?

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 在机器学习领域,不平衡数据集是一种常见问题,指的是训练数据集中不同类别的样本数量差异很大。例如,在二分类问题中,正样本数量远远小于负样本数量。这会导致训练出的模型更倾向于预测数量更多的类别,而忽…

    2025年12月1日 科技
    000
  • 零知识机器学习:应用与发展潜力

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 零知识机器学习(Zero-Knowledge Machine Learning,ZKML)是一种新兴的机器学习技术,旨在在保护数据隐私的同时实现机器学习任务。它的潜力在于解决当前机器学习中普遍存…

    2025年12月1日 科技
    000
  • 了解自动编码器的训练方法:从架构探究开始

    噪声数据是机器学习中常见的问题之一,自动编码器是解决这类问题的有效方法。本文将介绍自动编码器的结构和正确训练方法。 自动编码器是一种无监督学习的人工神经网络,用于学习数据的编码。其目标是通过训练网络来捕捉输入图像的关键特征,并将其转化为低维表示,常用于降维处理。 自动编码器的架构 自动编码器由3部分…

    2025年12月1日 科技
    000
  • 零基础图像识别的学习方法

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 基于零次学习的图像识别是一种新兴的技术,它与传统的图像识别方法不同。传统的图像识别需要通过训练数据来学习特征和分类规则,而零次学习则不需要预先训练模型。它是根据待识别图像的特征进行实时分类,从而…

    2025年12月1日 科技
    000
  • 手写识别技术及其算法分类

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 机器学习技术的进步必定推动手写识别技术的发展。本文将重点介绍目前表现优异的手写识别技术和算法。 matlab基础知识简介 中文WORD版 MATLAB(矩阵实验室)是MATrix LABorat…

    2025年12月1日 科技
    000
  • 拥抱未来:塑造 2024 年的顶尖技术

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 在充满活力的技术创新领域,每一年都会带来一系列进步,重新定义我们的生活、工作以及与周围世界互动的方式。 步入 2024 年,大量突破性技术有望彻底改变我们生活的各个方面,从医疗保健、交通到通信和…

    2025年12月1日 科技
    000
  • Web 端实时防挡脸弹幕(基于机器学习)

    防挡脸弹幕,即大量弹幕飘过,但不会遮挡视频画面中的人物,看起来像是从人物背后飘过去的。 机器学习已经火了好几年了,但很多人都不知道浏览器中也能运行这些能力; 本文介绍在视频弹幕方面的实践优化过程,文末列举了一些本方案可适用的场景,期望能开启一些脑洞。 mediapipe Demo(https://g…

    2025年12月1日 科技
    000
  • 机器人技能大比拼

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 2023年6月30日,合肥市瑶海区的三十八中学北校区成功举办了第八届青少年机器人竞赛。超过400名青少年在全区参与了包括机器人创意、综合技能和创新挑战在内的8个项目的比赛,共同感受科技的魅力。(…

    2025年12月1日 科技
    100
  • 智能化解决方案:保障数据安全阻击泄露和丢失

    网络安全是一场不断进行的战斗,每天都会出现新的威胁,首席信息安全官 (ciso) 正在努力跟进。他们承受着警报的压力,团队也面临着挑战。因此,ciso 及其团队面临着持续的压力,需要寻找新的创新方法来保护组织免受伤害。其中一种应对方法是利用人工智能 (ai) 的力量。人工智能可以帮助识别潜在威胁,自…

    2025年12月1日 科技
    000
  • 九种常用的Python特征重要性分析方法

    特征重要性分析用于了解每个特征(变量或输入)对于做出预测的有用性或价值。目标是确定对模型输出影响最大的最重要的特征,它是机器学习中经常使用的一种方法。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 为什么特征重要性分析很重要? 如果有一个包…

    2025年12月1日 科技
    000
  • 人工智能和机器学习将如何改变数据中心?

    高盛预计,到 2025 年,全球人工智能投资预计将达到 2000 亿美元。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 这些快速发展的技术的巨大潜力刺激了其用例的显着增加,从医疗保健转型到增强客户体验。 尽管人们已经对人工智能和机器学习在…

    2025年12月1日 科技
    000
  • 使用Panda-Gym的机器臂模拟实现Deep Q-learning强化学习

    强化学习(rl)是一种机器学习方法,它允许代理通过试错来学习如何在环境中表现。行为主体会因为采取行动导致预期结果而获得奖励或受到惩罚。随着时间的推移,代理会学会采取行动,以使得其预期回报最大化 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ …

    2025年12月1日 科技
    000
  • 2023年AI和ML在数据中心的十大新兴应用

    人工智能(ai)和机器学习(ml)已经成为数据中心领域的关键技术。到2023年,我们将目睹数据中心运营、效率和安全性的革命,这要归功于人工智能和机器学习的应用。这些技术越来越多地实现了任务的自动化,优化了资源管理,并提高了整个数据中心的性能。本文详细探讨了十种新兴的数据中心应用,这些应用将在今年彻底…

    2025年12月1日 科技
    100
  • 机器学习 | PyTorch简明教程上篇

    前面几篇文章介绍了特征归一化和张量,接下来开始写两篇pytorch简明教程,主要介绍pytorch简单实践。 1、四则运算 import torcha = torch.tensor([2, 3, 4])b = torch.tensor([3, 4, 5])print(“a + b: “, (a + …

    2025年12月1日 科技
    100
  • 机器学习|PyTorch简明教程下篇

    接着上篇《pytorch简明教程上篇》,继续学习多层感知机,卷积神经网络和lstmnet。 1、多层感知机 多层感知机是一种简单的神经网络,也是深度学习的重要基础。它通过在网络中添加一个或多个隐藏层来克服线性模型的限制。具体的图示如下: ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限…

    2025年12月1日 科技
    000
  • 微软新专利公布:通过机器学习创建出“会脸红”的逼真头像

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 11 月 16 日消息,微软的一项新专利于当地时间周二在美国专利商标局网站上公开,这是一种新的机器学习模型专利,可为用户创作出“更加有生命力”的逼真头像。 据介绍,通过新的机器学习模型,头像或照…

    2025年12月1日 科技
    000

发表回复

登录后才能评论
关注微信