监督学习与无监督学习:专家定义差距

需要重写的内容是:了解监督学习无监督学习和半监督学习的特征,以及它们在机器学习项目中的应用方式

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

监督学习与无监督学习:专家定义差距

在讨论人工智能技术时,监督学习往往是最受关注的一种方法,因为它通常是创建人工智能模型的最后一步,可以用于图像识别、更好的预测、产品推荐和潜在客户评分等方面

相比之下,无监督学习往往在人工智能开发生命周期的早期在幕后工作:它通常被用来为监督学习的魔力展开奠定基础,就像让经理大放异彩的繁重工作一样。正如后面所解释的,这两种机器学习模式都可以有效地应用于业务问题。

在技术层面上,监督学习与无监督学习之间的区别在于用于创建算法的原始数据是预先标记(监督学习)还是未预先标记(无监督学习)。

我们开始吧

什么是监督学习?

在监督学习中,数据科学家会为算法提供标记过的训练数据,并定义他们希望算法评估相关性的变量

算法的输入数据和输出变量都是通过训练数据来指定的。举个例子,如果您想要使用监督学习的方法来训练算法判断一张图片中是否有猫,您可以为每一张在训练数据中使用的图片创建一个标签,来指示这个图像是否含有猫

正如我们在监督学习的定义中所解释的那样:“[A]计算机算法是在为特定输出标记的输入数据上训练的。该模型经过训练,直到它能够检测到输入数据和输出标签之间的基本模式和关系,使其能够在呈现前所未见的数据时产生准确的标记结果。监督算法的常见类型包括分类、决策树、回归和预测建模,您可以在 Arcitura Education 的机器学习教程中了解这些内容。

监督式机器学习技术用于各种业务应用程序,包括以下内容:

个性化营销。保险/信贷承销决策。欺诈检测。垃圾邮件过滤。

什么是无监督学习?

在无监督学习中,有一种适用于此方法的算法(例如K-means聚类),它是在未标记的数据上进行训练的。该算法会扫描数据集,寻找其中的任何有意义的关联。换句话说,无监督学习会确定数据中的模式和相似性,而不是将其与某些外部度量相关联

当您不知道自己在寻找什么时,这种方法很有用,而当您知道时,这种方法就不那么有用了。如果你向无监督算法展示了数千或数百万张图片,它可能会将图片的子集归类为人类识别为猫科动物的图像。相比之下,在猫与犬科动物的标记数据上训练的监督算法能够高度自信地识别猫的图像。但这种方法有一个权衡:如果监督学习项目需要数百万张标记图像来开发模型,那么机器生成的预测需要大量的人力。

有一个中间地带:半监督学习。

什么是半监督学习?

半监督学习是将无监督学习和监督学习结合的一种有效方法。它通过一定的工作流程,使用无监督学习算法自动产生标签,然后将这些标签输入到监督学习算法中。在该方法中,人类手动标记一些图像,而无监督学习算法则猜测其他图像的标签,最终将所有的标签和图像输入到监督学习算法中,从而创建AI模型

半监督学习的一个好处是可以降低在机器学习中使用大规模数据集的成本。根据企业数据目录平台Alation的联合创始人兼首席创新官Aaron Kalb的说法,如果能够让人类对数百万个样本中的0.01%进行标记,计算机就可以利用这些标签来显著提高其预测准确性

监督学习与无监督学习:专家定义差距

什么是强化学习?

另一种机器学习方法是强化学习。强化学习通常用于教机器完成一系列步骤,不同于监督学习和无监督学习。数据科学家对算法进行编程来执行任务,在确定如何完成任务时给予积极或消极的线索或强化。程序员为奖励设定规则,但让算法自己决定需要采取哪些步骤来最大化奖励,从而完成任务。

什么时候应该使用监督学习与无监督学习?

LinkedIn机器学习经理Shivani Rao表示,采用监督或无监督机器学习方法的最佳实践通常取决于环境,你可以对数据和应用程序做出的假设。

Rao说,使用监督学习与无监督机器学习算法的选择也会随着时间的推移而改变。在模型构建过程的早期阶段,数据通常是未标记的,而标记的数据可以在建模的后期阶段出现。

举个例子,对于预测LinkedIn成员是否会观看课程视频的问题,第一个模型采用无监督技术。在提供这些建议后,记录某人是否单击建议的指标将提供新的数据来生成标签

LinkedIn 还使用这种技术来标记学生可能想要获得的技能的在线课程。人工标记者,例如作者、出版商或学生,可以提供课程教授的精确和准确的技能列表,但他们不可能提供此类技能的详尽列表。因此,可以认为这些数据标记不完整。这些类型的问题可以使用半监督技术来帮助构建一组更详尽的标记。

数据科学和高级分析专家、咨询公司科尔尼(Kearney)的合伙人巴拉特·托塔(Bharath Thota)表示,他的团队选择使用监督学习或无监督学习时,也往往会考虑实际因素。

Thota说:“当有可用的标记数据时,我们选择监督学习作为应用程序,目标是预测或分类未来的观察结果。当没有可用的标记数据时,我们使用无监督学习,目标是通过从数据中识别模式或片段来制定策略。”

Kalb说,Alation数据科学家在内部将无监督学习用于各种应用程序。例如,他们开发了一种人机协作流程,用于将晦涩难懂的数据对象名称翻译成人类语言,例如,将“na_gr_rvnu_ps”翻译成“北美专业服务总收入”。在这种情况下,机器猜测,人类确认,机器学习

“你可以把它想象成一个迭代循环中的半监督学习,创造一个提高准确性的良性循环,”Kalb说。

5种无监督学习技巧

在高层次上,监督学习技术倾向于关注线性回归(将模型拟合到一组数据点以进行预测)或分类问题(图像是否有猫?

非监督学习技术通常采用多种方式对原始数据集进行切片和切块,以补充监督学习的工作,这些方式包括:

数据聚类。具有相似特征的数据点组合在一起,以帮助更有效地理解和探索数据。例如,公司可能会使用数据聚类方法根据客户的人口统计、兴趣、购买行为和其他因素将客户细分为几组。

降维。数据集中的每个变量都被视为一个单独的维度。但是,许多模型通过分析变量之间的特定关系来更好地工作。降维的一个简单例子是将利润用作单一维度,它表示收入减去支出——两个独立的维度。但是,可以使用主成分分析、自动编码器、将文本转换为向量的算法或 T 分布随机邻域嵌入等算法生成更复杂的新变量类型。

降维可以帮助减少过度拟合的问题,在这种问题中,模型适用于小数据集,但不能很好地泛化到新数据。该技术还使公司能够以 2D 或 3D 形式可视化人类可以轻松理解的高维数据。

异常或异常值检测。无监督学习可以帮助识别常规数据分布之外的数据点。识别和删除异常作为数据准备步骤可能会提高机器学习模型的性能。

迁移学习。这些算法利用在相关但不同的任务上训练的模型。例如,迁移学习技术可以很容易地微调在维基百科文章上训练的分类器,以使用正确的主题标记任意类型的新文本。LinkedIn的Rao表示,这是解决没有标签的数据问题的最有效,最快捷的方法之一。

基于图形的算法。Rao说,这些技术试图构建一个图表来捕捉数据点之间的关系。例如,如果每个数据点表示具有技能的 LinkedIn 成员,则可以使用图形来表示成员,其中边缘表示成员之间的技能重叠。图形算法还可以帮助将标签从已知数据点转移到未知但密切相关的数据点。无监督学习还可用于在不同类型的实体(源和目标)之间构建图形。边缘越强,源节点与目标节点的亲和力就越高。例如,LinkedIn 使用它们将成员与基于技能的课程相匹配。

以上就是监督学习与无监督学习:专家定义差距的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/808057.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
上一篇 2025年11月26日 21:13:47
下一篇 2025年11月26日 21:14:43

相关推荐

  • 怎样用免费工具美化PPT_免费美化PPT的实用方法分享

    利用KIMI智能助手可免费将PPT美化为科技感风格,但需核对文字准确性;2. 天工AI擅长优化内容结构,提升逻辑性,适合高质量内容需求;3. SlidesAI支持语音输入与自动排版,操作便捷,利于紧急场景;4. Prezo提供多种模板,自动生成图文并茂幻灯片,适合学生与初创团队。 如果您有一份内容完…

    2025年12月6日 软件教程
    000
  • Pages怎么协作编辑同一文档 Pages多人实时协作的流程

    首先启用Pages共享功能,点击右上角共享按钮并选择“添加协作者”,设置为可编辑并生成链接;接着复制链接通过邮件或社交软件发送给成员,确保其使用Apple ID登录iCloud后即可加入编辑;也可直接在共享菜单中输入邮箱地址定向邀请,设定编辑权限后发送;最后在共享面板中管理协作者权限,查看实时在线状…

    2025年12月6日 软件教程
    100
  • REDMI K90系列正式发布,售价2599元起!

    10月23日,redmi k90系列正式亮相,推出redmi k90与redmi k90 pro max两款新机。其中,redmi k90搭载骁龙8至尊版处理器、7100mah大电池及100w有线快充等多项旗舰配置,起售价为2599元,官方称其为k系列迄今为止最完整的标准版本。 图源:REDMI红米…

    2025年12月6日 行业动态
    200
  • Linux中如何安装Nginx服务_Linux安装Nginx服务的完整指南

    首先更新系统软件包,然后通过对应包管理器安装Nginx,启动并启用服务,开放防火墙端口,最后验证欢迎页显示以确认安装成功。 在Linux系统中安装Nginx服务是搭建Web服务器的第一步。Nginx以高性能、低资源消耗和良好的并发处理能力著称,广泛用于静态内容服务、反向代理和负载均衡。以下是在主流L…

    2025年12月6日 运维
    000
  • Linux journalctl与systemctl status结合分析

    先看 systemctl status 确认服务状态,再用 journalctl 查看详细日志。例如 nginx 启动失败时,systemctl status 显示 Active: failed,journalctl -u nginx 发现端口 80 被占用,结合两者可快速定位问题根源。 在 Lin…

    2025年12月6日 运维
    100
  • 华为新机发布计划曝光:Pura 90系列或明年4月登场

    近日,有数码博主透露了华为2025年至2026年的新品规划,其中pura 90系列预计在2026年4月发布,有望成为华为新一代影像旗舰。根据路线图,华为将在2025年底至2026年陆续推出mate 80系列、折叠屏新机mate x7系列以及nova 15系列,而pura 90系列则将成为2026年上…

    2025年12月6日 行业动态
    100
  • Linux如何优化系统性能_Linux系统性能优化的实用方法

    优化Linux性能需先监控资源使用,通过top、vmstat等命令分析负载,再调整内核参数如TCP优化与内存交换,结合关闭无用服务、选用合适文件系统与I/O调度器,持续按需调优以提升系统效率。 Linux系统性能优化的核心在于合理配置资源、监控系统状态并及时调整瓶颈环节。通过一系列实用手段,可以显著…

    2025年12月6日 运维
    000
  • 助力工业转型升级金士顿工博会大放异彩

    在刚刚落幕的第二十五届中国国际工业博览会(简称“工博会”)上,参会嘉宾或满载而归,或回味无穷,但无一例外地达成了一项共识——人工智能正深度赋能新型工业化,中国制造业正从“制造”迈向“智造”,并在转型升级之路上取得了令人瞩目的成就。 工业变革的核心在于技术架构的重塑与关键技术的支撑。当现代工业逐步演进…

    2025年12月6日 行业动态
    000
  • 曝小米17 Air正在筹备 超薄机身+2亿像素+eSIM技术?

    近日,手机行业再度掀起超薄机型热潮,三星与苹果已相继推出s25 edge与iphone air等轻薄旗舰,引发市场高度关注。在此趋势下,多家国产厂商被曝正积极布局相关技术,加速抢占这一细分赛道。据业内人士消息,小米的超薄旗舰机型小米17 air已进入筹备阶段。 小米17 Pro 爆料显示,小米正在评…

    2025年12月6日 行业动态
    000
  • 荣耀手表5Pro 10月23日正式开启首销国补优惠价1359.2元起售

    荣耀手表5pro自9月25日开启全渠道预售以来,市场热度持续攀升,上市初期便迎来抢购热潮,一度出现全线售罄、供不应求的局面。10月23日,荣耀手表5pro正式迎来首销,提供蓝牙版与esim版两种选择。其中,蓝牙版本的攀登者(橙色)、开拓者(黑色)和远航者(灰色)首销期间享受国补优惠价,到手价为135…

    2025年12月6日 行业动态
    000
  • 环境搭建docker环境下如何快速部署mysql集群

    使用Docker Compose部署MySQL主从集群,通过配置文件设置server-id和binlog,编写docker-compose.yml定义主从服务并组网,启动后创建复制用户并配置主从连接,最后验证数据同步是否正常。 在Docker环境下快速部署MySQL集群,关键在于合理使用Docker…

    2025年12月6日 数据库
    000
  • Linux文件系统rsync命令详解

    rsync通过增量同步高效复制文件,支持本地及远程同步,常用选项包括-a、-v、-z和–delete,结合SSH可安全传输数据,配合cron可实现定时备份。 rsync 是 Linux 系统中一个非常强大且常用的文件同步工具,能够高效地在本地或远程系统之间复制和同步文件与目录。它以“增量…

    2025年12月6日 运维
    000
  • Xbox删忍龙美女角色 斯宾塞致敬板垣伴信被喷太虚伪

    近日,海外游戏推主@HaileyEira公开发表言论,批评Xbox负责人菲尔·斯宾塞不配向已故的《死或生》与《忍者龙剑传》系列之父板垣伴信致敬。她指出,Xbox并未真正尊重这位传奇制作人的创作遗产,反而在宣传相关作品时对内容进行了审查和删减。 所涉游戏为年初推出的《忍者龙剑传2:黑之章》,该作采用虚…

    2025年12月6日 游戏教程
    000
  • 如何在mysql中分析索引未命中问题

    答案是通过EXPLAIN分析执行计划,检查索引使用情况,优化WHERE条件写法,避免索引失效,结合慢查询日志定位问题SQL,并根据查询模式合理设计索引。 当 MySQL 查询性能下降,很可能是索引未命中导致的。要分析这类问题,核心是理解查询执行计划、检查索引设计是否合理,并结合实际数据访问模式进行优…

    2025年12月6日 数据库
    000
  • VSCode入门:基础配置与插件推荐

    刚用VSCode,别急着装一堆东西。先把基础设好,再按需求加插件,效率高还不卡。核心就三步:界面顺手、主题舒服、功能够用。 设置中文和常用界面 打开软件,左边活动栏有五个图标,点最下面那个“扩展”。搜索“Chinese”,装上官方出的“Chinese (Simplified) Language Pa…

    2025年12月6日 开发工具
    000
  • php查询代码怎么写_php数据库查询语句编写技巧与实例

    在PHP中进行数据库查询,最常用的方式是使用MySQLi或PDO扩展连接MySQL数据库。下面介绍基本的查询代码写法、编写技巧以及实用示例,帮助你高效安全地操作数据库。 1. 使用MySQLi进行查询(面向对象方式) 这是较为推荐的方式,适合大多数中小型项目。 // 创建连接$host = ‘loc…

    2025年12月6日 后端开发
    000
  • 重现iPhone X颠覆性时刻!苹果2027年跳过19命名iPhone 20

    10月23日,有消息称,苹果或将再次调整iPhone的发布节奏,考虑跳过“iPhone 19”,并于2027年直接推出“iPhone 20”系列。 此举据传是为了庆祝初代iPhone发布二十周年,同时开启新一轮的设计革新,目标是复刻2017年iPhone X带来的划时代变革。 据悉,苹果或将告别长期…

    2025年12月6日 手机教程
    000
  • 如何在mysql中使用索引提高查询效率

    合理创建索引可显著提升MySQL查询效率,应优先为WHERE、JOIN、ORDER BY等高频字段建立B-Tree复合索引,如CREATE INDEX idx_status_created ON users(status, created_at, id),并遵循最左前缀原则;避免在索引列使用函数或前…

    2025年12月6日 数据库
    000
  • Linux命令行中free命令的使用方法

    free命令用于查看Linux内存使用情况,包括总内存、已用、空闲、共享、缓存及可用内存;使用-h可读格式显示,-s周期刷新,-c限制次数,-t显示总计,帮助快速评估系统内存状态。 free命令用于显示Linux系统中内存和交换空间的使用情况,包括物理内存、已用内存、空闲内存以及缓存和缓冲区的占用情…

    2025年12月6日 运维
    000
  • 在 Java 中使用 Argparse4j 接收 Duration 类型参数

    本文介绍了如何使用 `net.sourceforge.argparse4j` 库在 Java 命令行程序中接收 `java.time.Duration` 类型的参数。由于 `Duration` 不是原始数据类型,需要通过自定义类型转换器或工厂方法来处理。文章提供了两种实现方案,分别基于 `value…

    2025年12月6日 java
    000

发表回复

登录后才能评论
关注微信