Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
优化大数据集中的对象匹配:使用哈希表提升效率_创想鸟

优化大数据集中的对象匹配:使用哈希表提升效率

优化大数据集中的对象匹配:使用哈希表提升效率

本文探讨了在大规模数据集中,如何高效地根据特定属性匹配两个对象列表。针对传统嵌套循环方法在处理大量数据时效率低下的问题,我们提出并详细讲解了一种基于哈希表(字典)的优化方案。通过预处理其中一个列表为哈希表,可以将查找操作的时间复杂度从线性降低到常数,从而显著提升整体匹配过程的性能,尤其适用于需要按条件筛选并关联数据的场景。

在处理包含大量对象的列表时,根据特定条件从一个列表中筛选对象,并从另一个列表中找到与之匹配的对象,是一个常见的编程任务。然而,如果采用朴素的嵌套循环方法,其性能会随着数据量的增长而急剧下降。本教程将以一个具体的案例为例,展示如何通过引入哈希表(python中的字典)来大幅提升匹配效率。

场景描述

假设我们有以下 Person 类,用于表示居住在不同区域和房屋中的个体:

class Person:    def __init__(self, name, age, district, house_number):        self.name = name        self.age = age        self.district = district        self.house_number = house_number    def __repr__(self):        return f"Person(name='{self.name}', age={self.age}, district='{self.district}', house_number={self.house_number})"

我们有两个列表 men 和 women,分别存储了男性和女性的 Person 对象。每个房屋都住着一男一女,因此两个列表的长度相等。列表中的对象是随机排列的。

我们的目标是:

从 men 列表中找出所有年龄超过 min_age 的男性。对于每个符合条件的男性,从 women 列表中找到与他住在同一房屋(即 district 和 house_number 都相同)的女性。将筛选出的男性和匹配的女性分别存储到 men_new 和 women_new 两个新列表中,并确保同一对匹配的男女在新列表中具有相同的索引。

假设 min_age 和 men, women 列表已预先定义并填充,且数据量非常大。

初始(低效)解决方案及其瓶颈

一个直观的解决方案是使用嵌套循环。首先,遍历 men 列表筛选出符合年龄条件的男性,然后对于每个筛选出的男性,再次遍历 women 列表以找到匹配的女性。

# 假设 men, women 列表和 min_age 变量已定义# 示例数据(实际数据量远大于此)men = [    Person("Alex", 22, "District 7", 71),    Person("Bob", 30, "District 1", 101),    Person("Charlie", 25, "District 7", 72),    Person("David", 35, "District 1", 102),]women = [    Person("Alice", 28, "District 1", 101),    Person("Eve", 20, "District 7", 71),    Person("Grace", 23, "District 7", 72),    Person("Hannah", 32, "District 1", 102),]min_age = 25men_new = []women_new = []# 步骤1: 筛选男性for man in men:    if man.age > min_age:        men_new.append(man)# 步骤2: 匹配女性 (低效部分)# for man in men_new:#     # 每次都需要遍历整个 women 列表#     for woman in women:#         if woman.district == man.district and woman.house_number == man.house_number:#             women_new.append(woman)#             break # 找到后退出内层循环

上述方案的瓶颈在于第二步的匹配过程。如果 men_new 列表的长度为 N_new,women 列表的长度为 M,那么在最坏情况下,每次查找一个女性都需要遍历 M 个元素。因此,匹配的总时间复杂度将达到 O(N_new * M)。当 N_new 和 M 都非常大时,这种二次方的时间复杂度会导致程序运行极其缓慢,甚至无法完成。

优化方案:利用哈希表(字典)提升查找效率

为了解决上述性能问题,我们可以利用哈希表(Python中的字典)进行优化。哈希表的核心优势在于其平均 O(1) 的查找时间复杂度。

核心思想:我们可以将 women 列表预处理成一个哈希表,其中键是房屋的唯一标识(例如,district 和 house_number 的组合),值是对应的 Person 对象(女性)。这样,当我们需要查找某个男性对应的女性时,可以直接通过房屋标识在哈希表中进行 O(1) 的快速查找,而无需遍历整个 women 列表。

步骤1:构建女性房屋哈希表

首先,遍历 women 列表,创建一个字典 house_to_woman。由于 house_number 在不同 district 中可能重复(例如,”District 1″有1号房,”District 2″也有1号房),所以我们将 (district, house_number) 作为一个元组作为字典的键,以确保唯一性。

house_to_woman = {}for woman in women:    house_key = (woman.district, woman.house_number)    house_to_woman[house_key] = woman

这一步的时间复杂度是 O(M),其中 M 是 women 列表的长度。我们只需要遍历一次 women 列表。

步骤2:高效筛选和匹配

接下来,我们遍历 men 列表。对于每个男性:

检查其年龄是否符合 min_age 条件。如果符合,则构建其房屋的唯一键 (man.district, man.house_number)。使用这个键在 house_to_woman 字典中进行查找,获取对应的女性对象。将男性和女性对象分别添加到 men_new 和 women_new 列表中。

men_new = []women_new = []for man in men:    if man.age > min_age:        # 构建房屋键        house_key = (man.district, man.house_number)        # 从哈希表中 O(1) 查找匹配的女性        matched_woman = house_to_woman.get(house_key) # 使用 .get() 避免键不存在时报错        if matched_woman: # 确保找到了匹配的女性            men_new.append(man)            women_new.append(matched_woman)

这一步的时间复杂度是 O(N),其中 N 是 men 列表的长度。因为字典查找操作平均为 O(1)。

完整优化代码示例

class Person:    def __init__(self, name, age, district, house_number):        self.name = name        self.age = age        self.district = district        self.house_number = house_number    def __repr__(self):        return f"Person(name='{self.name}', age={self.age}, district='{self.district}', house_number={self.house_number})"# 示例数据(实际应用中数据量会大得多)men = [    Person("Alex", 22, "District 7", 71),    Person("Bob", 30, "District 1", 101),    Person("Charlie", 25, "District 7", 72),    Person("David", 35, "District 1", 102),    Person("Frank", 40, "District 3", 301),    Person("George", 28, "District 7", 73),]women = [    Person("Alice", 28, "District 1", 101),    Person("Eve", 20, "District 7", 71),    Person("Grace", 23, "District 7", 72),    Person("Hannah", 32, "District 1", 102),    Person("Ivy", 38, "District 3", 301),    Person("Julia", 27, "District 7", 73),]min_age = 25# --- 优化方案开始 ---# 步骤1: 构建女性房屋哈希表 (O(M) 时间复杂度)house_to_woman = {}for woman in women:    house_key = (woman.district, woman.house_number)    house_to_woman[house_key] = woman# 步骤2: 筛选男性并高效匹配女性 (O(N) 时间复杂度)men_new = []women_new = []for man in men:    if man.age > min_age:        house_key = (man.district, man.house_number)        matched_woman = house_to_woman.get(house_key)        if matched_woman:            men_new.append(man)            women_new.append(matched_woman)# 打印结果print("筛选出的男性 (men_new):")for m in men_new:    print(m)print("n匹配的女性 (women_new):")for w in women_new:    print(w)# 验证匹配关系print("n匹配验证:")for i in range(len(men_new)):    man = men_new[i]    woman = women_new[i]    print(f"男性: {man.name}, 房屋: ({man.district}, {man.house_number})  女性: {woman.name}, 房屋: ({woman.district}, {woman.house_number})")    assert man.district == woman.district and man.house_number == woman.house_number

性能分析与总结

原始方案的时间复杂度: O(N_new * M),其中 N_new 是符合条件的男性数量,M 是女性总数。优化方案的时间复杂度: O(M + N),其中 M 是女性总数(用于构建哈希表),N 是男性总数(用于筛选和查找)。

对于大规模数据集,N 和 M 都可能非常大。O(N_new * M) 的二次方复杂度会迅速变得不可接受,而 O(M + N) 的线性复杂度则具有更好的扩展性。这种优化方式将查找的效率从线性扫描提升到了接近常数时间,从而在大数据场景下实现了显著的性能提升。

注意事项:

哈希键的选择: 确保所选的哈希键能够唯一标识一个对象。在本例中,(district, house_number) 元组作为键是合适的,因为它能唯一标识一个房屋。如果仅使用 house_number,可能会因为不同区域有相同门牌号而导致匹配错误。内存消耗: 构建哈希表会占用额外的内存空间。对于极大规模的数据集,需要考虑内存限制。然而,在大多数实际应用中,这种内存消耗是可接受的,并且其带来的性能收益远大于内存成本。键不存在的处理: 在从哈希表中获取值时,使用 .get(key) 方法比直接 dictionary[key] 更安全,因为它允许指定一个默认值(默认为 None),避免在键不存在时引发 KeyError。虽然本问题中假设总能找到匹配项,但在更通用的场景下,这是一个良好的实践。

通过将一个列表转换为哈希表,我们可以将对象匹配问题从一个计算密集型的任务转化为一个高效的查找任务,这是处理大数据集时常用的优化策略之一。

以上就是优化大数据集中的对象匹配:使用哈希表提升效率的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1373137.html

赞 (0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
Python 多线程异常处理的技巧
上一篇 2025年12月14日 12:56:03
PyCharm 专业版与社区版如何选择
下一篇 2025年12月14日 12:56:14

相关推荐

  • win10去除快捷方式小箭头方法

    win10去除快捷方式小箭头方法win10去除快捷方式小箭头方法win10去除快捷方式小箭头方法win10去除快捷方式小箭头方法

    1. 如何移除win10快捷方式的小箭头 首先,在桌面上创建一个新的文本文档,接着将以下代码粘贴进去: reg add “HKEY_LOCAL_MACHINESOFTWAREMicrosoftWindowsCurrentVersionExplorerShell Icons” …

    2026年9月25日 • 用户投稿
    100
  • Java ParallelStream线程池管理:定制并发与I/O优化

    Java ParallelStream线程池管理:定制并发与I/O优化Java ParallelStream线程池管理:定制并发与I/O优化Java ParallelStream线程池管理:定制并发与I/O优化Java ParallelStream线程池管理:定制并发与I/O优化

    本文深入探讨了Java ParallelStream的线程池管理,特别是如何在I/O密集型任务(如数据库查询)中定制其并发行为。我们将介绍如何通过自定义ForkJoinPool来限制ParallelStream的线程数量,并强调在处理数据库操作时,除了线程池大小,还需关注数据库连接数等关键资源,并讨…

    2026年9月25日 • 用户投稿
    100
  • 抖音巨量千川账户余额怎么提现?抖音巨量千川的钱怎么退

    抖音巨量千川账户余额怎么提现?抖音巨量千川的钱怎么退抖音巨量千川账户余额怎么提现?抖音巨量千川的钱怎么退抖音巨量千川账户余额怎么提现?抖音巨量千川的钱怎么退抖音巨量千川账户余额怎么提现?抖音巨量千川的钱怎么退

    在当今这个短视频盛行的时代,抖音无疑成为了许多人展示才华、分享生活的舞台。而抖音旗下的巨量千川广告平台,更是让许多商家和创作者通过广告实现了商业变现。在使用巨量千川的过程中,如何提取账户余额成为了一个让人头疼的问题。今天,就让我来为大家详细解析一下抖音巨量千川账户余额提现的全过程,让你轻松提取,安全…

    2026年9月25日 • 用户投稿
    000
  • 控制Java ParallelStream线程池大小与并发优化:策略与最佳实践

    控制Java ParallelStream线程池大小与并发优化:策略与最佳实践控制Java ParallelStream线程池大小与并发优化:策略与最佳实践控制Java ParallelStream线程池大小与并发优化:策略与最佳实践控制Java ParallelStream线程池大小与并发优化:策略与最佳实践

    本文探讨如何有效管理Java ParallelStream的线程池大小,特别是在涉及数据库查询等I/O密集型操作时。我们将介绍通过自定义ForkJoinPool来限制ParallelStream线程的方法,并强调在处理I/O任务时,结合CompletableFuture与专用执行器的重要性。同时,文…

    2026年9月25日 • 用户投稿
    000
  • Java Stream API:高效处理列表数据,按组合键去重并选择最新记录

    Java Stream API:高效处理列表数据,按组合键去重并选择最新记录Java Stream API:高效处理列表数据,按组合键去重并选择最新记录Java Stream API:高效处理列表数据,按组合键去重并选择最新记录Java Stream API:高效处理列表数据,按组合键去重并选择最新记录

    本文详细介绍了如何利用Java Stream API,特别是Collectors.toMap,对包含重复条目的对象列表进行高级过滤。教程将演示如何根据对象的多个字段(如姓名组合)确定唯一性,并在出现重复时,根据特定字段(如日期)选择最新或最符合条件的记录,从而实现数据的高效聚合与筛选。 业务场景与问…

    2026年9月25日 • 用户投稿
    100
  • 微软确认Windows 11和10打印问题,HP Smart App引发疑虑

    微软确认Windows 11和10打印问题,HP Smart App引发疑虑微软确认Windows 11和10打印问题,HP Smart App引发疑虑微软确认Windows 11和10打印问题,HP Smart App引发疑虑微软确认Windows 11和10打印问题,HP Smart App引发疑虑

    N软网报道,微软近期确认,Windows 11与10用户正经历一系列令人头疼的打印故障。问题的核心在于HP Smart App,其相关文档已在官方Windows健康仪表板中更新,详细描述了这一异常状况。据反馈,HP Smart App可能会未经授权地侵入电脑,更改打印机名称及图标设置,导致诸如点击打…

    2026年9月25日 • 用户投稿
    200
  • mysql如何读取数据库数据

    mysql如何读取数据库数据mysql如何读取数据库数据mysql如何读取数据库数据mysql如何读取数据库数据

    MySQL 读取数据库数据有两种常用方法:SELECT 语句,用于从表中提取数据,语法为:SELECT [列名] FROM [表名] [条件] [分组] [条件] [排序] [限制]。fetchall() 方法,用于将所有结果行存储在一个元组列表中。 MySQL 读取数据库数据 MySQL 提供了多…

    2026年9月25日 • 用户投稿
    000
  • 快手如何加入快接单_快手加入快接单的条件与流程

    快手如何加入快接单_快手加入快接单的条件与流程快手如何加入快接单_快手加入快接单的条件与流程快手如何加入快接单_快手加入快接单的条件与流程快手如何加入快接单_快手加入快接单的条件与流程

    要开通快手快接单功能,需先满足粉丝门槛:加入工会者需超10万粉丝,未加入者需达30万以上。达标后通过创作者中心或服务列表查看入口,完善信息并等待审核,通过后可在任务广场浏览并承接广告任务,按时完成推广内容以实现变现。 如果您希望在快手平台通过发布广告内容实现收益变现,但发现无法找到或开通快接单功能,…

    2026年9月25日 • 用户投稿
    000
  • Hadoop MapReduce实现累计电量数据的最大小时耗电量计算

    本文详细介绍了如何使用Hadoop MapReduce从累计电量读数中计算出所有住户和所有日期内的最大小时耗电量。教程将分析原始代码的问题,包括自定义Writable类的序列化错误和逻辑缺陷,并提供一个基于两阶段MapReduce任务的完整解决方案,涵盖自定义数据类型、Mapper、Reducer的…

    2026年9月25日
    000
  • sublime怎么快速切换文件语法类型_sublime修改文件语言类型的方法

    sublime怎么快速切换文件语法类型_sublime修改文件语言类型的方法sublime怎么快速切换文件语法类型_sublime修改文件语言类型的方法sublime怎么快速切换文件语法类型_sublime修改文件语言类型的方法sublime怎么快速切换文件语法类型_sublime修改文件语言类型的方法

    点击状态栏语言名可快速切换语法类型,立即应用高亮规则;2. 用Ctrl+Shift+P或Cmd+Shift+P打开命令面板,输入Set Syntax选择目标语言;3. 通过“Open all with current extension as…”设置默认语法关联,或手动编辑配置文件,使特…

    2026年9月25日 • 用户投稿
    200
  • 小红书怎么查注册日期?小红书怎么查注册日期和时间

    小红书怎么查注册日期?小红书怎么查注册日期和时间小红书怎么查注册日期?小红书怎么查注册日期和时间小红书怎么查注册日期?小红书怎么查注册日期和时间小红书怎么查注册日期?小红书怎么查注册日期和时间

    随着社交媒体的不断发展,小红书已经成为了一个热门的分享平台。在这个平台上,我们可以发现各种有趣的内容,结交志同道合的朋友,甚至还能找到生活中的灵感。你是否好奇过自己是在什么时间注册的小红书呢?今天,就让我来带你了解一下,如何在小红书上查找注册日期。 一、登录小红书账号 当然是要确保你已经成功注册了小…

    2026年9月25日 • 用户投稿
    000
  • 抖音带货技巧全解析

    抖音带货技巧全解析抖音带货技巧全解析抖音带货技巧全解析抖音带货技巧全解析

    许多电商创业者都在探索如何通过抖音实现商品变现。具体该如何操作?流程又是怎样的呢?下面将为你逐步解析抖音带货的实用方法与核心步骤。 1、 打开抖音App,启动应用。 2、 进入个人主页,点击头像或“我”页面。 3、 在右上角找到并点击三条横线菜单按钮。 4、 选择进入“创作者服务中心”。 AI抖音 …

    2026年9月25日 • 用户投稿
    000
  • Win10新版Edge Canary版实现通用的显示密码按钮

    Win10新版Edge Canary版实现通用的显示密码按钮Win10新版Edge Canary版实现通用的显示密码按钮Win10新版Edge Canary版实现通用的显示密码按钮Win10新版Edge Canary版实现通用的显示密码按钮

    在最新版的基于chromium的edge canary通道中,微软对用户界面作出了进一步的改进,其中就包括对inprivate窗口的简化设计。而在最近的一次版本更新里,微软再次聚焦于隐私功能,推出了全新的“显示密码”按钮。 微软指出,这是众多“受控功能部署”项目的一部分,其目标在于增强用户体验。具体…

    2026年9月25日 • 用户投稿
    200
  • Yandex网页版入口在哪?全球第二大搜索引擎使用指南!

    Yandex网页版入口在哪?全球第二大搜索引擎使用指南!Yandex网页版入口在哪?全球第二大搜索引擎使用指南!Yandex网页版入口在哪?全球第二大搜索引擎使用指南!Yandex网页版入口在哪?全球第二大搜索引擎使用指南!

    Yandex网页版入口是https://yandex.com/,该平台提供多语言搜索、图片识别、音视频索引、实时新闻及地图导航等服务,界面简洁支持深色模式,具备翻译、邮箱、应用中心等特色功能。 1、立即进入“☞☞☞☞点击yandex网页版入口☜☜☜☜”; 2、立即进入“☞☞☞☞点击全球第二大搜索引擎…

    2026年9月25日 • 用户投稿
    500
  • Java布尔方法条件逻辑解析与预期行为校正

    Java布尔方法条件逻辑解析与预期行为校正Java布尔方法条件逻辑解析与预期行为校正Java布尔方法条件逻辑解析与预期行为校正Java布尔方法条件逻辑解析与预期行为校正

    本文旨在探讨Java中布尔方法条件表达式的常见误解,通过一个具体的kindaLiked()方法案例,详细分析代码逻辑与预期行为不符的原因。我们将演示如何精确定义条件,确保方法返回结果与业务逻辑一致,并提供示例代码、调试技巧及最佳实践,以帮助开发者编写更准确、可维护的布尔判断逻辑。 理解布尔方法与条件…

    2026年9月25日 • 用户投稿
    100
  • sublime怎么快速查看函数或类列表_sublime结构导航与符号浏览技巧

    sublime怎么快速查看函数或类列表_sublime结构导航与符号浏览技巧sublime怎么快速查看函数或类列表_sublime结构导航与符号浏览技巧sublime怎么快速查看函数或类列表_sublime结构导航与符号浏览技巧sublime怎么快速查看函数或类列表_sublime结构导航与符号浏览技巧

    使用Ctrl+R或Cmd+R打开“前往符号”面板,可快速定位函数和类;通过安装SideBarEnhancements等插件,在侧边栏查看文件符号树;配合LSP插件支持,使用F12实现“转到定义”跨文件跳转;自定义快捷键如Ctrl+Shift+R优化操作效率。 在使用 Sublime Text 编辑代…

    2026年9月25日 • 用户投稿
    400
  • 京东延迟发货赔付怎么操作?店铺如何避免延迟发货?小心!京东48小时未发货就赔30%?手把手教你申请赔偿+紧急报备技巧!

    京东延迟发货赔付怎么操作?店铺如何避免延迟发货?小心!京东48小时未发货就赔30%?手把手教你申请赔偿+紧急报备技巧!京东延迟发货赔付怎么操作?店铺如何避免延迟发货?小心!京东48小时未发货就赔30%?手把手教你申请赔偿+紧急报备技巧!京东延迟发货赔付怎么操作?店铺如何避免延迟发货?小心!京东48小时未发货就赔30%?手把手教你申请赔偿+紧急报备技巧!京东延迟发货赔付怎么操作?店铺如何避免延迟发货?小心!京东48小时未发货就赔30%?手把手教你申请赔偿+紧急报备技巧!

    最新数据显示,京东平台因延迟发货产生的纠纷投诉量同比激增35%,90%的商家因不了解规则面临高额赔付。本文将深度解析2025年最新赔付政策:买家可获订单金额30%的赔偿(最高500元),通过「联系商家→纠纷申请→提交证据」3步即可快速到账;商家则需掌握24小时报备黄金期、三级预警机制(12/6/2小…

    2026年9月25日 • 用户投稿
    100
  • mysql怎么创建新连接

    mysql怎么创建新连接mysql怎么创建新连接mysql怎么创建新连接mysql怎么创建新连接

    要创建新的 MySQL 连接,需要导入 MySQL Connector,然后依次创建连接对象、验证连接、创建游标对象、执行查询、检索结果,最后关闭连接。 如何创建新的 MySQL 连接 若要创建新的 MySQL 连接,可以使用以下步骤: 1. 导入 MySQL Connector 导入 MySQL …

    2026年9月25日 • 用户投稿
    000
  • 夸克怎么更新到最新版本_夸克App版本检查与升级方法

    夸克怎么更新到最新版本_夸克App版本检查与升级方法夸克怎么更新到最新版本_夸克App版本检查与升级方法夸克怎么更新到最新版本_夸克App版本检查与升级方法夸克怎么更新到最新版本_夸克App版本检查与升级方法

    首先检查应用商店是否有更新,其次在夸克App内“我的-设置-关于夸克”中查看版本并更新,最后可通过官网下载最新安装包手动升级。 如果您尝试在设备上使用夸克App,但发现某些功能无法正常使用或界面显示异常,可能是由于当前版本过旧导致与服务器不兼容。以下是检查并升级夸克App至最新版本的操作步骤: 本文…

    2026年9月25日 • 用户投稿
    200
  • sublime怎么恢复上次打开的文件_sublime自动恢复文件会话设置方法

    sublime怎么恢复上次打开的文件_sublime自动恢复文件会话设置方法sublime怎么恢复上次打开的文件_sublime自动恢复文件会话设置方法sublime怎么恢复上次打开的文件_sublime自动恢复文件会话设置方法sublime怎么恢复上次打开的文件_sublime自动恢复文件会话设置方法

    Sublime Text 能自动恢复文件和布局,需确保设置中”remember_open_files”: true且”hot_exit”: false,正常关闭程序以保存会话,会话文件位于系统指定路径,若丢失可手动重命名备份文件恢复。 Sublime …

    2026年9月25日 • 用户投稿
    200

发表回复

登录后才能评论
关注微信