Pandas数据处理:基于列表型列的跨DataFrame条件合并与最小值聚合

Pandas数据处理:基于列表型列的跨DataFrame条件合并与最小值聚合

本教程详细阐述了如何在Pandas中处理复杂的DataFrame合并场景,特别是当一个DataFrame的匹配键是列表型列时。文章通过explode、merge和groupby等核心函数,演示了如何根据多重条件(包括列表成员关系)从另一个DataFrame中提取数据,并进行聚合(如计算最小值),最终将结果高效地整合回原始DataFrame。

在数据分析和处理过程中,我们经常会遇到需要从一个数据源(dataframe)中根据特定条件提取信息并填充到另一个数据源的情况。当这些条件涉及复杂的数据结构,例如列表型列作为匹配键时,传统的合并操作将不再适用。本文将针对此类场景,提供一个高效且专业的pandas解决方案,旨在从另一个dataframe中,基于列表型列的匹配和月份条件,提取并聚合(取最小值)所需的值。

问题场景描述

假设我们有两个Pandas DataFrame,df1 包含商店的销售值 (value) 和月份 (month),df2 包含一个商店列表 (store) 和月份 (month)。我们的目标是为 df2 添加一个 value 列,该列的值需要满足以下条件:

df1 中的 month 必须与 df2 中的 month 匹配。df1 中的 store 必须是 df2 中 store 列表的成员。如果一个 df2 行的 store 列表中包含多个 df1 中存在的商店,并且这些商店在对应月份都有值,我们需要取这些匹配值中的最小值。

示例数据:

import pandas as pddata1 = {'store': [1, 1, 2, 2], 'value': [24, 28, 29, 0], 'month': [1, 2, 1, 2]}df1 = pd.DataFrame(data1)data2 = {'store': [[1, 2, 3], [2]], 'month': [1, 2]}df2 = pd.DataFrame(data2)print("df1:")print(df1)print("ndf2:")print(df2)

输出:

df1:   store  value  month0      1     24      11      1     28      22      2     29      13      2      0      2df2:       store  month0  [1, 2, 3]      11        [2]      2

我们期望的输出结果是:

       store  month  value0  [1, 2, 3]      1   24.01        [2]      2    0.0

其中,对于 df2 的第一行 ([1, 2, 3], 1),df1 中 store=1, month=1 对应 value=24;store=2, month=1 对应 value=29;store=3 在 month=1 时没有匹配值。因此,取 min(24, 29) 得到 24。对于 df2 的第二行 ([2], 2),df1 中 store=2, month=2 对应 value=0,因此结果为 0。

核心解决方案:使用 explode 展开列表

解决此类问题的关键在于处理 df2 中列表型的 store 列。Pandas 的 explode 函数能够将列表或类列表的条目转换为单独的行,从而使我们能够执行标准的合并操作。

步骤分解:

预处理 df1:聚合每个 (store, month) 的最小值由于我们最终需要获取匹配值的最小值,且 df1 可能在同一 (store, month) 组合下有多个 value(尽管在此示例中没有,但这是一个良好的实践),或者更重要的是,为了后续合并时能直接获取每个 (store, month) 的最小有效值,我们首先对 df1 进行分组聚合,计算每个 (store, month) 组合的 value 最小值。

df1_min_values = df1.groupby(['store', 'month'], as_index=False)['value'].min()print("ndf1_min_values:")print(df1_min_values)

输出:

df1_min_values:   store  month  value0      1      1     241      1      2     282      2      1     293      2      2      0

展开 df2 的列表列并合并接下来,我们使用 explode(‘store’) 将 df2 中的 store 列表展开。为了在后续聚合时能追溯到原始 df2 的行,我们还需要在 explode 之前重置索引并保存原始索引。然后,我们将展开后的 df2 与预处理过的 df1_min_values 进行左连接 (how=’left’),基于 store 和 month 列进行匹配。

# 展开df2的store列,并保留原始索引df2_exploded = df2.explode('store').reset_index()# 将展开后的df2与df1的最小值进行合并merged_df = df2_exploded.merge(df1_min_values, on=['store', 'month'], how='left')print("nmerged_df after explode and merge:")print(merged_df)

输出:

merged_df after explode and merge:   index  store  month  value0      0      1      1   24.01      0      2      1   29.02      0      3      1    NaN3      1      2      2    0.0

可以看到,原始 df2 的第一行(index=0)现在被分成了三行,分别对应 store 列表中的 1, 2, 3。store=3 在 df1 中没有匹配的 month=1 的值,因此 value 为 NaN。

重新聚合 value 到原始 df2 的行现在 merged_df 包含了所有可能的匹配项。我们需要回到原始 df2 的结构,即为每行 df2 找到其 store 列表中所有匹配项的 value 最小值。这可以通过对 merged_df 按照原始索引 (index) 进行分组,并再次取 value 的最小值来实现。

# 按原始索引重新分组,并取value的最小值final_values = merged_df.groupby('index')['value'].min()# 将最终的value列赋值回原始df2df2_final = df2.assign(value=final_values)print("nFinal df2:")print(df2_final)

输出:

Final df2:   store  month  value0  [1, 2, 3]      1   24.01        [2]      2    0.0

至此,我们成功地根据复杂条件从 df1 中提取并聚合了值,并将其添加到了 df2 中。

完整示例代码

将上述步骤整合到一起,完整的解决方案如下:

import pandas as pd# 1. 准备数据data1 = {'store': [1, 1, 2, 2], 'value': [24, 28, 29, 0], 'month': [1, 2, 1, 2]}df1 = pd.DataFrame(data1)data2 = {'store': [[1, 2, 3], [2]], 'month': [1, 2]}df2 = pd.DataFrame(data2)print("原始 df1:")print(df1)print("n原始 df2:")print(df2)# 2. 预处理 df1:计算每个 (store, month) 的最小 valuedf1_min_values = df1.groupby(['store', 'month'], as_index=False)['value'].min()# 3. 展开 df2 的 'store' 列,并与预处理的 df1_min_values 合并#    - reset_index() 用于保存原始行索引,以便后续重新聚合#    - merge() 执行左连接,匹配 store 和 monthmerged_exploded_df = df2.explode('store').reset_index().merge(    df1_min_values, on=['store', 'month'], how='left')# 4. 根据原始索引重新聚合,获取每个 df2 原始行的 value 最小值#    - groupby('index') 针对原始 df2 的每一行进行分组#    - min() 再次取最小值,处理了 df2 中 store 列表的多个匹配值final_aggregated_values = merged_exploded_df.groupby('index')['value'].min()# 5. 将聚合后的值添加回原始 df2df2_result = df2.assign(value=final_aggregated_values)print("n最终结果 df2:")print(df2_result)

注意事项

性能开销: explode 操作会根据列表的长度复制行。如果列表非常长或 DataFrame 包含大量行,explode 可能会显著增加 DataFrame 的行数,从而导致内存消耗增加和计算时间延长。在处理大规模数据时,需要评估其性能影响。缺失值处理: 如果 explode 后合并的 store/month 组合在 df1 中不存在,合并后的 value 列将包含 NaN。在最终的 groupby().min() 操作中,NaN 会被忽略(除非所有值都是 NaN,此时结果为 NaN)。如果需要将 NaN 视为 0 或其他默认值,应在 final_aggregated_values 赋值前进行 fillna() 处理。数据类型一致性: 确保 df1.store 的数据类型与 df2.store 列表中元素的数据类型一致,以避免合并失败。聚合函数选择: 本例中业务需求是获取最小值 (min()),但根据实际情况,也可以替换为 max()、mean()、sum() 或其他自定义聚合函数。

总结

通过巧妙地结合使用 Pandas 的 explode()、merge() 和 groupby().min() 函数,我们能够有效地解决涉及列表型列的复杂跨 DataFrame 数据提取和聚合问题。这种方法不仅功能强大,而且在 Pandas 框架下具有良好的可读性和效率。理解并掌握这些高级数据操作技巧,对于进行复杂的数据清洗、转换和分析至关重要。

以上就是Pandas数据处理:基于列表型列的跨DataFrame条件合并与最小值聚合的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1373801.html

赞 (0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
Python中将2D列向量转换为1D向量以计算Pearson相关系数
上一篇 2025年12月14日 13:35:07
解决F2PY与Meson构建中LNK2019链接错误的指南
下一篇 2025年12月14日 13:35:17

相关推荐

  • Android开发:按钮点击实现Activity切换教程

    Android开发:按钮点击实现Activity切换教程Android开发:按钮点击实现Activity切换教程Android开发:按钮点击实现Activity切换教程Android开发:按钮点击实现Activity切换教程

    本教程详细讲解了在Android应用中如何通过按钮点击实现不同活动(页面)之间的切换。我们将重点介绍如何利用Intent机制来启动目标Activity,并提供具体的代码示例,帮助开发者快速掌握页面导航的核心方法,提升用户体验。 理解Android Intent机制 在android开发中,inten…

    2026年9月28日 • 用户投稿
    100
  • ChatExcel自定义分析流程_ChatExcel个性化分析流程创建方法

    ChatExcel自定义分析流程_ChatExcel个性化分析流程创建方法ChatExcel自定义分析流程_ChatExcel个性化分析流程创建方法ChatExcel自定义分析流程_ChatExcel个性化分析流程创建方法ChatExcel自定义分析流程_ChatExcel个性化分析流程创建方法

    答案:通过定义目标、使用自然语言或脚本创建流程、设置自动化触发及调试管理,可在ChatExcel中实现个性化数据处理。具体包括明确分析范围与规则,拆解任务;用自然语言生成指令并优化;切换脚本模式编写逻辑;绑定时间或事件触发器自动执行;最后通过调试、日志和版本控制确保流程稳定运行。 如果您希望在Cha…

    2026年9月27日 • 用户投稿
    000
  • 详解抖音平台订单导出的具体步骤

    详解抖音平台订单导出的具体步骤详解抖音平台订单导出的具体步骤详解抖音平台订单导出的具体步骤详解抖音平台订单导出的具体步骤

    随着电商行业的不断壮大,抖音已逐渐成为众多电商从业者不可或缺的运营阵地。在日常经营中,订单导出是一项极为关键的操作,能够帮助商家高效整理交易数据,优化发货流程,并提升客户服务体验。本文将从多个方面深入介绍如何在抖音平台完成订单导出操作。 1. 登录抖音商家后台 首先需进入抖音商家后台系统。打开抖音A…

    2026年9月27日 • 用户投稿
    000
  • Java Swing GUI:构建交互式逻辑门(AND门示例)

    Java Swing GUI:构建交互式逻辑门(AND门示例)Java Swing GUI:构建交互式逻辑门(AND门示例)Java Swing GUI:构建交互式逻辑门(AND门示例)Java Swing GUI:构建交互式逻辑门(AND门示例)

    本文详细介绍了如何使用Java Swing构建一个简单的AND逻辑门GUI应用。通过结合JCheckBox作为输入和JLabel作为视觉输出,并利用ChangeListener监听组件状态变化,实现当两个复选框都被选中时显示“绿色”,否则显示“红色”的功能。教程涵盖了组件创建、事件监听以及将自定义面…

    2026年9月27日 • 用户投稿
    200
  • Java Swing 实现带复选框和图像的逻辑门

    Java Swing 实现带复选框和图像的逻辑门Java Swing 实现带复选框和图像的逻辑门Java Swing 实现带复选框和图像的逻辑门Java Swing 实现带复选框和图像的逻辑门

    本文介绍了如何使用 Java Swing 创建一个简单的 AND 逻辑门 GUI,该 GUI 包含两个复选框和一个图像。当两个复选框都被选中时,图像变为绿色;否则,图像变为红色。我们将使用 JCheckBox、JLabel 和 ChangeListener 来实现这一功能,并提供完整的代码示例。 创…

    2026年9月27日 • 用户投稿
    000
  • laravel怎么在 Eloquent 中使用 DB::raw() 执行原生表达式_laravel Eloquent DB::raw原生表达式使用方法

    laravel怎么在 Eloquent 中使用 DB::raw() 执行原生表达式_laravel Eloquent DB::raw原生表达式使用方法laravel怎么在 Eloquent 中使用 DB::raw() 执行原生表达式_laravel Eloquent DB::raw原生表达式使用方法laravel怎么在 Eloquent 中使用 DB::raw() 执行原生表达式_laravel Eloquent DB::raw原生表达式使用方法laravel怎么在 Eloquent 中使用 DB::raw() 执行原生表达式_laravel Eloquent DB::raw原生表达式使用方法

    在 Laravel Eloquent 中可使用 DB::raw() 实现复杂查询,1. 在 select 中添加计算字段如 COUNT;2. 用 whereRaw 配合参数绑定安全过滤数据;3. 通过 orderByRaw 按表达式排序;4. 使用 havingRaw 对聚合结果筛选;5. 注意避免…

    2026年9月27日 • 用户投稿
    1100
  • Gateway台式机蓝屏系统崩溃怎么办?实用步骤指导你排除蓝屏。

    Gateway台式机蓝屏系统崩溃怎么办?实用步骤指导你排除蓝屏。Gateway台式机蓝屏系统崩溃怎么办?实用步骤指导你排除蓝屏。Gateway台式机蓝屏系统崩溃怎么办?实用步骤指导你排除蓝屏。Gateway台式机蓝屏系统崩溃怎么办?实用步骤指导你排除蓝屏。

    蓝屏问题需先记录错误代码并拍照留存,通过强制重启进入安全模式排查软硬件变更,卸载可疑程序或回退驱动,运行SFC、DISM、chkdsk等工具修复系统文件与磁盘错误,检查内存、硬盘连接及散热状况,最后使用系统还原或重置功能恢复系统正常状态。 如果您尝试访问某个网站,但服务器无法访问,则可能是由于服务器…

    2026年9月27日 • 用户投稿
    500
  • ️「领域驱动设计」Java微服务拆分策略与界限上下文划分

    ️「领域驱动设计」Java微服务拆分策略与界限上下文划分️「领域驱动设计」Java微服务拆分策略与界限上下文划分️「领域驱动设计」Java微服务拆分策略与界限上下文划分️「领域驱动设计」Java微服务拆分策略与界限上下文划分

    微服务拆分的核心在于通过领域驱动设计(DDD)识别业务的“自然边界”,其中界限上下文(Bounded Context)是关键。它强调从业务语言和领域专家沟通出发,而非技术视角,确保服务高内聚、低耦合。通过事件风暴、通用语言、业务能力分析等方法识别界限上下文,并结合团队结构与上下文映射明确服务边界。在…

    2026年9月26日 • 用户投稿
    100
  • MySQL中窗口函数用法 窗口函数在数据分析中的实际案例

    窗口函数是在一组数据行上执行计算并为每一行返回一个值的函数。它与普通聚合函数不同,保留原始数据行并进行行级计算。常见函数包括row_number()、rank()、dense_rank()以及结合over()使用的sum()、avg()等。例如,在计算销售排名时,使用rank() over(orde…

    2026年9月26日
    100
  • Spring Boot 应用:分离 REST API 和 Web 应用的最佳实践

    Spring Boot 应用:分离 REST API 和 Web 应用的最佳实践Spring Boot 应用:分离 REST API 和 Web 应用的最佳实践Spring Boot 应用:分离 REST API 和 Web 应用的最佳实践Spring Boot 应用:分离 REST API 和 Web 应用的最佳实践

    本文旨在探讨在 Spring Boot 项目中,如何有效地分离 REST API 和 Web 应用程序。针对小型项目,建议保持简单,将代码放在同一模块的不同包中。对于大型项目,则需要考虑可伸缩性、团队协作和性能需求,将前后端分离成两个独立的 Spring Boot 应用。文章将深入分析不同场景下的架…

    2026年9月25日 • 用户投稿
    400
  • Android Activity中集成自定义类功能的委托模式实践

    Android Activity中集成自定义类功能的委托模式实践Android Activity中集成自定义类功能的委托模式实践Android Activity中集成自定义类功能的委托模式实践Android Activity中集成自定义类功能的委托模式实践

    本文旨在解决Android开发中,Activity需要继承AppCompatActivity同时又想复用自定义类功能(如HereMapClass)时的“多重继承”问题。由于Java不支持多重继承,我们将深入探讨并实践委托模式(Delegation Pattern),这是一种优雅且高效的设计模式,允许…

    2026年9月25日 • 用户投稿
    000
  • 猫咪怪盗“亨迪”时间暂停弹幕Roguelike “时间掠夺者亨迪”参展Steam Next Fest

    猫咪怪盗“亨迪”时间暂停弹幕Roguelike “时间掠夺者亨迪”参展Steam Next Fest猫咪怪盗“亨迪”时间暂停弹幕Roguelike “时间掠夺者亨迪”参展Steam Next Fest猫咪怪盗“亨迪”时间暂停弹幕Roguelike “时间掠夺者亨迪”参展Steam Next Fest猫咪怪盗“亨迪”时间暂停弹幕Roguelike “时间掠夺者亨迪”参展Steam Next Fest

    韩国游戏发行商“cometsoft inc.”近日宣布,将携手独立游戏开发者“clockworkcats”携作品《时间掠夺者亨迪》亮相即将开启的“steam next fest”线上游戏盛会。 作为Steam平台每年备受瞩目的大型活动,“Steam Next Fest”致力于连接全球玩家与独立游戏创…

    2026年9月24日 • 用户投稿
    000
  • 探索VSCode Jupyter Notebook集成与扩展

    VSCode集成Jupyter Notebook提升开发效率,安装Jupyter扩展后可直接运行.ipynb文件,支持内核选择、Shift+Enter执行单元格、图表渲染及变量状态保留;结合Python扩展、Pylance、GitLens等工具,实现调试、智能提示、版本控制与代码转换,适合数据分析与…

    2026年9月24日
    100
  • 如何在mysql中使用数值函数计算

    答案:MySQL数值函数用于执行数学运算,如ABS、ROUND、FLOOR、CEIL、MOD、POWER、SQRT等,可对数据直接计算。例如用ROUND四舍五入价格,TRUNCATE截断小数,FLOOR取整,MOD求余判断奇偶,SQRT开方,还可结合AVG、MAX等聚合函数使用,提升查询效率并减少应…

    2026年9月23日
    200
  • 在MySQL中有效处理空值NULL的技巧

    在MySQL中有效处理空值NULL的技巧在MySQL中有效处理空值NULL的技巧在MySQL中有效处理空值NULL的技巧在MySQL中有效处理空值NULL的技巧

    1.在mysql中直接比较null值会出错,因为null代表的是“未知”状态,任何与null的比较结果都是unknown,而不是true或false;2.处理空值应使用is null、is not null判断,使用ifnull提供单一替代值,coalesce按优先级取第一个非null值,以及用nu…

    2026年9月23日 • 用户投稿
    700
  • 如何在mysql中使用HAVING筛选聚合结果

    HAVING用于筛选聚合函数的结果,通常与GROUP BY配合使用。例如:SELECT customer_id, SUM(amount) FROM orders GROUP BY customer_id HAVING SUM(amount) > 1000;WHERE在分组前过滤行,HAVING…

    2026年9月23日
    100
  • Linux命令行中uniq命令的使用场景

    uniq命令需与sort配合处理相邻重复行,直接执行uniq可去除连续重复行如aabba变为aba;使用-c统计每行出现次数,结合sort -nr可排序频次;-d选项仅输出重复行,适合定位重复数据;-f跳过前N个字段(空白分隔),-s跳过前N字符,常用于忽略日志时间戳;整体在日志分析中高效实用。 u…

    2026年9月23日
    100
  • Flink 1.16 Job Manager 重启后消息丢失问题排查及解决

    Flink 作业在遇到异常时,会根据配置的重启策略进行自动重启。但如果整个 Job Manager 重启,可能会出现消息丢失的情况。本文旨在帮助你排查和解决 Flink 1.16 中 Job Manager 重启后消息丢失的问题,涵盖了可能的原因和相应的解决方案,确保数据处理的完整性。 问题分析 当…

    2026年9月23日
    000
  • Laravel Eloquent:优化消息查询以获取最新记录

    本文探讨了在 laravel 中如何高效地查询用户消息,以获取与特定用户相关的所有最新消息记录。通过摒弃传统的 sql `join` 和 `group by` 组合在复杂场景下的局限性,我们推荐使用 eloquent 关系和预加载机制。这种方法不仅能避免 `group by` 可能导致的非预期结果,…

    2026年9月23日
    200
  • 机械键盘轴体深度手感分析:线性轴、段落轴与提前段落轴

    机械键盘手感取决于轴体类型,主流分为线性轴、段落轴和提前段落轴。线性轴直上直下顺滑连贯,代表如Cherry MX Red,适合游戏与快速输入;段落轴中程有明显阻力峰,提供清晰反馈,如Cherry MX Blue,适合文字工作;提前段落轴起步阻力大随后变轻,如TTC Gold Pink,防误触且节奏独…

    2026年9月22日
    000

发表回复

登录后才能评论
关注微信