Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
Pandas DataFrame中字符串组合的唯一聚合与自定义排序教程_创想鸟

Pandas DataFrame中字符串组合的唯一聚合与自定义排序教程

Pandas DataFrame中字符串组合的唯一聚合与自定义排序教程

本教程旨在解决Pandas DataFrame中对字符串列进行分组聚合,并对聚合后的唯一成员进行自定义排序的问题。我们将展示如何将多个字符串组合拆分为独立元素,去除重复,并根据预设顺序重新组合。通过利用Python的sorted函数结合自定义映射器,以及itertools.chain的优化方案,实现灵活的数据处理和精确的输出控制。

在数据处理和分析中,我们经常需要对字符串数据进行聚合操作。一个常见的场景是,某一列包含由分隔符连接的多个字符串元素,我们需要按某个键进行分组,然后将这些元素合并,同时去除重复项,并按照特定的顺序排列。

1. 问题描述与初始数据

假设我们有以下Pandas DataFrame,其中CLASS列表示类别,MEMBERS列包含由” & “连接的成员:

import pandas as pddf = pd.DataFrame({    'CLASS': ['A', 'B', 'A'],    'MEMBERS': ['foo & bar', 'bar & luz', 'baz']})print(df)#    CLASS    MEMBERS# 0      A  foo & bar# 1      B  bar & luz# 2      A        baz

我们的目标是:

按CLASS列进行分组。合并每个组中MEMBERS列的所有唯一元素。对这些唯一元素进行自定义排序,例如按照[‘foo’, ‘bar’, ‘baz’, ‘luz’]的顺序。

期望的输出结果如下:

# CLASS# A    foo & bar & baz# B          bar & luz# Name: MEMBERS, dtype: object

2. 核心挑战:唯一聚合与自定义排序

首先,我们可以通过groupby()和agg()函数实现初步的唯一聚合。关键在于如何将每个MEMBERS字符串拆分,获取所有独立的成员,然后去重,最后再重新连接。

一个初步的解决方案是:

# 步骤1: 拆分所有成员并去重# ' & '.join(s) 将一个组内的所有MEMBERS字符串连接成一个长字符串# .split(' & ') 将这个长字符串拆分成单个成员列表# set(...) 对列表进行去重# ' & '.join(...) 将去重后的成员重新连接aggregated_members = df.groupby('CLASS')['MEMBERS'].agg(    lambda s: " & ".join(set(' & '.join(s).split(' & '))))print(aggregated_members)# CLASS# A    foo & baz & bar# B          luz & bar# Name: MEMBERS, dtype: object

可以看到,虽然实现了唯一聚合,但成员的顺序是随机的(因为set是无序的)。接下来,我们需要引入自定义排序逻辑。

3. 解决方案一:利用 sorted() 与自定义键

Python的内置函数sorted()允许我们通过key参数指定一个函数,该函数将应用于列表中的每个元素,并返回一个用于排序的值。我们可以创建一个映射字典,将我们期望的排序顺序编码为整数,然后将其作为key传递给sorted()。

# 定义期望的排序顺序order = ['foo', 'bar', 'baz', 'luz']# 创建一个映射字典,将每个成员映射到其在排序列表中的索引# 例如:{'foo': 0, 'bar': 1, 'baz': 2, 'luz': 3}mapper = {k: i for i, k in enumerate(order)}# 应用到DataFrameresult_df = (df.groupby('CLASS')['MEMBERS']             .agg(lambda s: " & ".join(sorted(set(' & '.join(s).split(' & ')),                                              key=mapper.get)))            )print(result_df)# CLASS# A    foo & bar & baz# B          bar & luz# Name: MEMBERS, dtype: object

代码解析:

order = [‘foo’, ‘bar’, ‘baz’, ‘luz’]:定义了我们希望的最终排序顺序。mapper = {k: i for i, k in enumerate(order)}:这是一个字典推导式,创建了一个映射器。例如,’foo’映射到0,’bar’映射到1,以此类推。当sorted()函数需要比较两个成员时,它会调用mapper.get(member)来获取对应的整数值,然后根据这些整数值进行排序。set(‘ & ‘.join(s).split(‘ & ‘)):这部分与之前的逻辑相同,负责将一个组内的所有MEMBERS字符串连接成一个长字符串,然后拆分并去重,得到一个包含所有唯一成员的集合。sorted(…, key=mapper.get):这是核心部分。sorted()函数接收这个唯一成员的集合,并使用mapper.get作为排序键。对于集合中的每个成员,mapper.get()会返回其在order列表中对应的索引。如果某个成员不在mapper中(例如,如果原始数据中出现了order中没有的新成员),mapper.get()默认会返回None,这可能导致排序行为不确定。为了更健壮,可以考虑为mapper.get()提供一个默认值,例如key=lambda x: mapper.get(x, float(‘inf’)),将未知的成员排到最后。” & “.join(…):最后将排序后的成员列表用” & “重新连接成一个字符串。

4. 解决方案二:使用 itertools.chain 优化

当MEMBERS列中的字符串数量非常多,或者每个字符串包含的成员数量很大时,反复调用’ & ‘.join(s).split(‘ & ‘)可能会创建大型的中间字符串和列表,效率不高。itertools.chain可以更有效地处理迭代器,避免创建大的中间数据结构。

我们可以定义一个辅助函数来封装聚合和排序逻辑:

from itertools import chaindef custom_join_and_sort(series, order_list):    """    对Series中的字符串进行拆分、去重、按指定顺序排序并重新连接。    Args:        series (pd.Series): 包含字符串的Series,字符串通过' & '分隔。        order_list (list): 期望的排序顺序列表。    Returns:        str: 排序并连接后的字符串。    """    # 创建映射字典    mapper = {k: i for i, k in enumerate(order_list)}    # 使用itertools.chain.from_iterable高效地扁平化所有成员    # x.split(' & ') 将每个字符串拆分成列表    # chain.from_iterable 将所有这些列表扁平化为一个迭代器    all_members = chain.from_iterable(x.split(' & ') for x in series)    # 去重并排序    # 注意:如果成员不在mapper中,mapper.get(x)将返回None,    # 可能会导致排序问题。可以考虑添加默认值,如 mapper.get(x, float('inf'))    # 将未知成员排到最后。    sorted_unique_members = sorted(set(all_members), key=lambda x: mapper.get(x, float('inf')))    # 重新连接    return ' & '.join(sorted_unique_members)# 应用到DataFrameresult_df_optimized = (df.groupby('CLASS')['MEMBERS']                       .agg(custom_join_and_sort, order_list=['foo', 'bar', 'baz', 'luz'])                      )print(result_df_optimized)# CLASS# A    foo & bar & baz# B          bar & luz# Name: MEMBERS, dtype: object

代码解析:

from itertools import chain:导入itertools.chain模块。chain.from_iterable(x.split(‘ & ‘) for x in series):这是优化点。它不再将所有字符串连接成一个巨大的字符串,而是对Series中的每个字符串调用x.split(‘ & ‘)生成一个列表,然后chain.from_iterable将这些列表的迭代器“链接”起来,形成一个单一的、扁平化的成员迭代器。这避免了不必要的中间字符串和列表的创建,对于内存和性能有益。key=lambda x: mapper.get(x, float(‘inf’)):这里对mapper.get()增加了默认值float(‘inf’)。这意味着如果order_list中没有包含某个成员,它将被赋予一个非常大的排序值,从而被排到结果字符串的末尾。这增加了代码的健壮性。

5. 注意事项

性能考量:对于非常大的数据集和复杂的字符串操作,itertools.chain通常比’ & ‘.join().split()更高效,因为它处理的是迭代器而不是创建完整的中间列表。未知成员的处理:在定义mapper和使用sorted(key=…)时,务必考虑如果原始数据中出现order列表中未定义的成员,它们的排序行为。如上所示,使用mapper.get(x, float(‘inf’))是一个稳健的策略,可以将未知成员排到已知成员之后。分隔符的一致性:确保MEMBERS列中的分隔符始终一致,本教程中是” & “。如果存在多种分隔符,需要更复杂的解析逻辑。空值处理:如果MEMBERS列可能包含NaN或其他非字符串值,在split(‘ & ‘)之前可能需要添加类型检查或空值处理,例如str(x).split(‘ & ‘)或x if isinstance(x, str) else ”。

6. 总结

本教程详细介绍了如何在Pandas DataFrame中实现字符串组合的唯一聚合和自定义排序。我们首先展示了如何通过groupby()和agg()结合set进行基本的去重聚合。接着,通过引入sorted()函数和自定义的key(基于映射字典),解决了自定义排序的问题。最后,为了提高效率和健壮性,我们展示了如何使用itertools.chain优化成员的扁平化处理,并讨论了处理未知成员的策略。这些技术在处理复杂的文本数据聚合场景中非常实用。

以上就是Pandas DataFrame中字符串组合的唯一聚合与自定义排序教程的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1365086.html

赞 (0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
Python 元组打包与解包性能分析及优化
上一篇 2025年12月14日 04:25:18
PyPy中类型注解的语法错误解析与Python版本兼容性指南
下一篇 2025年12月14日 04:25:30

相关推荐

  • 贾跃亭:FX Super One试制顺利 将携新车亮相火人节

    8月25日,faraday future(ff)创始人贾跃亭发布了第17期周报。周报中提到,fx super one的试制进展顺利,并计划于下周携新车亮相火人节。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ FX Super One 据了…

    2026年10月3日
    100
  • Notion AI新用户必看:5分钟上手基础写作与总结

    Notion AI新用户必看:5分钟上手基础写作与总结Notion AI新用户必看:5分钟上手基础写作与总结Notion AI新用户必看:5分钟上手基础写作与总结Notion AI新用户必看:5分钟上手基础写作与总结

    notion ai可通过掌握指令系统、使用模板、迭代优化、善用总结功能及认识局限性来快速生成高质量内容。首先熟悉基础指令并自定义以适应不同写作风格;其次从预设模板入手了解应用场景;随后对ai生成内容进行多次修改优化;利用ai总结功能提取关键信息;同时注意核实事实避免错误。针对博客写作,需结合选题研究…

    2026年10月3日 • 用户投稿
    000
  • Java字符串压缩算法优化:处理末尾字符序列的策略

    本文深入探讨了字符串压缩算法,旨在将连续重复字符替换为字符加计数。我们将分析在实现此类算法时常见的末尾字符序列处理遗漏问题,并提供一个优化后的Java解决方案,确保所有字符序列都能被正确压缩,从而实现如“abbbccccc”到“ab3c4”的准确转换。 理解字符串压缩需求 字符串压缩是一种常见的数据…

    2026年10月3日
    300
  • Skyeye 云智能制造办公系统 – Saas v3.17.4 发布

    Skyeye 云智能制造办公系统 – Saas v3.17.4 发布Skyeye 云智能制造办公系统 – Saas v3.17.4 发布Skyeye 云智能制造办公系统 – Saas v3.17.4 发布Skyeye 云智能制造办公系统 – Saas v3.17.4 发布

    skyeye 云智能制造,智能制造一体化,采用 springboot+ uni-app + ant design vue 的低代码平台开发模式。包含 50 多种电子流程,crm、pm、erp、mes、adm、oa、ehr、ai、项目、商城、财务、多班次考勤、薪资、招聘、云售后、论坛、问卷、报表设计、…

    2026年10月3日 • 用户投稿
    000
  • 如何在Android中替换已弃用的LocalBroadcastManager

    如何在Android中替换已弃用的LocalBroadcastManager如何在Android中替换已弃用的LocalBroadcastManager如何在Android中替换已弃用的LocalBroadcastManager如何在Android中替换已弃用的LocalBroadcastManager

    本文档旨在指导开发者如何在Android应用中替换已弃用的 LocalBroadcastManager。LocalBroadcastManager 由于其全局事件总线的特性,导致应用层级之间的耦合,已被官方弃用。本文将介绍两种替代方案:使用 LiveData 和 RxJava,并提供详细的代码示例和…

    2026年10月3日 • 用户投稿
    000
  • 中国移动、中兴通讯5G 云化核心网荣获AMO“亚洲最佳气候行动移动创新奖”

    中国移动、中兴通讯5G 云化核心网荣获AMO“亚洲最佳气候行动移动创新奖”中国移动、中兴通讯5G 云化核心网荣获AMO“亚洲最佳气候行动移动创新奖”中国移动、中兴通讯5G 云化核心网荣获AMO“亚洲最佳气候行动移动创新奖”中国移动、中兴通讯5G 云化核心网荣获AMO“亚洲最佳气候行动移动创新奖”

    【上海,6月19日】近日,2025年亚洲移动大奖(amo大奖)揭晓,中国移动联合中兴通讯打造的基于ai驱动的绿色节能5g云化核心网创新项目荣获gsma颁发的“亚洲最佳气候行动移动创新奖”。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 在全…

    2026年10月3日 • 用户投稿
    200
  • Java Stream API:高效扁平化嵌套Map并收集数据

    Java Stream API:高效扁平化嵌套Map并收集数据Java Stream API:高效扁平化嵌套Map并收集数据Java Stream API:高效扁平化嵌套Map并收集数据Java Stream API:高效扁平化嵌套Map并收集数据

    本文探讨如何利用Java Stream API将一个包含嵌套Map的复杂数据结构(Map<String, Map>)扁平化为一个简单的Map。文章详细介绍了在没有重复键和存在重复键两种场景下,如何使用flatMap和Collectors.toMap的不同重载方法进行高效的数据转换,并提供…

    2026年10月3日 • 用户投稿
    700
  • Yii框架中的Gii代码生成器:快速创建代码

    yii框架是一种开源的php框架,它提供了丰富的功能和特性,旨在提高开发者的工作效率和代码质量。其中一个值得一提的功能是gii代码生成器,它可以帮助开发者快速创建代码并减少手工编写冗长、重复的代码的时间和精力,本篇文章就为大家介绍一下yii框架中的gii代码生成器。 什么是Gii代码生成器 Gii(…

    用户投稿 2026年10月3日
    100
  • 谷歌浏览器怎么重置所有设置_谷歌浏览器恢复默认设置操作方法

    谷歌浏览器怎么重置所有设置_谷歌浏览器恢复默认设置操作方法谷歌浏览器怎么重置所有设置_谷歌浏览器恢复默认设置操作方法谷歌浏览器怎么重置所有设置_谷歌浏览器恢复默认设置操作方法谷歌浏览器怎么重置所有设置_谷歌浏览器恢复默认设置操作方法

    首先重置浏览器设置可解决运行异常问题。通过设置菜单选择“将设置还原为默认设置”并确认重置,适用于配置错误;若开发者工具异常,则在F12面板中点击“Restore defaults and reload”;若因配置文件损坏导致重置失败,需重命名“Default”文件夹以重建配置,或调整“Secure …

    2026年10月3日 • 用户投稿
    100
  • 显存差了4GB 玩家为何仍选择RTX 5070而非RX 9070:老外分析四大原因

    显存差了4GB 玩家为何仍选择RTX 5070而非RX 9070:老外分析四大原因显存差了4GB 玩家为何仍选择RTX 5070而非RX 9070:老外分析四大原因显存差了4GB 玩家为何仍选择RTX 5070而非RX 9070:老外分析四大原因显存差了4GB 玩家为何仍选择RTX 5070而非RX 9070:老外分析四大原因

    9月14日消息,amd的rx 9070虽然与nvidia rtx 5070定价相近,并拥有更大的显存容量和略微领先的游戏性能,但rtx 5070的市场销量依然大幅领先于rx 9070。 针对此现象,wccftech总结了四个关键原因。 DLSS 4生态更成熟,图像增强技术普及率更高 如今,图像超分技…

    2026年10月3日 • 用户投稿
    1700
  • 初代《深海迷航》与“冰点之下”获更新档与大幅折扣

    初代《深海迷航》与“冰点之下”获更新档与大幅折扣初代《深海迷航》与“冰点之下”获更新档与大幅折扣初代《深海迷航》与“冰点之下”获更新档与大幅折扣初代《深海迷航》与“冰点之下”获更新档与大幅折扣

    《深海迷航2》无疑是今年最受关注的游戏之一,尽管这种关注度并非开发团队所期望的。在发行商krafton突然解雇unknown worlds entertainment整个核心管理团队后,一场重大的法律争端随之爆发。 被解职的前领导层包括联合创始人查理·克利夫兰和马克斯·麦圭尔,他们随后对Krafto…

    2026年10月3日 • 用户投稿
    200
  • 使用递归方法展平嵌套的Java对象为字符串数组

    使用递归方法展平嵌套的Java对象为字符串数组使用递归方法展平嵌套的Java对象为字符串数组使用递归方法展平嵌套的Java对象为字符串数组使用递归方法展平嵌套的Java对象为字符串数组

    本文介绍如何使用递归方法将一个嵌套的Java对象(表示树形结构的类别)转换为一个字符串数组,其中每个字符串代表从根节点到叶子节点的完整路径。这种方法避免了使用Java 8 Stream API的复杂性,提供了一种更简洁易懂的解决方案。 递归展平嵌套对象 在处理具有父子关系的嵌套数据结构时,递归是一种…

    2026年10月3日 • 用户投稿
    1100
  • Java中处理空字符串和数值输入的异常

    Java中处理空字符串和数值输入的异常Java中处理空字符串和数值输入的异常Java中处理空字符串和数值输入的异常Java中处理空字符串和数值输入的异常

    本文旨在解决Java程序中读取用户输入时,如何优雅地处理空字符串和数值转换异常的问题。通过使用try-catch块,我们可以捕获NumberFormatException,从而避免程序崩溃,并允许程序在接收到无效输入时执行特定的处理逻辑,例如提示用户重新输入或采取默认行为。本文提供了一个具体的代码示…

    2026年10月3日 • 用户投稿
    400
  • Java程序处理空白输入和数值符号的正确姿势

    Java程序处理空白输入和数值符号的正确姿势Java程序处理空白输入和数值符号的正确姿势Java程序处理空白输入和数值符号的正确姿势Java程序处理空白输入和数值符号的正确姿势

    本文旨在指导开发者如何编写Java程序,使其能够正确读取并处理包含空白字符的输入,并判断数值的正负号。通过使用try-catch块捕获NumberFormatException,程序可以优雅地处理空白输入或无法转换为数字的输入,避免程序崩溃,并给出友好的提示信息。同时,本文还展示了如何使用Float…

    2026年10月3日 • 用户投稿
    900
  • 深入理解ISO8601日期格式及其PHP DateTime 类转换指南

    本文旨在解析常见的2021-10-04T08:19:54.000+04:00日期格式为ISO8601标准,并提供在PHP中将其高效转换为d.m.Y H:i:s格式的专业教程。我们将重点介绍如何利用PHP内置的DateTime类进行日期解析和格式化,避免直接使用gmdate可能遇到的问题,确保日期时间…

    2026年10月3日
    400
  • 初代《辐射》原定是《废土》系列的续作 制作组拼尽全力避免被EA起诉

    初代《辐射》原定是《废土》系列的续作 制作组拼尽全力避免被EA起诉初代《辐射》原定是《废土》系列的续作 制作组拼尽全力避免被EA起诉初代《辐射》原定是《废土》系列的续作 制作组拼尽全力避免被EA起诉初代《辐射》原定是《废土》系列的续作 制作组拼尽全力避免被EA起诉

    近日,interplay前联合创始人brian fargo在一次采访中透露,初代《辐射》最初其实是作为ea于1988年发行的游戏《废土》的续作来开发的。为了防止被ea提起诉讼,开发团队当时竭尽全力调整设计,规避法律风险。 《辐射》初代作品发布于1997年,距离首部《废土》问世已过去近十年。尽管两款游…

    2026年10月3日 • 用户投稿
    1100
  • 悟空浏览器如何让标签页竖排显示_悟空浏览器垂直标签页模式设置方法

    悟空浏览器如何让标签页竖排显示_悟空浏览器垂直标签页模式设置方法悟空浏览器如何让标签页竖排显示_悟空浏览器垂直标签页模式设置方法悟空浏览器如何让标签页竖排显示_悟空浏览器垂直标签页模式设置方法悟空浏览器如何让标签页竖排显示_悟空浏览器垂直标签页模式设置方法

    悟空浏览器支持通过设置菜单、实验室功能或主题联动启用垂直标签页模式,将标签栏移至左侧竖向排列以提升多任务效率。首先可进入主菜单→设置→标签页管理→选择“垂直显示”;若未上线,可在地址栏输入internal://flags,搜索“垂直标签”并启用对应实验功能后重启浏览器;此外部分主题如“极简侧栏版”会…

    2026年10月3日 • 用户投稿
    200
  • 豆包ai怎么创作歌词 豆包ai歌词创作指南

    豆包ai怎么创作歌词 豆包ai歌词创作指南豆包ai怎么创作歌词 豆包ai歌词创作指南豆包ai怎么创作歌词 豆包ai歌词创作指南豆包ai怎么创作歌词 豆包ai歌词创作指南

    豆包ai虽非专为歌词创作设计,但其强大的文本生成能力可有效辅助歌词创意、押韵优化及风格多样化。1. 可通过输入关键词或具体情境获取歌词灵感;2. 可请求优化押韵和句子结构以提升音乐性;3. 可生成不同风格版本便于选择与融合。掌握提问技巧能让豆包ai更贴合创作需求,多加尝试将提升辅助效果。 ☞☞☞AI…

    2026年10月3日 • 用户投稿
    100
  • composer如何处理一个被fork(分叉)的依赖包?

    composer如何处理一个被fork(分叉)的依赖包?composer如何处理一个被fork(分叉)的依赖包?composer如何处理一个被fork(分叉)的依赖包?composer如何处理一个被fork(分叉)的依赖包?

    答案:通过配置composer.json的repositories字段可使用fork的第三方包。具体操作为添加type为vcs、url指向fork仓库的配置,require中仍使用原始包名但指定分支如dev-main,确保fork仓库的composer.json中name字段与原包一致,推送修改后运…

    2026年10月3日 • 用户投稿
    100
  • 利用Josson和Jackson处理复杂JSON数据:聚合与POJO映射

    利用Josson和Jackson处理复杂JSON数据:聚合与POJO映射利用Josson和Jackson处理复杂JSON数据:聚合与POJO映射利用Josson和Jackson处理复杂JSON数据:聚合与POJO映射利用Josson和Jackson处理复杂JSON数据:聚合与POJO映射

    本文详细阐述了如何使用Josson库高效处理嵌套的JSON数据结构,实现特定字段(如count)的最小值和最大值聚合,并最终将聚合结果映射到简洁的Java POJO对象。教程涵盖了Josson的链式查询语法,包括展平、分组和聚合操作,最后结合Jackson进行POJO反序列化,为复杂数据转换提供了清…

    2026年10月3日 • 用户投稿
    100

发表回复

登录后才能评论
关注微信