Pandas中从混合字符串列提取数字并进行聚合的教程

Pandas中从混合字符串列提取数字并进行聚合的教程

本教程详细介绍了如何在Pandas DataFrame中处理包含数字和文本的混合字符串列。针对数据格式不一致的问题,我们将利用str.extract结合正则表达式高效地提取数值,并进行类型转换,最终实现按类别分组汇总销售额。文章还将演示如何进行条件性聚合,以应对更复杂的业务需求,帮助用户有效清洗和分析非结构化数据。

数据清洗挑战:从混合字符串中提取数值

在数据分析实践中,我们经常会遇到数据格式不一致的问题。例如,在pandas dataframe的某一列中,数值可能与描述性文本混合在一起,且格式不统一。这给直接的数值计算和聚合带来了挑战。考虑以下示例数据:

import pandas as pdimport iodata = """Category    Sales       PaidTable       1 table     YesChair       3chairs     YesCushion     8 cushions  YesTable       3Tables     YesChair       12 Chairs   NoMats        12Mats      Yes"""df = pd.read_csv(io.StringIO(data), sep=r's+')print(df)

输出:

  Category       Sales Paid0    Table     1 table  Yes1    Chair     3chairs  Yes2  Cushion  8 cushions  Yes3    Table     3Tables  Yes4    Chair   12 Chairs   No5     Mats      12Mats  Yes

如上所示,Sales列中的销售数量与单位(如”table”, “chairs”)混合,且格式不固定(例如”3chairs”和”12 Chairs”)。我们的目标是从Sales列中提取纯数字,然后按Category列进行分组汇总。

核心工具:pandas.Series.str.extract

Pandas提供了强大的字符串操作方法,其中str.extract()是处理此类问题的理想工具。它允许我们使用正则表达式从字符串中提取匹配的模式,并将其转换为新的列或Series。

逐步实现:提取与汇总

1. 准备数据

首先,确保我们有上述的DataFrame df。

2. 提取所有销售额并按类别汇总

为了从Sales列中提取数字,我们可以使用正则表达式^(d+)。

^:匹配字符串的开始。d+:匹配一个或多个数字。():捕获组,表示我们想要提取这部分内容。

str.extract(pattern, expand=False)方法将返回一个Series,其中包含匹配到的数字。expand=False参数确保返回一个Series而不是DataFrame。

提取数字后,需要将其转换为整数类型(astype(int)),以便进行数学运算。最后,我们可以使用groupby()和sum()方法按Category汇总。

# 提取数字并转换为整数extracted_sales = df['Sales'].str.extract('^(d+)', expand=False).astype(int)print("提取的销售额数字:")print(extracted_sales)# 按类别汇总所有销售额total_sales_per_category = extracted_sales.groupby(df['Category']).sum()print("n按类别汇总的所有销售额:")print(total_sales_per_category)

输出:

提取的销售额数字:0     11     32     83     34    125    12Name: Sales, dtype: int64按类别汇总的所有销售额:CategoryChair      15Cushion     8Mats       12Table       4Name: Sales, dtype: int64

从中间结果可以看出,extracted_sales成功地从原始的混合字符串中提取了纯数字。最终的汇总结果清晰地展示了每个类别的总销售额。

3. 实现条件性汇总:仅统计已支付项

有时,我们可能需要根据其他列的条件来汇总数据。例如,我们只想统计Paid列为’Yes’的销售额。在这种情况下,我们可以结合where()方法。

df[‘Sales’].where(df[‘Paid’] == ‘Yes’, other=’0′) 的作用是:

如果Paid列的值为’Yes’,则保留原始Sales列的值。如果Paid列的值不为’Yes’(例如’No’),则将Sales列的对应值替换为字符串’0’。这样处理后,即使原始Sales列中包含非数字字符,str.extract也能从替换后的’0’中提取数字0,从而正确地参与后续的求和。

# 仅统计已支付项的销售额paid_sales_per_category = (    df['Sales']    .where(df['Paid'] == 'Yes', other='0') # 将未支付项的销售额替换为'0'    .str.extract('^(d+)', expand=False)    .astype(int)    .groupby(df['Category'])    .sum())print("n按类别汇总的已支付销售额:")print(paid_sales_per_category)

输出:

按类别汇总的已支付销售额:CategoryChair       3Cushion     8Mats       12Table       4Name: Sales, dtype: int64

通过这种方式,我们成功地实现了条件性汇总,仅计算了已支付的销售额。

关键概念解析

pandas.Series.str.extract(pattern, expand=False): 这是本教程的核心。它利用正则表达式的强大功能,从Series中的每个字符串元素中提取匹配的子字符串。expand=False确保返回一个Series,而不是一个包含单列的DataFrame。正则表达式 ^(d+):^:匹配字符串的开头。这很重要,因为它确保我们只提取字符串开头的数字,而不是中间或末尾的数字。d+:匹配一个或多个数字(0-9)。():捕获组。str.extract会提取括号内匹配到的内容。.astype(int): 将提取到的字符串数字转换为整数类型。这是进行数学运算(如求和)的必要步骤。如果提取结果中包含NaN(表示没有匹配到数字),astype(int)会报错。在这种情况下,可能需要先使用fillna(0)等方法处理NaN。pandas.Series.where(condition, other): 根据指定的条件有选择地替换Series中的值。如果条件为True,则保留原值;如果条件为False,则替换为other指定的值。这在进行条件性数据预处理时非常有用。.groupby().sum(): Pandas中进行分组聚合的标准操作。它首先根据指定列(如Category)对数据进行分组,然后对每个组应用聚合函数(如sum())。

注意事项与最佳实践

正则表达式的准确性: 正则表达式是str.extract功能的关键。确保你的正则表达式能够准确匹配你想要提取的数字模式,并处理可能的变体。如果数字不在字符串开头,你需要调整正则表达式,例如使用(d+)匹配任意位置的数字,或更精确的模式。NaN值的处理: 如果str.extract没有找到匹配项,它将返回NaN。在尝试使用astype(int)之前,你可能需要处理这些NaN值,例如使用fillna(0)将其替换为0,或者使用dropna()删除包含NaN的行。

# 示例:处理NaNdf_with_nan_sales = pd.DataFrame({'Sales': ['1 table', 'no sales', '5 chairs']})extracted = df_with_nan_sales['Sales'].str.extract('^(d+)', expand=False)print("包含NaN的提取结果:n", extracted)# 在转换前填充NaNconverted = extracted.fillna('0').astype(int)print("填充NaN并转换后的结果:n", converted)

性能考虑: 对于非常大的数据集,str.extract结合正则表达式通常是高效的。但在极端情况下,如果正则表达式非常复杂或数据量极大,可能需要考虑其他基于C语言实现的解析库或更优化的字符串处理方法。数据一致性: 尽可能在数据采集阶段就保证数据格式的一致性,这将大大减少后期数据清洗的工作量。

总结

本教程演示了如何利用Pandas的str.extract()方法结合正则表达式,有效地从格式不一致的混合字符串列中提取数值,并进行分组聚合。通过这种方法,我们不仅能够解决常见的数据清洗难题,还能进一步实现基于条件的复杂数据分析。掌握这些技巧将显著提升你在Pandas中处理和分析非结构化数据的能力。

以上就是Pandas中从混合字符串列提取数字并进行聚合的教程的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1371376.html

赞 (0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
python f-string格式化如何使用_python f-string格式化字符串用法详解
上一篇 2025年12月14日 11:23:34
Python怎么解析HTML_Python HTML解析方法与库介绍
下一篇 2025年12月14日 11:23:46

相关推荐

  • DeepSeek能做代码生成吗 使用DeepSeek进行编程任务的能力测试

    DeepSeek能做代码生成吗 使用DeepSeek进行编程任务的能力测试DeepSeek能做代码生成吗 使用DeepSeek进行编程任务的能力测试DeepSeek能做代码生成吗 使用DeepSeek进行编程任务的能力测试DeepSeek能做代码生成吗 使用DeepSeek进行编程任务的能力测试

    本文将探讨名为DeepSeek的语言模型在代码生成领域的表现。针对“DeepSeek能做代码生成吗?”这一问题,我们将阐述其在编程任务上的能力,并模拟进行一次能力测试的描述,帮助读者了解DeepSeek作为编程助手的潜力及其适用场景。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量…

    2026年9月26日 • 用户投稿
    100
  • 可能是目前效果最好的开源生图模型,混元生图 3.0 来了

    可能是目前效果最好的开源生图模型,混元生图 3.0 来了可能是目前效果最好的开源生图模型,混元生图 3.0 来了可能是目前效果最好的开源生图模型,混元生图 3.0 来了可能是目前效果最好的开源生图模型,混元生图 3.0 来了

    腾讯混元最新发布并开源原生多模态生图模型——混元图像 3.0(hunyuanimage 3.0)! 模型参数规模高达 80B,是目前参数量最大的开源生图模型。 同时,HunyuanImage 3.0 将理解与生成一体化融合,也是首个开源工业级原生多模态生图模型,效果对标业界头部闭源模型,堪称目前开源…

    2026年9月26日 • 用户投稿
    400
  • 如何用Java制作个人任务提醒应用

    使用Java创建任务提醒应用,核心功能包括任务管理与定时提醒。2. 设计Task类封装标题、描述、截止时间与完成状态,用LocalDateTime处理时间。3. 任务存储于List中,通过ObjectOutputStream序列化实现持久化。4. 利用ScheduledExecutorService…

    2026年9月26日
    100
  • 一键PHP环境可以同时跑多个PHP版本吗_多版本共存实现

    多PHP版本共存可行。通过宝塔、phpStudy等集成环境或手动配置Nginx+多PHP-FPM,可实现不同站点使用不同PHP版本,需注意扩展兼容性、端口冲突及安全维护。 一键PHP环境通常指的是集成化的开发环境工具,比如 XAMPP、WAMP、宝塔面板 或 phpStudy 这类软件。这类工具默认…

    2026年9月26日
    000
  • Google浏览器官网入口一键直达

    Google浏览器官网入口一键直达Google浏览器官网入口一键直达Google浏览器官网入口一键直达Google浏览器官网入口一键直达

    Google浏览器官网入口一键直达地址是https://www.google.cn/chrome/,该网址提供简洁界面、多标签管理、智能搜索、网页翻译等功能,并支持跨设备同步书签、历史记录和密码,具备高效性能与安全更新。 Google浏览器官网入口一键直达在哪里?这是不少网友都关注的,接下来由PHP…

    2026年9月26日 • 用户投稿
    000
  • 抖音内容怎么吸引流量_抖音内容吸引流量的核心方法

    抖音内容怎么吸引流量_抖音内容吸引流量的核心方法抖音内容怎么吸引流量_抖音内容吸引流量的核心方法抖音内容怎么吸引流量_抖音内容吸引流量的核心方法抖音内容怎么吸引流量_抖音内容吸引流量的核心方法

    答案:提升抖音推荐需优化开头3秒、内容结构、互动率、AI工具和垂直领域。打造强钩子如结果前置、冲突制造、高悬念提问;采用痛点—解决—升华结构,每30秒设信息点;引导评论、挑战和点赞;用AI生成素材与分析数据;明确账号定位并连续发布同领域内容10条以上,前3-5天模拟用户行为助系统打标。 如果您发布的…

    2026年9月26日 • 用户投稿
    400
  • AI辩论教练:用豆包AI+Character模拟对手训练逻辑反应

    AI辩论教练:用豆包AI+Character模拟对手训练逻辑反应AI辩论教练:用豆包AI+Character模拟对手训练逻辑反应AI辩论教练:用豆包AI+Character模拟对手训练逻辑反应AI辩论教练:用豆包AI+Character模拟对手训练逻辑反应

    你可以使用豆包ai和character.ai进行辩论训练,具体步骤包括:1.选择合适的平台,豆包ai适合快速访问,character.ai适合丰富角色设定;2.创建或选择辩论角色并设定背景、立场和风格;3.明确辩题并输入给ai;4.轮流发言并及时记录分析;5.利用豆包ai进行观点碰撞、论据挖掘和模拟…

    2026年9月26日 • 用户投稿
    000
  • Linux网络配置与防火墙设置

    Linux网络配置与防火墙设置Linux网络配置与防火墙设置Linux网络配置与防火墙设置Linux网络配置与防火墙设置

    本文介绍了linux网络配置和防火墙设置方法。1. 配置网络接口需修改/etc/network/interfaces或netplan配置文件,设置静态ip、子网掩码、网关和dns服务器;2. 使用iptables命令管理防火墙,例如sudo iptables -a input -p tcp &#82…

    2026年9月26日 • 用户投稿
    000
  • Java项目质量保障体系:静态分析、单元测试与集成测试

    Java项目质量保障体系:静态分析、单元测试与集成测试Java项目质量保障体系:静态分析、单元测试与集成测试Java项目质量保障体系:静态分析、单元测试与集成测试Java项目质量保障体系:静态分析、单元测试与集成测试

    静态分析是Java质量保障的第一道防线,因其能在代码运行前发现潜在缺陷。SonarQube等工具通过集成Checkstyle、PMD等规则集,实现代码规范、安全、性能的全面扫描,及早暴露空指针、资源泄漏等问题,减少技术债。它作为“预检系统”,避免低级错误流入后续阶段,提升整体代码整洁度,为单元与集成…

    2026年9月26日 • 用户投稿
    000
  • 如何解决MySQL版本兼容性问题的处理方法?

    如何解决MySQL版本兼容性问题的处理方法?如何解决MySQL版本兼容性问题的处理方法?如何解决MySQL版本兼容性问题的处理方法?如何解决MySQL版本兼容性问题的处理方法?

    mysql版本兼容性问题可通过升级、降级或编写兼容代码解决。具体步骤为:1.明确问题根源,如sql语法、函数或协议不兼容;2.选择升级或降级版本,优先考虑升级以获取优化和修复;3.使用注释语法编写兼容性sql;4.借助orm框架屏蔽底层差异;5.通过查询版本号或配置文件实现条件判断;6.利用dock…

    2026年9月26日 • 用户投稿
    100
  • 自媒体内容怎么避免同质化_避免自媒体内容同质化的实用方法

    自媒体内容怎么避免同质化_避免自媒体内容同质化的实用方法自媒体内容怎么避免同质化_避免自媒体内容同质化的实用方法自媒体内容怎么避免同质化_避免自媒体内容同质化的实用方法自媒体内容怎么避免同质化_避免自媒体内容同质化的实用方法

    内容同质化指不同来源的信息高度相似,缺乏独特性。其表现为内容重复、视角单一、模板化创作等;核心原因包括平台算法驱动形成“信息茧房”、原创成本高导致复制泛滥、创作者创新能力不足;这会降低用户信息筛选效率,阻碍多元思考,并削弱社会创新动力;解决方向需优化算法以增加多样性权重、加强原创保护机制,并提升用户…

    2026年9月26日 • 用户投稿
    000
  • Linux系统备份与恢复方案:定时备份与应急恢复

    Linux系统备份与恢复方案:定时备份与应急恢复Linux系统备份与恢复方案:定时备份与应急恢复Linux系统备份与恢复方案:定时备份与应急恢复Linux系统备份与恢复方案:定时备份与应急恢复

    linux系统备份恢复方案旨在防止数据丢失并重建系统。实现方法包括:1. 核心数据每日备份(如数据库、配置文件);2. 系统完整备份每周一次,作为最后防线;3. 使用crontab定时任务及rsync工具实现增量备份,提高效率。应急恢复策略需预先规划,包括:1. 选择多种备份介质(外置硬盘、网络存储…

    2026年9月26日 • 用户投稿
    000
  • 研祥智能亮相2025工博会:工业智能,此刻正在爆发!

    研祥智能亮相2025工博会:工业智能,此刻正在爆发!研祥智能亮相2025工博会:工业智能,此刻正在爆发!研祥智能亮相2025工博会:工业智能,此刻正在爆发!研祥智能亮相2025工博会:工业智能,此刻正在爆发!

    9月23日,2025工博会正式拉开帷幕 创新浪潮席卷申城 人流与焦点在此交汇 在6.1HD005展位上 研祥智能开启了一场关于工业智能化的深度对话 全场景解决方案与自主可控成果重磅登场 本次展会,研祥智能携“5+N”全场景工业制造解决方案及20余款新品惊艳亮相,精准聚焦锂电制造、低空经济、智慧工厂、…

    2026年9月26日 • 用户投稿
    200
  • 抖音视频怎么优化SEO_抖音视频SEO优化的详细方法

    抖音视频怎么优化SEO_抖音视频SEO优化的详细方法抖音视频怎么优化SEO_抖音视频SEO优化的详细方法抖音视频怎么优化SEO_抖音视频SEO优化的详细方法抖音视频怎么优化SEO_抖音视频SEO优化的详细方法

    优化抖音曝光需从标题、描述、封面、语音、互动及发布时间入手。1、标题嵌入关键词并吸引点击;2、描述补充核心词与话题标签;3、封面清晰统一增强识别;4、语音与字幕突出关键信息;5、引导互动提升点赞评论完播;6、定时发布保持频率紧跟热点,全面提升搜索排名与推荐概率。 如果您希望提升抖音视频在平台内的曝光…

    2026年9月26日 • 用户投稿
    100
  • 对象的内存布局是怎样的?(对象头、实例数据、对齐填充)

    对象的内存布局是怎样的?(对象头、实例数据、对齐填充)对象的内存布局是怎样的?(对象头、实例数据、对齐填充)对象的内存布局是怎样的?(对象头、实例数据、对齐填充)对象的内存布局是怎样的?(对象头、实例数据、对齐填充)

    JVM中对象内存布局由对象头、实例数据和对齐填充三部分组成,对象头存储Mark Word和类型指针,实例数据按字段大小排序存放以优化对齐,对齐填充保证对象大小为8字节倍数以提升访问效率。 在Java虚拟机(JVM)中,一个对象在内存中的布局通常可以划分为三个主要部分:对象头(Object Heade…

    2026年9月26日 • 用户投稿
    200
  • 【Tools】 一款方便 Windows 桌面运维的计算机信息收集和在线检测工具

    【Tools】 一款方便 Windows 桌面运维的计算机信息收集和在线检测工具【Tools】 一款方便 Windows 桌面运维的计算机信息收集和在线检测工具【Tools】 一款方便 Windows 桌面运维的计算机信息收集和在线检测工具【Tools】 一款方便 Windows 桌面运维的计算机信息收集和在线检测工具

    简介 这是一款专为windows桌面运维设计的计算机信息采集与在线状态检测工具,可自动获取主机名、当前用户名、cpu型号、内存容量、硬盘使用情况、ip地址、mac地址等关键硬件和网络信息。 功能特点: 支持系统托盘运行模式 客户端可设置静默启动 支持定时向服务端上报设备信息 服务端配备图形化管理界面…

    2026年9月26日 • 用户投稿
    200
  • sublime怎么在mac上设置命令行工具_sublime Mac命令行工具配置

    sublime怎么在mac上设置命令行工具_sublime Mac命令行工具配置sublime怎么在mac上设置命令行工具_sublime Mac命令行工具配置sublime怎么在mac上设置命令行工具_sublime Mac命令行工具配置sublime怎么在mac上设置命令行工具_sublime Mac命令行工具配置

    首先确认Sublime可执行路径为/Applications/Sublime Text.app/Contents/SharedSupport/bin/subl,接着创建软链接sudo ln -s /Applications/Sublime Text.app/Contents/SharedSuppor…

    2026年9月26日 • 用户投稿
    100
  • iPhone15ProMax密码设置不了怎么办?解决旗舰机密码设置问题

    iPhone 15 Pro Max无法设置密码多为软件问题,可尝试强制重启、更新系统、重置所有设置或检查屏幕使用时间限制;若无效,可考虑DFU模式恢复或移除屏幕膜;仍无法解决应联系苹果官方支持。 遇到iPhone 15 Pro Max无法设置密码的问题,通常并非硬件故障,而是软件层面的一些小插曲,或…

    2026年9月26日
    100
  • 可以穿梭时空的实时计算框架——Flink对时间的处理

    可以穿梭时空的实时计算框架——Flink对时间的处理可以穿梭时空的实时计算框架——Flink对时间的处理可以穿梭时空的实时计算框架——Flink对时间的处理可以穿梭时空的实时计算框架——Flink对时间的处理

    Flink对于流处理架构的意义十分重要,Kafka让消息具有了持久化的能力,而处理数据,甚至穿越时间的能力都要靠Flink来完成。 在streaming-大数据的未来一文中我们知道,对于流式处理最重要的两件事,正确性,时间推理工具。而flink对两者都有非常好的支持。 Flink对于正确性的保证 对…

    2026年9月26日 • 用户投稿
    300
  • Claude如何优化金融分析 Claude财经数据解读模型

    Claude如何优化金融分析 Claude财经数据解读模型Claude如何优化金融分析 Claude财经数据解读模型Claude如何优化金融分析 Claude财经数据解读模型Claude如何优化金融分析 Claude财经数据解读模型

    在金融分析领域使用claude类ai模型需注意四个关键点。一要确保输入数据质量高且结构化,如提供具体财报数字而非模糊描述;二要通过引导式提问促进深度分析,例如要求比较公司roe变化及原因;三要结合术语与通俗表达适应不同场景,比如让非专业者理解贝塔系数;四要注意模型局限性,不盲目依赖结论、关注数据时效…

    2026年9月26日 • 用户投稿
    100

发表回复

登录后才能评论
关注微信