Pandas DataFrame中字符串标准化与分组聚合实践

Pandas DataFrame中字符串标准化与分组聚合实践

本教程详细介绍了如何在Pandas DataFrame中对包含不规范字符的字符串列进行标准化处理,特别是通过使用Python的正则表达式(re模块)清除特殊符号、数字和多余空格。通过将清理函数应用于目标列,我们可以有效地统一数据条目,从而确保后续的groupby和聚合操作(如求和)能够准确无误地进行,最终获得期望的汇总结果。

问题背景:不规范数据对聚合的影响

在数据分析中,我们经常需要对数据进行分组聚合操作,例如计算不同类别的总和。然而,原始数据往往存在不一致性,尤其是在字符串列中。例如,同一个实体的名称可能因为包含括号、连字符、数字或多余的空格而以多种形式出现(如 “michael” 和 “michael ()”)。当直接对这样的列进行 groupby 操作时,pandas 会将这些看似相似但字符不同的条目视为独立的组,导致聚合结果不准确。

考虑以下示例数据:

Name Fee

Michael3Michael ()4Sarah – (0)5Sarah5

如果直接对 Name 列进行分组求和,输出将与原始表相同,因为 “Michael” 和 “Michael ()” 被视为两个不同的名称。我们的目标是清除 Name 列中的不规范字符,使 “Michael ()” 变为 “Michael”,”Sarah – (0)” 变为 “Sarah”,从而实现正确的聚合。

核心工具:正则表达式 (re模块)

解决此类问题的关键在于对字符串进行标准化处理。Python 的 re 模块提供了强大的正则表达式功能,可以高效地查找和替换字符串中的特定模式。

1. 移除特殊字符和数字

我们可以使用 re.sub() 函数来替换字符串中匹配特定模式的部分。为了只保留字母和空格,我们可以使用正则表达式模式 [^A-Za-z ]+。

[^…]: 匹配不在括号内的任何字符。A-Za-z: 匹配所有大写和小写英文字母。` `: 匹配空格字符。+: 匹配前一个字符或组一次或多次。

因此,[^A-Za-z ]+ 表示匹配除英文字母和空格之外的任何字符,并将其替换为空字符串。

import re# 示例字符串string1 = 'Sarah - (0)'string2 = 'Michael ()'# 使用正则表达式移除特殊字符和数字clean_string1 = re.sub(r'[^A-Za-z ]+', '', string1)clean_string2 = re.sub(r'[^A-Za-z ]+', '', string2)print(f"'{string1}' 清理后: '{clean_string1}'") # 输出: 'Sarah  'print(f"'{string2}' 清理后: '{clean_string2}'") # 输出: 'Michael '

2. 结合 strip() 清除首尾空格

经过正则表达式处理后,字符串中可能会留下多余的空格,尤其是在原始特殊字符的位置。例如,’Sarah – (0)’ 变为 ‘Sarah ‘。为了进一步规范化,我们可以使用字符串的 strip() 方法来移除字符串开头和结尾的所有空白字符(包括空格、制表符、换行符等)。

# 结合 re.sub 和 stripstring = 'Sarah - (0)'clean_string = re.sub(r'[^A-Za-z ]+', '', string).strip()print(f"'{string}' 最终清理后: '{clean_string}'") # 输出: 'Sarah'

Pandas DataFrame中的应用

将上述字符串清理逻辑应用于 Pandas DataFrame 的列,是实现数据标准化的关键步骤。

1. 定义清理函数

首先,我们将清理逻辑封装成一个函数,以便于在 DataFrame 中调用。

import redef clean_name(name_str):    """    清理名称字符串,移除特殊字符、数字,并去除首尾空格。    """    if isinstance(name_str, str): # 确保输入是字符串类型        # 移除除字母和空格外的所有字符        cleaned = re.sub(r'[^A-Za-z ]+', '', name_str)        # 去除首尾空格        return cleaned.strip()    return name_str # 如果不是字符串,则原样返回

2. 使用 .apply() 方法作用于列

Pandas DataFrame 的 apply() 方法允许我们将一个函数应用于 Series(即 DataFrame 的列)的每个元素。

import pandas as pd# 原始数据data = {    'Name': ['Michael', 'Michael ()', 'Sarah - (0)', 'Sarah'],    'Fee': [3, 4, 5, 5]}df = pd.DataFrame(data)print("原始 DataFrame:")print(df)# 应用清理函数到 'Name' 列df['Name_Cleaned'] = df['Name'].apply(clean_name)print("n清理后的 DataFrame (新增 'Name_Cleaned' 列):")print(df)

此时,DataFrame 将会有一个新的列 Name_Cleaned,其中包含标准化后的名称。

Name Fee Name_Cleaned

Michael3MichaelMichael ()4MichaelSarah – (0)5SarahSarah5Sarah

3. 执行分组聚合

现在,我们可以使用清理后的 Name_Cleaned 列进行 groupby 操作并求和。

# 使用清理后的列进行分组聚合df_grouped = df.groupby('Name_Cleaned')['Fee'].sum().reset_index()print("n分组聚合后的结果:")print(df_grouped)

最终输出将是期望的结果:

Name_Cleaned Fee

Michael7Sarah10

完整示例代码

以下是一个完整的 Pandas DataFrame 字符串标准化与分组聚合的示例:

import pandas as pdimport re# 1. 定义清理函数def clean_name(name_str):    """    清理名称字符串,移除特殊字符、数字,并去除首尾空格。    """    if isinstance(name_str, str):        # 移除除字母和空格外的所有字符        cleaned = re.sub(r'[^A-Za-z ]+', '', name_str)        # 去除首尾空格        return cleaned.strip()    return name_str# 2. 创建原始 DataFramedata = {    'Name': ['Michael', 'Michael ()', 'Sarah - (0)', 'Sarah', 'John 123', 'John'],    'Fee': [3, 4, 5, 5, 2, 3]}df = pd.DataFrame(data)print("--- 原始 DataFrame ---")print(df)print("-" * 30)# 3. 应用清理函数到 'Name' 列,并覆盖原列或创建新列# 为了保持原始数据不变,通常建议创建新列或先复制DataFramedf['Name'] = df['Name'].apply(clean_name)# 4. 进一步的标准化:统一大小写(可选但常用)# 例如,如果 'michael' 和 'Michael' 应该被视为同一个,则需要这一步df['Name'] = df['Name'].str.lower().str.capitalize() # 先转小写再首字母大写print("n--- 清理并标准化后的 DataFrame ---")print(df)print("-" * 30)# 5. 执行分组聚合df_grouped = df.groupby('Name')['Fee'].sum().reset_index()print("n--- 分组聚合后的结果 ---")print(df_grouped)print("-" * 30)

进一步的标准化考虑

大小写统一: 在很多场景下,”Michael” 和 “michael” 应该被视为同一个实体。在应用 clean_name 函数之后,可以额外使用 .str.lower() 或 .str.upper() 方法将所有名称统一为小写或大写,以避免因大小写差异导致的分组错误。例如:df[‘Name_Cleaned’] = df[‘Name_Cleaned’].str.lower()。更复杂的清理需求: 本教程中的正则表达式 [^A-Za-z ]+ 仅保留字母和空格。如果需要保留数字(例如 “Product 1″),则正则表达式模式需要调整,例如 [^A-Za-z0-9 ]+。根据具体的数据特点和业务需求,正则表达式的编写会更加灵活。性能: 对于非常大的数据集,apply() 方法可能不是最高效的方式。在这种情况下,可以考虑使用 Pandas 的 .str.replace() 结合正则表达式,或使用 Cython 优化过的自定义函数。然而,对于大多数常见规模的数据,apply() 已经足够。

总结

对数据进行预处理和标准化是数据分析流程中至关重要的一步。通过利用 Python 的 re 模块进行正则表达式匹配和替换,结合 Pandas DataFrame 的 .apply() 方法,我们可以有效地清理和统一字符串数据。这不仅能够解决因数据不一致导致的分组聚合问题,还能显著提高数据分析的准确性和可靠性。在实际应用中,务必根据数据的具体特点和业务需求,灵活选择和组合不同的字符串处理方法。

以上就是Pandas DataFrame中字符串标准化与分组聚合实践的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1366744.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
Pandas数据清洗与分组聚合:标准化列名实现精确统计
上一篇 2025年12月14日 06:50:00
Python中如何规范化处理句子首字母大写
下一篇 2025年12月14日 06:50:11

相关推荐

  • 铁路12306电子发票下载失败怎么解决_铁路12306电子发票下载问题解决方案

    铁路12306电子发票下载失败怎么解决_铁路12306电子发票下载问题解决方案铁路12306电子发票下载失败怎么解决_铁路12306电子发票下载问题解决方案铁路12306电子发票下载失败怎么解决_铁路12306电子发票下载问题解决方案铁路12306电子发票下载失败怎么解决_铁路12306电子发票下载问题解决方案

    首先检查网络连接并重新尝试下载电子发票,若失败可联系12306客服重发,同时查看邮箱垃圾文件夹,最后可通过个人所得税App等工具同步管理发票。 如果您在尝试下载铁路12306电子发票时遇到失败情况,可能是由于网络连接、系统状态或权限设置等问题导致。以下是针对该问题的多种解决方案。 本文运行环境:iP…

    2026年9月24日 用户投稿
    100
  • AI音频工具有哪些_好用的AI音频工具大全

    AI音频工具有哪些_好用的AI音频工具大全AI音频工具有哪些_好用的AI音频工具大全AI音频工具有哪些_好用的AI音频工具大全AI音频工具有哪些_好用的AI音频工具大全

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 魔音工坊:AI配音神器,轻松打造媲美真人声线 讯飞智作:科大讯飞出品的语音转换与配音利器 听脑AI:智能语音记录助手 Suno:高品质AI音乐创作平台 海绵音乐:字节旗下免费AI音乐创作与探索平…

    2026年9月24日 用户投稿
    300
  • 2025年最受欢迎的手机数据恢复免费软件

    2025年最受欢迎的手机数据恢复免费软件2025年最受欢迎的手机数据恢复免费软件2025年最受欢迎的手机数据恢复免费软件2025年最受欢迎的手机数据恢复免费软件

    数据恢复软件可找回误删的手机数据,推荐2025年实用工具:一、数据蛙恢复专家支持快速与深度扫描,预览后导出至电脑;二、转转大师操作简单,适合新手,可恢复多种场景数据;三、Recuva无需安装,擅长小文件快速恢复,建议启用深度扫描;四、奇客数据恢复专为安卓设计,兼容性强,无需Root即可恢复消息与媒体…

    2026年9月24日 用户投稿
    100
  • Java正则表达式:利用词边界实现精确的非贪婪字符串替换

    Java正则表达式:利用词边界实现精确的非贪婪字符串替换Java正则表达式:利用词边界实现精确的非贪婪字符串替换Java正则表达式:利用词边界实现精确的非贪婪字符串替换Java正则表达式:利用词边界实现精确的非贪婪字符串替换

    本教程探讨如何在Java中使用正则表达式精确替换字符串中的特定部分,特别是在目标字符串不应消耗后续字符的场景。通过分析常见错误,文章详细介绍了词边界的原理与应用,展示了如何利用它实现非贪婪且不破坏原字符串结构的替换,确保匹配的精确性与替换结果的完整性。 在处理字符串替换时,我们经常面临需要精确匹配特…

    2026年9月24日 用户投稿
    700
  • win8怎么关闭metro应用后台运行_Win8 Metro应用后台关闭方法

    win8怎么关闭metro应用后台运行_Win8 Metro应用后台关闭方法win8怎么关闭metro应用后台运行_Win8 Metro应用后台关闭方法win8怎么关闭metro应用后台运行_Win8 Metro应用后台关闭方法win8怎么关闭metro应用后台运行_Win8 Metro应用后台关闭方法

    通过任务管理器结束进程、调整隐私设置禁用后台权限、使用组策略限制应用运行及修改注册表可有效控制Windows 8中Metro应用的后台活动。 如果您在使用Windows 8系统时发现Metro应用在后台持续运行,导致资源占用较高或影响电池续航,则可以通过以下方法进行管理。这些操作将帮助您有效控制Me…

    2026年9月24日 用户投稿
    100
  • JFugue中和弦解析的深度解析与实践

    JFugue中和弦解析的深度解析与实践JFugue中和弦解析的深度解析与实践JFugue中和弦解析的深度解析与实践JFugue中和弦解析的深度解析与实践

    JFugue库的onChordParsed方法不会被调用,因为JFugue将和弦分解为独立的音符进行处理。本文详细阐述了如何通过onNoteParsed方法结合音符的isFirstNote(), isHarmonicNote(), isMelodicNote()属性来识别Staccato字符串中的和…

    2026年9月24日 用户投稿
    100
  • 公众号文章如何插入小程序_在文章中插入小程序的正确操作方法

    公众号文章如何插入小程序_在文章中插入小程序的正确操作方法公众号文章如何插入小程序_在文章中插入小程序的正确操作方法公众号文章如何插入小程序_在文章中插入小程序的正确操作方法公众号文章如何插入小程序_在文章中插入小程序的正确操作方法

    可通过图文编辑器插入小程序卡片,设置封面标题及路径;或将小程序链接设为“阅读原文”跳转目标;也可通过自定义菜单关联小程序并引导用户点击;对于无法使用插件的情况,可生成小程序码图片嵌入文章,配以“长按识别”提示语。 如果您希望在公众号文章中增加互动性或引导用户使用特定功能,可以通过插入小程序来实现。小…

    2026年9月24日 用户投稿
    100
  • Agent Zero— 开源可扩展AI框架,通过用户指令和任务动态学习

    Agent Zero— 开源可扩展AI框架,通过用户指令和任务动态学习Agent Zero— 开源可扩展AI框架,通过用户指令和任务动态学习Agent Zero— 开源可扩展AI框架,通过用户指令和任务动态学习Agent Zero— 开源可扩展AI框架,通过用户指令和任务动态学习

    agent zero 是一个开源的、可扩展的人工智能框架,能够作为用户的个性化智能助手。它不是基于预设功能的工具,而是通过用户指令和任务来动态学习与成长。agent zero 具备持久记忆能力,可以存储过往的解决方案、代码和事实信息,从而更快速地应对未来的任务。该框架将操作系统视为执行任务的工具,具…

    2026年9月24日 用户投稿
    100
  • 主板 BIOS 功能深度对比:哪家超频与调校选项更丰富?

    主板 BIOS 功能深度对比:哪家超频与调校选项更丰富?主板 BIOS 功能深度对比:哪家超频与调校选项更丰富?主板 BIOS 功能深度对比:哪家超频与调校选项更丰富?主板 BIOS 功能深度对比:哪家超频与调校选项更丰富?

    答案是旗舰芯片组主板超频功能更强,具体取决于平台和型号。Intel的Z系列与AMD的X/B650E等高端主板提供完整超频选项,而B/H/A系列则限制较多;微星MPOWER系列在主流芯片组上提供越级超频工具;华硕、微星、技嘉三大品牌在BIOS设计上兼顾易用性与专业性,各具特色;最终选择需结合CPU支持…

    2026年9月24日 用户投稿
    000
  • ubuntu compton减少延迟策略

    compton 是 ubuntu 的一个轻量级窗口合成器,通常用于实现透明度和合成效果。然而,compton 可能会导致一些延迟,特别是在资源受限的系统上。以下是一些减少 compton 延迟的策略: 降低合成分辨率:通过降低 Compton 的合成分辨率,可以减少处理负担,从而减少延迟。可以在 C…

    2026年9月24日
    000
  • windows10的gpedit.msc组策略打不开_windows10组策略编辑器打不开修复方法

    windows10的gpedit.msc组策略打不开_windows10组策略编辑器打不开修复方法windows10的gpedit.msc组策略打不开_windows10组策略编辑器打不开修复方法windows10的gpedit.msc组策略打不开_windows10组策略编辑器打不开修复方法windows10的gpedit.msc组策略打不开_windows10组策略编辑器打不开修复方法

    首先检查系统文件完整性,运行sfc /scannow修复损坏文件;若为家庭版系统,使用DISM命令安装组策略组件;接着通过注册表编辑器修改MMC相关限制策略;最后尝试直接从System32目录运行gpedit.msc文件。 如果您尝试通过运行命令打开Windows 10的组策略编辑器(gpedit.…

    2026年9月24日 用户投稿
    200
  • DeepSeek能不能帮我写代码 简单编程任务如何交给DeepSeek完成

    DeepSeek能不能帮我写代码 简单编程任务如何交给DeepSeek完成DeepSeek能不能帮我写代码 简单编程任务如何交给DeepSeek完成DeepSeek能不能帮我写代码 简单编程任务如何交给DeepSeek完成DeepSeek能不能帮我写代码 简单编程任务如何交给DeepSeek完成

    很多用户好奇,像DeepSeek这样的AI模型能否帮助完成编程任务,特别是那些相对简单的编程需求。答案是肯定的。DeepSeek具备理解自然语言描述并尝试生成相应代码的能力,这使得它成为完成一些简单编程任务的有力工具。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepS…

    2026年9月24日 用户投稿
    200
  • ubuntu如何mount网络驱动器

    在ubuntu中挂载网络驱动器有多种方法,以下是一些常见的方法: 方法一:使用mount命令 确定网络驱动器的地址:例如,如果是Samba共享,地址可能是smb://server/share。如果是NFS共享,地址可能是nfs://server/share。安装必要的软件包:对于Samba共享,安装…

    2026年9月24日
    000
  • mysql中rand的用法 mysql随机函数使用教程

    mysql 的 rand() 函数返回 0 到 1 之间的随机浮点数,用于随机选择和排序数据。1)随机排序:select from your_table order by rand()。2)随机抽取记录:select from your_table order by rand() limit 10。…

    2026年9月24日
    300
  • 高质量免费logo设计网站 国产免费logo生成工具推荐

    国产免费Logo设计网站推荐即时设计、DesignEvo、牛人设计等,这些平台提供海量模板、支持中文输入与AI智能生成,具备全中文界面、本土化元素和矢量导出功能,适合零基础用户快速制作高质量Logo。 高质量免费logo设计网站国产免费logo生成工具推荐这是不少网友都关注的接下来由PHP小编为大家…

    2026年9月24日
    300
  • 如何通过BIOS调整CPU电压实现节能?

    答案:CPU降压通过BIOS调整Vcore电压,采用Offset模式在保证稳定前提下降低功耗与温度,提升能效;需结合HWiNFO64等工具监控温度、功耗,并用Prime95等压力测试验证稳定性,避免蓝屏或崩溃,合理设置可使CPU在更低温度下维持更高睿频,实现节能且不牺牲性能。 通过BIOS调整CPU…

    2026年9月24日
    900
  • 为什么GPU显存带宽比容量更重要?

    显存带宽比容量更重要,因其直接决定数据传输速度,影响GPU计算单元的利用率。在AI训练和高分辨率渲染中,高带宽可避免“数据饥饿”,确保海量数据高效流转,而HBM技术凭借3D堆叠和宽接口提供远超GDDR的带宽,成为高性能计算的关键。 GPU显存带宽比容量更重要,核心在于现代GPU的工作模式和其处理的数…

    2026年9月24日
    200
  • VSCode如何实现代码热重载 VSCode实时预览开发的高效配置方案

    使用live server扩展实现静态文件的实时预览,保存后浏览器自动刷新;2. 利用现代前端框架(如react、vue)内置的开发服务器(如vite、webpack dev server)实现hmr热模块替换,修改代码后仅更新变动模块而不刷新页面;3. 结合browsersync等工具实现多设备同…

    2026年9月24日
    100
  • 外媒测试《消逝的光芒:困兽》PC性能:运行表现相当优秀

    外媒测试《消逝的光芒:困兽》PC性能:运行表现相当优秀外媒测试《消逝的光芒:困兽》PC性能:运行表现相当优秀外媒测试《消逝的光芒:困兽》PC性能:运行表现相当优秀外媒测试《消逝的光芒:困兽》PC性能:运行表现相当优秀

    来入手《消逝的光芒:困兽》吧!现享金币优惠叠加专属优惠券折上折,标准版仅需200.9元(共节省47.1元);豪华版233.2元(总计立减54.8元)。 由Techland打造的《消逝的光芒》系列新作《消逝的光芒:困兽》已正式上线。本作背景设定在曾经风景如画、如今却尸横遍野的河狸谷。玩家将在此组建临时…

    2026年9月24日 用户投稿
    000
  • UC浏览器怎么查看和清除LocalStorage数据 UC浏览器LocalStorage数据管理方法

    可通过隐私设置清除或开发者工具查看LocalStorage。①在UC浏览器设置中选择“隐私与安全”→“清除浏览数据”,勾选“Cookie及其他网站数据”即可批量删除LocalStorage;②打开uc://inspect启用开发者工具,通过电脑Chrome远程调试查看具体键值对;③root设备后使用…

    2026年9月24日
    300

发表回复

登录后才能评论
关注微信