Pandas 数据聚合优化:利用 Pivot 提升效率与代码简洁性

Pandas 数据聚合优化:利用 Pivot 提升效率与代码简洁性

本文旨在解决使用 Pandas 进行数据聚合时,因频繁的筛选和合并操作导致的冗余代码问题。我们将介绍如何利用 Pandas 的 pivot 函数高效重塑数据,并通过简洁的代码实现复杂的统计计算,从而显著提升数据处理效率和代码可维护性,避免不必要的中间 DataFrame。

传统数据聚合方法的痛点

在数据分析工作中,我们经常需要从原始数据集中提取特定子集,进行计算,然后将结果合并。例如,根据不同的条件(如 regions 和 n)筛选数据,计算特定指标(如 length),再将这些结果通过 merge 操作组合起来。这种方法虽然能达到目的,但在实际操作中往往面临以下问题:

代码冗长且重复: 每次筛选和计算都需要单独的代码块,当需要处理的组合条件增多时,代码量会急剧膨胀。效率低下: 频繁创建中间 DataFrame 并执行 merge 操作,尤其是在处理百万级别甚至更大数据量时,会带来显著的性能开销。可读性差: 大量的筛选和合并逻辑使得代码难以理解,增加了维护成本。易出错: 重复的代码模式更容易引入复制粘贴错误,导致结果不准确。

以下是原始问题中展示的示例代码片段,它清晰地体现了这种重复性:

# 原始的重复筛选和合并操作示例df_cap_N90 = df_stats[(df_stats['N'] == 90) & (df_stats['regions'] == 'captured')].drop(columns=['regions', 'N'])df_cap_N50 = df_stats[(df_stats['N'] == 50) & (df_stats['regions'] == 'captured')].drop(columns=['regions', 'N'])df_all_N50 = df_stats[(df_stats['N'] == 50) & (df_stats['regions'] == 'all')     ].drop(columns=['regions', 'N'])df_summ_cap_N50_all_N50 = pd.merge(df_cap_N50, df_all_N50, on='enzyme', how='inner', suffixes=('_cap_N50', '_all_N50'))df_summ_cap_N50_all_N50['cap_N50_all_N50'] = (df_summ_cap_N50_all_N50['length_cap_N50'] -                                              df_summ_cap_N50_all_N50['length_all_N50'])df_summ_cap_N90_all_N50 = pd.merge(df_cap_N90, df_all_N50, on='enzyme', how='inner', suffixes=('_cap_N90', '_all_N50'))df_summ_cap_N90_all_N50['cap_N90_all_N50'] = df_summ_cap_N90_all_N50['length_cap_N90'] - df_summ_cap_N90_all_N50['length_all_N50']df_summ = pd.merge(df_summ_cap_N50_all_N50.drop(columns=['length_cap_N50', 'length_all_N50']),                   df_summ_cap_N90_all_N50.drop(columns=['length_cap_N90', 'length_all_N50']),                   on='enzyme', how='inner')

Pandas pivot 函数:数据重塑的利器

为了解决上述问题,Pandas 提供了 pivot 函数,它能够将“长格式”数据(即多个变量的值存储在同一列中,通过其他列标识其类型)转换为“宽格式”数据(即每个变量类型拥有独立的列)。这种重塑操作能极大地简化后续的计算逻辑。

pivot 函数的核心参数包括:

index: 用于创建新 DataFrame 的行索引的列。columns: 用于创建新 DataFrame 的列索引的列(可以是一个列表,生成多级列索引)。values: 用于填充新 DataFrame 单元格的值的列。

示例数据准备

首先,我们加载并查看原始数据:

import ioimport pandas as pdTESTDATA="""enzyme  regions   N   lengthAaaI    all       10  238045AaaI    all       20  170393AaaI    all       30  131782AaaI    all       40  103790AaaI    all       50  81246AaaI    all       60  62469AaaI    all       70  46080AaaI    all       80  31340AaaI    all       90  17188AaaI    captured  10  292735AaaI    captured  20  229824AaaI    captured  30  193605AaaI    captured  40  163710AaaI    captured  50  138271AaaI    captured  60  116122AaaI    captured  70  95615AaaI    captured  80  73317AaaI    captured  90  50316AagI    all       10  88337AagI    all       20  19144AagI    all       30  11030AagI    all       40  8093AagI    all       50  6394AagI    all       60  4991AagI    all       70  3813AagI    all       80  2759AagI    all       90  1666AagI    captured  10  34463AagI    captured  20  19220AagI    captured  30  15389AagI    captured  40  12818AagI    captured  50  10923AagI    captured  60  9261AagI    captured  70  7753AagI    captured  80  6201AagI    captured  90  4495"""df_stats = pd.read_csv(io.StringIO(TESTDATA), sep='s+')print("原始数据 df_stats 头部:")print(df_stats.head())

输出:

原始数据 df_stats 头部:  enzyme regions   N  length0   AaaI     all  10  2380451   AaaI     all  20  1703932   AaaI     all  30  1317823   AaaI     all  40  1037904   AaaI     all  50   81246

使用 pivot 重塑数据

为了进行 cap_N50_all_N50 和 cap_N90_all_N50 的计算,我们只需要 N 为 50 和 90 的数据。首先筛选出这些数据,然后使用 pivot 进行重塑。

# 筛选出 N 为 50 或 90 的数据,这是后续计算所需filtered_df = df_stats.loc[df_stats["N"].isin([50, 90])]# 使用 pivot 重塑数据# index='enzyme' 将 enzyme 作为新的行索引# columns=['regions', 'N'] 将 regions 和 N 的组合作为新的列索引(多级列)# values='length' 将 length 列的值填充到新的单元格中pivoted_df = filtered_df.pivot(index="enzyme", columns=["regions", "N"], values="length")print("n重塑后的 pivoted_df 头部:")print(pivoted_df.head())

输出:

重塑后的 pivoted_df 头部:regions   all         captured    N          50      90       50      90enzyme                              AaaI    81246   17188   138271   50316AagI     6394    1666    10923    4495

可以看到,pivoted_df 现在是一个宽格式的 DataFrame,enzyme 作为行索引,regions 和 N 的组合作为多级列索引。所有需要进行计算的值都已排列在同一行中,使得后续操作变得非常直接。

基于重塑数据的统计计算

数据重塑完成后,复杂的跨列计算就变得异常简单。我们可以直接通过列名访问数据,并利用 Pandas 的内置方法进行高效的向量化操作。

# 进行统计计算# 从 'captured' 区域的 N50/N90 值中减去 'all' 区域的 N50 值# pivoted_df["captured"] 选取所有 'captured' 区域的列(N50, N90)# pivoted_df[("all", 50)] 选取 'all' 区域的 N50 列# .sub() 方法执行减法,axis=0 表示按行对齐索引进行操作result_df = (pivoted_df["captured"]             .sub(pivoted_df[("all", 50)], axis=0)             .add_prefix("cap_N") # 为列添加前缀 'cap_N'             .add_suffix("_all_N50") # 为列添加后缀 '_all_N50'             .reset_index()) # 将 enzyme 索引重置为普通列print("n最终结果 result_df:")print(result_df)

输出:

最终结果 result_df:N enzyme  cap_N50_all_N50  cap_N90_all_N500   AaaI            57025           -309301   AagI             4529            -1899

通过上述代码,我们仅用了几行简洁的代码就实现了与原始冗长代码相同的结果,并且逻辑更加清晰。

优化效果与优势

与原始的重复筛选和合并方法相比,使用 pivot 进行数据聚合和计算带来了显著的优势:

代码简洁性: 将多步骤的筛选、合并和计算整合为少数几行代码,大大减少了代码量。执行效率: pivot 操作在底层经过高度优化,且避免了多次创建中间 DataFrame 和执行昂贵的 merge 操作,这对于处理大数据集时性能提升尤为明显。可读性与可维护性: 代码逻辑更加集中和直观,易于理解和后续修改。当需要添加新的计算组合时,只需在 pivot 后的 DataFrame 上进行简单的列操作即可。灵活性: 这种模式便于扩展。如果需要计算更多 N 值或 regions 类型的组合,只需调整 filtered_df 的筛选条件和后续的列操作即可。

注意事项与最佳实践

pivot 与 pivot_table 的选择: pivot 函数要求 index 和 columns 参数的组合必须是唯一的,否则会报错。如果存在重复的 index/columns 组合,并且需要对 values 进行聚合(如求和、平均值等),则应使用功能更强大的 pivot_table 函数,它允许指定聚合函数 aggfunc。在本例中,enzyme、regions 和 N 的组合是唯一的,因此 pivot 适用。缺失值处理: 如果某些 index/columns 组合在原始数据中不存在,pivot 操作会在新生成的 DataFrame 中填充 NaN。在进行后续计算前,可能需要使用 fillna() 等方法处理这些缺失值。性能考量: 尽管 pivot 效率高,但对于拥有极大量唯一 columns

以上就是Pandas 数据聚合优化:利用 Pivot 提升效率与代码简洁性的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1370716.html

赞 (0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
利用Python进行网页表格数据抓取与Pandas DataFrame转换
上一篇 2025年12月14日 10:47:18
Pandas高效聚合:利用pivot和广播操作简化复杂数据转换
下一篇 2025年12月14日 10:47:30

相关推荐

  • 豆包AI生成商业计划书的技巧 快速梳理创业要点的AI方法

    豆包AI生成商业计划书的技巧 快速梳理创业要点的AI方法豆包AI生成商业计划书的技巧 快速梳理创业要点的AI方法豆包AI生成商业计划书的技巧 快速梳理创业要点的AI方法豆包AI生成商业计划书的技巧 快速梳理创业要点的AI方法

    用豆包ai生成商业计划书的关键在于结构引导与内容优化。首先明确核心内容结构,先提问获取通用框架,再结合项目实际逐项补充,控制在8个部分以内,突出重点并简化合并章节;其次使用关键词+语气提示引导ai写出专业内容,如“产品优势”可设定“以专业语气写一段关于智能喂食器的产品优势说明”;第三步借助ai生成财…

    2026年9月29日 • 用户投稿
    100
  • 李飞飞世界模型大更新! 实时生成 3D 世界,只要一块 GPU

    李飞飞世界模型大更新! 实时生成 3D 世界,只要一块 GPU李飞飞世界模型大更新! 实时生成 3D 世界,只要一块 GPU李飞飞世界模型大更新! 实时生成 3D 世界,只要一块 GPU李飞飞世界模型大更新! 实时生成 3D 世界,只要一块 GPU

    当 OpenAI 的奥特曼还在到处买显卡、买算力,来支撑他的 Sora 2 视频生成模型。 李飞飞的实验室 The World Labs,用一张显卡就能运行一个世界。他们今天发布了一项名为 RTFM ( Real-Time Frame Model ) 的新技术,一个全新的实时世界生成模型。 和九月中…

    2026年9月29日 • 用户投稿
    200
  • 桶排序是什么?桶排序的实现方法

    桶排序是什么?桶排序的实现方法桶排序是什么?桶排序的实现方法桶排序是什么?桶排序的实现方法桶排序是什么?桶排序的实现方法

    桶排序通过将数据分到多个桶内,对每个桶单独排序再合并,实现高效排序。其核心优势在于数据均匀分布时可达O(n+k)线性时间复杂度。与计数排序(统计频次)和基数排序(按位排序)不同,桶排序按值范围划分,适用于浮点数且更灵活,但性能依赖数据分布均匀性。实际应用中面临数据分布不均导致性能退化、内存开销大、桶…

    2026年9月29日 • 用户投稿
    100
  • 一门双至尊!荣耀MagicPad3 Pro平板首发第五代骁龙8至尊版:定义安卓最强平板

    一门双至尊!荣耀MagicPad3 Pro平板首发第五代骁龙8至尊版:定义安卓最强平板一门双至尊!荣耀MagicPad3 Pro平板首发第五代骁龙8至尊版:定义安卓最强平板一门双至尊!荣耀MagicPad3 Pro平板首发第五代骁龙8至尊版:定义安卓最强平板一门双至尊!荣耀MagicPad3 Pro平板首发第五代骁龙8至尊版:定义安卓最强平板

    9月25日,高通在骁龙峰会上正式揭晓了其最新旗舰移动平台——第五代骁龙8至尊版。这一发布瞬间点燃行业关注,而更引人瞩目的是,多家终端品牌随即宣布将推出搭载该芯片的新品,其中荣耀尤为抢眼。 荣耀产品线总裁方飞在峰会现场宣布:荣耀MagicPad3 Pro与荣耀Magic8系列将同步首发第五代骁龙8至尊…

    2026年9月29日 • 用户投稿
    100
  • 如何在Java中使用用户输入退出for或while循环

    如何在Java中使用用户输入退出for或while循环如何在Java中使用用户输入退出for或while循环如何在Java中使用用户输入退出for或while循环如何在Java中使用用户输入退出for或while循环

    本文旨在介绍如何在Java程序中,通过用户输入来灵活地中断for或while循环的执行。我们将探讨如何使用BufferedReader类来接收用户输入,并在循环内部判断输入是否为特定退出指令,从而实现程序的动态控制。同时,也会提供代码示例和注意事项,帮助你编写更健壮、更易维护的Java代码。 使用B…

    2026年9月29日 • 用户投稿
    000
  • 前端开发如何安装Sublime_Sublime前端环境搭建教程

    前端开发如何安装Sublime_Sublime前端环境搭建教程前端开发如何安装Sublime_Sublime前端环境搭建教程前端开发如何安装Sublime_Sublime前端环境搭建教程前端开发如何安装Sublime_Sublime前端环境搭建教程

    首先安装Sublime Text并配置Package Control插件管理器,接着安装Emmet、HTML-CSS-JS Prettify等前端插件,然后设置文件类型关联以正确识别.html、.css、.js文件语法,最后通过快捷键配置实现代码格式化功能。 如果您尝试在前端开发中使用 Sublim…

    2026年9月29日 • 用户投稿
    1700
  • GPU功耗超1000W 微软发布芯片级液冷散热技术:温度骤降65%

    GPU功耗超1000W 微软发布芯片级液冷散热技术:温度骤降65%GPU功耗超1000W 微软发布芯片级液冷散热技术:温度骤降65%GPU功耗超1000W 微软发布芯片级液冷散热技术:温度骤降65%GPU功耗超1000W 微软发布芯片级液冷散热技术:温度骤降65%

    9月24日,随着ai技术的快速发展,高性能芯片尤其是ai gpu的需求激增,但随之而来的功耗问题也日益严峻。下一代gpu的功耗预计将突破1000w,带来散热与能效方面的巨大挑战。 为应对这一难题,微软推出了一项创新的芯片级液冷解决方案——microfluidics(微流体)技术。该技术通过在硅芯片背…

    2026年9月29日 • 用户投稿
    100
  • 怎么用豆包AI帮我生成Docker配置 用AI快速创建最佳容器化方案的秘诀

    怎么用豆包AI帮我生成Docker配置 用AI快速创建最佳容器化方案的秘诀怎么用豆包AI帮我生成Docker配置 用AI快速创建最佳容器化方案的秘诀怎么用豆包AI帮我生成Docker配置 用AI快速创建最佳容器化方案的秘诀怎么用豆包AI帮我生成Docker配置 用AI快速创建最佳容器化方案的秘诀

    豆包ai能高效生成并优化docker配置,关键在于提问方式和信息完整度。1. 明确应用类型、依赖及部署需求,如服务语言、数据库、端口暴露等;2. 提供现有配置文件让ai检查安全与性能问题;3. 常见优化建议包括使用alpine镜像、多阶段构建、非root运行等;4. 可要求生成不同环境的配置文件(开…

    2026年9月29日 • 用户投稿
    100
  • Java中将当前时间转换为秒数

    Java中将当前时间转换为秒数Java中将当前时间转换为秒数Java中将当前时间转换为秒数Java中将当前时间转换为秒数

    本文介绍了如何在Java中将当前时间转换为自当天开始的秒数,并提供使用java.time.LocalTime类的示例代码。通过LocalTime.now()获取当前时间,并使用toSecondOfDay()方法将其转换为秒数。同时,还介绍了如何处理时区问题以及如何使用更易读的方式定义目标时间。 在J…

    2026年9月29日 • 用户投稿
    100
  • Mac如何设置静态IP地址_Mac网络手动配置静态IP教程

    Mac如何设置静态IP地址_Mac网络手动配置静态IP教程Mac如何设置静态IP地址_Mac网络手动配置静态IP教程Mac如何设置静态IP地址_Mac网络手动配置静态IP教程Mac如何设置静态IP地址_Mac网络手动配置静态IP教程

    首先将Mac的网络配置从DHCP改为手动,依次设置静态IP、子网掩码、路由器地址,并配置DNS服务器,最后通过终端ping命令验证网络连通性和域名解析是否正常。 如果您需要为您的Mac设备分配一个固定不变的网络地址以便于远程访问或服务器托管,那么您可能需要将网络配置从自动获取改为手动指定。以下是完成…

    2026年9月29日 • 用户投稿
    100
  • Safari浏览器怎么关闭标签页预览_Safari浏览器标签页缩略图预览关闭方法

    Safari浏览器怎么关闭标签页预览_Safari浏览器标签页缩略图预览关闭方法Safari浏览器怎么关闭标签页预览_Safari浏览器标签页缩略图预览关闭方法Safari浏览器怎么关闭标签页预览_Safari浏览器标签页缩略图预览关闭方法Safari浏览器怎么关闭标签页预览_Safari浏览器标签页缩略图预览关闭方法

    可通过Safari偏好设置关闭标签页预览功能,进入设置→标签页→取消勾选“在标签页中显示网站预览”;配合快捷键如Command+Shift+Tab切换标签,或启用系统辅助功能中的减少动态效果,进一步优化浏览体验。 如果您在使用Safari浏览器时发现标签页以缩略图形式预览显示,影响浏览效率或视觉体验…

    2026年9月29日 • 用户投稿
    200
  • windows怎么安装补丁包.msu文件_windows .msu格式补丁包的安装方法

    windows怎么安装补丁包.msu文件_windows .msu格式补丁包的安装方法windows怎么安装补丁包.msu文件_windows .msu格式补丁包的安装方法windows怎么安装补丁包.msu文件_windows .msu格式补丁包的安装方法windows怎么安装补丁包.msu文件_windows .msu格式补丁包的安装方法

    首先通过命令提示符使用wusa命令安装.msu补丁,其次可双击文件图形化安装,最后也可用PowerShell调用wusa.exe完成部署,三种方法均需按提示重启系统应用更新。 如果您下载了Windows系统的补丁包但不确定如何正确安装.msu格式的更新文件,可能是由于系统未正确识别或手动安装流程不熟…

    2026年9月29日 • 用户投稿
    100
  • 如何在Power BI中集成AI Power BI使用AI视觉分析数据

    如何在Power BI中集成AI Power BI使用AI视觉分析数据如何在Power BI中集成AI Power BI使用AI视觉分析数据如何在Power BI中集成AI Power BI使用AI视觉分析数据如何在Power BI中集成AI Power BI使用AI视觉分析数据

    在power bi中集成ai需多步骤实现,而非简单添加模块。1. 使用内置ai视觉分析功能如“分解树”和“关键影响因素”快速识别数据模式;2. 通过azure服务如anomaly detector进行复杂数据分析并可视化结果;3. 在power query中利用ai辅助清洗数据,提升效率;4. 自行…

    2026年9月29日 • 用户投稿
    100
  • 文心一言官方主页直达链接 文心一言语言模型主页官方访问地址

    文心一言官方主页可通过百度智能云平台访问,官网地址为https://yiyan.baidu.com,用户需用百度账号登录或注册后使用,可体验文本生成、图像创作、代码编写等功能,部分高级功能需开通会员或企业权限,注意辨别官网以防假冒。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使…

    2026年9月29日
    100
  • 摄像机怎么连接电视播放_摄像机连接电视播放视频的详细操作步骤

    摄像机怎么连接电视播放_摄像机连接电视播放视频的详细操作步骤摄像机怎么连接电视播放_摄像机连接电视播放视频的详细操作步骤摄像机怎么连接电视播放_摄像机连接电视播放视频的详细操作步骤摄像机怎么连接电视播放_摄像机连接电视播放视频的详细操作步骤

    可通过HDMI线、AV线、存储卡或无线投屏将摄像机连接电视播放。1、HDMI连接:用HDMI线连接摄像机与电视,切换至对应HDMI输入源并开启摄像机回放。2、AV线连接:使用三色AV线对接视频音频接口,电视切换至AV模式后播放。3、存储卡播放:将SD卡插入电视卡槽或通过读卡器U盘连接USB口直接播放…

    2026年9月29日 • 用户投稿
    200
  • Mac上怎么用Homebrew装Sublime_Homebrew安装Sublime教程

    Mac上怎么用Homebrew装Sublime_Homebrew安装Sublime教程Mac上怎么用Homebrew装Sublime_Homebrew安装Sublime教程Mac上怎么用Homebrew装Sublime_Homebrew安装Sublime教程Mac上怎么用Homebrew装Sublime_Homebrew安装Sublime教程

    首先确认Mac上已安装Homebrew,若未安装需通过官方脚本进行安装;随后使用brew install –cask sublime-text命令安装Sublime Text;最后创建软链接ln -s /Applications/Sublime Text.app/Contents/Sha…

    2026年9月29日 • 用户投稿
    100
  • 使用 Java 比较版本号:一种更健壮的方法

    使用 Java 比较版本号:一种更健壮的方法使用 Java 比较版本号:一种更健壮的方法使用 Java 比较版本号:一种更健壮的方法使用 Java 比较版本号:一种更健壮的方法

    本文介绍了一种在 Java 中比较版本号的有效方法,避免了使用正则表达式进行复杂匹配的局限性。通过将版本号解析为整数数组并实现 Comparable 接口,我们可以轻松地比较版本号的大小,从而实现版本控制和依赖管理等功能。这种方法更易于理解、维护和扩展,且能更准确地处理各种版本号格式。 在软件开发中…

    2026年9月29日 • 用户投稿
    200
  • 怎么用豆包AI帮我修复安全漏洞代码 用豆包AI自动修复代码漏洞的实战方法

    怎么用豆包AI帮我修复安全漏洞代码 用豆包AI自动修复代码漏洞的实战方法怎么用豆包AI帮我修复安全漏洞代码 用豆包AI自动修复代码漏洞的实战方法怎么用豆包AI帮我修复安全漏洞代码 用豆包AI自动修复代码漏洞的实战方法怎么用豆包AI帮我修复安全漏洞代码 用豆包AI自动修复代码漏洞的实战方法

    豆包ai能有效辅助代码安全漏洞修复,尤其对sql注入、xss攻击等常见问题。一、可先将可疑代码发给豆包ai分析漏洞,如指出php中未过滤的get参数并建议使用预处理语句;二、再根据漏洞类型请求修复建议和示例代码,如防止xss时推荐htmlspecialchars函数;三、也可批量提交多个文件让ai初…

    2026年9月29日 • 用户投稿
    100
  • Java字符串中特定单词的忽略大小写转换教程

    本教程将指导您如何在Java中高效地将字符串中特定单词的所有大小写变体转换为小写。通过利用正则表达式的忽略大小写匹配功能,您可以避免为每种变体编写单独的替换条件,从而实现代码的简洁性和高效性。 解决字符串中特定单词的大小写转换难题 在编程实践中,我们经常会遇到需要对字符串中的特定单词进行大小写转换的…

    2026年9月29日
    1100
  • 怎么让豆包AI帮我写Python上下文管理器 用AI自动生成with语句示例

    怎么让豆包AI帮我写Python上下文管理器 用AI自动生成with语句示例怎么让豆包AI帮我写Python上下文管理器 用AI自动生成with语句示例怎么让豆包AI帮我写Python上下文管理器 用AI自动生成with语句示例怎么让豆包AI帮我写Python上下文管理器 用AI自动生成with语句示例

    要让豆包ai帮你写python的上下文管理器,需先明确使用场景。1. 告诉ai你是操作文件、数据库连接还是其他资源;2. 可要求用类或contextmanager实现;3. 若有异常处理等特殊需求可进一步提问。例如描述“用with管理网络连接并自动收发消息”或“用contextmanager切换目录…

    2026年9月29日 • 用户投稿
    300

发表回复

登录后才能评论
关注微信