Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
利用Pandas实现行数据转列:从多行报告页数据到单行汇总_创想鸟

利用Pandas实现行数据转列:从多行报告页数据到单行汇总

利用pandas实现行数据转列:从多行报告页数据到单行汇总

本教程详细介绍了如何使用Pandas库将多行、页级的数据结构转换为单行、列级汇总的格式。通过`pivot`函数,结合`add_prefix`、`reset_index`和`rename_axis`等方法,可以高效地将特定标识符下的重复行数据(如报告的每一页)转置为以页码为后缀的新列,从而实现数据维度的转换和聚合,便于后续分析。

在数据处理和分析中,我们经常会遇到需要将“长格式”数据(即同一实体的信息分散在多行中)转换为“宽格式”数据(即同一实体的信息聚合在一行中,通过新列来区分不同属性)的场景。一个典型的例子是,当一份报告的详细信息按页存储在不同的行中时,我们可能希望将这些页级信息转置为以报告为单位的单行数据,其中每页的内容对应一个独立的列。Pandas库提供了强大的工具来高效地完成这种数据重塑任务。

1. 理解问题场景与原始数据结构

假设我们有一份关于公司年度报告的数据,其中包含了公司(FIRM)、年份(YEAR)、报告页码(Report Page)以及每页对应的某个值(Value1)。原始数据中,每份报告的每一页都占据独立的一行,如下所示:

import pandas as pddata = {    'FIRM': ['A', 'A', 'B', 'B'],    'YEAR': [2012, 2012, 2013, 2013],    'Report Page': [1, 2, 1, 2],    'Value1': [10, 15, 20, 25]}df = pd.DataFrame(data)print("原始DataFrame:")print(df)

输出的DataFrame结构为:

原始DataFrame:  FIRM  YEAR  Report Page  Value10    A  2012            1       101    A  2012            2       152    B  2013            1       203    B  2013            2       25

我们的目标是将同一公司、同一年份下的不同页码的Value1值转置为新的列,并以“Value1_PageX”的形式命名,其中X代表页码。期望的输出格式如下:

  FIRM  YEAR  Value1_Page1  Value1_Page20    A  2012            10            151    B  2013            20            25

2. 使用 pandas.pivot 进行数据重塑

Pandas的pivot函数是实现这种数据转置的核心工具。它根据指定的索引、列和值来重塑DataFrame。

pivot函数的主要参数包括:

index: 用于构建新DataFrame索引的列名或列名列表。columns: 用于构建新DataFrame列名的列名。该列的唯一值将成为新的列标题。values: 用于填充新DataFrame中的值的列名或列名列表。

在我们的案例中:

index 应该是 [‘FIRM’, ‘YEAR’],因为我们希望以公司和年份作为唯一标识来汇总数据。columns 应该是 ‘Report Page’,因为我们希望将不同的页码转换为不同的列。values 应该是 ‘Value1’,因为这是我们想要在新的列中显示的值。

# 步骤1: 使用pivot函数进行基础重塑pivoted_df = df.pivot(index=['FIRM', 'YEAR'], columns='Report Page', values='Value1')print("n经过pivot后的DataFrame:")print(pivoted_df)

此时的输出会是:

经过pivot后的DataFrame:Report Page    1   2FIRM YEAR           A    2012     10  15B    2013     20  25

可以看到,FIRM和YEAR已经成为了新的索引,Report Page的唯一值(1和2)成为了新的列名,并且Value1的值填充到了相应的位置。

3. 后续处理:列名美化与索引重置

为了达到最终期望的输出格式,我们还需要进行以下几个步骤:

3.1 添加列名前缀

当前的列名只是页码(1, 2),我们希望它们是“Value1_Page1”、“Value1_Page2”。可以使用add_prefix()方法为所有列名添加前缀。

# 步骤2: 为列名添加前缀df_with_prefix = pivoted_df.add_prefix('Value1_Page')print("n添加前缀后的DataFrame:")print(df_with_prefix)

输出结果:

添加前缀后的DataFrame:             Value1_Page1  Value1_Page2FIRM YEAR                            A    2012            10            15B    2013            20            25

3.2 重置索引

此时,FIRM和YEAR仍然是DataFrame的索引。为了将它们变回普通的列,我们需要使用reset_index()方法。

# 步骤3: 重置索引df_reset_index = df_with_prefix.reset_index()print("n重置索引后的DataFrame:")print(df_reset_index)

输出结果:

重置索引后的DataFrame:Report Page FIRM  YEAR  Value1_Page1  Value1_Page20              A  2012            10            151              B  2013            20            25

注意,此时Report Page作为一个额外的列名级别出现在最上方,这是pivot函数在创建多级列名时的一个副作用。

3.3 清理列索引名称

最后一步是移除这个多余的列索引名称Report Page。可以使用rename_axis(None, axis=1)来实现。

# 步骤4: 清理列索引名称final_df = df_reset_index.rename_axis(None, axis=1)print("n最终结果DataFrame:")print(final_df)

最终输出结果:

最终结果DataFrame:  FIRM  YEAR  Value1_Page1  Value1_Page20    A  2012            10            151    B  2013            20            25

这正是我们期望的输出。

4. 完整代码示例

将上述步骤整合到一起,完整的解决方案如下:

import pandas as pddata = {    'FIRM': ['A', 'A', 'B', 'B', 'A'],    'YEAR': [2012, 2012, 2013, 2013, 2014],    'Report Page': [1, 2, 1, 2, 1],    'Value1': [10, 15, 20, 25, 30]}df = pd.DataFrame(data)print("原始DataFrame:")print(df)# 使用pivot进行数据重塑,并链式调用后续操作final_df = df.pivot(index=['FIRM', 'YEAR'],                     columns='Report Page',                     values='Value1')              .add_prefix('Value1_Page')              .reset_index()              .rename_axis(None, axis=1)print("n最终转换后的DataFrame:")print(final_df)

输出:

原始DataFrame:  FIRM  YEAR  Report Page  Value10    A  2012            1       101    A  2012            2       152    B  2013            1       203    B  2013            2       254    A  2014            1       30最终转换后的DataFrame:  FIRM  YEAR  Value1_Page1  Value1_Page20    A  2012          10.0          15.01    A  2014          30.0           NaN2    B  2013          20.0          25.0

5. 注意事项与扩展

报告页数不一致的情况: 原始问题中提到“报告不总是有相同数量的页面”。pivot函数自然地处理了这种情况。如果某个报告没有特定的页码(例如,公司A在2014年只有第1页,没有第2页),那么对应的Value1_PageX列将填充 NaN(Not a Number),这在数据分析中是常见的缺失值表示。pivot 与 pivot_table 的区别:pivot 要求 index 和 columns 参数的组合必须是唯一的,否则会报错。它本质上是一个重塑操作。pivot_table 更通用,可以处理非唯一组合,因为它在内部可以进行聚合操作(通过 aggfunc 参数,默认为 mean)。如果你的数据中可能存在多个值对应同一个 (index, columns) 组合的情况,或者需要对值进行聚合(如求和、计数等),那么 pivot_table 是更合适的选择。在当前案例中,每个 (FIRM, YEAR, Report Page) 组合只有一个 Value1,所以 pivot 是完全适用的。多值列转置: 如果除了Value1,还有Value2等多个值需要转置,可以将values参数传入一个列表,例如 values=[‘Value1’, ‘Value2’]。此时,pivot会生成多级列名,例如 (Value1, Page1)、(Value2, Page1)等。后续的add_prefix和rename_axis可能需要根据具体需求进行调整。

总结

通过本教程,我们学习了如何利用Pandas的pivot函数及其辅助方法(add_prefix、reset_index、rename_axis)将分散在多行中的页级数据高效地转置为列级数据。这种数据重塑技术在处理报告、日志或其他分层数据时非常有用,能够将数据转换为更易于分析和理解的宽格式。理解pivot的工作原理以及如何处理其输出,是Pandas数据处理能力的关键组成部分。

以上就是利用Pandas实现行数据转列:从多行报告页数据到单行汇总的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1380842.html

赞 (0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
Python教程:高效将列表数据按月份和年份分块存储
上一篇 2025年12月14日 22:26:54
Scrapy 高效内部链接爬取与数据整合指南
下一篇 2025年12月14日 22:27:09

相关推荐

  • 如何设置Linux软件包更新排除 yum exclude和apt-mark hold

    如何设置Linux软件包更新排除 yum exclude和apt-mark hold如何设置Linux软件包更新排除 yum exclude和apt-mark hold如何设置Linux软件包更新排除 yum exclude和apt-mark hold如何设置Linux软件包更新排除 yum exclude和apt-mark hold

    要阻止linux系统中特定软件包更新,可针对不同发行版使用相应方法。对于rhel/centos系系统,可通过在/etc/yum.conf或.repo文件中添加exclude=包名来排除升级;对于debian/ubuntu系系统,则使用sudo apt-mark hold 包名命令锁定版本。这两种方式…

    2026年9月21日 • 用户投稿
    400
  • 美图秀秀图片亮度无法调节怎么办 美图秀秀亮度调整与修复方法

    亮度调不了可能是未进入“美化”或“编辑”模式,需确认已正确导入图片并找到亮度滑块;2. 软件版本过旧或缓存异常会导致功能失效,应更新美图秀秀或重启程序,电脑版可尝试以管理员身份运行;3. 不同设备可能存在兼容性问题,建议切换手机App或电脑客户端测试,手机用户可清除缓存或重装应用;4. 若功能仍不可…

    2026年9月21日
    000
  • 长佩阅读如何自定义封面

    在长佩阅读中,设置自定义封面可以让你的书架更具个人风格。以下是具体操作步骤: 一、确认书籍是否支持自定义封面 并非所有书籍都开放自定义封面功能,你需要先进入书籍详情页查看是否存在“自定义封面”这一选项。若该按钮存在,则说明这本书允许用户更换封面。 二、准备合适的封面图片 选择一张你喜欢的图片作为新封…

    2026年9月21日
    000
  • MAC游戏模式怎么开启和使用_MAC游戏模式开启与使用方法

    首先需明确macOS无官方游戏模式,但可通过系统设置或第三方工具优化性能。1、检查“系统设置”中“电池”选项是否支持“高性能模式”并启用;2、下载安装如GameMode for macOS等工具,启动前开启以优化资源分配;3、手动关闭后台进程、通知及屏幕休眠,连接电源确保性能全开,从而提升游戏流畅度…

    2026年9月21日
    000
  • MySQL热点数据缓存策略_MySQL减少磁盘访问提升性能

    MySQL热点数据缓存策略_MySQL减少磁盘访问提升性能MySQL热点数据缓存策略_MySQL减少磁盘访问提升性能MySQL热点数据缓存策略_MySQL减少磁盘访问提升性能MySQL热点数据缓存策略_MySQL减少磁盘访问提升性能

    mysql热点数据缓存的核心在于将频繁访问的数据保留在内存中以减少磁盘i/o,提升查询速度并缓解数据库压力。1. innodb缓冲池是关键机制,需合理配置其大小(通常为服务器内存的70-80%)及实例数以优化性能;2. 应用层缓存如redis/memcached通过前置缓存逻辑减少对mysql的直接…

    2026年9月21日 • 用户投稿
    000
  • UC浏览器下载时中断了怎么续传_UC浏览器下载任务续传方法

    UC浏览器下载中断后可尝试恢复:首先检查下载管理中暂停或失败的任务并继续;若无效,手动开启断点续传功能重新添加链接;仍无法恢复时,可用ADM等第三方工具接管任务;最后清理UCDownloads目录下的临时文件后重新下载。 如果您在使用UC浏览器下载文件时遇到下载中断的情况,可能是由于网络不稳定或应用…

    2026年9月21日
    100
  • VSCode怎么更改解码方式_VSCode文件编码修改教程

    VSCode通过设置文件编码解决乱码问题,可手动选择“以不同编码重新打开”或“使用编码保存”,推荐统一使用UTF-8编码并启用files.autoGuessEncoding自动检测,避免编码错误。 VSCode更改解码方式主要通过设置文件编码来实现,以便正确显示文件内容。通常情况下,VSCode会自…

    2026年9月21日
    800
  • 如何在Krita导出AI生成的8K艺术图片?保存超高清图像方法

    答案是优先选择PNG格式导出8K AI艺术作品,确保画布为8K分辨率,嵌入sRGB色彩配置文件,并优化系统内存与硬盘性能以提升Krita处理效率。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 在Krita中导出AI生成的8K艺术图片,核心…

    2026年9月21日
    100
  • CorelDRAW X6怎样为矢量图形填充纹理图案_CorelDRAW X6图样填充功能使用教程

    使用交互式填充工具可快速为矢量图形添加预设纹理,如石墙、织物等,并通过控制点调整位置、缩放及颜色参数;2. 通过图样填充功能可自定义双色或全彩图案,选择砖墙、木纹等样式并调节比例贴合设计;3. 叠加黑色矩形并设置透明度与混合模式,可增强纹理的层次感和立体效果。 在CorelDRAW X6中为矢量图形…

    2026年9月21日
    000
  • 如何用Animoto制作AI营销视频?快速生成商业AI视频的教程

    如何用Animoto制作AI营销视频?快速生成商业AI视频的教程如何用Animoto制作AI营销视频?快速生成商业AI视频的教程如何用Animoto制作AI营销视频?快速生成商业AI视频的教程如何用Animoto制作AI营销视频?快速生成商业AI视频的教程

    Animoto通过模板与拖放功能,结合AI生成的文案和配音,帮助用户快速制作品牌统一、节奏合理、带明确CTA的高效营销视频,适用于多平台推广。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ Animoto是一个非常适合快速制作AI营销视频的…

    2026年9月21日 • 用户投稿
    000
  • 使用本地HTML文件运行JavaScript脚本失败的原因及解决方案

    本文旨在帮助开发者理解在没有Web服务器的情况下,直接通过浏览器打开本地HTML文件时,JavaScript脚本可能无法正常运行的原因,并提供相应的解决方案。文章将深入探讨浏览器安全策略、相对路径问题以及如何正确引入和执行JavaScript脚本,确保你的HTML、CSS和JavaScript代码能…

    2026年9月21日
    000
  • mac怎么使用磁盘工具_mac磁盘工具使用教程

    使用磁盘工具可解决Mac外接存储问题。1. 打开磁盘工具,选择设备后点击“急救”扫描修复错误;2. 通过“抹掉”功能将设备格式化为APFS或Mac OS扩展以提升兼容性;3. 利用“分区”功能划分硬盘为多个宗卷,便于数据管理;4. 创建空白磁盘映像用于备份,或恢复.dmg文件至U盘制作启动盘。 如果…

    2026年9月21日
    100
  • VSCode怎么看效果_VSCode实时预览和调试代码运行效果教程

    VSCode通过实时预览扩展和内置调试器实现代码效果查看。使用Live Server可实时预览前端页面,保存即刷新;Markdown文件支持侧边预览。调试功能需配置launch.json,支持Node.js、Python、浏览器端JavaScript等,通过断点、变量监视、调用堆栈等深入分析代码执行…

    2026年9月21日
    000
  • 抖音青少年模式时间限制?青少年模式40分钟后多久介绍

    短视频平台在青少年群体中日益受到欢迎。作为国内领先的短视频平台,抖音为了保护青少年的身心健康,推出了青少年模式。本文将围绕青少年模式的时间限制展开探讨,分析其对青少年健康成长的意义,并思考如何打造一个绿色的网络环境。 一、抖音青少年模式时间限制的价值 1. 防止沉迷于短视频 通过设置使用时长限制,抖…

    2026年9月21日
    200
  • MySQL常见错误码代表什么_如何快速定位问题?

    MySQL常见错误码代表什么_如何快速定位问题?MySQL常见错误码代表什么_如何快速定位问题?MySQL常见错误码代表什么_如何快速定位问题?MySQL常见错误码代表什么_如何快速定位问题?

    遇到mysql错误码应先明确错误类型再逐步排查。error 1045表示用户名、密码或访问权限问题,需检查拼写、ip限制和远程访问权限;error 2003表示连接失败,需依次检查服务器状态、mysql服务运行情况、防火墙设置及bind-address配置;error 1054表示sql语句中引用了…

    2026年9月21日 • 用户投稿
    100
  • AI钉钉1.0联动雅里数科 共探“酒旅+AI”的工作新范式

    在数字化浪潮席卷全球的当下,人工智能正以前所未有的速度重塑各行各业,酒旅产业也正在迎来由ai驱动的深刻变革。10月11日,阿里巴巴钉钉再度走进雅里数科集团,开启一场关于“酒旅行业ai原生工作方式”的深度对话。此次交流标志着双方合作迈入全新阶段,致力于共同探索ai原生工作范式,引领酒旅行业迈向智能化发…

    2026年9月21日
    100
  • 如何检测Linux网络接口DMA状态 硬件加速功能验证

    如何检测Linux网络接口DMA状态 硬件加速功能验证如何检测Linux网络接口DMA状态 硬件加速功能验证如何检测Linux网络接口DMA状态 硬件加速功能验证如何检测Linux网络接口DMA状态 硬件加速功能验证

    可通过以下方法检测linux系统中网络接口dma状态和硬件加速是否启用:1.使用 ethtool -i eth0 和 ethtool -k eth0 查看驱动信息及sg、tso、ufo、gso功能是否启用;2.通过 cat /proc/interrupts 和 cat /proc/slabinfo …

    2026年9月21日 • 用户投稿
    800
  • win11系统占用C盘空间过大怎么办_Win11清理C盘空间方法

    首先使用磁盘清理工具删除系统文件,包括旧更新和临时安装文件;接着启用存储感知功能自动定期清理临时文件与回收站;然后手动清除用户临时文件夹(%temp%)中的缓存数据;最后更改新应用和个人文件的默认保存位置至非C盘分区,以释放并节省C盘空间。 如果您发现Windows 11系统文件占用了C盘大量空间,…

    2026年9月21日
    100
  • 如何从被调用类中获取调用者文件的命名空间

    本文探讨了在PHP中,如何在不通过参数传递的情况下,从一个被调用的工具类中获取到调用该方法的文件的命名空间。通过结合使用`debug_backtrace()`回溯调用栈以定位调用者文件,并利用`token_get_all()`解析文件内容来提取命名空间声明,提供了一种实用的解决方案。文章详细介绍了实…

    2026年9月21日
    000
  • 构建Spring自定义Kafka配置的注解式解决方案

    本文探讨了在Spring Boot应用中通过自定义注解实现Kafka配置自动化时遇到的挑战,特别是由于Bean注册时机不当导致的依赖注入失败。我们将深入分析问题根源,并提供两种核心解决方案:利用META-INF/spring.factories实现标准化的自动配置发现,以及通过ImportBeanD…

    2026年9月21日
    1100

发表回复

登录后才能评论
关注微信