Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
在Pandas中高效计算分组堆叠数据框中的变量比率_创想鸟

在Pandas中高效计算分组堆叠数据框中的变量比率

在Pandas中高效计算分组堆叠数据框中的变量比率

本教程详细介绍了如何在pandas数据框中,针对特定分组(如g1和g2)内的变量(如tpe列中的’ts’与’td’)计算比率,并将结果作为新行添加回原数据框。文章通过一个实际案例,展示了如何利用`set_index`、`unstack`和向量化操作,以高效且优雅的方式处理数据重塑、比率计算以及缺失值(nan)的填充,避免了传统`groupby().apply()`方法可能存在的性能瓶颈和复杂性。

数据框中分组比率计算的挑战与解决方案

在数据分析中,我们经常需要根据数据框中的某些列进行分组,然后计算组内特定变量之间的比率。例如,在一个包含交易类型(TPE)和数量(QC)的数据框中,我们可能需要计算每组(G1, G2)中’ts’类型数量与’td’类型数量的比率(ts/td)。此外,还需要将计算出的比率作为新行添加到原始数据框中,并且要妥善处理那些不包含完整’ts’和’td’值的组。

初始数据结构

假设我们有以下Pandas DataFrame df_in:

import pandas as pdimport numpy as npdata = {    'G1': ['A', 'A', 'A', 'A', 'B', 'B', 'B', 'B', 'C', 'D'],    'G2': ['S1', 'S1', 'S2', 'S2', 'S1', 'S1', 'S2', 'S2', 'S1', 'S2'],    'TPE': ['td', 'ts', 'td', 'ts', 'td', 'ts', 'td', 'ts', 'td', 'ts'],    'QC': [2, 4, 6, 3, 20, 40, 60, 30, 90, 7]}df_in = pd.DataFrame(data)# 模拟原始数据中可能存在的缺失类型df_in.loc[8, 'TPE'] = 'td' # C S1 只有 tddf_in.loc[9, 'TPE'] = 'ts' # D S2 只有 tsdf_in = df_in.drop(index=[8,9]).append(pd.DataFrame([['C', 'S1', 'td', 90], ['D', 'S2', 'ts', 7]], columns=df_in.columns), ignore_index=True)print("原始数据框 df_in:")print(df_in)

输出 df_in 如下:

  G1  G2 TPE  QC0  A  S1  td   21  A  S1  ts   42  A  S2  td   63  A  S2  ts   34  B  S1  td  205  B  S1  ts  406  B  S2  td  607  B  S2  ts  308  C  S1  td  909  D  S2  ts   7

目标输出

我们的目标是生成一个包含原始数据和计算出的比率的新数据框 df_out。对于每个 (G1, G2) 组,如果同时存在 ‘td’ 和 ‘ts’ 类型的 QC 值,则计算 ts_QC / td_QC 作为比率,并将新行的 TPE 列标记为 ‘ratio’。如果缺少 ‘td’ 或 ‘ts’,则比率应为空(NaN)。

期望的 df_out 结构如下:

   G1  G2    TPE   QC0   A  S1     td  2.01   A  S1     ts  4.02   A  S2     td  6.03   A  S2     ts  3.04   B  S1     td 20.05   B  S1     ts 40.06   B  S2     td 60.07   B  S2     ts 30.08   C  S1     td 90.09   D  S2     ts  7.010  A  S1  ratio  2.011  A  S2  ratio  0.512  B  S1  ratio  2.013  B  S2  ratio  0.514  C  S1  ratio  NaN15  D  S2  ratio  NaN

传统 groupby().apply() 方法的局限性

一种常见的思路是使用 groupby().apply() 方法,为每个组编写一个自定义函数来计算比率。

def calculate_ratio_apply(group):    td_row = group[group['TPE'] == 'td']    ts_row = group[group['TPE'] == 'ts']    if not td_row.empty and not ts_row.empty:        ratio = ts_row['QC'].values[0] / td_row['QC'].values[0]        return pd.DataFrame({'G1': [group['G1'].iloc[0]],                              'G2': [group['G2'].iloc[0]],                              'TPE': ['ratio'],                              'QC': [ratio]})    # 如果缺少td或ts,返回一个空的DataFrame,这会导致这些组的比率行被省略    return pd.DataFrame() # 这种方法会忽略没有完整td和ts值的组# grouped = df_in.groupby(['G1', 'G2']).apply(calculate_ratio_apply).reset_index(drop=True)# df_out_apply = pd.concat([df_in, grouped], ignore_index=True)# print("n使用 apply 方法(可能遗漏空比率):")# print(df_out_apply)

上述 apply 方法虽然能计算比率,但如果某个组没有同时包含 ‘td’ 和 ‘ts’ 值,它会返回一个空的DataFrame,导致这些组的比率行被完全省略,而不是填充 NaN。对于大型数据集,apply 方法也可能因为循环迭代而导致性能问题。

算家云 算家云

高效、便捷的人工智能算力服务平台

算家云 37 查看详情 算家云

优化方案:利用 unstack 和向量化操作

更高效和优雅的解决方案是利用 Pandas 的数据重塑功能,将 ‘TPE’ 列中的 ‘td’ 和 ‘ts’ 值转化为独立的列,然后进行向量化计算。

# 1. 重塑数据:将 'TPE' 列中的 'td' 和 'ts' 值转换为独立的列#    - set_index(['G1', 'G2', 'TPE']): 将这三列设为索引#    - unstack()['QC']: 将 TPE 索引层的数据(QC值)unstack(逆透视)成列#      结果是一个多级索引的 DataFrame,列为 TPE 的不同值(td, ts)tmp = df_in.set_index(['G1', 'G2', 'TPE']).unstack()['QC']print("n中间结果 tmp (重塑后的数据):")print(tmp)

中间结果 tmp 的结构如下,我们可以清晰地看到每个 (G1, G2) 组对应的 ‘td’ 和 ‘ts’ 值,以及缺失值(NaN):

TPE     td    tsG1 G2           A  S1    2.0   4.0   S2    6.0   3.0B  S1   20.0  40.0   S2   60.0  30.0C  S1   90.0   NaND  S2    NaN   7.0
# 2. 计算比率:直接对重塑后的列进行向量化除法#    - tmp['ts'].div(tmp['td']): 计算 'ts' 列与 'td' 列的比率#    - reset_index(name='QC'): 将多级索引重置为列,并将比率结果命名为 'QC'#    - assign(TPE='ratio'): 添加一个新列 'TPE',其值为 'ratio'ratio_df = tmp['ts'].div(tmp['td']).reset_index(name='QC').assign(TPE='ratio')print("n计算出的比率数据框 ratio_df:")print(ratio_df)

计算出的比率数据框 ratio_df 如下:

  G1  G2   QC    TPE0  A  S1  2.0  ratio1  A  S2  0.5  ratio2  B  S1  2.0  ratio3  B  S2  0.5  ratio4  C  S1  NaN  ratio5  D  S2  NaN  ratio
# 3. 合并数据:将原始数据框和计算出的比率数据框进行纵向合并df_out = pd.concat([df_in, ratio_df], ignore_index=True)print("n最终输出数据框 df_out:")print(df_out)

最终的 df_out 完美符合我们的要求:

   G1  G2    TPE   QC0   A  S1     td  2.01   A  S1     ts  4.02   A  S2     td  6.03   A  S2     ts  3.04   B  S1     td 20.05   B  S1     ts 40.06   B  S2     td 60.07   B  S2     ts 30.08   C  S1     td 90.09   D  S2     ts  7.010  A  S1  ratio  2.011  A  S2  ratio  0.512  B  S1  ratio  2.013  B  S2  ratio  0.514  C  S1  ratio  NaN15  D  S2  ratio  NaN

完整代码示例

import pandas as pdimport numpy as np# 原始数据框data = {    'G1': ['A', 'A', 'A', 'A', 'B', 'B', 'B', 'B', 'C', 'D'],    'G2': ['S1', 'S1', 'S2', 'S2', 'S1', 'S1', 'S2', 'S2', 'S1', 'S2'],    'TPE': ['td', 'ts', 'td', 'ts', 'td', 'ts', 'td', 'ts', 'td', 'ts'],    'QC': [2, 4, 6, 3, 20, 40, 60, 30, 90, 7]}df_in = pd.DataFrame(data)# 模拟原始数据中可能存在的缺失类型,确保 C S1 只有 td,D S2 只有 tsdf_in = df_in.drop(index=[8,9]).append(pd.DataFrame([['C', 'S1', 'td', 90], ['D', 'S2', 'ts', 7]], columns=df_in.columns), ignore_index=True)# 1. 重塑数据:将 'TPE' 列中的 'td' 和 'ts' 值转换为独立的列#    通过 set_index 和 unstack,将数据从长格式转换为宽格式,便于计算tmp = df_in.set_index(['G1', 'G2', 'TPE']).unstack()['QC']# 2. 计算比率并格式化结果#    - tmp['ts'].div(tmp['td']): 执行向量化除法,自动处理缺失值(NaN)#    - reset_index(name='QC'): 将多级索引重置为常规列,并将比率结果列命名为 'QC'#    - assign(TPE='ratio'): 添加一个新列 'TPE',其值为 'ratio'ratio_df = tmp['ts'].div(tmp['td']).reset_index(name='QC').assign(TPE='ratio')# 3. 合并数据:将原始数据框和计算出的比率数据框进行纵向合并df_out = pd.concat([df_in, ratio_df], ignore_index=True)print("最终输出数据框 df_out:")print(df_out)

注意事项与总结

效率提升: 相比于 groupby().apply(),使用 set_index().unstack() 结合向量化操作(如 .div())在处理大型数据集时通常更高效,因为它利用了 Pandas 底层的优化 C 语言实现。缺失值处理: unstack() 操作会自动将缺失的数据填充为 NaN。在进行除法运算时,任何包含 NaN 的运算结果仍为 NaN,这自然地满足了对“空比率”的需求。可读性与简洁性: 这种方法代码更简洁,逻辑更清晰,避免了自定义函数中复杂的条件判断。通用性: 这种数据重塑和向量化计算的模式适用于各种需要计算分组内变量之间比率或差值等场景。

通过本教程,您应该能够高效且优雅地在 Pandas 数据框中处理分组比率计算问题,即使面对复杂的数据结构和缺失值情况也能游刃有余。

以上就是在Pandas中高效计算分组堆叠数据框中的变量比率的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/590924.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
Scala多线程环境下的计数器线程安全问题详解
上一篇 2025年11月10日 15:53:08
什么是SQL的JOIN操作?多表连接的实现方式解析
下一篇 2025年11月10日 15:53:13

相关推荐

  • 抖音app如何关注其他用户

    在抖音这个充满创意与乐趣的平台上,关注他人是发掘优质内容、拓展社交圈的重要途径。那么,该如何在抖音app中关注其他用户呢? 首先,打开抖音App。进入首页后,你会看到源源不断的短视频自动播放。在屏幕顶部,搜索栏旁有一个“放大镜”图标,点击即可进入搜索页面。在这里,你可以通过输入用户名、关键词等方式查…

    2026年9月23日
    200
  • 京东自营外卖门店“七鲜小厨”入驻美团

    10 月 13 日消息,据电商派今日报道,京东自营外卖门店“七鲜小厨”已正式登陆美团 app。与此同时,京东全新推出的独立咖啡品牌“七鲜咖啡”也同步上线美团平台。 京东首家“七鲜小厨”自营外卖门店于今年7月20日在北京市东城区开业,采用“外卖 + 自提”的运营模式,不设堂食服务,用户可通过线上渠道下…

    2026年9月23日
    000
  • QQ音乐会员退订后还能听吗_QQ音乐会员退订后听歌的说明

    退订QQ音乐会员后将无法享受高音质、无广告等权益,系统自动切换至免费模式。此时仅可播放标有“免费”或无版权标识的歌曲,VIP歌曲需开通会员才能畅听。已下载的加密格式会员歌曲(如.QMC、.TMF)在会员过期后无法继续播放,需重新开通会员解密。免费用户可通过观看广告解锁每日最多5首歌曲完整播放,每次看…

    2026年9月23日
    300
  • 抖音短视频被系统判定违规怎么办 抖音内容管理与违规申诉方法

    先明确违规原因,再通过APP申诉并提交原创或授权证据,必要时邮件、电话多渠道沟通,确保材料真实完整。 抖音视频被系统判定违规,先别急着申诉,关键是要搞清楚为什么会被判。平台的审核机制有时会出现误判,但也可能是内容确实踩了红线。处理的核心是精准定位问题、准备充分证据、通过正确渠道沟通。下面分几步说明怎…

    2026年9月23日
    300
  • 如何在mysql中优化多表JOIN查询

    答案:优化MySQL多表JOIN需创建关联字段索引、提前过滤数据、选择合适JOIN类型与表序、利用EXPLAIN分析执行计划,并定期更新统计信息以提升查询效率。 在MySQL中优化多表JOIN查询,关键在于减少数据扫描量、提升连接效率,并合理利用索引和执行计划。以下是一些实用的优化策略。 1. 确保…

    2026年9月23日
    300
  • Java Web项目在无Maven/Eclipse环境下生成WAR包的实践指南

    本文详细介绍了如何在没有Maven或Eclipse等集成开发环境或构建工具的情况下,为Java Web项目手动或通过Apache Ant工具生成WAR文件。教程涵盖了WAR文件的基本结构、使用Ant进行编译和打包的具体步骤,并提供了Ant构建脚本示例,旨在帮助开发者理解并实践WAR包的独立构建过程。…

    2026年9月23日
    100
  • 硬核推理游戏《机密谋杀案中案》参加Steam新品节 试玩版上线

    硬核推理游戏《机密谋杀案中案》参加Steam新品节 试玩版上线硬核推理游戏《机密谋杀案中案》参加Steam新品节 试玩版上线硬核推理游戏《机密谋杀案中案》参加Steam新品节 试玩版上线硬核推理游戏《机密谋杀案中案》参加Steam新品节 试玩版上线

    如果你已经顺利解开《奥伯拉丁的回归》或《金偶像迷案》中的重重谜团,那么接下来的挑战将更加扑朔迷离!好莱坞正陷入一场震惊全城的连环谋杀风暴!你将化身为一名敏锐过人的侦探,运用你的观察力与推理能力:勘察犯罪现场,搜集关键证据,抽丝剥茧地还原真相。幕后黑手究竟是谁?他又为何精心策划这一系列隐秘的杀局? 这…

    2026年9月23日 用户投稿
    100
  • safari浏览器与iCloud钥匙串同步失败如何解决_safari浏览器钥匙串同步失败解决方法

    首先检查iCloud钥匙串是否在所有设备上开启且使用同一Apple ID,确认已启用双重认证;接着重启设备并重新开启钥匙串功能以修复临时故障;然后确保网络稳定并查看Apple服务器状态正常;最后通过退出并重新登录Apple ID重建同步授权,恢复密码自动填充与跨设备同步。 如果您在使用Safari浏…

    2026年9月23日
    200
  • 优麒麟 25.10 版本正式发布

    优麒麟 25.10 正式版现已上线,此版本将提供长达9个月的支持周期,基于最新的 linux 6.17 内核打造,在基础库、子系统及核心组件等方面实现了全面升级,显著提升了系统的稳定性与兼容性,同时推出了焕然一新的软件商店。 新增特性 1. 搭载 Linux 6.17 内核 优麒麟 25.10 集成…

    2026年9月23日
    100
  • 快手极速版官方网页版地址_快手极速版App下载官网首页

    快手极速版官方网页版地址在哪里?这是不少网友都关注的,接下来由PHP小编为大家带来快手极速版官方网页版地址及App下载相关信息,感兴趣的网友一起随小编来瞧瞧吧! https://www.kuaishou.com/ 1、小步骤内容。进入官网后可直接浏览平台首页推荐内容,涵盖生活记录、才艺展示等多个领域…

    2026年9月23日
    300
  • 优化 Laravel Nova 长耗时操作的响应消息持久化显示

    本文旨在解决 Laravel Nova 中耗时操作(如数分钟)的响应消息(Toast)短暂显示问题。针对默认 Action::message() 无法提供持久化反馈的局限性,我们将深入探讨如何利用 Laravel Nova 4 的通知功能,实现更持久、可交互且用户友好的操作完成提示,确保用户不会错过…

    2026年9月23日
    200
  • 苹果 iPhone Air 今日正式发售:仅支持 eSIM,起售价 7999 元

    10 月 22 日消息,苹果全新 iphone air 于今日上午 8:00 正式开售,起售价定为 7999 元。值得关注的是,该机型仅支持 esim 功能,用户需持本人有效身份证件前往运营商实体营业厅完成实名核验与服务激活。现阶段仍处于商用试验阶段,暂未开放线上办理通道。 iPhone Air 搭…

    2026年9月23日
    300
  • 优化 Laravel Nova 动作响应消息的持久性与交互性

    本文探讨了 Laravel Nova 动作响应消息(toast 提示)持续时间过短的问题,尤其对于耗时较长的操作,默认提示难以满足用户反馈需求。我们提出并详细介绍了如何利用 Laravel Nova 4 的通知功能,实现持久化且可交互的用户通知,从而有效解决传统 toast 消息的局限性,提升用户体…

    2026年9月23日
    400
  • 如何在mysql中配置用户连接权限

    创建用户并设置密码:使用CREATE USER指定主机和密码,如’localhost’或’%’(存在安全风险);2. 授予权限:通过GRANT赋予ALL、SELECT等操作权限,并用FLUSH PRIVILEGES生效;3. 验证管理:用SHOW GR…

    2026年9月23日
    1000
  • 悟空浏览器提示“喔唷,崩溃了”怎么修复_悟空浏览器页面崩溃问题解决方案

    答案:清理缓存、关闭多余标签页与插件、更新或重装应用、关闭硬件加速可解决悟空浏览器崩溃问题。具体操作包括在设置中清理缓存和数据,通过多窗口管理关闭无用页面,禁用或卸载可疑扩展,前往App Store更新或重新安装应用,以及在高级设置中关闭硬件加速功能以提升稳定性。 如果您在使用悟空浏览器时遇到“喔唷…

    2026年9月23日
    700
  • win11开机PIN码登录选项消失了怎么办_win11PIN码登录选项丢失修复方法

    首先尝试切换登录方式重置PIN,若无效则通过命令提示符启用管理员账户,再检查本地组策略设置并清除NGC文件夹以重建PIN凭据,最终恢复PIN登录功能。 如果您尝试在Windows 11开机时使用PIN码登录,却发现登录选项中缺少PIN码入口,这通常是由系统临时故障、策略设置或账户同步问题导致的。此问…

    2026年9月23日
    000
  • 优化 Laravel Nova 动作响应消息的持久性与用户体验

    本文探讨了在 Laravel Nova 中处理长时任务后,默认动作响应消息(Toast)短暂显示的问题。针对这一挑战,我们将介绍如何利用 Laravel Nova 4 提供的 NovaNotification 功能,实现持久化的、带有交互操作的通知,从而显著提升用户体验,确保重要信息不会因消息瞬时消…

    2026年9月23日
    200
  • 飞利浦559M1RYV对决AOC U34G3XE:带鱼屏与巨幕的沉浸式体验,办公娱乐两不误谁更全能?

    飞利浦559M1RYV适合追求影院级沉浸体验的用户,拥有55英寸大屏、HDMI 2.1接口、Ambiglow灯效和宝华韦健音响,需搭配主机使用且占用空间大;AOC U34G3XE为34英寸21:9带鱼屏,主打多任务办公与高效分屏,兼顾电影原生比例与主流游戏,适合桌面空间有限的生产力用户。选择取决于核…

    2026年9月23日
    600
  • 小说全文免费阅读APP榜单 小说阅读免费APP推荐大全

    直接观看“☞☞☞☞☞点击小说资源在线观看首页直达☜☜☜☜☜”; 直接观看“☞☞☞☞☞点击海内外小说、漫画观看APP合集☜☜☜☜☜”; 还在为找不到好用又免费的小说APP而烦恼吗?市面上免费阅读应用众多,但质量参差不齐。本文为你精选了几款广受好评的免费小说阅读APP,帮助你轻松找到心仪的阅读神器,畅享…

    2026年9月23日
    100
  • 如何使用Java制作简易的博客系统

    首先搭建Spring Boot后端,设计BlogPost实体类并用JPA实现数据持久化,通过BlogController处理页面请求,使用Thymeleaf模板引擎渲染index和create页面,配置H2内存数据库并启用控制台,最终实现文章的发布与展示功能。 用Java制作一个简易的博客系统,核心…

    2026年9月23日
    200

发表回复

登录后才能评论
关注微信