Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
使用Python Pandas在分组聚合中计算加权平均值(使用闭包)_创想鸟

使用Python Pandas在分组聚合中计算加权平均值(使用闭包)

使用Python Pandas在分组聚合中计算加权平均值(使用闭包)

本文详细介绍了在pandas `groupby().agg()`操作中,当自定义聚合函数需要访问分组外部的dataframe数据(例如用于加权平均)时,如何解决`nameerror`问题。通过引入python闭包(closure)的概念,文章提供了一种优雅且高效的解决方案,确保聚合函数能够正确地获取并利用外部数据,从而实现复杂的加权计算,并附带了具体的代码示例和实现步骤。

引言:Pandas分组聚合与外部数据访问的挑战

在数据分析中,我们经常需要对数据集进行分组聚合操作,例如计算每组的总和、平均值等。Pandas的groupby().agg()方法为此提供了强大而灵活的工具。然而,当聚合逻辑变得复杂,特别是当自定义聚合函数需要访问当前分组Series之外的原始DataFrame中的其他列(例如,在计算加权平均时,权重列位于原始DataFrame中)时,我们可能会遇到作用域问题,导致NameError。

典型的场景是,我们有一个DataFrame df,包含 id、amount 和 other_col。我们希望按 id 分组,然后计算 other_col 的加权平均值,其中权重由 amount 列提供。如果尝试直接在聚合函数中引用外部DataFrame df1,Python会因为 df1 不在函数的作用域内而抛出 NameError。

问题分析:NameError的根源

考虑以下初始尝试的代码结构:

import pandas as pdimport numpy as npdef weighted_mean(x):    # 这里的df1在函数定义时并不存在于其局部或全局作用域    try:         return np.average(x, weights=df1.loc[x.index, 'amount']) > 0.5    except ZeroDivisionError:        return 0def some_function(df1=None):    df1 = df1.groupby('id').agg(xx=('amount', lambda x: x.sum() > 100),                                yy=('other_col', weighted_mean)).reset_index()    return df1df2 = pd.DataFrame({'id':[1,1,2,2,3], 'amount':[10, 200, 1, 10, 150], 'other_col':[0.1, 0.6, 0.7, 0.2, 0.4]})df2 = some_function(df1=df2)

当 some_function 调用 df1.groupby(‘id’).agg() 时,agg 方法会将每个分组的 other_col 列作为一个Series x 传递给 weighted_mean 函数。在 weighted_mean 内部,我们试图通过 df1.loc[x.index, ‘amount’] 来获取对应的权重。然而,此时 df1 并不是 weighted_mean 函数的参数,也不是其外部(全局)作用域中的变量,因此会引发 NameError: name ‘df1’ is not defined。

立即学习“Python免费学习笔记(深入)”;

聚好用AI 聚好用AI

可免费AI绘图、AI音乐、AI视频创作,聚集全球顶级AI,一站式创意平台

聚好用AI 115 查看详情 聚好用AI

解决方案:利用Python闭包

解决此问题的关键在于利用Python的闭包(closure)特性。闭包允许一个内部函数记住并访问其外部(封闭)函数的作用域中的变量,即使外部函数已经执行完毕。

我们可以将 weighted_mean 函数重构为一个高阶函数(即一个返回另一个函数的函数)。这个外部函数将接收 df1 作为参数,然后返回一个内部函数,该内部函数才是真正用于 agg 操作的函数,并且它会“捕获”外部函数传入的 df1。

闭包实现步骤

创建外部函数 weighted_mean(df): 这个函数将接收完整的DataFrame df 作为参数。定义内部函数 inner_weighted_mean(x): 这个函数将是实际传递给 agg 方法的聚合函数。它接收一个Series x(代表当前分组的列数据)。在内部函数中使用捕获的 df: inner_weighted_mean 可以通过 df.loc[x.index, ‘amount’] 安全地访问外部函数传入的 df。外部函数返回内部函数: weighted_mean(df) 返回 inner_weighted_mean。

示例代码:使用闭包计算加权平均

import pandas as pdimport numpy as npdef weighted_mean_closure(df_full):    """    这是一个高阶函数,用于创建计算加权平均的闭包。    它接收完整的DataFrame (df_full) 并返回一个聚合函数。    """    def inner_weighted_mean(x):        """        这个内部函数是实际用于Pandas agg方法的聚合函数。        它通过闭包访问外部函数的df_full参数。        """        try:             # 使用闭包捕获的df_full来获取权重            weights = df_full.loc[x.index, 'amount']            # 确保权重不是全部为零,避免ZeroDivisionError            if weights.sum() == 0:                return 0            return np.average(x, weights=weights) > 0.5        except ZeroDivisionError:            # 当所有权重都为0时,np.average可能抛出此错误            return 0    return inner_weighted_meandef some_function(df_input=None):    """    主函数,负责执行分组聚合操作。    """    if df_input is None:        raise ValueError("Input DataFrame cannot be None.")    # 在这里创建闭包:将当前的df_input传递给weighted_mean_closure    # 这样,inner_weighted_mean_for_agg 就“记住”了df_input    inner_weighted_mean_for_agg = weighted_mean_closure(df_input)    # 执行分组聚合    df_result = df_input.groupby('id').agg(        xx=('amount', lambda x: x.sum() > 100),        yy=('other_col', inner_weighted_mean_for_agg) # 使用闭包返回的函数    ).reset_index()    return df_result# 示例数据df2 = pd.DataFrame({    'id': [1, 1, 2, 2, 3],     'amount': [10, 200, 1, 10, 150],     'other_col': [0.1, 0.6, 0.7, 0.2, 0.4]})# 调用函数并获取结果df2_result = some_function(df_input=df2)print(df2_result)

代码解析

weighted_mean_closure(df_full): 这个函数接收原始的DataFrame df_full。它的作用是为特定的 df_full 创建一个定制的加权平均函数。inner_weighted_mean(x): 这是嵌套在 weighted_mean_closure 内部的函数。当 weighted_mean_closure 被调用时,inner_weighted_mean 会被定义,并且它能够访问 weighted_mean_closure 的局部变量 df_full。some_function(df_input=None):在 some_function 内部,我们首先调用 weighted_mean_closure(df_input)。这会返回 inner_weighted_mean 函数的一个实例,我们将其赋值给 inner_weighted_mean_for_agg。重要的是,此时 inner_weighted_mean_for_agg 已经“捕获”了 df_input 的值。然后,在 groupby().agg() 调用中,我们将 inner_weighted_mean_for_agg 作为 yy 列的聚合函数。当 agg 调用 inner_weighted_mean_for_agg 时,inner_weighted_mean_for_agg 就能通过其闭包访问到 df_input(也就是 df_full),从而正确地获取权重。np.average(x, weights=weights): 这是NumPy提供的计算加权平均的函数。x 是当前分组的 other_col 值,weights 是从 df_full 中根据 x.index 提取出的对应 amount 值。ZeroDivisionError 处理: 考虑到如果所有权重都为零,np.average 可能会抛出 ZeroDivisionError,我们添加了 try-except 块来优雅地处理这种情况,并返回 0。

预期输出

运行上述代码,将得到以下结果:

   id     xx     yy0   1   True   True1   2  False  False2   3   True  False

注意事项与最佳实践

理解闭包的作用域: 闭包的强大之处在于它让内部函数能够访问其定义时的外部作用域,而不是其执行时的作用域。这对于需要在特定上下文(如本例中的 df_full)中操作的通用函数非常有用。性能考量: 对于非常大的数据集,虽然闭包解决了功能性问题,但自定义Python函数在 groupby().agg() 中的性能可能不如内置的Pandas或NumPy函数。然而,对于复杂逻辑,通常没有更直接的替代方案。代码可读性 尽管闭包是一种高级概念,但正确使用它可以使代码更模块化和可读。将创建聚合函数的逻辑封装起来,使得 agg 调用本身更简洁。错误处理: 在自定义聚合函数中,务必考虑各种边界情况和潜在的错误(如本例中的 ZeroDivisionError),并进行适当的错误处理,以提高代码的健壮性。替代方案:apply(): 如果聚合逻辑变得极其复杂,或者需要访问整个分组的DataFrame而不仅仅是单个Series,groupby().apply() 可能是另一种选择。apply() 会将每个分组的子DataFrame传递给自定义函数,但通常 agg() 配合闭包在性能上优于 apply(),尤其是在聚合操作可以并行化时。

总结

通过利用Python的闭包特性,我们可以优雅地解决Pandas groupby().agg() 中自定义聚合函数无法直接访问外部DataFrame的问题。这种模式使得在复杂的数据处理场景中,例如计算依赖于其他列的加权平均值,变得既可行又高效。理解并掌握闭包是编写更灵活、更强大的Python数据处理代码的关键一步。

以上就是使用Python Pandas在分组聚合中计算加权平均值(使用闭包)的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/569933.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
8旬阿婆被超市门口铁链绊倒摔断肋骨 超市负责人:警示牌被人挪开了
上一篇 2025年11月10日 05:33:13
微信朋友圈小红点一直不消失怎么办_微信朋友圈未读提示解决方法
下一篇 2025年11月10日 05:33:14

相关推荐

  • MySQL如何实现数据的实时备份_有哪些高效工具和方法?

    mysql 实时备份主要依赖主从复制、二进制日志(binlog)配合增量备份,以及借助专业工具实现自动化监控与恢复。一、主从复制通过将主库数据变更同步到从库实现“准实时”备份,但存在延迟风险,建议开启 gtid 模式提升一致性;二、结合 binlog 与定时归档实现可回溯的增量备份,配合全量备份可恢…

    2026年9月21日
    000
  • 百度网盘官方网页登录 百度网盘网页版入口快捷

    百度网盘官方网页登录入口是https://pan.baidu.com,用户可直接访问该网址登录账号,主界面布局清晰,支持文件上传下载、智能检索、跨设备同步及在线预览等功能。 百度网盘官方网页登录入口在哪里?这是不少网友都关注的,接下来由PHP小编为大家带来百度网盘网页版入口快捷方式,感兴趣的网友一起…

    2026年9月21日
    100
  • MAC系统磁盘空间不足怎么办_Mac磁盘空间清理与管理技巧

    Mac存储空间不足时,应先使用系统自带的存储管理工具分析并优化存储,通过“关于本机”进入“管理”界面,启用优化选项;接着手动删除不常用应用及其在Application Support和Caches中的残留文件;再进入资源库清理Caches和Logs中的缓存与日志;随后在“避免杂乱”中查找并删除大型无…

    2026年9月21日
    000
  • DALL-E的AI混合工具如何使用?生成创意图像的详细操作教程

    DALL-E的AI混合工具能将两张图片融合生成新图像,操作简单且支持权重调整与后期编辑,适用于创意激发与艺术探索。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ DALL-E的AI混合工具,简单来说,就是把两张图“缝合”在一起,让AI帮你生…

    2026年9月21日
    000
  • 实现搜索结果的 A-Z 排序:PHP 教程

    本文档旨在指导开发者如何在 PHP 中实现搜索结果的 A-Z 排序功能。通过结合 AJAX 技术和 PHP 函数,可以方便地对通过 POST 方法获取的医生搜索结果进行 A-Z 排序,从而优化用户浏览体验。本文将详细介绍实现步骤,提供可复用的代码示例,并着重强调注意事项,旨在帮助开发者快速掌握并应用…

    2026年9月21日
    000
  • MySQL全文搜索引擎集成方案_提升文本数据搜索能力的实用指南

    MySQL全文搜索引擎集成方案_提升文本数据搜索能力的实用指南MySQL全文搜索引擎集成方案_提升文本数据搜索能力的实用指南MySQL全文搜索引擎集成方案_提升文本数据搜索能力的实用指南MySQL全文搜索引擎集成方案_提升文本数据搜索能力的实用指南

    mysql原生全文搜索功能存在明显局限,需结合外部搜索引擎才能满足复杂需求。1. mysql全文搜索适用于小数据量、简单查询场景,但分词能力弱,尤其对中文支持差,查询功能有限,无法实现模糊查询、纠错等高级功能,且性能随数据量增长显著下降。2. 外部搜索引擎如elasticsearch(es)和sph…

    2026年9月21日 用户投稿
    000
  • Android应用中实现游戏循环与UI更新的正确姿势

    本文旨在解决Android应用开发中,开发者尝试使用传统游戏循环(如while(running))导致应用无响应或崩溃的问题。核心内容是阐明Android事件驱动的UI模型,指导开发者如何正确初始化UI组件、设置事件监听器,并通过事件回调机制实现逻辑更新和UI刷新,避免阻塞主线程,确保应用的流畅运行…

    2026年9月21日
    700
  • bilibili客户端如何开启省流量模式_bilibili客户端省流量功能的设置指南

    首先调整默认视频清晰度至“流畅”或“480P”,再开启省流播放模式以优化数据传输,最后关闭自动缓存与预加载功能,从而有效降低B站移动数据消耗。 如果您在使用移动数据网络观看B站视频时发现流量消耗过快,可能是未开启针对性的省流量设置。通过调整客户端内的相关选项,可以有效降低数据使用量。以下是具体的操作…

    2026年9月21日
    000
  • google浏览器“请停用以开发者模式运行的扩展程序”怎么解决_google浏览器开发者模式扩展提示解决方法

    1、关闭开发者模式并移除手动扩展可消除警告;2、替换为官方商店版本扩展避免风险;3、修改注册表或组策略可永久屏蔽提示;4、使用命令行参数临时绕过检查。 如果您在使用Google Chrome浏览器时,看到“请停用以开发者模式运行的扩展程序”的警告提示,这通常是因为当前有通过非应用商店方式加载的扩展程…

    2026年9月21日
    900
  • 如何用AffinityPhoto导出AI生成图片?专业图像保存的详细指南

    答案:AI生成图片导出时,色彩管理确保跨设备色彩一致,避免印刷偏色。需根据用途选择sRGB(网页)或CMYK(印刷)色彩空间,结合DPI、格式和重采样设置优化输出。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ Affinity Photo…

    2026年9月21日
    600
  • 蝴蝶号无人直播怎么赚钱?从引流到转化全拆解

    蝴蝶号无人直播要赚钱,核心在于内容策划与流量转化结合。1.内容为王,需优质且有吸引力,如风景、美食、宠物或商品展示;2.引流关键在平台规则运用,包括标题、标签、封面及定时开播;3.变现方式多样,如带货、知识付费、广告等,需与内容高度匹配;4.应对挑战需持续更新内容、多账号运营、增强互动感、防范技术与…

    2026年9月21日
    1000
  • AMD RX 9070 XT显卡难得用12V-2×6供电接口:结果连烧两块!

    AMD RX 9070 XT显卡难得用12V-2×6供电接口:结果连烧两块!AMD RX 9070 XT显卡难得用12V-2×6供电接口:结果连烧两块!AMD RX 9070 XT显卡难得用12V-2×6供电接口:结果连烧两块!AMD RX 9070 XT显卡难得用12V-2×6供电接口:结果连烧两块!

    10月14日最新消息,尽管NVIDIA显卡已普遍采用12V-2×6 16针供电接口,但AMD官方至今未将其纳入标准设计。目前仅有华擎、蓝宝石等少数厂商在非公版产品中尝试使用,而华硕也曾在R9700专业卡上应用过该接口。然而近期接连曝出接口烧毁事件,引发广泛关注。 首例问题出现在华擎的RX …

    2026年9月21日 用户投稿
    000
  • MAC的随航(Sidecar)功能怎么使用_MAC Sidecar功能使用教程

    首先确认设备兼容性,确保Mac和iPad满足硬件与系统要求,并登录同一Apple ID。接着开启Wi-Fi和蓝牙,使两设备处于同一网络。通过控制中心“显示器”选项选择iPad名称,无线连接即可建立;或使用数据线进行有线连接以获得更稳定体验。连接后可在“系统设置-显示器-随航”中配置扩展或镜像模式,启…

    2026年9月21日
    000
  • MacBookPro怎么下VSCode_MacBookPro下载安装VSCode详细教程

    访问code.visualstudio.com下载Mac通用版安装包;2. 解压后将Visual Studio Code.app拖入“应用程序”文件夹;3. 首次运行需右键选择“打开”以绕过安全限制;4. 推荐安装Python、Prettier等常用插件并配置环境变量;5. 若字体模糊可调整zoom…

    2026年9月21日
    000
  • MySQL慢查询到底是什么_怎样快速定位并修复它?

    MySQL慢查询到底是什么_怎样快速定位并修复它?MySQL慢查询到底是什么_怎样快速定位并修复它?MySQL慢查询到底是什么_怎样快速定位并修复它?MySQL慢查询到底是什么_怎样快速定位并修复它?

    mysql慢查询可通过开启日志、分析日志和针对性优化快速定位修复。具体步骤:1. 修改配置文件或使用命令开启慢查询日志并设置阈值;2. 利用mysqldumpslow或pt-query-digest工具分析日志内容,找出耗时sql;3. 针对常见原因如缺少索引、sql写法不合理、数据量过大、锁竞争及…

    2026年9月21日 用户投稿
    000
  • HuggingFace的AI混合工具如何使用?开发AI模型的实用操作教程

    HuggingFace的AI混合工具核心在于其生态系统设计,通过Transformers库的统一接口、Pipelines的抽象封装、Datasets与Accelerate等工具,实现多模型组合与微调。它允许开发者将复杂任务拆解,利用预训练模型如BERT、T5等,通过Python逻辑串联不同Pipel…

    2026年9月21日
    1000
  • Java中高效查找时空事件重叠的方法

    本文探讨了在Java中高效查找具有空间和时间范围定义的事件之间重叠的解决方案。核心思想是将时空事件编码为二维矩形,然后利用专业的空间索引结构(如R树、四叉树或PH树)进行快速查询。通过这种方法,可以显著提升在大规模数据集中识别事件重叠的效率,并提供了使用Tinspin索引库的示例代码和实践建议。 时…

    2026年9月21日
    000
  • Evernote如何快速搜索内容 Evernote高级搜索技巧大全

    掌握印象笔记高级搜索技巧可大幅提升效率:首先利用intitle:、tag:、created:等操作符精确查找标题、标签或日期范围内的笔记;其次通过组合多个条件如intitle:项目计划 tag:工作 created:202510实现复合筛选,并用减号排除无关结果;最后启用OCR功能,使图片和扫描PD…

    2026年9月21日
    000
  • 苹果手机怎么卸载app

    一、常规删除方式 最常用的卸载方法非常直观。只需长按想要移除的app图标,图标会进入抖动状态,同时左上角出现一个“×”标志。点击这个“×”,随后在跳出的提示框中选择“删除app”,即可完成卸载。卸载后,该应用将从主屏幕消失,并释放其所占用的存储空间。 二、保留数据的卸载方式 若你只是暂时不使用某个应…

    2026年9月21日
    000
  • PHPComposer怎么安装_PHPComposer依赖管理工具安装与使用指南

    PHPComposer是PHP的依赖管理工具,类似npm或pip。需先安装PHP,再下载并验证composer-setup.php,执行安装生成composer.phar,推荐全局安装至/usr/local/bin/composer,运行composer –version验证。使用com…

    2026年9月21日
    000

发表回复

登录后才能评论
关注微信