使用Pandas创建依赖于条件和相邻行值的列

使用pandas创建依赖于条件和相邻行值的列

本文详细介绍了如何在Pandas DataFrame中创建一列,其单元格值不仅取决于自身行的条件,还可能依赖于后续或之前的特定标记行。我们将利用Series.where进行条件性赋值,并结合Series.bfill或Series.ffill来高效地填充缺失值,从而解决复杂的数据依赖问题。

1. 问题背景与挑战

在数据处理中,我们经常需要根据特定条件创建新的数据列。一个常见的场景是,如果某一列的值满足某个条件,新列就取自当前行的另一列值;否则,新列的值需要从其上方(或下方)最近的满足条件的行中获取。这种“依赖于相邻行”的逻辑,尤其是在存在连续多行不满足条件时,如果采用传统的循环或简单的移位操作,往往效率低下且难以正确处理。

例如,考虑以下DataFrame:

import pandas as pddata = {    'Colonne 1': ['MTN_LI2', 'MTN_IRU', 'MTN_ACE', 'MTN_IME', 'RIPP7', 'CA_SOT', 'CA_OTI', 'CNW00', 'BSNTF', 'RIPNJ'],    'Dimension 1': ['Indicator', 'Indicator', 'Indicator', 'Indicator', 'Organisation', 'Indicator', 'Indicator', 'Organisation', 'Organisation', 'Organisation']}df = pd.DataFrame(data)print(df)

原始DataFrame df 如下所示:

  Colonne 1   Dimension 10  MTN_LI2      Indicator1  MTN_IRU      Indicator2  MTN_ACE      Indicator3  MTN_IME      Indicator4     RIPP7  Organisation5    CA_SOT     Indicator6    CA_OTI     Indicator7     CNW00  Organisation8     BSNTF  Organisation9     RIPNJ  Organisation

我们的目标是创建一列 new,其逻辑如下:

如果 Dimension 1 的值为 ‘Organisation’,则 new 列取当前行 Colonne 1 的值。如果 Dimension 1 的值不是 ‘Organisation’,则 new 列取其下方最近的、Dimension 1 为 ‘Organisation’ 的行的 Colonne 1 值。如果下方没有,则保持为空。

2. 核心解决方案:Series.where 与 Series.bfill/ffill

Pandas提供了Series.where()方法,它允许我们根据布尔条件选择性地保留或替换Series中的值。结合bfill()(backward fill,向后填充)或ffill()(forward fill,向前填充)方法,可以优雅地解决上述问题。

2.1 Series.where() 的应用

首先,我们使用 Series.where() 来实现条件赋值。where(cond, other=NaN) 的作用是:当 cond 为 True 时,保留原Series的值;当 cond 为 False 时,替换为 other(默认为 NaN)。

对于我们的问题,条件是 df[‘Dimension 1’].eq(‘Organisation’)。我们希望当条件为真时,取 df[‘Colonne 1’] 的值。

# 步骤1: 应用 Series.where()temp_series = df['Colonne 1'].where(df['Dimension 1'].eq('Organisation'))print(temp_series)

执行上述代码后,temp_series 将会是:

0        NaN1        NaN2        NaN3        NaN4      RIPP75        NaN6        NaN7      CNW008      BSNTF9      RIPNJName: Colonne 1, dtype: object

可以看到,所有 Dimension 1 不是 ‘Organisation’ 的行都被替换成了 NaN。

2.2 Series.bfill() 或 Series.ffill() 填充 NaN

现在,temp_series 中包含了我们需要的“标记”值(即’Organisation’对应的Colonne 1值)以及大量的 NaN。我们需要根据这些标记值来填充 NaN。

Series.bfill() (Backward Fill): 向后填充,使用下一个有效观测值填充 NaN。这正好符合我们的需求:“取其下方最近的、Dimension 1 为 ‘Organisation’ 的行的 Colonne 1 值”。Series.ffill() (Forward Fill): 向前填充,使用上一个有效观测值填充 NaN。这适用于“取其上方最近的”场景。

使用 bfill() 实现需求:

df['new'] = df['Colonne 1'].where(df['Dimension 1'].eq('Organisation')).bfill()print(df)

输出结果:

  Colonne 1   Dimension 1    new0  MTN_LI2      Indicator  RIPP71  MTN_IRU      Indicator  RIPP72  MTN_ACE      Indicator  RIPP73  MTN_IME      Indicator  RIPP74     RIPP7  Organisation  RIPP75    CA_SOT     Indicator  CNW006    CA_OTI     Indicator  CNW007     CNW00  Organisation  CNW008     BSNTF  Organisation  BSNTF9     RIPNJ  Organisation  RIPNJ

可以看到,RIPP7 成功地填充了其上方的 NaN,CNW00 填充了其上方的 NaN。这完美地解决了问题。

使用 ffill() 的替代方案(了解其不同行为):

如果你的需求是“如果 Dimension 1 的值不是 ‘Organisation’,则 new 列取其上方最近的、Dimension 1 为 ‘Organisation’ 的行的 Colonne 1 值”,那么应该使用 ffill():

df_ffill = df.copy() # 创建副本以展示不同结果df_ffill['new_ffill'] = df_ffill['Colonne 1'].where(df_ffill['Dimension 1'].eq('Organisation')).ffill()print(df_ffill)

输出结果:

  Colonne 1   Dimension 1 new_ffill0  MTN_LI2      Indicator       NaN1  MTN_IRU      Indicator       NaN2  MTN_ACE      Indicator       NaN3  MTN_IME      Indicator       NaN4     RIPP7  Organisation     RIPP75    CA_SOT     Indicator     RIPP76    CA_OTI     Indicator     RIPP77     CNW00  Organisation     CNW008     BSNTF  Organisation     BSNTF9     RIPNJ  Organisation     RIPNJ

注意,使用 ffill() 时,前四行(索引0-3)因为在它们上方没有 ‘Organisation’ 值,所以仍然是 NaN。这突出了 bfill() 和 ffill() 在填充方向上的根本区别

3. 注意事项与总结

性能优势: Series.where() 和 Series.bfill() / Series.ffill() 都是高度优化的Pandas操作,它们在C语言层面实现,因此对于大型DataFrame而言,比Python循环或自定义函数要快得多。初始 NaN 处理:当使用 bfill() 时,如果DataFrame的起始部分(或任何连续的 NaN 块)在它们下方找不到任何非 NaN 值来填充,这些 NaN 将会保留。当使用 ffill() 时,如果DataFrame的起始部分在它们上方找不到任何非 NaN 值来填充,这些 NaN 将会保留。在我们的 ffill() 示例中,前四行就是这种情况。灵活性: 这种 where().fill_method() 的模式非常灵活,可以应用于各种复杂的条件填充场景。你可以根据实际需求调整 where() 的条件以及选择 bfill() 或 ffill()。链式操作: Pandas的许多方法都支持链式操作,使得代码简洁易读。

通过结合 Series.where() 和 Series.bfill() 或 Series.ffill(),我们能够高效且优雅地解决Pandas中涉及条件性赋值和跨行依赖的复杂数据转换问题。这种方法是处理此类场景的推荐实践。

以上就是使用Pandas创建依赖于条件和相邻行值的列的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1367056.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
Pandas DataFrame中基于字符串包含与排除的多条件筛选
上一篇 2025年12月14日 07:05:31
Pandas条件性列生成:利用where与填充方法处理行间依赖
下一篇 2025年12月14日 07:05:45

相关推荐

  • 抖音粉丝LV0到LV6等级要卖多少钱,2025年抖音粉丝最新价格参考

    抖音达人带货等级从lv0到lv6级,都需要卖多少钱?很多新手朋友都不清楚带货等级是如何划分的额,也不清楚每个等级都需要多少交易额,相匹配的抖音粉丝数量是多少,接下来小编会带领大家详细了解下抖音粉丝带货等级的区别和2025年抖音最新的价格参考明细: 一,抖音粉丝等级划分标注和对应粉丝数量: 1,LV0…

    2026年9月24日
    000
  • VSCode如何通过Dev Containers开发 VSCode开发容器环境的搭建与使用

    vscode通过dev containers提供容器化开发环境,解决了“在我的机器上能运行”的问题。1. 安装docker并配置vscode访问;2. 安装remote – containers扩展;3. 创建.devcontainer文件夹和devcontainer.json文件;4.…

    2026年9月24日
    100
  • VSCode如何集成Cassandra数据库工具 VSCode NoSQL数据库管理插件指南

    解决vscode连接cassandra认证问题的方法是确认cassandra集群是否启用认证,若启用则检查连接配置中的用户名、密码是否正确,并确保authenticator和authorizer配置匹配,如使用passwordauthenticator需提供正确凭据,若使用kerberos等其他认证…

    2026年9月24日
    500
  • VSCode如何设置智能代码折叠策略 VSCode基于语义的自动折叠配置技巧

    vscode通过配置editor.foldingstrategy可实现智能代码折叠,1. 将editor.foldingstrategy设为indentation可基于缩进折叠,适用于缩进规范但语法不严格的文件;2. 使用#region和#endregion标记自定义折叠区域,适用于c#等支持该语法…

    2026年9月24日
    600
  • 时区错误怎样校准?时间同步完整解决方法

    时区错误怎样校准?时间同步完整解决方法时区错误怎样校准?时间同步完整解决方法时区错误怎样校准?时间同步完整解决方法时区错误怎样校准?时间同步完整解决方法

    时区错误和时间同步问题通常由系统时区设置错误、硬件时钟漂移或ntp服务异常导致。1.确保系统时间通过ntp服务准确同步,linux可使用timedatectl检查ntp状态并启用systemd-timesyncd或chronyd,windows则开启自动时间同步;2.正确设置本地时区,linux使用…

    2026年9月24日 用户投稿
    200
  • VS Code微服务开发:Docker与Kubernetes集成

    VS Code通过Docker扩展实现本地容器化开发,支持自动生成Dockerfile、一键构建镜像及devcontainer环境一致性;2. Kubernetes扩展可连接集群并管理资源,结合Bridge to Kubernetes实现本地调试与集群网络集成;3. 使用Skaffold自动化构建部…

    2026年9月24日
    100
  • Intel OpenCAS缓存加速方案

    open cas 架构概览:数据从hdd盘读取后被复制到open cas的缓存中,后续的读取操作从内存中进行,从而提高读写效率。在write-through模式下,所有数据同步刷新到open cas的ssd和后端的hdd中。在write-back模式下,数据同步写入到open cas的ssd中,然后…

    2026年9月24日
    500
  • VSCode如何实现AI代码反混淆 VSCode智能分析混淆代码的技巧

    vscode没有一键ai反混淆功能,但可通过智能扩展、调试器、ast查看器、代码格式化工具及外部ai工具集成来辅助分析和逐步还原混淆代码;2. 利用eslint、prettier等扩展提升代码可读性,通过“重命名符号”“转到定义”“查找引用”等功能追踪变量和函数流向,结合多光标编辑和代码片段进行手动…

    2026年9月24日
    200
  • 小红书推广选择阅读量还是粉丝量?小红书怎么推广引流

    小红书作为融合内容、社交与电商的综合性平台,近年来吸引了大量创作者和品牌入驻。在进行推广时,很多人常常纠结:是更重视阅读量,还是更关注粉丝量?本文将从两者的定义出发,分析各自的优劣势,并提供实用建议,帮助你制定适合自己的推广策略。 一、阅读量与粉丝量的本质区别 1. 阅读量 阅读量代表的是某篇笔记或…

    2026年9月24日
    100
  • 苹果15换屏幕费用是多少

    官方维修费用:品质与保障的代价 苹果官方售后以其高标准的服务和原装零部件著称。针对iPhone 15的屏幕更换,官方定价普遍处于1000元至2000元区间,具体费用会因机型差异(如标准版与Pro版)以及所在城市而有所不同。这一价格不仅体现了苹果品牌的技术投入与服务保障,也确保了维修后的设备性能与出厂…

    2026年9月24日
    400
  • VSCode 怎样配置终端默认路径 VSCode 终端默认路径的配置技巧​

    在 vscode 中配置终端默认启动路径需修改 terminal.integrated.cwd 设置项;2. 可通过用户设置(全局生效)或工作区设置(项目专属)进行配置,优先级为工作区设置覆盖用户设置;3. 路径可使用绝对路径或相对路径(推荐相对路径以提升协作性),windows 系统需注意反斜杠转…

    2026年9月24日
    100
  • 《Python完全自学教程》免费在线连载1.5

    《Python完全自学教程》免费在线连载1.5《Python完全自学教程》免费在线连载1.5《Python完全自学教程》免费在线连载1.5《Python完全自学教程》免费在线连载1.5

    说明: 本节内容,是针对非计算机专业的读者提供的补充知识。 1.5 操作系统 本节不是全面介绍操作系统知识,是提醒读者从开发者的角度认识自己的操作系统——根据多年的经验,至少要能熟练使用一些命令完成常见操作。 首先要声明硬件设备,本书所演示的代码都是基于个人计算机( Personal Compute…

    2026年9月24日 用户投稿
    800
  • 探索VSCode Jupyter Notebook集成与扩展

    VSCode集成Jupyter Notebook提升开发效率,安装Jupyter扩展后可直接运行.ipynb文件,支持内核选择、Shift+Enter执行单元格、图表渲染及变量状态保留;结合Python扩展、Pylance、GitLens等工具,实现调试、智能提示、版本控制与代码转换,适合数据分析与…

    2026年9月24日
    100
  • Linux用户adduser与useradd命令区别

    adduser是交互式脚本,默认创建家目录并设密码,适用于Debian/Ubuntu;2. useradd是底层命令,需手动加参数创建家目录和Shell,通用性强,适合脚本使用。 在Linux系统中,adduser 和 useradd 都可以用来创建新用户,但它们在实现方式、使用习惯和功能上存在明显…

    2026年9月24日
    100
  • 如何在PHP的require语句中传递参数并有效管理变量作用域

    本文探讨了在php中使用`require`或`include`语句时如何向被引入文件传递参数。文章详细阐述了通过直接变量作用域共享、利用`$_get`超全局变量(不推荐)以及将引入文件内容封装为函数或类(推荐最佳实践)这三种方法,并提供了相应的代码示例,旨在帮助开发者理解和选择最适合其场景的参数传递…

    2026年9月24日
    100
  • VSCode如何实现代码自动修复 VSCode智能重构与错误修正技巧

    VSCode如何实现代码自动修复 VSCode智能重构与错误修正技巧VSCode如何实现代码自动修复 VSCode智能重构与错误修正技巧VSCode如何实现代码自动修复 VSCode智能重构与错误修正技巧VSCode如何实现代码自动修复 VSCode智能重构与错误修正技巧

    vscode通过集成语言服务协议(lsp)、内置quick fixes和refactoring actions,并结合扩展如eslint、prettier等,实现代码自动修复与智能重构;2. 启用editor.formatonsave和editor.codeactionsonsave设置可在保存时自…

    2026年9月24日 用户投稿
    100
  • VSCode如何设置智能代码重构建议 VSCode自动化重构工具的配置优化

    vscode的智能代码重构建议不出现时,首先检查文件类型是否受支持、对应语言扩展是否安装启用、项目根目录是否有jsconfig.json或tsconfig.json等配置文件;2. 确保editor.lightbulb.enabled为true以显示灯泡提示;3. 通过设置editor.codeac…

    2026年9月24日
    700
  • PCIe 4.0和PCIe 5.0的固态硬盘,实际使用差别大吗?

    PCIe 5.0 SSD相比4.0在游戏加载中提升有限,仅快1-2秒且感知不强;但在视频剪辑、AI训练等生产力场景下,顺序读写速度提升近一倍,渲染和文件传输效率显著提高。 PCIe 4.0和5.0固态硬盘在实际使用中的差别,主要看你怎么用。对大多数普通用户来说,差距没想象中大;但如果你干的是专业活儿…

    2026年9月24日
    200
  • Laravel Blade中条件隐藏元素的优雅实践

    本文探讨了在Laravel Blade模板中如何高效地实现HTML元素的条件隐藏。针对传统@if-@else语句导致代码冗余的问题,教程提出使用Blade的内联三元运算符在style属性中动态控制display: none,从而避免重复代码,提升模板的可读性和维护性。此外,还将介绍如何利用CSS类和…

    2026年9月24日
    200
  • 如何在mysql中使用数值函数计算

    答案:MySQL数值函数用于执行数学运算,如ABS、ROUND、FLOOR、CEIL、MOD、POWER、SQRT等,可对数据直接计算。例如用ROUND四舍五入价格,TRUNCATE截断小数,FLOOR取整,MOD求余判断奇偶,SQRT开方,还可结合AVG、MAX等聚合函数使用,提升查询效率并减少应…

    2026年9月23日
    200

发表回复

登录后才能评论
关注微信