Pandas中高效填充特定边界内NaN值的教程

程序猿 • 2025年12月14日 13:54:50 • 用户投稿 • 阅读 0

本教程详细讲解如何在Pandas DataFrame中，精准地填充位于特定“起始”和“结束”字符串之间的NaN值，同时保留其他位置的NaN。我们将通过构建组合布尔掩码的方法，利用ffill()和bfill()函数，实现这一复杂的条件数据填充任务，提供清晰的步骤和代码示例。

1. 问题背景与挑战

在数据处理过程中，我们经常需要对pandas dataframe中的缺失值（nan）进行填充。然而，在某些特定场景下，填充规则并非全局性，而是依赖于数据中存在的特定标记。例如，我们可能需要将所有位于“start”字符串和“finish”字符串之间的nan值替换为另一个特定字符串（如“check”），而对于不在这些边界内的nan，则保持不变。

传统的ffill()（前向填充）或bfill()（后向填充）方法通常无法直接满足这种有条件的需求。ffill()会将前一个有效值向下传播，而bfill()会将后一个有效值向上回溯，这两种方法都可能填充超出我们期望边界的NaN，或者无法准确界定填充范围。

考虑以下原始DataFrame示例：

import pandas as pdimport numpy as npdata = {'start_finish': ['start', np.nan, np.nan, 'finish', np.nan, np.nan,                         'start', np.nan, np.nan, 'start', np.nan, 'finish']}df = pd.DataFrame(data)print("原始DataFrame:")print(df)

输出：

原始DataFrame:   start_finish0         start1           NaN2           NaN3        finish4           NaN5           NaN6         start7           NaN8           NaN9         start10          NaN11       finish

我们期望的结果是：

   start_finish0         start1         check2         check3        finish4           NaN5           NaN6         start7           NaN8           NaN9         start10        check11       finish

可以看到，只有位于“start”和“finish”之间的NaN（索引1、2和10）被填充为“check”，而其他位置的NaN则保持不变。

2. 核心思路：构建组合布尔掩码

解决此类问题的关键在于巧妙地构建两个辅助布尔掩码，分别从前向和后向识别潜在的填充区域，然后通过逻辑与（AND）操作将它们组合起来。这样可以精确地定位到同时满足“在某个‘start’之后”和“在某个‘finish’之前”这两个条件的单元格，从而实现精准的条件填充。

3. 实现步骤与代码示例

我们将分步实现这一逻辑，以确保每一步的意图都清晰明了。

步骤 1：识别非NaN值

首先，创建一个基础布尔掩码，用于标识DataFrame中所有非NaN的单元格。这个掩码在后续步骤中至关重要，它能确保我们的ffill()和bfill()操作仅基于实际存在的字符串值进行传播，而不会将其他NaN视为传播源。

# m 标识所有非NaN的单元格m = df['start_finish'].notna()print("n掩码 m (非NaN值):")print(m)

输出：

掩码 m (非NaN值):0      True1     False2     False3      True4     False5     False6      True7     False8     False9      True10    False11     TrueName: start_finish, dtype: bool

步骤 2：构建前向填充掩码 (m1)

此掩码旨在识别从“start”字符串开始并向下传播的区域。

df[‘start_finish’].eq(‘start’)：创建一个布尔Series，标记所有值为“start”的位置为True。.where(m)：将上述Series中对应于原始NaN的位置设置为NaN。这一步至关重要，它确保了ffill()只传播实际的“start”标记，而不会受到其他NaN的影响，从而避免了不必要的传播。.ffill()：执行前向填充，将“start”标记向下传播，直到遇到下一个非NaN值或Series结束。

# m1 标识从'start'开始向下传播的区域# 只有在原始数据非NaN时才考虑'start'，然后进行前向填充m1 = df['start_finish'].eq('start').where(m).ffill()print("n掩码 m1 (从'start'向下传播):")print(m1)

输出：

掩码 m1 (从'start'向下传播):0      True1      True2      True3     False4     False5     False6      True7      True8      True9      True10     True11    FalseName: start_finish, dtype: object

步骤 3：构建后向填充掩码 (m2)

与m1类似，这个掩码旨在识别从“finish”字符串开始并向上回溯的区域。

df[‘start_finish’].eq(‘finish’)：标记所有值为“finish”的位置为True。.where(m)：同样，确保bfill()只传播实际的“finish”标记。.bfill()：执行后向填充，将“finish”标记向上传播。

# m2 标识从'finish'开始向上回溯的区域# 只有在原始数据非NaN时才考虑'finish'，然后进行后向填充m2 = df['start_finish'].eq('finish').where(m).bfill()print("n掩码 m2 (从'finish'向上回溯):")print(m2)

输出：

掩码 m2 (从'finish'向上回溯):0     False1      True2      True3      True4     False5     False6     False7     False8     False9     False10     True11     TrueName: start_finish, dtype: object

步骤 4：组合掩码并应用填充

现在我们有了两个关键的布尔掩码：

m1：当某个位置在“start”之后（或就是“start”本身）时为True。m2：当某个位置在“finish”之前（或就是“finish”本身）时为True。

通过对m1和m2进行逻辑与（&）操作，我们就能精确地识别出那些同时满足“在’start’之后”和“在’finish’之前”条件的单元格。这些正是我们想要填充的NaN值所在的位置。

# 组合掩码：同时满足 m1 和 m2 的条件# 这会识别出位于 'start' 和 'finish' 之间的所有单元格fill_mask = m1 & m2print("n组合掩码 (m1 & m2):")print(fill_mask)# 最后，使用布尔索引将这些位置的 'start_finish' 列值设置为 'check'# 注意：此操作会修改所有满足 fill_mask 条件的单元格，包括原始为NaN和非NaN的。# 但由于我们只关心填充NaN，且m1&m2只会是True在NaN处，所以结果符合预期。df.loc[fill_mask, 'start_finish'] = 'check'print("n填充后的DataFrame:")print(df)

输出：

组合掩码 (m1 & m2):0

以上就是Pandas中高效填充特定边界内NaN值的教程的详细内容，更多请关注创想鸟其它相关文章！

版权声明：本文内容由互联网用户自发贡献，该文观点仅代表作者本人。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容，请发送邮件至 chuangxiangniao@163.com 举报，一经查实，本站将立刻删除。
发布者：程序猿，转转请注明出处：https://www.chuangxiangniao.com/p/1374159.html

打赏

微信扫一扫

支付宝扫一扫

0 0

关于作者

程序猿签约作者

414.1K 文章

0 评论

2 粉丝

这个人很懒，什么都没有留下～

Pandas DataFrame中精确选择重复列与指定列的技巧

上一篇 2025年12月14日 13:54:48

Python模块类型提示与不可变配置管理实践

下一篇 2025年12月14日 13:54:54

用户投稿

使用 Python QuickFIX 通过 Stunnel 建立安全连接

本文档旨在指导开发者如何使用 Python QuickFIX 库通过 Stunnel 建立安全的 FIX 消息连接。我们将详细介绍 Stunnel 的配置，QuickFIX 应用程序的设置，以及如何调试可能出现的问题，确保 FIX 消息能够安全可靠地传输。本文档适用于需要在非安全网络中传输 FIX …

程序猿
2025年12月14日
1000
用户投稿

python scrapy模拟登录的方法

答案：Scrapy模拟登录需分析登录流程，提取表单字段及隐藏参数如csrf_token，使用FormRequest.from_response提交登录信息，自动处理cookies和重定向；若存在动态token或验证码，则结合Playwright等工具模拟浏览器操作；登录后Scrapy通过Cookie…

程序猿
2025年12月14日
1000
用户投稿

理解 Transformers 中的交叉熵损失与 Masked Label 问题

本文旨在深入解析 Hugging Face Transformers 库中，针对 Decoder-Only 模型（如 GPT-2）计算交叉熵损失时，如何正确使用 labels 参数进行 Masked Label 的设置。通过具体示例和代码，详细解释了 target_ids 的构造方式，以及如何避免常…

程序猿
2025年12月14日
1000
用户投稿

利用Tshark和PDML实现网络数据包十六进制字节到字段的映射

本教程旨在解决将网络数据包十六进制字节与具体协议层级数据关联的难题。通过介绍使用tshark工具将Pcap文件转换为PDML（Packet Details Markup Language）格式，然后解析PDML文件，提取每个字段在数据包中的起始位置和长度信息，最终实现对任意十六进制字节所属协议层和字…

程序猿
2025年12月14日
1000
用户投稿

PySpark中多层嵌套Array Struct的扁平化处理技巧

本文深入探讨了在PySpark中如何高效地将复杂的多层嵌套 array(struct(array(struct))) 结构扁平化为 array(struct)。通过结合使用Spark SQL的 transform 高阶函数和 flatten 函数，我们能够优雅地提取内层结构字段并与外层字段合并，最终…

程序猿
2025年12月14日
1000
用户投稿

在IIS 10上部署FastAPI应用的完整教程

本教程详细指导如何在Windows Server 2019的IIS 10环境中，利用HTTP Platform Handler部署Python FastAPI应用程序。内容涵盖Python、HTTP Platform Handler的安装，FastAPI应用及Uvicorn配置，IIS应用池创建与权…

程序猿
2025年12月14日
1000
用户投稿

Python 模块导入与文档字符串消失问题详解

本文旨在解释 Python 中模块导入后文档字符串变为 None 的现象。我们将深入探讨 Python 的导入机制和 PEP 8 规范，分析为什么在导入语句后定义的文档字符串无法被正确识别，并提供避免此问题的最佳实践。在 Python 中，文档字符串（docstring）是用于为模块、类、函数或方…

程序猿
2025年12月14日
1000
用户投稿

Python 模块导入与 Docstring 丢失问题解析

本文旨在解释并解决 Python 中模块导入后可能导致文件 Docstring 变为 None 的问题。通过分析代码示例和参考 PEP 8 规范，我们将深入探讨模块导入位置对 Docstring 的影响，并提供正确的模块导入实践，确保 Docstring 的正确保留。在 Python 编程中，Do…

程序猿
2025年12月14日
1000
用户投稿

在Flask-SQLAlchemy中生成唯一6位ID的策略与实践

本教程探讨在Flask-SQLAlchemy中为模型生成唯一6位ID的最佳实践。文章分析了UUID截断方法的局限性，推荐使用Python的secrets模块生成加密安全的随机字符串，并详细讨论了短ID的碰撞风险及应对策略，旨在提供一套高效、可靠的ID生成方案。引言：在Web应用中管理唯一标识符在…

程序猿
2025年12月14日
2000
用户投稿

Python导入模块时避免顶层代码意外执行的技巧

本文探讨了在Python中导入包含顶层执行代码且不可修改的模块时，如何避免其在导入阶段意外运行。针对无法修改源模块的限制，文章提出了一种通过临时重写内置print函数来抑制不必要输出的实用技巧，并提供了详细的代码示例及注意事项，以帮助开发者在特定场景下有效管理模块导入行为。理解Python模块导入…

程序猿
2025年12月14日
1000
用户投稿

在Anaconda指定环境中正确安装Jupyter Notebook的教程

本教程旨在解决Jupyter Notebook在Anaconda中默认安装到基础环境的问题。核心在于，用户必须先通过conda activate命令激活目标虚拟环境，然后才能在该环境中执行pip install jupyter等安装命令，确保所有软件包均正确地隔离并安装到期望的环境中，从而避免环境污…

程序猿
2025年12月14日
0000
用户投稿

使用 SQLAlchemy 进行多列选择时保持对象定义

在使用 SQLAlchemy 进行数据库查询时，我们经常需要选择多个表中的列，并希望能够方便地访问这些列对应的数据对象。然而，直接使用 session.execute(stmt).all() 方法可能会返回 Sequence[Row[Tuple[Item, Package]]] 这样的类型，导致在后…

程序猿
2025年12月14日
2000
用户投稿

SQLAlchemy 多列查询结果的对象定义保持

本文介绍了在使用 SQLAlchemy 进行多表联合查询时，如何保持查询结果中每个对象的类型定义，避免类型推断为 Any。通过使用 .tuples() 方法，可以将查询结果转换为元组序列，从而方便地解包并直接使用对象，无需额外定义变量类型。在使用 SQLAlchemy 进行数据库查询时，经常会遇到…

程序猿
2025年12月14日
0000
用户投稿

python中的插入排序怎么用？

插入排序通过构建有序序列，将未排序元素插入已排序部分的合适位置。从第二个元素开始，依次取出待插入元素，在已排序部分从后向前比较并后移大于它的元素，找到位置后插入。Python实现无需外部库，代码简洁：定义函数insertion_sort，遍历数组，使用while循环向左比较并移动元素，最后插入正确位…

程序猿
2025年12月14日
1000
用户投稿

解决 Couchbase Python SDK 连接超时问题

本文旨在帮助开发者解决在使用 Couchbase Python SDK 连接 Couchbase 集群时遇到的 `UnAmbiguousTimeoutException` 异常。通过介绍 SDK Doctor 工具的使用，诊断网络连接问题，并提供相应的排查思路，帮助开发者快速定位并解决连接超时问题，…

程序猿
2025年12月14日
0000
用户投稿

Pandas DataFrame：基于日期范围条件批量更新列值

本教程详细介绍了如何在Pandas DataFrame中，根据指定日期范围高效地批量更新某一列的值。文章将通过示例，演示如何结合使用pandas.Series.between()函数与numpy.where()或布尔索引（.loc）两种方法，实现对数据进行精确的条件性修改，并提供了重要注意事项。在…

程序猿
2025年12月14日
0000
用户投稿

使用 SQLAlchemy 进行多列查询时保持对象定义

本文旨在解决在使用 SQLAlchemy 进行多列查询时，如何保持查询结果中对象的类型信息，避免类型丢失，并提供一种更简洁的方式来处理查询结果，无需手动创建新变量进行类型声明。通过使用 .tuples() 方法，可以直接获取包含对象元组的序列，从而方便地进行解包和使用。在使用 SQLAlchemy…

程序猿
2025年12月14日
1000
用户投稿

优化Python中稀疏向量对欧氏距离计算的性能

本文探讨了在Python中高效计算两组向量间稀疏欧氏距离的策略。针对传统方法中计算大量不必要距离的性能瓶颈，我们提出并实现了一种结合Numba加速和SciPy稀疏矩阵（CSR格式）的解决方案。该方法通过显式循环和条件判断，仅计算所需距离，并直接构建稀疏矩阵，显著提升了计算速度和内存效率，特别适用于大…

程序猿
2025年12月14日
0000
用户投稿

Kivy项目APK导出错误：pyjnius编译失败问题解析与解决方案

本文旨在解决Kivy应用使用Buildozer打包APK时遇到的pyjnius编译错误，特别是涉及Py_REFCNT不可赋值的C语言编译问题。文章将详细分析错误日志，并提供包括修正命令拼写、优化buildozer.spec配置以及清理构建环境等专业解决方案，帮助开发者顺利完成Kivy应用的Andro…

程序猿
2025年12月14日
0000
用户投稿

python poetry如何安装依赖

使用Poetry可轻松管理Python依赖。1. 运行poetry install安装pyproject.toml中所有依赖，确保环境一致；2. 用poetry add包名添加生产依赖，加–group dev安装开发依赖；3. 部署时用poetry install –only…

程序猿
2025年12月14日
0000