Pandas自动化比较成对列并生成差异标识列的教程

程序猿 • 2025年11月10日 18:13:24 • 用户投稿 • 阅读 2

本教程旨在解决在pandas dataframe中高效比较大量具有特定后缀（如`_x`和`_y`）的成对列，并为每对列生成一个表示差异的新列（如`_change`）的问题。文章将详细介绍如何利用python和pandas的强大功能，通过识别列名模式并结合循环与向量化操作，实现代码的自动化和简化，从而避免手动定义大量比较函数，大幅提升数据处理的效率和可维护性。

在数据分析和处理中，我们经常会遇到需要比较DataFrame中多组相关列的情况。例如，一个常见场景是数据合并（merge）操作后，源数据和目标数据中同名字段会分别带有_x和_y的后缀，我们需要找出这些字段之间的差异。当需要比较的列对数量庞大时，手动为每一对列编写比较逻辑会变得非常繁琐且难以维护。本教程将提供一种优雅且高效的解决方案。

问题场景描述

假设我们有一个包含数百列的Pandas DataFrame，其中许多列以_x和_y作为后缀成对出现，例如cost_x和cost_y，amount_x和amount_y，type_x和type_y。我们的目标是为每一对这样的列创建一个新的列，例如cost_change、amount_change、type_change，用以标识对应_x和_y列的值是否相同。如果值相同，新列的值为1；如果不同，则为0。

传统的做法可能涉及为每一对列定义一个独立的比较函数，然后使用apply方法逐行应用。这种方法在处理少量列时尚可接受，但当需要比较的列对达到数十甚至上百对时，代码量会急剧增加，可读性和可维护性都会受到严重影响。

自动化比较解决方案

Pandas提供了一种更简洁、更高效的方法来处理这类批量操作。其核心思想是：

识别通用特征名： 从带有_x或_y后缀的列名中提取出其共同的基础部分（例如，从cost_x和cost_y中提取cost）。迭代并应用向量化比较： 遍历这些基础特征名，对每一对相应的_x和_y列执行一次向量化比较操作，并将结果保存到新的_change列中。

示例数据准备

首先，我们创建一个示例DataFrame来模拟上述场景：

标书对比王

标书对比王是一款标书查重工具，支持多份投标文件两两相互比对，重复内容高亮标记，可快速定位重复内容原文所在位置，并可导出比对报告。

58 查看详情

import pandas as pd# 示例DataFramedata = {    'cost_x': [1, 1],    'cost_y': [1, 0],    'amount_x': [1, 1],    'amount_y': [0, 1],    'type_x': ['a', 'b'],    'type_y': ['a', 'c']}df = pd.DataFrame(data)print("原始 DataFrame:")print(df)

输出：

原始 DataFrame:   cost_x  cost_y  amount_x  amount_y type_x type_y0       1       1         1         0      a      a1       1       0         1         1      b      c

核心实现步骤

提取所有独特的特征名：遍历DataFrame的所有列名，对于每个列名，使用split(“_”)[0]方法提取下划线之前的部分，然后使用unique()方法获取所有不重复的特征名。

# 提取所有独特的特征名（例如 'cost', 'amount', 'type'）features = pd.Series(df.columns).apply(lambda s: s.split("_")[0]).unique()print("n提取的特征名:", features)

输出：

提取的特征名: ['cost' 'amount' 'type']

循环创建差异列：使用一个for循环遍历上一步获取的每个特征名。在循环内部，构建对应的_x和_y列名，执行逐元素的比较操作，并将布尔结果转换为整数（1表示相同，0表示不同）。

# 遍历每个特征名，创建对应的_change列for v in features:    df[v + "_change"] = (df[v + "_x"] == df[v + "_y"]).astype(int)print("n处理后的 DataFrame:")print(df)

输出：

处理后的 DataFrame:   cost_x  cost_y  amount_x  amount_y type_x type_y  cost_change  amount_change  type_change0       1       1         1         0      a      a            1              0            11       1       0         1         1      b      c            0              1            0

代码解析

pd.Series(df.columns)：将DataFrame的列名转换为一个Pandas Series，以便可以使用apply方法。.apply(lambda s: s.split(“_”)[0])：对Series中的每个列名字符串应用一个匿名函数。s.split(“_”)[0]将字符串按_分割，并取第一个部分，即特征名。.unique()：从结果Series中获取所有不重复的特征名，返回一个NumPy数组。for v in features:：遍历每个提取出的特征名。df[v + “_change”]：这会创建一个新的列，其名称由特征名和_change后缀组成。(df[v + “_x”] == df[v + “_y”])：这是Pandas的向量化比较操作。它会逐行比较v_x列和v_y列的值，返回一个布尔型的Series（True表示相同，False表示不同）。.astype(int)：将布尔型Series转换为整数型。True会被转换为1，False会被转换为0。

注意事项与扩展

列名模式的灵活性： 本教程假设列名模式为feature_x和feature_y。如果你的列名模式不同（例如feature.old和feature.new），只需相应地调整split方法的分隔符和索引，或者使用正则表达式进行更复杂的匹配。性能优化： 这种基于向量化操作的循环方法比逐行apply函数要高效得多，尤其是在处理大型DataFrame时。Pandas和NumPy的底层优化使得这类操作非常快速。更复杂的比较逻辑： 如果不仅仅是简单的相等性比较，例如需要比较数值差异是否在某个阈值内，或者字符串比较需要忽略大小写，可以在循环内部调整比较表达式。例如：

# 数值差异在阈值内# df[v + "_change"] = (abs(df[v + "_x"] - df[v + "_y"]) < threshold).astype(int)# 字符串忽略大小写比较# df[v + "_change"] = (df[v + "_x"].str.lower() == df[v + "_y"].str.lower()).astype(int)

处理缺失值（NaN）： 默认情况下，NaN == NaN的结果是False。如果希望将两个NaN视为相同，则需要额外的处理，例如使用fillna()或者在比较前进行条件判断。

# 考虑NaN相等的情况df[v + "_change"] = ((df[v + "_x"] == df[v + "_y"]) | (df[v + "_x"].isna() & df[v + "_y"].isna())).astype(int)

总结

通过本教程介绍的方法，我们可以高效地在Pandas DataFrame中批量比较成对的列，并自动生成差异标识列。这种方法不仅显著减少了代码量，提高了可读性和可维护性，而且利用了Pandas的向量化操作，确保了在处理大规模数据时的性能优势。掌握这种模式识别和批量处理的技巧，对于任何需要进行数据清洗、对比分析的Pandas用户都至关重要。

以上就是Pandas自动化比较成对列并生成差异标识列的教程的详细内容，更多请关注创想鸟其它相关文章！

版权声明：本文内容由互联网用户自发贡献，该文观点仅代表作者本人。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容，请发送邮件至 chuangxiangniao@163.com 举报，一经查实，本站将立刻删除。
发布者：程序猿，转转请注明出处：https://www.chuangxiangniao.com/p/595897.html

打赏

微信扫一扫

支付宝扫一扫

0 0

关于作者

程序猿签约作者

414.1K 文章

0 评论

2 粉丝

这个人很懒，什么都没有留下～

苹果手机充电慢的原因和解决方法最新

上一篇 2025年11月10日 18:13:18

sql语句怎样解决exists子查询与in子查询误用导致的性能问题 sql语句exists与in误用的常见问题处理

下一篇 2025年11月10日 18:13:30

好文分享

如何解决本地图片在使用 mask JS 库时出现的跨域错误？

如何跨越localhost使用本地图片？问题: 在本地使用mask js库时，引入本地图片会报跨域错误。解决方案: 要解决此问题，需要使用本地服务器启动文件，以http或https协议访问图片，而不是使用file://协议。例如： python -m http.server 8000 然后，可以…

程序猿
2025年12月24日
4000
好文分享

旋转长方形后，如何计算其相对于画布左上角的轴距？

绘制长方形并旋转，计算旋转后轴距在拥有 1920×1080 画布中，放置一个宽高为 200×20 的长方形，其坐标位于 (100, 100)。当以任意角度旋转长方形时，如何计算它相对于画布左上角的 x、y 轴距？以下代码提供了一个计算旋转后长方形轴距的解决方案： const x = 200;co…

程序猿
2025年12月24日
0000
好文分享

旋转长方形后，如何计算它与画布左上角的xy轴距？

旋转后长方形在画布上的xy轴距计算在画布中添加一个长方形，并将其旋转任意角度，如何计算旋转后的长方形与画布左上角之间的xy轴距？问题分解：要计算旋转后长方形的xy轴距，需要考虑旋转对长方形宽高和位置的影响。首先，旋转会改变长方形的长和宽，其次，旋转会改变长方形的中心点位置。求解方法：计算旋…

程序猿
2025年12月24日
0000
好文分享

旋转长方形后如何计算其在画布上的轴距？

旋转长方形后计算轴距假设长方形的宽、高分别为 200 和 20，初始坐标为 (100, 100)，我们将它旋转一个任意角度。根据旋转矩阵公式，旋转后的新坐标 (x’, y’) 可以通过以下公式计算： x’ = x * cos(θ) – y * sin(θ)y’ = x * …

程序猿
2025年12月24日
0000
好文分享

如何计算旋转后长方形在画布上的轴距？

旋转后长方形与画布轴距计算在给定的画布中，有一个长方形，在随机旋转一定角度后，如何计算其在画布上的轴距，即距离左上角的距离？以下提供一种计算长方形相对于画布左上角的新轴距的方法： const x = 200; // 初始 x 坐标const y = 90; // 初始 y 坐标const w =…

程序猿
2025年12月24日
2000
好文分享

CSS元素设置em和transition后，为何载入页面无放大效果？

css元素设置em和transition后，为何载入无放大效果很多开发者在设置了em和transition后，却发现元素载入页面时无放大效果。本文将解答这一问题。原问题：在视频演示中，将元素设置如下，载入页面会有放大效果。然而，在个人尝试中，并未出现该效果。这是由于macos和windows系统…

程序猿
2025年12月24日
3000
好文分享

如何计算旋转后的长方形在画布上的 XY 轴距？

旋转长方形后计算其画布xy轴距在创建的画布上添加了一个长方形，并提供其宽、高和初始坐标。为了视觉化旋转效果，还提供了一些旋转特定角度后的图片。问题是如何计算任意角度旋转后，这个长方形的xy轴距。这涉及到使用三角学来计算旋转后的坐标。以下是一个 javascript 代码示例，用于计算旋转后长方…

程序猿
2025年12月24日
0000
好文分享

使用 Mask 导入本地图片时，如何解决跨域问题？

跨域疑难：如何解决 mask 引入本地图片产生的跨域问题？在使用 mask 导入本地图片时，你可能会遇到令人沮丧的跨域错误。为什么会出现跨域问题呢？让我们深入了解一下： mask 框架假设你以 http(s) 协议加载你的 html 文件，而当使用 file:// 协议打开本地文件时，就会产生跨域…

程序猿
2025年12月24日
3000
好文分享

正则表达式在文本验证中的常见问题有哪些？

正则表达式助力文本输入验证在文本输入框的验证中，经常遇到需要限定输入内容的情况。例如，输入框只能输入整数，第一位可以为负号。对于不会使用正则表达式的人来说，这可能是个难题。下面我们将提供三种正则表达式，分别满足不同的验证要求。 1. 可选负号，任意数量数字如果输入框中允许第一位为负号，后面可输入…

程序猿
2025年12月24日
3000
好文分享

如何在 VS Code 中解决折叠代码复制问题？

解决 VS Code 折叠代码复制问题在 VS Code 中使用折叠功能可以帮助组织长代码，但使用复制功能时，可能会遇到只复制可见部分的问题。以下是如何解决此问题：当代码被折叠时，可以使用以下简单操作复制整个折叠代码：按下 Ctrl + C (Windows/Linux) 或 Cmd + C …

程序猿
2025年12月24日
1000
好文分享

如何相对定位使用 z-index 在小程序中将文字压在图片上？

如何在小程序中不使用绝对定位压住上面的图片？在小程序开发中，有时候需要将文字内容压在图片上，但是又不想使用绝对定位来实现。这种情况可以使用相对定位和 z-index 属性来解决。问题示例：小程序中的代码如下：顶顶顶顶 .index{ width: 100%; height: 100vh;}.…

程序猿
2025年12月24日
0000
好文分享

为什么多年的经验让我选择全栈而不是平均栈

在全栈和平均栈开发方面工作了 6 年多，我可以告诉您，虽然这两种方法都是流行且有效的方法，但它们满足不同的需求，并且有自己的优点和缺点。这两个堆栈都可以帮助您创建 Web 应用程序，但它们的实现方式却截然不同。如果您在两者之间难以选择，我希望我在两者之间的经验能给您一些有用的见解。在这篇文章中，我…

程序猿
2025年12月24日
3000
好文分享

姜戈顺风

本教程演示如何在新项目中从头开始配置 django 和 tailwindcss。 django 设置创建一个名为 .venv 的新虚拟环境。 # windows$ python -m venv .venv$ .venvscriptsactivate.ps1(.venv) $# macos/linu…

程序猿
2025年12月24日
1000
好文分享

花 $o 学习这些编程语言或免费

→ Python → JavaScript → Java → C# → 红宝石 → 斯威夫特 → 科特林 → C++ → PHP → 出发 → R → 打字稿 []https://x.com/e_opore/status/1811567830594388315?t=_j4nncuiy2wfbm7ic…

程序猿
2025年12月24日
0000
好文分享

html5怎么导视频_html5用video标签导出或Canvas转DataURL获视频【导出】

HTML5无法直接导出video标签内容，需借助Canvas捕获帧并结合MediaRecorder API、FFmpeg.wasm或服务端协同实现。MediaRecorder适用于WebM格式前端录制；FFmpeg.wasm支持MP4等格式及精细编码控制；服务端方案适合高负载场景。如果您希望在网页…

程序猿
2025年12月23日
4000
好文分享

如何查看编写的html_查看自己编写的HTML文件效果【效果】

要查看HTML文件的浏览器渲染效果，需确保文件以.html为扩展名保存、用浏览器直接打开、利用开发者工具调试、必要时启用本地HTTP服务器、或使用编辑器实时预览插件。如果您编写了HTML代码，但无法直观看到其在浏览器中的实际渲染效果，则可能是由于文件未正确保存、未使用浏览器打开或文件扩展名设置错误…

程序猿
2025年12月23日
4000
好文分享

html5怎么加php_html5用Ajax与PHP后端交互实现数据传递【交互】

HTML5不能直接运行PHP，需通过Ajax与PHP通信：前端用fetch发送请求，PHP接收处理并返回JSON，前端解析响应更新DOM；注意跨域、编码、CSRF防护和输入过滤。 HTML5 本身是前端标记语言，不能直接运行 PHP 代码，但可以通过 Ajax（异步 JavaScript）与 PHP…

程序猿
2025年12月23日
3000
好文分享

html5 js怎么加_html5用script标签内嵌或外链引入JS代码【添加】

在HTML5中执行JavaScript需通过script标签：一、内联编写于head或body中；二、外链引入.js文件并建议放body末尾或加defer；三、defer按序执行，async独立执行；四、可动态创建script元素插入执行。如果您希望在HTML5页面中执行JavaScript代码，…

程序猿
2025年12月23日
0000
好文分享

node.js怎么运行html_node.js运行html步骤【指南】

答案是使用Node.js内置http模块、Express框架或第三方工具serve可快速搭建服务器预览HTML文件。首先通过http模块创建服务器并读取index.html返回响应；其次用Express初始化项目并配置静态文件服务；最后利用serve工具全局安装后一键启动服务器，三种方式均在浏览器访…

程序猿
2025年12月23日
4000
好文分享

html5能否插入带表单的文档_html5表单文档嵌入与数据提交【步骤】

HTML5中无法直接嵌入外部带表单的HTML文档并原生提交；可行方案有四：一、用iframe嵌入，需同源或CORS支持，并用postMessage通信；二、用fetch+DOMParser动态加载表单片段并手动绑定事件；三、在当前页面直接编写表单，最规范且兼容性好；四、用JavaScript+fet…

程序猿
2025年12月23日
1000