Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
Pandas DataFrame高效数据对比与差异定位教程_创想鸟

Pandas DataFrame高效数据对比与差异定位教程

pandas dataframe高效数据对比与差异定位教程

本教程详细介绍了如何高效比较两个Pandas DataFrame,以识别并定位其中的数据差异。文章通过直接的布尔比较、自定义函数以及apply方法,展示了如何准确找出发生数据不匹配的行和列,并以清晰的格式输出差异报告,适用于数据验证和质量控制场景。

1. 引言

在数据分析和处理过程中,经常需要对比两个DataFrame,例如,比较不同时间点的数据快照、验证数据清洗结果或核对报告数据与源数据的一致性。本教程将介绍一种简洁有效的方法,用于识别两个结构相同(或可对齐)的Pandas DataFrame中所有不匹配的数据点,并以易于理解的格式输出差异报告,明确指出差异所在的行和列。

2. 核心概念:DataFrame的元素级布尔比较

Pandas DataFrame支持直接的元素级比较操作。当对两个DataFrame使用!=(不等于)运算符时,结果会是一个与原DataFrame形状相同的布尔型DataFrame。在这个布尔型DataFrame中,True表示对应位置的元素在两个原始DataFrame中不相同,而False则表示相同。

示例数据准备:

首先,我们创建两个示例DataFrame,df_actual代表实际数据,df_rpt_all1代表报告数据,其中包含一些预设的差异。

import pandas as pddf_actual = pd.DataFrame({    'Partner': ['P1', 'P2', 'P3'],    'lobName': ['L1', 'L2', 'L3'],    'sublobName': ['S1', 'S2', 'S3'],    'channelName': ['C1', 'C5', 'C3'], # P2的channelName与df_rpt_all1不同    'value1': [1, 2, 3] # P3的value1与df_rpt_all1不同})df_rpt_all1 = pd.DataFrame({    'Partner': ['P1', 'P2', 'P3'],    'lobName': ['L1', 'L2', 'L3'],    'sublobName': ['S1', 'S2', 'S3'],    'channelName': ['C1', 'C2', 'C3'], # P2的channelName与df_actual不同    'value1': [1, 2, 6] # P3的value1与df_actual不同})print("df_actual:")print(df_actual)print("ndf_rpt_all1:")print(df_rpt_all1)

执行元素级比较:

difference_df = df_actual != df_rpt_all1print("n差异布尔DataFrame (difference_df):")print(difference_df)

输出结果解释:

difference_df中的True值精确指示了两个DataFrame中不一致的单元格。例如,在索引为1的行(第二行),channelName列为True,表示df_actual和df_rpt_all1在该位置的值不同。同样,在索引为2的行(第三行),value1列为True。

差异布尔DataFrame (difference_df):   Partner  lobName  sublobName  channelName  value10    False    False       False        False   False1    False    False       False         True   False2    False    False       False        False    True

3. 定位并格式化不匹配信息

为了生成清晰的差异报告,我们需要遍历difference_df,找出每一行中所有为True的列,并将其格式化为指定的输出字符串。

自定义函数 filter_different_columns:

我们将定义一个辅助函数,该函数接收difference_df的每一行(在reset_index()之后),识别出其中值为True的列,并构建一个描述该行差异的字符串。

def filter_different_columns(row_series):    """    根据布尔Series识别出值为True的列,并格式化输出。    row_series: 一个Pandas Series,代表difference_df中的一行,                其中包含一个名为'index'的列(原始行索引)和布尔值列。    """    row_dict = dict(row_series)    # 提取原始行索引,通常在reset_index()后作为'index'列    original_index = row_dict.pop('index')    # 找出所有值为True(即存在差异)的列名    mismatched_columns = [col for col, is_diff in row_dict.items() if is_diff]    # 如果存在差异列,则格式化输出字符串    if mismatched_columns:        return f"(Row {original_index + 1}, columns=[" + ",".join(mismatched_columns) + "]),"    else:        return "" # 如果没有差异,返回空字符串

应用函数并聚合结果:

接下来,我们将difference_df重置索引(以便在函数中获取原始行号),然后使用apply方法将filter_different_columns函数应用于每一行。最后,通过sum()方法将所有非空字符串连接起来,形成最终的差异报告。

# 将difference_df的索引重置为普通列,以便在apply函数中访问原始行号# original_index + 1 是为了将0-based index转换为1-based index,更符合人类阅读习惯mismatched_data_parts = difference_df.reset_index().apply(filter_different_columns, axis=1)# 将所有差异字符串连接起来,并移除末尾可能多余的逗号mismatched_report = "".join(mismatched_data_parts).strip(',')if mismatched_report:    print(f"nMismatched Rows:n{mismatched_report}")else:    print("nNo mismatches found.")

完整代码示例:

import pandas as pd# 示例数据df_actual = pd.DataFrame({    'Partner': ['P1', 'P2', 'P3'],    'lobName': ['L1', 'L2', 'L3'],    'sublobName': ['S1', 'S2', 'S3'],    'channelName': ['C1', 'C5', 'C3'],    'value1': [1, 2, 3]})df_rpt_all1 = pd.DataFrame({    'Partner': ['P1', 'P2', 'P3'],    'lobName': ['L1', 'L2', 'L3'],    'sublobName': ['S1', 'S2', 'S3'],    'channelName': ['C1', 'C2', 'C3'],    'value1': [1, 2, 6]})# 1. 执行元素级比较,生成布尔型DataFramedifference_df = df_actual != df_rpt_all1# 2. 定义辅助函数,用于识别并格式化每行的差异def filter_different_columns(row_series):    row_dict = dict(row_series)    original_index = row_dict.pop('index') # 获取原始行索引    mismatched_columns = [col for col, is_diff in row_dict.items() if is_diff]    if mismatched_columns:        # 转换为1-based index        return f"(Row {original_index + 1}, columns=[" + ",".join(mismatched_columns) + "]),"    else:        return ""# 3. 应用函数并聚合结果# reset_index() 将原始索引作为名为 'index' 的列添加到 DataFrame 中mismatched_data_parts = difference_df.reset_index().apply(filter_different_columns, axis=1)# 使用 join() 方法连接所有字符串,并去除末尾可能多余的逗号mismatched_report = "".join(mismatched_data_parts).strip(',')# 4. 打印最终报告if mismatched_report:    print(f"Mismatched Rows:n{mismatched_report}")else:    print("No mismatches found.")

预期输出:

Mismatched Rows:(Row 2, columns=[channelName]),(Row 3, columns=[value1])

4. 注意事项与扩展

DataFrame对齐:

此方法假设两个DataFrame的列名和索引是相同且对齐的。如果两个DataFrame的列顺序不同,或者索引不完全一致,直接使用!=可能会导致比较结果不准确。在这种情况下,可能需要先使用df1.reindex(columns=df2.columns)或df1.align(df2)等方法进行对齐。如果需要基于特定ID列进行比较,且两个DataFrame的行数或顺序可能不同,可以考虑先通过merge操作将它们连接起来,再进行比较。

缺失值(NaN)处理:

在Pandas中,NaN != NaN 的结果是 True。这意味着如果两个DataFrame在相同位置都包含NaN,它们会被视为不匹配。如果希望NaN与NaN视为匹配,可以先使用df.fillna(value)将NaN替换为特定值(如0或空字符串),或者使用df1.equals(df2)(它将NaN视为相等)进行精确比较。

性能考量:

对于非常大的DataFrame,元素级布尔比较(df1 != df2)是高度优化的,性能良好。apply(…, axis=1)在Python循环中执行,对于极大的DataFrame,其性能可能不如完全矢量化的操作。但对于生成这种特定格式的差异报告,它通常是一个可接受且易于理解的方案。如果需要极致性能,可能需要探索更复杂的矢量化方法,例如使用stack()和groupby()。

输出格式定制:

filter_different_columns函数可以根据需求轻松修改,以生成不同格式的差异报告。例如,可以返回一个包含字典的列表,每个字典描述一个差异点(包括行号、列名、df_actual值和df_rpt_all1值),而不是一个字符串。

5. 总结

通过利用Pandas DataFrame的元素级布尔比较能力,结合自定义函数和apply方法,我们可以有效地识别并报告两个DataFrame之间的数据差异。这种方法不仅提供了清晰的差异定位,而且具有良好的可读性和可扩展性,是数据验证和质量控制任务中的一个实用工具。正确理解其工作原理和注意事项,可以帮助我们更准确、高效地管理和分析数据。

以上就是Pandas DataFrame高效数据对比与差异定位教程的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1376889.html

赞 (0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
如何计算独立事件聚合结果的概率分布
上一篇 2025年12月14日 16:18:02
Selenium自动化:利用显式等待解决动态按钮点击难题
下一篇 2025年12月14日 16:18:14

相关推荐

  • 如何用Sublime导出MySQL数据表结构_生成Markdown或HTML格式文档

    要使用 sublime text 导出 mysql 数据表结构并生成 markdown 或 html 文档,需通过以下步骤操作:1. 使用 show create table 命令或 mysqldump 工具获取建表语句;2. 在 sublime 中整理字段信息,按字段名、类型、是否为空、键、默认值…

    2026年9月22日
    000
  • VSCode如何安装和使用插件 VSCode插件管理的高效方法

    安装插件需通过vscode扩展视图搜索并点击安装,部分插件需重启或配置后生效;2. 使用插件时可通过命令面板、上下文菜单、状态栏或自动语言特性调用功能,并在设置中自定义行为;3. 高效管理应定期审视插件使用频率,禁用或卸载不常用者,关注性能影响,利用“开发者: 显示正在运行的扩展”识别资源占用高的插…

    2026年9月22日
    200
  • Java Stream API:从嵌套集合中提取唯一值的高效实践

    本文深入探讨如何利用Java Stream API,从包含嵌套集合的对象列表中高效地提取唯一的字符串值。我们将重点介绍flatMap()和mapMulti()这两种强大的流操作,演示它们如何替代传统的嵌套循环,从而实现代码的简洁性、可读性以及潜在的性能优化。 在java应用开发中,我们经常会遇到处理…

    2026年9月22日
    100
  • CapCut的AI混合工具如何使用?快速制作高质量短视频的教程

    CapCut的AI混合工具通过智能算法将多段素材自然融合,支持画中画、双重曝光、背景替换等效果,提升视频创意与质感;使用时需导入素材并分层,选择“混合模式”如滤色、叠加等,结合不透明度、位置调整实现融合;可打造情绪隐喻、时间流逝等叙事效果,增强艺术表达;避免过度使用、素材冲突等问题,善用蒙版、色彩调…

    2026年9月22日
    500
  • 苹果手机如何快速整理桌面图标

    掌握技巧可轻松整理苹果手机桌面:1. 用文件夹归类应用,长按图标拖动合并并自定义命名;2. 批量移动图标时,抖动模式下双指滑屏切换页面;3. 利用App资源库自动分类,隐藏不常用应用;4. 恢复默认布局可通过设置中的“还原主屏幕布局”操作,保持桌面整洁有序。 苹果手机整理桌面图标其实很简单,只要掌握…

    2026年9月22日
    000
  • 使用Java Selenium验证表格数据排序:金额列的升序与降序检查

    本教程详细介绍了如何利用Java Selenium WebDriver验证网页表格中金额列的排序功能。文章涵盖了从环境配置、登录应用到数据提取、清洗、数值转换,再到实现表格数据(特别是金额数据)的升序或降序验证的完整流程。通过示例代码,演示了如何获取页面元素、处理文本数据,并使用JUnit进行断言,…

    2026年9月22日
    100
  • VSCode安装C/C++代码格式化 专业VSCode开发环境配置

    配置VSCode进行C/C++开发需安装C/C++扩展包和clang-format,设置自动格式化与调试环境,推荐使用CMake Tools、Include Autocomplete等扩展,结合快捷键、代码片段和任务自动化提升效率。 配置VSCode以实现C/C++代码的专业格式化和高效开发环境,核…

    2026年9月22日
    400
  • MySQL备份数据恢复演练_MySQL数据恢复流程与实战

    MySQL备份数据恢复演练_MySQL数据恢复流程与实战MySQL备份数据恢复演练_MySQL数据恢复流程与实战MySQL备份数据恢复演练_MySQL数据恢复流程与实战MySQL备份数据恢复演练_MySQL数据恢复流程与实战

    mysql备份数据恢复演练是为了验证备份有效性并提升dba恢复能力的必要措施。其核心流程包括:1.准备与生产环境相似的演练环境并明确恢复目标;2.检查备份策略并准备所需全量与增量备份文件;3.模拟数据丢失场景并记录故障时间;4.停止mysql服务、清理数据目录后从全量备份恢复;5.依次应用增量备份并…

    2026年9月22日 • 用户投稿
    100
  • RayLink如何设置快捷键操作_RayLink远程控制效率的提升方法

    首先启用RayLink快捷键穿透模式,进入会话设置并勾选“启用快捷键穿透模式”;接着自定义快捷键映射,在“快捷键管理”中新建规则,将本地组合键如Ctrl+Shift+S映射为远程端Win+Shift+S;然后使用预设快捷键如Ctrl+Alt+R重启远程电脑、Ctrl+Alt+M释放鼠标、Ctrl+A…

    2026年9月22日
    400
  • Could NOT find Doxygen (missing: DOXYGEN_EXECUTABLE)

    could not find doxygen (missing: doxygen_executable)  使用cmake .. 有时候会遇到如下问题: 代码语言:javascript代码运行次数:0运行复制 $ cmake ..– The CXX compiler identification …

    2026年9月22日
    100
  • 解决Spring Boot Actuator升级后Tomcat指标缺失问题

    本文旨在解决Spring Boot Actuator升级至2.7.0及更高版本后,部分Tomcat指标(如tomcat.cache.access、tomcat.global.error)在MetricsEndpoint中缺失的问题。通过在application.properties中配置server…

    2026年9月22日
    600
  • MAC的Safari浏览器怎么安装插件_MAC Safari浏览器安装插件教程

    首先通过App Store安装Safari扩展,打开Safari浏览器选择“Safari 浏览器扩展”进入下载页面,找到所需插件点击“获取”安装;其次可手动安装.safariextz文件,双击下载文件按提示完成安装并配置权限;最后在Safari设置中启用插件,进入“扩展”标签页勾选对应插件,调整功能…

    2026年9月22日
    100
  • 苹果手机忘记密码

    确认你的Apple ID与密码情况 首先,确认你是否真的忘记了密码。有时候可能是输错了Apple ID或密码,建议仔细核对。回想一下是否曾修改过密码,并检查与该账户绑定的邮箱、安全提示问题或双重认证设备,这些都有助于找回账户访问权限。 如何重设密码 若确认密码遗失,最有效的解决方式是进行密码重置。请…

    2026年9月22日
    100
  • Laravel 8 登录后重定向到仪表盘:完整教程

    本教程详细阐述了在 Laravel 8 中实现用户登录后重定向到仪表盘的多种方法。我们将探讨 Laravel 默认的重定向机制、如何正确配置仪表盘路由及其中间件,并提供通过自定义 LoginController 实现精确重定向的示例代码。通过本文,您将全面掌握 Laravel 认证后的重定向流程,并…

    2026年9月22日
    500
  • Ubuntu VMware Tools安装详细过程(非常靠谱)「建议收藏」

    Ubuntu VMware Tools安装详细过程(非常靠谱)「建议收藏」Ubuntu VMware Tools安装详细过程(非常靠谱)「建议收藏」Ubuntu VMware Tools安装详细过程(非常靠谱)「建议收藏」Ubuntu VMware Tools安装详细过程(非常靠谱)「建议收藏」

    大家好,很高兴再次与大家见面,我是你们的朋友全栈君。 说明:这篇博客是博主亲自编写的,内容独特,辛苦付出,请大家尊重原创,感谢支持! 一.前言VMware Ubuntu安装的详细指南:https://www.php.cn/link/35e7132c1742eaa9dacfedd5607b5f94。 …

    2026年9月22日 • 用户投稿
    900
  • VSCode如何集成Jai游戏开发环境 VSCode配置高性能游戏编程工作流

    配置#%#$#%@%@%$#%$#%#%#$%@_e2fc++805085e25c9761616c00e065bfe8集成jai游戏开发环境的核心在于正确设置编译器与调试器并利用扩展提升效率,1. 配置settings.json指定jai.compilerpath、builddirectory、in…

    2026年9月22日
    500
  • mac怎么使用iMovie剪辑视频_mac使用iMovie剪辑视频教程

    首先打开iMovie并导入视频素材,然后将视频拖入时间线进行裁剪与分割,接着为片段间添加转场效果,再插入背景音乐并调节音量,最后设置参数导出视频。 如果您想在Mac上对视频进行剪辑和编辑,但不知道如何使用系统自带的iMovie应用完成操作,可以按照以下步骤进行。iMovie提供了直观的界面和基础剪辑…

    2026年9月22日
    600
  • 淘宝签到红包如何兑换

    淘宝签到红包是平台为用户准备的一项实用福利,帮助你在日常购物中获得更多实惠。那么,如何顺利兑换这些签到红包呢?接下来为你一步步解析。 一、参与签到领取红包 打开淘宝App后,通常在首页就能看到醒目的“签到”入口,点击即可进入签到页面。每日坚持打卡,系统便会发放对应的签到红包。红包金额会根据连续签到的…

    2026年9月22日
    000
  • MySQL自动化备份如何实现_适合企业级部署吗?

    MySQL自动化备份如何实现_适合企业级部署吗?MySQL自动化备份如何实现_适合企业级部署吗?MySQL自动化备份如何实现_适合企业级部署吗?MySQL自动化备份如何实现_适合企业级部署吗?

    mysql的自动化备份对企业级部署是必要的,且可通过多种方式实现。1. 使用mysqldump+定时任务(crontab)是最基础的方式,操作简单适合中小规模数据库,但备份时可能锁表影响业务;2. 增量备份结合二进制日志(binary log)更高效,适用于频繁变更的数据,支持精确恢复到某时间点;3…

    2026年9月21日 • 用户投稿
    100
  • TensorFlow的AI混合工具怎么操作?构建机器学习模型的详细步骤

    TensorFlow的混合编程核心在于结合Keras的高级抽象与TensorFlow底层API的灵活性,实现高效模型开发。首先使用tf.data构建高性能数据管道,通过map、batch、shuffle和prefetch等操作优化数据预处理;接着利用Keras快速搭建模型结构,同时通过继承tf.ke…

    2026年9月21日
    400

发表回复

登录后才能评论
关注微信