Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
比较带有浮点数和NaN的DataFrame列:处理精度与缺失值_创想鸟

比较带有浮点数和NaN的DataFrame列:处理精度与缺失值

比较带有浮点数和NaN的DataFrame列:处理精度与缺失值

本教程详细介绍了如何在Pandas DataFrame中比较两列浮点数,并准确计算差异行数。文章重点解决了浮点数精度问题(通过四舍五入)和NaN值(缺失值)的特殊处理,确保NaN与NaN不被计为差异,而NaN与数值则被计为差异,从而实现精确的数据对比和差异统计。

挑战:浮点数比较与NaN处理

在数据分析中,我们经常需要对比两个dataframe中特定列的数值差异。当这些列包含浮点数和缺失值(nan)时,简单的相等性检查会遇到两个主要挑战:

浮点数精度问题: 计算机表示浮点数时可能存在微小的精度误差,导致表面上相同的数值在直接比较时被判定为不相等。例如,0.1 + 0.2可能不严格等于0.3。NaN的特殊性: 在Python和Pandas中,NaN(Not a Number)是一个特殊的值,其特点是NaN != NaN。这意味着,如果两列在同一位置都包含NaN,直接比较会将其视为不同,但这通常不是我们希望的行为,我们通常希望NaN与NaN被视为相同,不计入差异。

为了克服这些挑战,我们需要一种稳健的方法来比较浮点数列并准确计算差异行数。

解决方案核心:round()与compare()

Pandas库提供了强大的工具来解决上述问题:

pandas.DataFrame.round(): 用于对DataFrame中的浮点数进行四舍五入,从而消除由于精度问题导致的微小差异。pandas.DataFrame.compare(): 用于比较两个DataFrame或Series,并返回一个仅包含差异行的新DataFrame。它在处理NaN时具有智能行为,即当两边都是NaN时,该行不会被视为差异并包含在结果中,这正是我们所需要的。

实战演示

下面通过一个具体的例子来演示如何使用round()和compare()来解决浮点数和NaN的比较问题。

假设我们有两个结构相同的DataFrame,它们在某一列(col)中包含浮点数和NaN,我们需要找出col列中值不同的行数。

1. 数据准备

首先,创建两个示例DataFrame:

import pandas as pdd1 = {"col": [7.1, 2.0, 3.0, 4.0, None, 1.9, 1.3]}d2 = {"col": [7.1, 2.5, 3.0, 4.0, None, 1.2, None]}df1 = pd.DataFrame(d1)df2 = pd.DataFrame(d2)print("DataFrame 1:")print(df1)print("nDataFrame 2:")print(df2)

2. 统一浮点数精度

为了解决浮点数精度问题,我们首先对需要比较的列进行四舍五入。选择合适的四舍五入位数取决于数据的实际精度要求。这里我们以保留4位小数为例。

# 对 'col' 列进行四舍五入,保留4位小数df1["col"] = df1["col"].round(4)df2["col"] = df2["col"].round(4)print("nDataFrame 1 (四舍五入后):")print(df1)print("nDataFrame 2 (四舍五入后):")print(df2)

3. 执行DataFrame列比较

使用df.compare()方法来比较两个DataFrame。此方法会返回一个新的DataFrame,其中只包含两个DataFrame之间存在差异的行和列。对于NaN的处理,如果df1和df2在同一位置都为NaN,compare()方法默认不会将此行包含在结果中,这符合我们“NaN与NaN视为相同”的需求。如果其中一个为NaN而另一个为数值,则会被视为差异。

# 使用 compare 方法比较两个 DataFrame# 默认情况下,compare 会比较所有列,但由于我们只修改了 'col',所以结果会反映 'col' 的差异comparison = df1.compare(df2)print("n差异比较结果:")print(comparison)

compare()方法返回的DataFrame具有特殊的列结构:对于每个有差异的列,它会创建两列,分别以self和other作为子列名,表示原始DataFrame(调用compare的DataFrame)和被比较DataFrame中的值。

从输出中可以看到:

索引1处,df1.col是2.0,df2.col是2.5,被识别为差异。索引5处,df1.col是1.9,df2.col是1.2,被识别为差异。索引6处,df1.col是1.3,df2.col是NaN,被识别为差异。索引4处,df1.col和df2.col都是NaN,因此没有出现在比较结果中,这正是我们希望的“NaN与NaN视为相同”的行为。

4. 统计差异行数

差异比较结果DataFrame的行数即为不同行的数量。

# 统计差异行数different_rows_count = len(comparison)print(f"n差异行数: {different_rows_count}")

完整示例代码

将上述步骤整合到一起,形成完整的解决方案代码:

import pandas as pd# 1. 数据准备d1 = {"col": [7.1, 2.0, 3.0, 4.0, None, 1.9, 1.3]}d2 = {"col": [7.1, 2.5, 3.0, 4.0, None, 1.2, None]}df1 = pd.DataFrame(d1)df2 = pd.DataFrame(d2)print("DataFrame 1:")print(df1)print("nDataFrame 2:")print(df2)# 2. 统一浮点数精度(例如,保留4位小数)df1["col"] = df1["col"].round(4)df2["col"] = df2["col"].round(4)print("nDataFrame 1 (四舍五入后):")print(df1)print("nDataFrame 2 (四舍五入后):")print(df2)# 3. 执行DataFrame列比较# compare方法会返回一个只包含差异的DataFrame# 如果两边都是NaN,则不会被包含在结果中comparison = df1.compare(df2)print("n差异比较结果:")print(comparison)# 4. 统计差异行数different_rows_count = len(comparison)print(f"n差异行数: {different_rows_count}")

输出结果与解读

运行上述代码,将得到如下输出:

DataFrame 1:   col0  7.11  2.02  3.03  4.04  NaN5  1.96  1.3DataFrame 2:   col0  7.11  2.52  3.03  4.04  NaN5  1.26  NaNDataFrame 1 (四舍五入后):   col0  7.11  2.02  3.03  4.04  NaN5  1.96  1.3DataFrame 2 (四舍五入后):   col0  7.11  2.52  3.03  4.04  NaN5  1.26  NaN差异比较结果:   col        self other1  2.0   2.55  1.9   1.26  1.3   NaN差异行数: 3

从输出结果中,我们可以清晰地看到哪些行存在差异,以及差异的具体值。最终统计的差异行数是3,这准确地反映了在考虑浮点数精度和NaN特殊处理后,两列中实际不同的行数。

注意事项与最佳实践

选择合适的四舍五入精度: round()方法的参数应根据数据的业务含义和所需的精度来确定。过高的精度可能无法解决浮点数误差,过低的精度则可能丢失有效信息。compare()的灵活性: compare()方法不仅可以比较单个列,也可以比较整个DataFrame。它还提供了align_axis、keep_shape等参数,以适应更复杂的比较需求。性能考量: 对于非常大的DataFrame,compare()方法可能需要一定的计算资源。在性能敏感的场景下,可以考虑先筛选出可能存在差异的子集,或者使用Numpy进行更底层的数组操作。然而,对于大多数常见的数据集,compare()提供了非常便捷且高效的解决方案。NaN与None: 在Pandas中,None在数值列中通常会被转换为NaN。因此,本教程中处理NaN的方法同样适用于包含None的数值列。

以上就是比较带有浮点数和NaN的DataFrame列:处理精度与缺失值的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1376691.html

赞 (0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
Python实现文本文件内容按行分组:高效处理数据块的教程
上一篇 2025年12月14日 16:07:07
掌握从HTTP响应中导出和处理Excel文件的方法
下一篇 2025年12月14日 16:07:23

相关推荐

  • VSCode管理FPGA约束文件(高效编辑方法,时序约束指南)

    使用vscode高效编辑fpga约束文件的方法包括:1. 安装“better comments”和“bracket pair colorizer”等插件以提升可读性和编辑效率;2. 利用代码片段功能创建常用约束模板,如时钟和i/o约束,通过关键词快速插入以减少重复输入和错误;3. 使用支持正则表达式…

    2026年9月23日
    000
  • 如何在Krita中使用AI裁剪图片?快速掌握高效图像裁剪技巧

    如何在Krita中使用AI裁剪图片?快速掌握高效图像裁剪技巧如何在Krita中使用AI裁剪图片?快速掌握高效图像裁剪技巧如何在Krita中使用AI裁剪图片?快速掌握高效图像裁剪技巧如何在Krita中使用AI裁剪图片?快速掌握高效图像裁剪技巧

    Krita虽无内置AI裁剪功能,但可通过其构图辅助线、选区与变换工具实现“智能”裁剪,并结合外部AI工具完成内容扩展与智能构图,形成高效工作流。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ Krita本身,作为一款强大的开源数字绘画与图像…

    2026年9月23日 • 用户投稿
    200
  • 在Loom中利用虚拟线程实现递归任务:告别ForkJoinPool的限制

    本文探讨了Java Loom中RecursiveAction和RecursiveTask与虚拟线程的兼容性。由于它们设计上依赖于ForkJoinPool及其特定的工作线程,无法直接与虚拟线程配合使用。文章提供了两种替代方案:一是利用CompletableFuture结合虚拟线程工厂实现自定义递归任务…

    2026年9月23日
    500
  • 微信小店铺首页怎么设置?微信店铺怎么开通

    随着线上商业的发展,越来越多的商家开始借助微信小店铺拓展销售渠道。一个结构清晰、视觉吸引人的首页不仅能提升用户购物体验,还能有效提高成交转化率。本文将详细介绍如何优化设置微信小店铺首页,帮助您打造高效的线上销售入口。 一、首页设计与风格布局 1. 简洁直观 在进行首页设计时,应坚持简洁直观的原则,避…

    2026年9月23日
    100
  • win10提示“由你的组织管理”怎么办_win10组织管理提示解除教程

    首先断开工作或学校账户,再将网络ID改为家庭模式,接着用命令行清除组策略和注册表项,最后手动删除特定注册表路径中的管理策略项并重启电脑。 如果您在使用Windows 10时发现系统设置中出现“由你的组织管理”的提示,这通常意味着某些策略正在控制您的设备设置,导致部分功能受限。以下是解除该管理状态的多…

    2026年9月23日
    000
  • 如何使用TensorFlowLite训练AI大模型?移动端模型优化的教程

    如何使用TensorFlowLite训练AI大模型?移动端模型优化的教程如何使用TensorFlowLite训练AI大模型?移动端模型优化的教程如何使用TensorFlowLite训练AI大模型?移动端模型优化的教程如何使用TensorFlowLite训练AI大模型?移动端模型优化的教程

    TensorFlow Lite通过模型转换、量化、剪枝等优化手段,将训练好的大模型压缩并加速,使其能在移动端高效推理。首先在服务器端训练模型,随后用TFLiteConverter转为.tflite格式,结合量化(如Float16或全整数量化)、量化感知训练、剪枝和聚类等技术减小模型体积、提升运行速度…

    2026年9月23日 • 用户投稿
    000
  • ​​VSCode的超级生产力指南!这些快捷键让你的编码速度起飞​​

    VSCode的快捷键能显著提升编码效率,掌握核心快捷键如Ctrl/Cmd + P快速打开文件、Ctrl/Cmd + Shift + P调出命令面板、Ctrl/Cmd + D选择下一个匹配项、Alt/Option + Click多光标编辑、Ctrl/Cmd + Shift + L选择所有匹配项、F2重…

    2026年9月23日
    100
  • 如何在mysql中调试触发器逻辑错误

    答案是使用日志表、手动验证逻辑、SIGNAL报错和检查触发器顺序可调试MySQL触发器。通过创建trigger_log表记录执行信息,将触发器逻辑在客户端分步测试,利用SIGNAL主动抛出异常,并用SHOW TRIGGERS检查多触发器冲突,系统化暴露问题。 在 MySQL 中调试触发器逻辑错误没有…

    2026年9月23日
    000
  • mysql怎么修改索引 mysql索引创建与更新操作教程

    mysql怎么修改索引 mysql索引创建与更新操作教程mysql怎么修改索引 mysql索引创建与更新操作教程mysql怎么修改索引 mysql索引创建与更新操作教程mysql怎么修改索引 mysql索引创建与更新操作教程

    mysql中修改索引的正确方法是删除旧索引并创建新索引,因为mysql不支持直接修改索引结构;1. 创建索引可通过create index或alter table add index实现,用于加速数据检索;2. 删除索引使用drop index或alter table drop index,操作前需…

    2026年9月23日 • 用户投稿
    200
  • VSCode如何管理技术债务 VSCode代码质量跟踪的实用方法

    eslint、pylint等linter类扩展可实时识别代码问题,从源头减少技术债务;2. sonarlint能集成sonarqube规则,深度检测代码异味并提供修复建议;3. code metrics可量化函数圈复杂度等指标,帮助定位高风险代码;4. todo tree将todo、fixme等注释…

    2026年9月23日
    000
  • 失易得苹果恢复如何恢复照片

    失易得苹果恢复是一款专为苹果设备打造的数据恢复工具,能够有效帮助用户找回因多种原因丢失的照片。无论是误删照片、系统崩溃造成的数据丢失,还是设备找回后需要恢复内容,这款软件都能提供有力支持。 操作过程简单便捷。首先,在电脑上下载并安装失易得苹果恢复软件。安装完成后,使用数据线将iPhone或iPad连…

    2026年9月23日
    200
  • win11无法将网络位置从公用更改为专用怎么办_win11网络位置从公用改专用修复方法

    首先通过设置应用尝试更改网络配置文件类型,若失败则依次采用本地安全策略编辑器、重置网络配置文件或PowerShell命令行方式解决,确保网络从公用更改为专用。 如果您尝试在Windows 11中更改网络位置类型,但发现无法将网络从公用更改为专用,则可能是由于系统策略、网络配置文件异常或用户权限问题导…

    2026年9月23日
    100
  • ClipStudioPaint的AI混合工具怎么操作?优化漫画创作的步骤

    AI混合工具是高效上色助手而非替代者,通过高质量线稿与色彩提示,快速生成基础颜色,显著提升漫画上色效率;其局限在于缺乏艺术理解与复杂光影处理能力,需人工精修光影、材质与色彩情绪,结合分层调整与选区工具优化,实现从自动化底稿到艺术化成品的转化。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免…

    2026年9月23日
    000
  • win10麦克风没有声音怎么办_win10麦克风无声排查与修复

    首先检查麦克风隐私权限是否开启,确认应用及桌面应用允许访问麦克风;接着在声音设置中将麦克风设为默认输入设备,并通过声音控制面板测试输入电平与侦听功能;若问题仍存,更新或重新安装音频驱动程序;最后运行Windows音频疑难解答工具自动修复问题。 如果您在使用语音通话或录音功能时发现麦克风没有输入声音,…

    2026年9月23日
    000
  • mysql安装后怎么可视化 mysql图形界面工具安装使用

    mysql安装后怎么可视化 mysql图形界面工具安装使用mysql安装后怎么可视化 mysql图形界面工具安装使用mysql安装后怎么可视化 mysql图形界面工具安装使用mysql安装后怎么可视化 mysql图形界面工具安装使用

    要更方便地操作 mysql 数据库,推荐使用图形界面工具。常见的有:1. mysql workbench(官方工具,功能全面)2. navicat for mysql(商业软件,界面简洁,功能丰富)3. dbeaver(开源免费,跨平台支持)4. phpmyadmin(基于 web,适合 php 环…

    2026年9月23日 • 用户投稿
    300
  • UC浏览器如何批量下载网页图片_UC浏览器批量下载网页图片教程

    首先使用UC浏览器内置图片嗅探功能可批量下载网页图片,页面加载后点击“图片”标签,系统扫描并高亮图片,全选或手动勾选后点击下载即可保存至相册。 如果您在浏览网页时需要保存多张图片,但手动逐一下载效率较低,则可以借助UC浏览器的批量下载功能来快速获取所需图片。以下是实现该操作的具体方法: 本文运行环境…

    2026年9月23日
    000
  • 如何在mysql中备份和恢复视图

    备份视图需导出其CREATE VIEW语句,可使用mysqldump、SHOW CREATE VIEW或批量查询INFORMATION_SCHEMA.VIEWS;恢复时确保基础表存在并执行原创建语句,注意依赖关系、结构一致性和权限设置。 在 MySQL 中,视图本身不存储数据,它是一个基于 SQL …

    2026年9月23日
    1000
  • win10电脑亮度无法保存怎么办_win10亮度设置无法保存解决方法

    首先通过组策略锁定亮度,其次检查注册表亮度接口设置,接着更新或回滚%ignore_a_1%驱动,最后关闭电源计划中的自适应亮度功能以确保亮度设置生效。 如果您在调整Win10电脑的屏幕亮度后,发现设置无法保存,重启或唤醒设备后又恢复到之前的亮度水平,这可能是由于系统策略、驱动程序或电源管理设置冲突导…

    2026年9月23日
    200
  • 华为畅享系列微信收款语音怎么设置?教你配置语音播报步骤

    答案:华为畅享系列设置微信收款语音播报需更新微信、开启收款助手与通知权限、在“收款小账本”开启语音提醒并授权麦克风,确保非静音状态;若无播报,检查设置、权限、音量或兼容性问题;不支持自定义播报内容;耗电极低可忽略。 华为畅享系列手机设置微信收款语音播报,简单来说,就是让手机在收到微信支付时,自动用语…

    2026年9月23日
    300
  • 为什么macOS系统被认为比Windows更少受到病毒和恶意软件的困扰?

    macOS受病毒困扰较少因用户基数小、系统架构安全、生态封闭及用户习惯好,但威胁正随市场份额增长而增加。 macOS系统相对较少受到病毒和恶意软件的困扰,这背后有多重因素共同作用,并非单一原因。虽然近年来针对Mac的威胁确实在增加,但整体感染率仍低于Windows平台。 用户基数与攻击目标 黑客开发…

    2026年9月23日
    800

发表回复

登录后才能评论
关注微信