Pandas DataFrame行求和:解决混合数据类型导致0值结果的问题

Pandas DataFrame行求和:解决混合数据类型导致0值结果的问题

本教程旨在解决pandas dataframe在对包含混合数据类型的行进行求和时,numeric_only=true参数失效并返回0值的问题。核心解决方案是利用pd.to_numeric函数的errors=’coerce’参数,将非数值型数据安全转换为nan,然后再进行行求和,从而确保准确计算。文章还将演示如何将总秒数转换为可读的时间格式。

在数据分析实践中,我们经常需要对Pandas DataFrame的行进行数值求和。然而,当DataFrame中包含混合数据类型(例如,数字以字符串形式存储,或存在非数字文本、列表等)时,直接使用df.sum(axis=1, numeric_only=True)可能无法得到预期的结果,甚至会返回一列0.0。本教程将深入探讨这个问题的原因,并提供一个健壮的解决方案。

理解 numeric_only=True 的局限性

pandas.DataFrame.sum() 方法提供了一个 numeric_only=True 参数,旨在只对DataFrame中的数值列进行求和。然而,其工作机制可能与直觉有所不同。当一个列被指定为 numeric_only=True 时,Pandas会检查该列的整体数据类型(dtype)。如果该列中包含任何非数值型数据(即使大部分是数字,但有一两个字符串或列表),Pandas会认为该整列是非数值列,并将其排除在求和计算之外。

例如,如果一个日期列中包含了像 ‘29160’ (字符串形式的数字) 和 ‘No hours logged’ (非数字字符串) 这样的混合值,Pandas会将整个列识别为 object 类型,并因 numeric_only=True 而将其跳过。如果所有需要求和的列都存在这种情况,那么最终的行求和结果将是对一个空集合求和,默认返回0.0。

解决方案:使用 pd.to_numeric 进行预处理

要正确地对包含混合数据类型的行进行求和,我们需要在求和之前,将所有潜在的数值型数据统一转换为真正的数值类型。pandas.to_numeric() 函数是完成此任务的理想工具,尤其是结合 errors=’coerce’ 参数。

pd.to_numeric(series, errors=’coerce’) 会尝试将Series中的每个元素转换为数值类型。如果转换成功,它将返回对应的数值;如果转换失败(例如,遇到 ‘No hours logged’ 或 [10:02, Odd number: missing entry] 这样的非数字字符串),errors=’coerce’ 参数将把这些无效值替换为 NaN (Not a Number)。NaN 值在进行求和时会被自动忽略,从而确保求和的准确性。

示例数据准备

首先,我们准备一个示例DataFrame,它模拟了实际数据中可能出现的混合数据类型情况。

import pandas as pdimport numpy as np # 用于可能的NaN操作data = {    'id': {0: 514, 1: 2414, 2: 3225, 3: 3434, 4: 3864, 5: 4716, 6: 5793},    'name': {0: 'alexis', 1: 'donald', 2: 'mackenzie', 3: 'louisa', 4: 'olga', 5: 'rick', 6: 'roberta'},    '2023-11-28': {0: 'No hours logged', 1: '29160', 2: '28500', 3: '25380', 4: '15600', 5: '30180', 6: '29220'},    '2023-11-29': {0: 'No hours logged', 1: '29160', 2: '28620', 3: '18840', 4: '19080', 5: '28800', 6: '29220'},    '2023-11-30': {0: 'No hours logged', 1: '28860', 2: '28560', 3: '26040', 4: '14400', 5: '28740', 6: '29460'},    '2023-12-01': {0: 'No hours logged', 1: '28620', 2: '28620', 3: 'No hours logged', 4: '13800', 5: '28620', 6: '29280'},    '2023-12-02': {0: 'No hours logged', 1: '[10:02, Odd number: missing entry]', 2: '28980', 3: '25560', 4: '5220', 5: '28680', 6: '29340'},    '2023-12-03': {0: 'No hours logged', 1: 'No hours logged', 2: 'No hours logged', 3: 'No hours logged', 4: '17820', 5: 'No hours logged', 6: 'No hours logged'},    '2023-12-04': {0: 'No hours logged', 1: 'No hours logged', 2: 'No hours logged', 3: 'No hours logged', 4: 'No hours logged', 5: 'No hours logged', 6: 'No hours logged'},    '2023-12-05': {0: 'No hours logged', 1: '28860', 2: '28740', 3: '24900', 4: '14400', 5: '28680', 6: '29040'},}df = pd.DataFrame(data)print("原始DataFrame:")print(df)

执行精确的行求和

接下来,我们将使用 pd.to_numeric 结合 apply 方法对选定的日期列进行预处理,然后进行行求和。

# 注意:'id'是索引为0的列,'name'是索引为1的列。# 我们需要从索引为2的列(即第一个日期列)开始选择。# 使用 .iloc[:, 2:] 选择从第三列到最后一列的所有数据。# 对选定列的每一列应用 pd.to_numeric,将非数字值转换为 NaN。# 最后,对转换后的DataFrame按行求和 (axis=1)。df['total_hours'] = (    df.iloc[:, 2:]      .apply(lambda x: pd.to_numeric(x, errors='coerce'))      .sum(axis=1))print("n添加'total_hours'列后的DataFrame(仅显示相关列):")print(df[['id', 'name', 'total_hours']])

运行上述代码,您会看到 total_hours 列现在包含了每行实际的工时总和(以秒为单位),而不是0.0。例如,对于 donald 这一行,所有有效的秒数都被正确地加总。

格式化总工时为可读时间

原始问题提到希望将总秒数转换为 HH:MM 格式。Pandas的 pd.to_timedelta() 函数可以非常方便地完成这个任务,它将秒数转换为 timedelta 对象,可以直接表示为天、小时、分钟和秒。

# 将total_hours(秒)转换为timedelta对象df['total_hours_formatted'] = pd.to_timedelta(df['total_hours'], unit='s')print("n格式化后的总工时:")print(df[['id', 'name', 'total_hours', 'total_hours_formatted']])

通过 pd.to_timedelta(df[‘total_hours’], unit=’s’),我们得到了一个更易读的时间格式,例如 1 days 16:11:00,这比原始的秒数更加直观。

注意事项与总结

数据类型检查: 在进行任何数值计算之前,始终建议检查相关列的数据类型 (df.dtypes)。这有助于识别潜在的混合数据类型问题。errors=’coerce’ 的重要性: 当处理可能含有非数值字符串的列时,errors=’coerce’ 是将数据清洗为可计算形式的关键。它能优雅地处理无效数据,避免程序崩溃。精确的列选择: 使用 iloc 或明确的列名列表来确保只对目标列进行操作,避免包含不需要的非数值列(如 id 或 name)。pd.to_timedelta 的应用: 对于时间相关的数值求和,这是一个非常有用的后续处理步骤,能显著提高数据可读性。性能考量: 对于非常大的DataFrame,apply 函数可能会比矢量化操作慢。但在大多数情况下,对于行级别的转换和求和,它的可读性和灵活性使其成为一个很好的选择。

通过上述方法,您可以有效地处理Pandas DataFrame中混合数据类型的行求和问题,确保计算的准确性,并将结果以更友好的格式呈现。

以上就是Pandas DataFrame行求和:解决混合数据类型导致0值结果的问题的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1381522.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
解决Polars动态API注册与Python类型检查器的兼容性问题
上一篇 2025年12月14日 23:01:48
异步协程中控制流与资源锁的精细化管理
下一篇 2025年12月14日 23:02:07

相关推荐

  • 实现PHP多线程的并发测试_通过测试优化php多线程怎么实现的性能

    PHP虽不原生支持多线程,但可通过pthreads扩展实现真正多线程,适用于ZTS版PHP,适合I/O密集或CPU密集任务;更常用的是curl_multi方式,兼容性好,可高效并发处理HTTP请求,显著提升性能;此外ReactPHP提供异步事件驱动模型,资源占用低,适合高并发非阻塞场景;结合Swoo…

    2026年9月24日
    700
  • ​​VSCode的进阶玩法!这些快捷键组合让你秒变编程大神​​

    要高效利用vscode进行代码导航,1. 使用ctrl + p / cmd + p快速打开文件;2. 使用ctrl + shift + o / cmd + shift + o定位文件中的符号;3. 使用ctrl + – / cmd + -后退,ctrl + shift + –…

    2026年9月24日
    700
  • AI PC 新晋狠角色:5000 元价位 Arrow Lake 最优解 惠普战 66 2025 争当全能卷王

    AI PC 新晋狠角色:5000 元价位 Arrow Lake 最优解 惠普战 66 2025 争当全能卷王AI PC 新晋狠角色:5000 元价位 Arrow Lake 最优解 惠普战 66 2025 争当全能卷王AI PC 新晋狠角色:5000 元价位 Arrow Lake 最优解 惠普战 66 2025 争当全能卷王AI PC 新晋狠角色:5000 元价位 Arrow Lake 最优解 惠普战 66 2025 争当全能卷王

    在 5000 元级别的主流商务本市场,长久以来似乎都遵循着一套 ” 潜规则 “:追求性能就得牺牲便携,看重耐用又往往在外观和屏幕上妥协,想要全面的接口以及优质的售后服务,预算就得一加再加。但现在,一个 ” 新晋狠角色 ” 决意打破这一局面。 惠普商用产…

    2026年9月24日 用户投稿
    000
  • mac怎么使用听写功能_mac听写输入开启方法

    首先启用高级听写功能,进入系统设置→键盘→听写,勾选“使用高级听写”并下载语言包;随后可设置快捷键(如双击Fn键)快速启动语音输入;在支持的应用中也可通过菜单栏“编辑→开始听写”直接调用;最后根据需要配置听写语言、自动纠正及连续听写选项以提升识别准确率。 如果您希望在Mac上通过语音输入文字以提高效…

    2026年9月24日
    200
  • WPS怎么办批量打印文件_WPS多文档批量打印与队列管理步骤

    使用WPS内置批量打印功能,通过工具→批量处理→批量打印添加文件并设置参数后一键打印;2. 在资源管理器中多选文件右键以WPS打开,再在文件菜单中选择打印所有文档;3. 通过控制面板的设备和打印机进入打印队列,可实时监控、暂停或取消任务,确保批量打印过程稳定可控。 如果您需要在短时间内处理多个WPS…

    2026年9月24日
    400
  • Intel OpenCAS缓存加速方案

    open cas 架构概览:数据从hdd盘读取后被复制到open cas的缓存中,后续的读取操作从内存中进行,从而提高读写效率。在write-through模式下,所有数据同步刷新到open cas的ssd和后端的hdd中。在write-back模式下,数据同步写入到open cas的ssd中,然后…

    2026年9月24日
    400
  • 使用MySQL命令行客户端进行交互式管理

    使用MySQL命令行客户端进行交互式管理使用MySQL命令行客户端进行交互式管理使用MySQL命令行客户端进行交互式管理使用MySQL命令行客户端进行交互式管理

    mysql命令行客户端的常用命令包括:1. 使用mysql -u 用户名 -p命令连接数据库;2. 执行show databases;查看所有数据库;3. 使用use 数据库名;选择数据库;4. 使用select * from 表名;查询数据;5. 使用insert into 表名 (列1, 列2)…

    2026年9月24日 用户投稿
    500
  • windows8如何取消开机密码_windows8取消开机密码的操作

    1、通过netplwiz取消密码验证并设置自动登录;2、在控制面板中更改密码为空实现无密码开机;3、使用命令提示符执行net user命令清除账户密码,三者均可实现Windows 8.1启动时跳过密码输入。 如果您希望在启动Windows 8系统时跳过手动输入密码的步骤,可以直接通过系统内置工具配置…

    2026年9月24日
    000
  • 手机qq浏览器阅读模式怎么退出_手机QQ浏览器退出阅读模式操作方法

    要退出手机QQ浏览器的阅读模式,首先点击页面顶部的“阅读模式已开启”按钮即可立即退出;若无明显开关,可刷新页面或长按刷新强制重新加载;也可通过右上角“更多”菜单选择“退出阅读模式”;为避免再次进入,可在设置中关闭“自动进入阅读模式”功能。 如果您在使用手机QQ浏览器时进入了阅读模式,但希望恢复到原始…

    2026年9月24日
    200
  • 老蛙首款大光圈定焦自动对焦镜头 老蛙 AF FF 200mm F2.0 C-Dreamer 镜头评测

    老蛙首款大光圈定焦自动对焦镜头 老蛙 AF FF 200mm F2.0 C-Dreamer 镜头评测老蛙首款大光圈定焦自动对焦镜头 老蛙 AF FF 200mm F2.0 C-Dreamer 镜头评测老蛙首款大光圈定焦自动对焦镜头 老蛙 AF FF 200mm F2.0 C-Dreamer 镜头评测老蛙首款大光圈定焦自动对焦镜头 老蛙 AF FF 200mm F2.0 C-Dreamer 镜头评测

    老蛙作为目前市场上国产镜头品牌之一,自从 2023 年底发布首款了 ff Ⅱ 10mm f2.8 c&d-dreamer 自动对焦镜头之后,今年又相继发布了不少亮眼的产品,比如超广角定焦镜头 ff ii 12mm f2.8、微距定焦镜头 ff 180mm f4.5 ca-dreamer ma…

    2026年9月24日 用户投稿
    200
  • 数据实时迁移同步工具 CloudCanal v5.2.0.0 发布,支持 SaaS 全托管

    cloudcanal 免费社区版 是 clougence 公司推出的一款全自研、可视化、自动化数据迁移同步工具,具备 结构迁移、数据迁移、数据同步、数据校验、数据订正 等功能,支持 60+ 款流行关系型数据库、实时数仓、消息中间件、缓存数据库和搜索引擎之间数据互通,其中包含国产数据库 oceanba…

    2026年9月24日
    000
  • VSCode如何实现AI代码反混淆 VSCode智能分析混淆代码的技巧

    vscode没有一键ai反混淆功能,但可通过智能扩展、调试器、ast查看器、代码格式化工具及外部ai工具集成来辅助分析和逐步还原混淆代码;2. 利用eslint、prettier等扩展提升代码可读性,通过“重命名符号”“转到定义”“查找引用”等功能追踪变量和函数流向,结合多光标编辑和代码片段进行手动…

    2026年9月24日
    100
  • Laravel 表单验证失败后保留输入值:最佳实践教程

    本文旨在帮助 Laravel 开发者解决表单验证失败后,如何保留用户已输入数据的问题。我们将深入探讨 withInput() 方法的使用,并提供清晰的代码示例,确保即使在验证失败的情况下,用户体验也能保持流畅。通过本文的学习,你将掌握在 Laravel 中优雅地处理表单验证,并提升应用的可用性。 在…

    2026年9月24日
    000
  • 小红书推广选择阅读量还是粉丝量?小红书怎么推广引流

    小红书作为融合内容、社交与电商的综合性平台,近年来吸引了大量创作者和品牌入驻。在进行推广时,很多人常常纠结:是更重视阅读量,还是更关注粉丝量?本文将从两者的定义出发,分析各自的优劣势,并提供实用建议,帮助你制定适合自己的推广策略。 一、阅读量与粉丝量的本质区别 1. 阅读量 阅读量代表的是某篇笔记或…

    2026年9月24日
    000
  • 如何通过日志排查权限问题

    排查权限问题需从日志入手,重点分析时间、用户、资源路径、拒绝原因及调用堆栈。首先检查应用日志中“用户无权访问”等提示,结合Web服务器日志中的403/401状态码定位请求异常;再查看操作系统日志如/var/log/secure中SSH或sudo拒绝记录,确认系统级权限问题;同时审查中间件如Sprin…

    2026年9月24日
    100
  • win10软件不兼容怎么办_win10软件兼容性处理方法

    首先使用兼容性疑难解答工具检测并修复问题,若无效则手动设置兼容模式为Windows 7或8,同时安装必要的Visual C++和.NET运行库,更新显卡等驱动程序,并尝试以管理员身份运行程序。 如果您尝试在Windows 10系统上运行某个软件,但出现“此应用无法在你的电脑上运行”或程序闪退等错误提…

    2026年9月24日
    000
  • 《明末:渊虚之羽》1.6更新奖励领不了?官方手把手教学来了!

    《明末:渊虚之羽》是一款类魂动作角色扮演游戏,故事发生在巴蜀之地,此时正值黑暗动荡的明末,战事四起,一场神秘的疫病催生了妖怪一般的生物。 今天早些时候我们曾报道,游戏官方发布了1.6版本更新公告,补丁大小约为5.3GB,其中包括豪华版专属内容、免费头饰和性能优化等内容。 官方表示,本次更新“豪华扩展…

    2026年9月24日
    100
  • VSCode如何配置.NET开发环境 VSCode搭建.NET项目的完整流程

    首先安装.net sdk并验证版本;2. 安装vscode及microsoft官方c#扩展,确保智能感知和调试功能正常;3. 通过dotnet new命令创建项目,并使用code .在vscode中打开项目;4. 添加构建和调试资产以生成tasks.json和launch.json文件;5. 安装n…

    2026年9月24日
    000
  • 大学论文怎么写?让AI工具助你一臂之力

    大学论文怎么写?让AI工具助你一臂之力大学论文怎么写?让AI工具助你一臂之力大学论文怎么写?让AI工具助你一臂之力大学论文怎么写?让AI工具助你一臂之力

    如果要选出大学学习过程中最令人头疼的事,写论文无疑能稳居榜首。从选题开题、内容撰写,到翻译润色、查重降重,每个步骤都耗时耗力,让人焦头烂额。然而,随着 ai 技术的发展,如今写论文这件事,已经可以借助智能工具变得更高效、更轻松。 开题太难?AI 来帮你破局! 论文的第一道难关就是开题。面对浩如烟海的…

    2026年9月24日 用户投稿
    100
  • Java Stream API:从嵌套集合中提取唯一值的两种高效方法

    本文详细介绍了如何利用Java Stream API中的flatMap()和mapMulti()操作,高效地从包含嵌套列表的复杂数据结构(如List中包含List)中提取并收集唯一的元素(如城市名称),替代传统的嵌套循环,提升代码的简洁性和可读性。 在java编程中,我们经常会遇到处理复杂数据结构的…

    2026年9月24日
    100

发表回复

登录后才能评论
关注微信