Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
Polars 中高效计算分组内时间序列差值_创想鸟

Polars 中高效计算分组内时间序列差值

polars 中高效计算分组内时间序列差值

本文将详细介绍如何使用 Polars 库高效地计算 Pandas DataFrame 中按唯一 ID 分组的时间序列差值。我们将探讨如何利用 Polars 强大的 over() 窗口函数,结合 diff() 和 dt.total_seconds(),为每个 ID 生成会话之间的时间间隔,并处理起始时间戳的空值问题,从而避免低效的 map 或 apply 操作,实现高性能的数据处理。

1. 背景与挑战

在数据分析任务中,我们经常需要处理时间序列数据,例如计算用户会话之间的时间间隔、订单处理时长等。当数据按某个标识符(如用户 ID)分组时,挑战在于如何高效地计算每个组内连续记录之间的时间差。传统的 Pandas groupby().apply() 方法在处理大数据集时可能效率低下。对于 Polars 而言,虽然 map_groups() 提供了一定的灵活性,但其性能通常不如原生表达式。

我们的目标是,给定一个包含 ID 和 Timestamp 列的 DataFrame,为每个 ID 计算一个新列 time_between_sessions,表示当前会话与上一个会话之间的时间间隔。

2. 准备数据

首先,我们创建一个示例 Pandas DataFrame,并将其转换为 Polars DataFrame。确保 Timestamp 列被正确解析为日期时间类型,这是进行时间计算的基础。

import polars as plimport pandas as pd# 创建一个示例 DataFramedata = {    'ID': ['A', 'A', 'A', 'B', 'B', 'B'],    'Timestamp': ['2023-01-01 10:00:00', '2023-01-01 10:30:00', '2023-01-01 11:00:00',                  '2023-01-01 12:00:00', '2023-01-01 12:30:00', '2023-01-01 13:00:00']}df_pandas = pd.DataFrame(data)# 将 Pandas DataFrame 转换为 Polars DataFramesessions_features = pl.from_pandas(df_pandas)# 确保 Timestamp 列是日期时间类型sessions_features = sessions_features.with_columns(   pl.col("Timestamp").str.to_datetime())print("原始 Polars DataFrame:")print(sessions_features)

输出:

原始 Polars DataFrame:shape: (6, 2)┌─────┬─────────────────────┐│ ID  ┆ Timestamp           ││ --- ┆ ---                 ││ str ┆ datetime[μs]        │╞═════╪═════════════════════╡│ A   ┆ 2023-01-01 10:00:00 ││ A   ┆ 2023-01-01 10:30:00 ││ A   ┆ 2023-01-01 11:00:00 ││ B   ┆ 2023-01-01 12:00:00 ││ B   ┆ 2023-01-01 12:30:00 ││ B   ┆ 2023-01-01 13:00:00 │└─────┴─────────────────────┘

3. 使用 pl.Expr.over() 高效计算时间差

Polars 提供了强大的表达式 API 和窗口函数,其中 pl.Expr.over() 是解决此类分组计算问题的理想选择。它允许我们在不显式使用 group_by() 的情况下,对指定分组(分区)执行聚合或转换操作。

核心思路是:

pl.col(“Timestamp”).diff(): 计算 Timestamp 列的差值。diff() 函数会返回当前行与上一行之间的差值。对于每个分组的第一行,diff() 的结果将是 null。.dt.total_seconds(): 将时间差(Duration 类型)转换为总秒数(整数或浮点数)。.fill_null(0): 将每个分组第一行产生的 null 值填充为 0,因为它们是该 ID 的第一个会话,没有“上一个会话”。.over(“ID”): 这是关键步骤,它告诉 Polars 在计算 diff() 之前,先根据 ID 列进行分区。这意味着 diff() 操作将在每个 ID 组内独立进行,而不是在整个 DataFrame 上。.alias(“time_between_sessions”): 为新生成的列指定一个有意义的名称。

以下是实现代码:

# 计算每个 ID 的会话之间的时间差sessions_features_with_time_diff = sessions_features.with_columns(  pl.col("Timestamp")    .diff()    .dt.total_seconds()    .fill_null(0)    .over("ID")    .alias("time_between_sessions"))print("n计算时间差后的 Polars DataFrame:")print(sessions_features_with_time_diff)

预期输出:

计算时间差后的 Polars DataFrame:shape: (6, 3)┌─────┬─────────────────────┬───────────────────────┐│ ID  ┆ Timestamp           ┆ time_between_sessions ││ --- ┆ ---                 ┆ ---                   ││ str ┆ datetime[μs]        ┆ i64                   │╞═════╪═════════════════════╪═══════════════════════╡│ A   ┆ 2023-01-01 10:00:00 ┆ 0                     ││ A   ┆ 2023-01-01 10:30:00 ┆ 1800                  ││ A   ┆ 2023-01-01 11:00:00 ┆ 1800                  ││ B   ┆ 2023-01-01 12:00:00 ┆ 0                     ││ B   ┆ 2023-01-01 12:30:00 ┆ 1800                  ││ B   ┆ 2023-01-01 13:00:00 ┆ 1800                  │└─────┴─────────────────────┴───────────────────────┘

从输出可以看出,对于 ID ‘A’ 和 ‘B’,它们各自的第一个会话的 time_between_sessions 值为 0,而后续会话的时间间隔则被正确计算为 1800 秒(30 分钟)。

4. 注意事项与最佳实践

避免 map 或 apply 函数: 尽可能使用 Polars 的原生表达式 API,如 over()、group_by() 配合表达式,而不是 map_groups() 或 apply()。原生表达式经过高度优化,能够利用 Polars 的并行计算能力,从而在处理大数据集时提供卓越的性能。数据类型: 确保时间戳列为 Polars 的 Datetime 类型。如果数据源是字符串,需要使用 str.to_datetime() 进行转换。排序: diff() 操作依赖于行的顺序。在进行时间差计算之前,如果数据未按 ID 和 Timestamp 排序,应先使用 sort([“ID”, “Timestamp”]) 进行排序,以确保计算的正确性。本示例中,输入数据已是按 ID 和时间戳排序的。空值处理: diff() 必然会在每个分组的第一行产生 null 值。根据业务需求,可以使用 fill_null() 将其填充为 0 或其他有意义的值。

5. 总结

通过利用 Polars 的 pl.Expr.over() 窗口函数,我们可以优雅且高效地在每个分组内执行时间序列的差值计算。这种方法避免了传统循环或低效的 apply 操作,充分发挥了 Polars 的列式和并行处理优势,是处理大规模时间序列数据时的首选方案。掌握 over() 的使用,将极大提升你在 Polars 中进行复杂分组计算的能力。

以上就是Polars 中高效计算分组内时间序列差值的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1366988.html

赞 (0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
使用 collections.ChainMap 实现深度字典合并
上一篇 2025年12月14日 07:01:55
Python深度合并嵌套字典:扩展ChainMap的实战指南
下一篇 2025年12月14日 07:02:04

相关推荐

  • 京东商智品牌版流量、交易、商品数据下载体验升级,具体升级了哪些内容? 商家必看!京东商智数据下载大升级,时段对比+滞销预警功能上线!

    京东商智品牌版流量、交易、商品数据下载体验升级,具体升级了哪些内容? 商家必看!京东商智数据下载大升级,时段对比+滞销预警功能上线!京东商智品牌版流量、交易、商品数据下载体验升级,具体升级了哪些内容? 商家必看!京东商智数据下载大升级,时段对比+滞销预警功能上线!京东商智品牌版流量、交易、商品数据下载体验升级,具体升级了哪些内容? 商家必看!京东商智数据下载大升级,时段对比+滞销预警功能上线!京东商智品牌版流量、交易、商品数据下载体验升级,具体升级了哪些内容? 商家必看!京东商智数据下载大升级,时段对比+滞销预警功能上线!

    在数字化运营的新纪元,数据获取的精准度已成为影响商业决策的核心要素。2023年3月,京东商智品牌版正式启动对流量、交易与商品数据下载功能的全面优化升级,推出四级渠道细分维度、sku查询容量提升至100个、时间筛选更精细化等一系列关键更新,并同步完成54项服务权益的迭代升级,标志着电商平台数据分析服务…

    2026年9月25日 • 用户投稿
    600
  • 货拉拉司机版怎样设置自动抢单参数_货拉拉司机版自动抢单的配置优化方法

    货拉拉司机版怎样设置自动抢单参数_货拉拉司机版自动抢单的配置优化方法货拉拉司机版怎样设置自动抢单参数_货拉拉司机版自动抢单的配置优化方法货拉拉司机版怎样设置自动抢单参数_货拉拉司机版自动抢单的配置优化方法货拉拉司机版怎样设置自动抢单参数_货拉拉司机版自动抢单的配置优化方法

    开启自动抢单并设置合理接单范围、筛选目标订单类型、匹配出车时间段及启用顺路单优先功能,可显著提升货拉拉司机接单效率。 如果您希望在货拉拉司机版中提升接单效率,合理配置自动抢单参数是关键。系统默认设置可能无法满足高峰时段或特定区域的接单需求,因此需要根据实际运营情况调整相关选项。以下是优化自动抢单配置…

    2026年9月25日 • 用户投稿
    000
  • 小熊电器回应“养生壶爆炸致一岁孩童烫伤”:正在调查当中

    小熊电器回应“养生壶爆炸致一岁孩童烫伤”:正在调查当中小熊电器回应“养生壶爆炸致一岁孩童烫伤”:正在调查当中小熊电器回应“养生壶爆炸致一岁孩童烫伤”:正在调查当中小熊电器回应“养生壶爆炸致一岁孩童烫伤”:正在调查当中

    感谢网友 Snailwang 的线索投递! 9 月 28 日消息,9 月 27 日,一位济南网民称,当月 20 日家中使用的小熊电器玻璃养生壶突然发生爆裂,导致一名仅一岁的幼儿全身40%遭受大面积烫伤。目前该事件已引发广泛关注,小熊电器相关负责人向第一财经记者回应表示,“事件正在调查当中”。 针对此…

    2026年9月25日 • 用户投稿
    900
  • laravel和tp5的区别

    laravel和tp5的区别laravel和tp5的区别laravel和tp5的区别laravel和tp5的区别

    Laravel框架:     (推荐学习:laravel开发) Lavavel一直秉承着优雅的原则,很好的支持了composer,实现了更丰富的扩展,社区文档活跃,相较于TP,Lavavel更庞大,安全性也更高,更适合开发大中型项目,被称为“巨匠型开发框架”。 在Laravel中已经具有了一套高级的…

    2026年9月25日 • 用户投稿
    000
  • MySQL中ibd文件的作用和特点详解

    MySQL中ibd文件的作用和特点详解MySQL中ibd文件的作用和特点详解MySQL中ibd文件的作用和特点详解MySQL中ibd文件的作用和特点详解

    MySQL中ibd文件的作用和特点详解 在MySQL数据库中,每个InnoDB表都对应一个.ibd文件,这个文件是InnoDB存储引擎用来存储表的数据和索引的地方。ibd文件是InnoDB表空间的一部分,它和.ibdata文件一起组成了InnoDB的表空间。 作用: 存储表的数据和索引:ibd文件是…

    2026年9月25日 • 用户投稿
    100
  • TPM 2.0芯片除了加密还有哪些实用功能?

    TPM 2.0芯片除了加密还有哪些实用功能?TPM 2.0芯片除了加密还有哪些实用功能?TPM 2.0芯片除了加密还有哪些实用功能?TPM 2.0芯片除了加密还有哪些实用功能?

    TPM 2.0不仅是加密工具,更是硬件级安全基石,通过构建信任链确保系统启动完整性,支持安全启动、设备健康证明、凭据保护及远程认证,广泛应用于企业零信任架构、虚拟化安全与身份验证(如Windows Hello、FIDO2),实现从固件到操作系统的全流程防护。 TPM 2.0芯片远不止是加密的工具,它…

    2026年9月25日 • 用户投稿
    000
  • Java字符串高级解析:使用正则表达式处理复杂指令模式

    Java字符串高级解析:使用正则表达式处理复杂指令模式Java字符串高级解析:使用正则表达式处理复杂指令模式Java字符串高级解析:使用正则表达式处理复杂指令模式Java字符串高级解析:使用正则表达式处理复杂指令模式

    本教程演示如何使用Java的java.util.regex包,通过正则表达式高效解析包含多条调音指令的复杂字符串。我们将学习构建匹配特定模式的正则表达式,并利用Pattern和Matcher类从输入字符串中准确提取乐器名称、调音方向和数值,从而将原始指令转换为清晰可读的输出格式。 1. 问题背景与挑…

    2026年9月25日 • 用户投稿
    000
  • Debian Nginx日志路径在哪里

    Debian Nginx日志路径在哪里Debian Nginx日志路径在哪里Debian Nginx日志路径在哪里Debian Nginx日志路径在哪里

    Debian系统中,Nginx的访问日志和错误日志默认存储位置如下: 访问日志 (access log): /var/log/nginx/access.log错误日志 (error log): /var/log/nginx/error.log 以上路径是标准Debian Nginx安装的默认配置。如…

    2026年9月25日 • 用户投稿
    100
  • 3D漫画在线阅读漫画入口 3D漫画免费漫画正版漫画在线浏览

    3D漫画在线阅读漫画入口 3D漫画免费漫画正版漫画在线浏览3D漫画在线阅读漫画入口 3D漫画免费漫画正版漫画在线浏览3D漫画在线阅读漫画入口 3D漫画免费漫画正版漫画在线浏览3D漫画在线阅读漫画入口 3D漫画免费漫画正版漫画在线浏览

    3D漫画在线阅读入口是https://www.3dmanhua.com/,该平台资源丰富、更新及时,提供高清流畅的阅读体验和简洁易用的操作界面,并支持个性化推荐、书架管理及夜间模式等贴心功能。 3D漫画在线阅读入口在哪里?这是不少网友都关注的,接下来由PHP小编为大家带来3D漫画在线阅读浏览地址,喜…

    2026年9月25日 • 用户投稿
    100
  • sublime如何同步多台电脑的配置和插件 _sublime多设备配置同步方法

    sublime如何同步多台电脑的配置和插件 _sublime多设备配置同步方法sublime如何同步多台电脑的配置和插件 _sublime多设备配置同步方法sublime如何同步多台电脑的配置和插件 _sublime多设备配置同步方法sublime如何同步多台电脑的配置和插件 _sublime多设备配置同步方法

    通过管理Sublime Text配置目录并结合云盘或Git实现多设备同步。将Packages目录移至云盘并创建符号链接,或用Git版本化关键配置文件,配合Package Control自动恢复插件,确保各设备设置一致。 Sublime Text 是许多开发者喜爱的轻量级编辑器,跨设备使用时保持配置和…

    2026年9月25日 • 用户投稿
    000
  • 操作系统的分类和发展

    操作系统的分类和发展操作系统的分类和发展操作系统的分类和发展操作系统的分类和发展

    知识概览 文章目录知识概览操作系统的分类和发展 手工操作阶段批处理阶段——单道批处理系统批处理阶段——多道批处理系统分时操作系统实时操作系统其他几种操作系统 知识回顾与重要考点 操作系统的分类和发展 如此AI写作 AI驱动的内容营销平台,提供一站式的AI智能写作、管理和分发数字化工具。 137 查看…

    2026年9月25日 • 用户投稿
    000
  • DNF手游:首批“75级武器”曝光,自带四属性攻击

    DNF手游:首批“75级武器”曝光,自带四属性攻击DNF手游:首批“75级武器”曝光,自带四属性攻击DNF手游:首批“75级武器”曝光,自带四属性攻击DNF手游:首批“75级武器”曝光,自带四属性攻击

    从策划在前期见面会透露的信息以及玩家“十四”爆料的内容来看,九月份DNF手游上线安图恩团本基本上已经是板上钉钉的事了,大概率会和金秋礼包同步更新。而安图恩团本的开启,势必会对游戏环境造成巨大冲击,首当其冲的就是玩家们即将迎来新一轮的武器毕业更替。 作为地下城系列最具代表性的团队副本之一,安图恩产出的…

    2026年9月25日 • 用户投稿
    000
  • MySQL连接数设置技巧与注意事项

    MySQL连接数设置技巧与注意事项MySQL连接数设置技巧与注意事项MySQL连接数设置技巧与注意事项MySQL连接数设置技巧与注意事项

    MySQL连接数设置技巧与注意事项 MySQL是一种常用的关系型数据库管理系统,在实际应用中,对于MySQL连接数的设置要特别注意,以确保系统的稳定性和性能。本文将介绍关于MySQL连接数设置的技巧和注意事项,并提供具体的代码示例供参考。 1. 连接数的概念 在MySQL中,连接数指的是同时连接到数…

    2026年9月25日 • 用户投稿
    000
  • laravel和thinkphp路由区别

    laravel和thinkphp路由区别laravel和thinkphp路由区别laravel和thinkphp路由区别laravel和thinkphp路由区别

    laravel路由有如下这些功能: 基本路由路由重定向 视图路由路由参数必填参数 可选参数 正则表达式约束命名路由路由组中间件 命名空间 子域名路由 路由前缀 路由命名前缀路由模型绑定隐式绑定 显式绑定频率限制表单方法伪造访问当前路由  (推荐学习:laravel开发) 所有 Laravel 路由都…

    2026年9月25日 • 用户投稿
    000
  • 360极速浏览器怎么关闭热搜和新闻弹窗_360极速浏览器屏蔽热点资讯与弹窗教程

    360极速浏览器怎么关闭热搜和新闻弹窗_360极速浏览器屏蔽热点资讯与弹窗教程360极速浏览器怎么关闭热搜和新闻弹窗_360极速浏览器屏蔽热点资讯与弹窗教程360极速浏览器怎么关闭热搜和新闻弹窗_360极速浏览器屏蔽热点资讯与弹窗教程360极速浏览器怎么关闭热搜和新闻弹窗_360极速浏览器屏蔽热点资讯与弹窗教程

    关闭360极速浏览器热搜和新闻弹窗需三步操作:一、在“设置-实验室-其他设置”中关闭“启用‘360热点资讯’功能”;二、在“隐私设置-网站设置-弹出式窗口”中开启阻止;三、手动点击弹窗上的“不再弹出”选项。 如果您在使用360极速浏览器时频繁遭遇热搜和新闻弹窗干扰,影响正常浏览体验,这通常是因为浏览…

    2026年9月25日 • 用户投稿
    000
  • 怎么用豆包AI帮我优化NumPy运算 3个技巧让AI加速科学计算

    怎么用豆包AI帮我优化NumPy运算 3个技巧让AI加速科学计算怎么用豆包AI帮我优化NumPy运算 3个技巧让AI加速科学计算怎么用豆包AI帮我优化NumPy运算 3个技巧让AI加速科学计算怎么用豆包AI帮我优化NumPy运算 3个技巧让AI加速科学计算

    豆包ai可通过三个技巧优化numpy计算效率。1. 描述逻辑让ai生成高效向量化表达式,如用np.mean(arr * (arr > 0), axis=1)替代循环求每行正数均值;2. 提供现有代码让ai分析瓶颈并提出优化建议,如将显式循环改为np.where(np.sum(arr, axis…

    2026年9月25日 • 用户投稿
    000
  • 微星MPG Z790 EDGE TI WIFI主板测试 14+1+1相供电

    微星MPG Z790 EDGE TI WIFI主板测试 14+1+1相供电微星MPG Z790 EDGE TI WIFI主板测试 14+1+1相供电微星MPG Z790 EDGE TI WIFI主板测试 14+1+1相供电微星MPG Z790 EDGE TI WIFI主板测试 14+1+1相供电

    微星mpg z790 edge ti wifi主板在极限负载下表现稳定,其14+1+1相供电设计为高性能处理器提供充足电力支持。1. 在极限负载测试中,如cinebench r23和prime95烤机,主板能持续为i9-13900k提供稳定电流,vrm温度控制出色,未出现降频。2. 日常高负载游戏如…

    2026年9月25日 • 用户投稿
    000
  • sublime如何卸载插件 _sublime插件卸载教程

    sublime如何卸载插件 _sublime插件卸载教程sublime如何卸载插件 _sublime插件卸载教程sublime如何卸载插件 _sublime插件卸载教程sublime如何卸载插件 _sublime插件卸载教程

    通过Package Control卸载:打开Sublime Text,调出命令面板,输入Remove Package,选择插件并删除;2. 手动删除:关闭软件后进入Packages目录,删除对应插件文件夹;3. 注意清理User目录下的残留配置文件,避免冗余。操作安全,不影响主程序。 在 Subli…

    2026年9月25日 • 用户投稿
    000
  • vivo Z5处理器是什么型号

    vivo Z5处理器是什么型号vivo Z5处理器是什么型号vivo Z5处理器是什么型号vivo Z5处理器是什么型号

    vivo Z5 搭载高通骁龙 712 处理器,其规格包括:1)64 位,8 核;2)主频高达 2.3GHz;3)GPU:Adreno 616;4)10nm 制造工艺;5)平衡高性能和能效;6)支持快速充电和有效的散热;7)增强的人工智能和游戏体验。 vivo Z5搭载的处理器型号 vivo Z5搭载…

    2026年9月25日 • 用户投稿
    000
  • GPU显存带宽如何影响4K纹理加载速度?

    显存带宽不足会严重制约4K纹理数据在显存与GPU核心间的传输速度,导致帧率下降、纹理pop-in、画面模糊等问题。4K纹理数据量庞大,现代渲染需频繁采样多张高分辨率贴图,叠加Mipmap切换和复杂着色器操作,使GPU对显存带宽需求激增。带宽不足时,数据流转不畅,渲染管线停滞,直接影响流畅度。此外,显…

    2026年9月25日
    000

发表回复

登录后才能评论
关注微信