Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
Pandas中基于时间窗口关联和聚合数据的技巧:以交易与浏览记录为例_创想鸟

Pandas中基于时间窗口关联和聚合数据的技巧:以交易与浏览记录为例

Pandas中基于时间窗口关联和聚合数据的技巧:以交易与浏览记录为例

本文详细介绍了如何在Pandas中,从两个DataFrame(如交易记录和浏览历史)中,高效地识别并聚合出在特定时间窗口(例如交易前7天)内相关联的数据。教程提供了两种实现方法:一种是利用pyjanitor库的conditional_join函数进行性能优化,另一种是纯Pandas的merge结合条件筛选,并最终通过groupby.agg完成数据聚合,旨在帮助用户处理复杂的时序数据关联需求。

1. 问题描述与数据准备

在数据分析中,我们经常需要根据时间范围将两个数据集关联起来。一个常见的场景是,我们有两个dataframe:一个记录了用户的交易信息,另一个记录了用户的浏览历史。我们的目标是为每笔交易找出其发生前7天内的所有相关浏览记录,并聚合这些记录的日期和值。这里的“相关”意味着交易和浏览记录必须属于同一个用户(person)和同一个商品代码(code)。

考虑以下两个示例DataFrame:

交易记录 (trade)

import pandas as pdimport janitor # 导入 janitor 库trade = pd.DataFrame({'date': ['2019-08-31', '2019-09-01', '2019-09-04'],                      'person': [1, 1,  2],                      'code': [123, 123, 456],                      'value1': [1, 2, 3]})

浏览历史 (view)

view = pd.DataFrame({'date': ['2019-08-29', '2019-08-29', '2019-08-30', '2019-08-31', '2019-09-01',   '2019-09-01', '2019-09-01', '2019-09-02', '2019-09-03'],                      'person': [1, 1, 1, 2, 1, 2, 2, 1, 2],                      'code': [123, 456, 123, 456, 123, 123, 456, 123, 456],                      'value': [1, 2, 3, 4, 5, 6, 7, 8, 9]                    })

在进行时间相关的操作之前,将日期列转换为Pandas的datetime类型是至关重要的。

trade['date'] = pd.to_datetime(trade['date'])view['date'] = pd.to_datetime(view['date'])

我们期望的输出结果是,在原始交易信息的基础上,增加两列:view_dates和view_values,它们分别是以列表形式存储的、在每笔交易前7天内匹配到的浏览记录日期和值。

2. 传统 merge_asof 的局限性

Pandas的merge_asof函数常用于近似合并时序数据。然而,它主要设计用于“最近匹配”场景,通常每个右侧(right)DataFrame的条目最多只能匹配一次。在本例中,我们希望每个交易条目能够匹配到多个浏览历史条目,且这些浏览历史条目可以被不同的交易重复匹配。因此,merge_asof无法直接满足我们的需求。例如,如果使用merge_asof,它可能会将浏览记录[1, 3]分配给第一笔交易,但对于第二笔交易,它可能只会分配[5],而忽略了同样在7天窗口内的[1, 3]。

3. 方法一:使用 pyjanitor.conditional_join (推荐)

pyjanitor库提供了一个强大的conditional_join函数,它允许我们基于多个自定义条件进行DataFrame的连接,包括非等值条件(如时间范围)。这使得它非常适合处理此类复杂的时序数据关联问题,尤其是在处理大规模数据时,其效率通常高于纯Pandas的循环或笛卡尔积合并。

实现步骤

创建辅助列 start_date: 在trade DataFrame中添加一个start_date列,表示每笔交易发生日期前7天的日期。这将作为我们时间窗口的下限。执行 conditional_join: 使用conditional_join函数连接trade和view。时间条件: 确保view_dates在start_date和trade.date之间(即start_date 匹配条件: 确保person和code相等。重命名列: 在view DataFrame中,将date和value列重命名为view_dates和view_values,以避免与trade中的列名冲突,并明确其来源。清理和格式化: 删除不再需要的start_date辅助列,并将view_dates格式化为字符串。聚合结果: 根据原始trade DataFrame的列进行分组,然后将匹配到的view_dates和view_values聚合成列表。

示例代码

# 1. 创建辅助列 'start_date'# 2. 执行 conditional_join# 3. 清理和格式化# 4. 聚合结果out_janitor = (trade  .assign(start_date=lambda d: d['date'].sub(pd.DateOffset(days=7))) # 计算7天前的日期  .conditional_join(view.rename(columns={'date': 'view_dates', 'value': 'view_values'}), # 重命名view列                    ('start_date', 'view_dates', '<='), # 条件1: start_date ='),     # 条件2: trade.date >= view_dates                    ('person', 'person', '=='),       # 条件3: person 匹配                    ('code', 'code', '=='),           # 条件4: code 匹配                    right_columns=['view_dates', 'view_values'] # 保留右侧DataFrame的哪些列                   )  .drop(columns='start_date') # 删除辅助列  .assign(view_dates=lambda d: d['view_dates'].dt.strftime('%Y-%m-%d')) # 格式化日期为字符串  .groupby(list(trade), as_index=False).agg(list) # 按原始trade列分组并聚合列表)print("使用 pyjanitor.conditional_join 的结果:")print(out_janitor)

输出结果

        date  person  code  value1                            view_dates view_values0 2019-08-31       1   123       1              [2019-08-29, 2019-08-30]      [1, 3]1 2019-09-01       1   123       2  [2019-08-29, 2019-08-30, 2019-09-01]   [1, 3, 5]2 2019-09-04       2   456       3  [2019-08-31, 2019-09-01, 2019-09-03]   [4, 7, 9]

4. 方法二:纯 Pandas 解决方案

如果不想引入额外的库,也可以纯粹使用Pandas的merge和条件筛选来实现。这种方法在概念上更直观,但对于非常大的数据集,其性能可能不如pyjanitor.conditional_join,因为它首先会生成一个潜在的较大中间DataFrame(笛卡尔积或近似笛卡尔积)。

实现步骤

进行笛卡尔合并: 首先,基于person和code列对trade和view进行合并。这将为每个交易条目与每个匹配的浏览条目创建一个组合。应用时间条件筛选: 在合并后的DataFrame上,应用两个时间条件:浏览日期必须早于交易日期 (trade_date > view_dates)。浏览日期必须在交易日期前7天之内 (trade_date – 7_days 格式化和聚合: 同样,将view_dates格式化为字符串,然后按原始trade DataFrame的列进行分组,并聚合列表。

示例代码

# 1. 进行笛卡尔合并# 2. 应用时间条件筛选# 3. 格式化和聚合out_pandas = (trade .merge(view.rename(columns={'date': 'view_dates', 'value': 'view_values'}), # 重命名view列并合并        on=['person', 'code']) .loc[lambda d: d['date'].gt(d['view_dates']) & # 筛选条件1: 交易日期 > 浏览日期      d['date'].sub(pd.DateOffset(days=7)).le(d['view_dates']) # 筛选条件2: 交易日期 - 7天 <= 浏览日期     ] .assign(view_dates=lambda d: d['view_dates'].dt.strftime('%Y-%m-%d')) # 格式化日期为字符串 .groupby(list(trade), as_index=False).agg(list) # 按原始trade列分组并聚合列表)print("n使用纯 Pandas 解决方案的结果:")print(out_pandas)

输出结果

        date  person  code  value1                            view_dates view_values0 2019-08-31       1   123       1              [2019-08-29, 2019-08-30]      [1, 3]1 2019-09-01       1   123       2  [2019-08-29, 2019-08-30, 2019-09-01]   [1, 3, 5]2 2019-09-04       2   456       3  [2019-08-31, 2019-09-01, 2019-09-03]   [4, 7, 9]

5. 总结与选择

本教程展示了两种在Pandas中实现基于时间窗口的数据关联和聚合的方法:

pyjanitor.conditional_join: 这种方法在处理复杂的非等值连接(如时间范围)时表现出色,尤其在性能方面优于纯Pandas的笛卡尔合并加筛选,因为它避免了生成过大的中间DataFrame。当处理大型数据集或需要更灵活的连接条件时,强烈推荐使用此方法。纯 Pandas merge + 筛选: 这种方法易于理解和实现,不需要额外库。但在数据量较大时,由于可能产生庞大的中间合并结果,其内存消耗和计算效率可能较低。对于中小型数据集或对性能要求不极致的场景,这是一个可行的选择。

选择哪种方法取决于你的具体需求、数据集大小以及对性能和依赖库的偏好。无论选择哪种,关键都在于正确地定义时间窗口条件并使用groupby.agg(list)来收集所有匹配的条目。

以上就是Pandas中基于时间窗口关联和聚合数据的技巧:以交易与浏览记录为例的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1369643.html

赞 (0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
Pandas中基于多条件和时间窗口匹配关联数据的策略
上一篇 2025年12月14日 09:50:18
Python 统计 CSV 文件中数字个数的实用指南
下一篇 2025年12月14日 09:50:32

相关推荐

  • OPPOFindX9与三星S24Ultra系统流畅度谁更好_OPPOFindX9与三星S24Ultra流畅度对比

    OPPO Find X9凭借ColorOS 16的极光、潮汐、繁星三大自研引擎,实现跨场景“无缝”动效、游戏稳帧与系统深层优化,搭配天玑9500芯片和7500mAh电池,重载多任务不掉帧、后台留存强,冷启动快,流畅更持久;三星S24 Ultra的One UI 6.1功能丰富生态完善,流畅稳定但动效连…

    2026年9月21日
    800
  • Via浏览器在鸿蒙系统上运行会闪退怎么办_Via浏览器鸿蒙系统闪退的解决方法

    Via浏览器闪退可依次尝试清除缓存数据、更新或重装应用、检查系统更新与存储空间、禁用硬件加速功能,必要时通过开发者模式启用USB调试并使用DevEco Studio捕获日志定位问题。 如果您在使用Via浏览器访问网页时,应用突然关闭或无法正常启动,则可能是由于软件兼容性或系统资源问题导致。以下是解决…

    2026年9月21日
    300
  • 蔚来发布协调用工资源助力提产请示 10月底新招1000人

    近日,蔚来发布协调用工资源助力提产请示。请示中提到:今年第三季度,需在10月底解决1000人次的用工需求。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 据披露,蔚来于2025年9月29日向合肥市政府提交了《蔚来恳请协调用工资源助力提升产能…

    2026年9月21日
    100
  • VSCode的便携模式(Portable Mode)如何工作,它适合哪些使用场景?

    VSCode便携模式通过将编辑器与data文件夹置于同一目录,实现配置、扩展和数据的集中存储,无需安装即可运行。1. 下载ZIP版解压至目标路径;2. 创建data文件夹;3. 运行Code.exe,所有数据自动存入data目录。适用于公共电脑、跨设备开发、教学演示、测试配置及受限环境。需注意手动更…

    2026年9月21日
    100
  • 升级X86架构性能大提升!极空间Z2 Ultra图赏

    升级X86架构性能大提升!极空间Z2 Ultra图赏升级X86架构性能大提升!极空间Z2 Ultra图赏升级X86架构性能大提升!极空间Z2 Ultra图赏升级X86架构性能大提升!极空间Z2 Ultra图赏

    10月23日,极空间正式推出全新双盘位nas产品——极空间z2 ultra,官方售价为1899元,参与国家补贴后仅需1457元,性价比进一步提升。 此次发布的Z2 Ultra最大的亮点在于采用X86架构处理器,相较以往使用的ARM平台,性能实现飞跃式提升,运行速度显著加快。更重要的是,新架构对Doc…

    2026年9月21日 • 用户投稿
    200
  • 数据库分库分表(Sharding)策略

    在现代应用程序中,随着数据量的增长,单一数据库的性能和容量往往难以满足需求。这时,数据库分库分表(Sharding)策略就成了一个关键的解决方案。那么,如何设计和实现一个有效的分库分表策略呢?让我们深入探讨一下。 在我的职业生涯中,我曾多次参与大型项目的数据库优化,其中分库分表是常见的挑战之一。我记…

    2026年9月21日
    000
  • 抖音电商与独立商城怎么结合?流量互通与转化全攻略

    许多自建电商平台的运营者正积极探索与抖音电商的合作路径,以期借助其庞大的用户基数实现流量增长和销售转化提升。虽然抖音能为独立商城导入可观的新用户,但要真正实现高效联动,必须依赖技术系统的深度对接与精准的内容运营策略。以下是抖音与独立商城融合的关键路径及实操建议。 如何实现抖音与独立商城的店铺互通? …

    2026年9月21日
    100
  • 如何在Java中实现个人财务管理工具

    首先设计Transaction、FinanceManager和Budget核心类,实现交易记录、统计分析与预算控制功能,通过ArrayList管理数据,使用LocalDate处理日期,结合ObjectOutputStream持久化存储,初期采用Scanner构建控制台菜单实现增删查改与报表展示,后期…

    2026年9月21日
    000
  • Linux目录结构学习常见问题汇总

    Linux目录结构学习常见问题汇总Linux目录结构学习常见问题汇总Linux目录结构学习常见问题汇总Linux目录结构学习常见问题汇总

    Linux只有一个根目录,所有设备挂载于此,形成统一树状结构。根目录下各路径分工明确:/bin和/sbin分别存放用户与管理员命令;/etc集中配置文件;/home为用户家目录;/var存储日志等动态数据;/tmp用于临时文件;/usr存放系统程序,/usr/local供手动安装软件;/dev包含设…

    2026年9月21日 • 用户投稿
    000
  • 如何选择适合自己的机械键盘轴体?

    明确使用场景是选轴关键:打字选青轴或茶轴,游戏选红轴或银轴,办公选静音轴;根据手感偏好选择线性、段落或静音类轴体,结合触发力度与行程,实际体验后决定。 选择适合自己的机械键盘轴体,关键在于了解不同轴体的特性以及自己的使用习惯。手感、声音、触发压力和用途是决定因素。下面从几个实用角度帮你理清思路。 明…

    2026年9月21日
    200
  • VSCode的代码折叠功能好用吗?

    VSCode代码折叠功能支持多种方式:点击箭头、快捷键、命令面板及按区域类型折叠;可自定义基于缩进的折叠、默认层级和提示装饰器;集成语言服务后能智能识别JSX、Vue组件等结构,提升大型文件编辑效率。 VSCode 的代码折叠功能非常实用,尤其在处理大型文件或复杂结构时能显著提升阅读和编辑效率。 支…

    2026年9月21日
    100
  • 事务隔离级别在mysql中如何应用

    MySQL提供四种事务隔离级别:READ UNCOMMITTED、READ COMMITTED、REPEATABLE READ(默认)、SERIALIZABLE,依次增强数据一致性,分别用于平衡并发性能与脏读、不可重复读、幻读等问题;通过SELECT @@tx_isolation等命令可查看级别,S…

    2026年9月21日
    300
  • iPhone 12 Pro Max如何连接蓝牙键盘

    iPhone 12 Pro Max连接蓝牙键盘需先开启键盘并进入配对模式,确保电量充足;接着在iPhone的“设置”中打开蓝牙,搜索设备并在“其他设备”列表中选择键盘名称进行配对,按提示输入配对码(如0000或1234)确认;连接成功后,键盘将显示在“已连接”列表,之后靠近自动连接,虚拟键盘不再弹出…

    2026年9月21日
    400
  • 计费集群部署方案

    计费集群部署方案计费集群部署方案计费集群部署方案计费集群部署方案

    1、 结合实际业务规模与历史经验数据,从CPU、内存、存储空间及网络带宽四个方面开展资源容量的预测与评估工作。 2、 根据各组件或节点的资源消耗特点,科学规划并分配适配类型的服务器资源,保障系统整体运行效率。 3、 分布式消息中间件集群对磁盘IO和网络吞吐能力要求较高,建议部署在物理机环境;而批价处…

    2026年9月21日 • 用户投稿
    100
  • 烟雨江湖新手开局指南

    初入《烟雨江湖》的新手玩家们注意啦!在角色达到40级前,有许多关键信息必须掌握。副本与npc标注的等级不必盲目追随,系统推荐战力也仅作参考。真正核心的是主角等级,随从甚至可以比主角高出两级!这其中涉及组队策略与战力搭配的诸多技巧,想要快速成长,这篇新手开局攻略千万别错过! 烟雨江湖新手起步全指南 1…

    2026年9月21日
    000
  • win10无法创建新的分区提示空间不足怎么办 _Win10 无法创建分区空间不足解决方法

    首先检查磁盘是否存在未分配空间,若无则通过压缩卷释放空间;使用磁盘管理或第三方工具如EaseUS创建新分区;必要时清理磁盘或转换MBR为GPT格式以突破分区限制。 如果您在使用Windows 10系统时尝试创建新的磁盘分区,但系统提示“无法创建新分区”或“空间不足”,这通常是因为当前磁盘未分配的空间…

    2026年9月21日
    100
  • X旗下Grok上线即时语音搜索,挑战Google引领搜索新方向

    近日,x平台旗下的ai助手grok正式推出了“即时语音搜索”功能。用户现在可以通过语音直接提问,触发实时网页检索,并迅速获得整合后的精准答案。此举意在优化信息获取流程,推动人机交互向更自然、高效的方向演进。 该语音搜索模式实现了“即说即搜即答”的流畅体验。例如,当用户提出“星舰发射的具体时间是什么?…

    2026年9月21日
    100
  • 如何备份VSCode的全部设置和扩展?

    备份VSCode全部设置和扩展需保存配置文件与扩展目录;2. 配置文件位于各系统指定路径的User文件夹内,包含settings.json和keybindings.json;3. 通过code –list-extensions导出扩展列表并用xargs批量重装可恢复扩展;4. 推荐直接复…

    2026年9月21日
    000
  • mysql数据库和表的关系是怎样

    数据库是表的集合,一个MySQL数据库可包含多个表,表依赖数据库存在,需先创建数据库才能建表,如CREATE DATABASE school;USE school;CREATE TABLE students;数据库实现数据隔离与管理,不同项目使用不同数据库,便于组织与权限控制。 MySQL数据库和表…

    2026年9月21日
    000
  • Laravel应用的安全审计(Security Audit)方法

    进行安全审计对laravel应用至关重要,因为它能发现并修复安全漏洞,提升整体安全性和用户信任度。具体方法包括:1. 代码审查,确保无未过滤输入和弱密码;2. 配置文件安全性,保护敏感信息;3. 依赖管理,更新第三方包;4. 用户认证和授权,防止未授权访问;5. 日志和监控,检测异常行为。 在讨论L…

    2026年9月21日
    100

发表回复

登录后才能评论
关注微信