Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
使用 Pandas 根据多列和时间分配唯一ID_创想鸟

使用 Pandas 根据多列和时间分配唯一ID

使用 pandas 根据多列和时间分配唯一id

本文介绍了如何使用 Pandas 根据日期、名称、产品以及经过时间这四个维度为数据帧分配唯一ID。核心在于当相同日期、名称和产品组合下,经过时间大于等于100秒时,ID需要递增,直到日期、名称或产品发生变化。本文提供两种解决方案,并解释了其原理和适用场景。

解决方案一:基于比较和累积求和

此方案的核心思想是:首先,比较当前行与前一行的 “Date”、”Name” 和 “Product” 列的值是否发生变化;然后,判断 “Elapsed_time” 是否大于等于 100。只要上述两个条件中的任何一个成立,就递增 ID。

以下是实现该功能的代码:

import pandas as pd# 示例数据data = {'Date': ['10/25/23', '10/25/23', '10/25/23', '10/25/23', '10/25/23', '10/25/23', '10/26/23', '10/27/23', '10/27/23', '10/27/23', '10/27/23', '10/27/23', '10/27/23', '10/27/23'],        'Name': ['Bill', 'Bill', 'John', 'John', 'John', 'John', 'John', 'Carl', 'Carl', 'Carl', 'Carl', 'Carl', 'Carl', 'Carl'],        'Product': ['A', 'A', 'B', 'B', 'B', 'B', 'C', 'A', 'A', 'A', 'A', 'B', 'A', 'A'],        'Elapsed_time': [30, 99, 10, 100, 1, 15, 45, 120, 99, 80, 101, 300, 12, 37]}df = pd.DataFrame(data)cols = ['Date', 'Name', 'Product']df['id'] = (df[cols].ne(df[cols].shift())     .assign(x=df['Elapsed_time'].ge(100))     .any(axis=1).cumsum()    )print(df)

代码解释:

cols = [‘Date’, ‘Name’, ‘Product’]: 定义需要进行比较的列名列表。df[cols].ne(df[cols].shift()): 使用 shift() 函数将 “Date”、”Name” 和 “Product” 列向下移动一行,然后使用 ne() 函数比较当前行与前一行是否不同。这将返回一个布尔型 DataFrame,指示哪些列发生了变化。.assign(x=df[‘Elapsed_time’].ge(100)): 创建一个新的布尔列 ‘x’,指示 “Elapsed_time” 是否大于等于 100。.any(axis=1): 对每一行应用 any() 函数,检查 “Date”、”Name”、”Product” 是否有任何一个发生变化,或者 “Elapsed_time” 是否大于等于 100。只要满足其中一个条件,就返回 True。.cumsum(): 对布尔型 Series 应用 cumsum() 函数,计算累积和。由于 True 被视为 1,False 被视为 0,因此 cumsum() 会在每次满足条件时递增。

输出结果:

        Date  Name Product  Elapsed_time  id0   10/25/23  Bill       A            30   11   10/25/23  Bill       A            99   12   10/25/23  John       B            10   23   10/25/23  John       B           100   34   10/25/23  John       B             1   35   10/25/23  John       B            15   36   10/26/23  John       C            45   47   10/27/23  Carl       A           120   58   10/27/23  Carl       A            99   59   10/27/23  Carl       A            80   510  10/27/23  Carl       A           101   611  10/27/23  Carl       B           300   712  10/27/23  Carl       A            12   813  10/27/23  Carl       A            37   8

适用场景:

此方案适用于数据帧未排序的情况。它通过比较相邻行来确定 ID 是否需要递增,因此不受数据顺序的影响。

解决方案二:基于分组和累积求和 (原答案)

此方案基于数据帧已经按照 “Date”、”Name” 和 “Product” 列排序的前提。它首先使用 groupby() 函数对数据进行分组,然后为每个组分配一个唯一的 ID。此外,它还考虑了 “Elapsed_time” 大于等于 100 的情况,并根据需要递增 ID。

以下是实现该功能的代码:

import pandas as pd# 示例数据data = {'Date': ['10/25/23', '10/25/23', '10/25/23', '10/25/23', '10/25/23', '10/25/23', '10/26/23'],        'Name': ['Bill', 'Bill', 'John', 'John', 'John', 'John', 'John'],        'Product': ['A', 'A', 'B', 'B', 'B', 'B', 'C'],        'Elapsed_time': [30, 99, 10, 100, 1, 15, 45]}df = pd.DataFrame(data)df['id'] = (df.groupby(['Date', 'Name', 'Product']).ngroup()              .add(1+df['Elapsed_time'].ge(100).cumsum())           )print(df)

代码解释:

df.groupby([‘Date’, ‘Name’, ‘Product’]).ngroup(): 使用 groupby() 函数对数据按照 “Date”、”Name” 和 “Product” 列进行分组,并使用 ngroup() 函数为每个组分配一个唯一的整数 ID。df[‘Elapsed_time’].ge(100).cumsum(): 创建一个布尔型 Series,指示 “Elapsed_time” 是否大于等于 100,然后使用 cumsum() 函数计算累积和。.add(1+ …): 将分组ID加上1,再加上Elapsed_time大于等于100的累积和。

输出结果:

       Date  Name Product  Elapsed_time  id0  10/25/23  Bill       A            30   11  10/25/23  Bill       A            99   12  10/25/23  John       B            10   23  10/25/23  John       B           100   34  10/25/23  John       B             1   35  10/25/23  John       B            15   36  10/26/23  John       C            45   4

适用场景:

此方案适用于数据帧已经按照 “Date”、”Name” 和 “Product” 列排序的情况。如果数据未排序,则结果可能不正确。

总结

本文介绍了两种使用 Pandas 根据多列和时间分配唯一ID的解决方案。第一种方案适用于数据帧未排序的情况,而第二种方案适用于数据帧已经排序的情况。选择哪种方案取决于数据的特点和需求。在实际应用中,请务必根据数据的实际情况选择合适的方案。此外,在处理时间数据时,请确保数据类型正确,并进行适当的格式转换。

以上就是使用 Pandas 根据多列和时间分配唯一ID的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1363522.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
使用 Pandas 根据多列和时间分配唯一 ID
上一篇 2025年12月14日 03:27:28
使用循环在 Symfit 中构建模型和参数
下一篇 2025年12月14日 03:27:39

相关推荐

  • MySQL常见连接错误及其解决方案汇总_开发和运维必备?

    MySQL常见连接错误及其解决方案汇总_开发和运维必备?MySQL常见连接错误及其解决方案汇总_开发和运维必备?MySQL常见连接错误及其解决方案汇总_开发和运维必备?MySQL常见连接错误及其解决方案汇总_开发和运维必备?

    access denied错误需检查用户名密码及权限,使用grant授权并执行flush privileges;2. can’t connect错误应确认mysql运行状态、防火墙设置及bind-address配置;3. host not allowed错误需创建用户并授权特定或全部ip…

    2026年9月22日 用户投稿
    000
  • 递归实现列表排序检查与条件移除最大值

    本文详细介绍了如何使用Java递归方法处理整数列表。核心内容包括:首先检查列表是否已排序,如果已排序则直接返回false;如果未排序,则查找列表中的最大值。仅当最大值位于列表的起始或结束位置时,才将其移除并递归地继续处理列表。如果最大值位于列表中间,则打印当前列表并终止递归。 在数据处理和算法设计中…

    2026年9月22日
    000
  • 国泰航空“广州始发礼遇”限时开启,新增广州往返香港航班助力畅游亚洲

    落地即启程,中转再提速,轻松畅游亚洲 秋意正浓,正是踏上旅途的好时机。国泰航空为大湾区“1小时生活圈”注入全新活力——自2025年10月27日起,广州与中国香港之间的往返航班将加密至每日三班,并同步推出“广州始发礼遇”限时优惠活动,让旅客以更实惠的价格畅行亚洲热门目的地。 限时优惠抢先订 亚洲美景随…

    2026年9月22日
    100
  • VSCode如何实现代码可视化调试 VSCode执行流程图形化分析方法

    vscode的可视化调试功能通过内置调试器和扩展生态,显著提升代码理解与问题排查效率。1. 首先配置launch.json文件以定义调试环境,支持多种语言如node.js、python等;2. 在代码中设置断点,程序运行至断点时暂停,便于检查变量状态和执行上下文;3. 利用调试面板查看变量、监视表达…

    2026年9月22日
    000
  • 比iPad mini更胜一筹!华为MatePad Mini包装盒曝光:8.8寸屏的手机 或卖4K起

    9月3日消息,明天除了mate xts亮相外,还有matepad mini,而它到底算是平板还是手机呢? 现在有博主晒出了MatePad Mini外包装盒,从产品名称上看,华为给它定位是手机(数字移动电话机)。 对于这款新机,今天我们也报道了相关内容,比如曝光的价格是:12GB+256GB售价为39…

    2026年9月22日
    000
  • win11外接显示器检测不到怎么办_win11外接显示器无法识别修复方法

    首先检查连接线和接口是否正常,确保外接显示器被正确识别;接着在显示设置中点击“检测”按钮手动搜索显示器;若无效则更新或重装显卡驱动;再进入BIOS确认外部显示功能已启用,并更新系统固件;最后通过重置显示设置恢复默认配置以解决识别问题。 如果您尝试将外部显示器连接到Windows 11设备,但系统无法…

    2026年9月22日
    000
  • 燕云十六声新门派墨山道介绍

    燕云十六声新门派墨山道介绍燕云十六声新门派墨山道介绍燕云十六声新门派墨山道介绍燕云十六声新门派墨山道介绍

    《燕云十六声》江湖风云再起!每次新门派登场都能掀起热潮,这次也不例外。官方已正式官宣,全新门派墨山道将于9月26日霸气上线!它带着全新玩法机制强势来袭,瞬间点燃玩家期待。今日官方再发公告确认,究竟墨山道有何独特魅力?快随我一起一探究竟! 燕云十六声新门派墨山道介绍 山在云中匿,城在山中隐。清河以北,…

    2026年9月22日 用户投稿
    000
  • 每个 Linux 用户都应该知道的 5 个简单的 Bash 历史技巧

    每个 Linux 用户都应该知道的 5 个简单的 Bash 历史技巧每个 Linux 用户都应该知道的 5 个简单的 Bash 历史技巧每个 Linux 用户都应该知道的 5 个简单的 Bash 历史技巧每个 Linux 用户都应该知道的 5 个简单的 Bash 历史技巧

    无论您是bash 初学者还是专家,如果不使用超级有用的 bash 历史记录功能,您将无法继续在命令行中工作。 您可能已经知道,如果您在 Linux 终端中使用向上或向下箭头键,您可以查看之前运行的命令。 这要归功于bash history 命令。 1.查看您的 bash 历史记录 查看您之前键入的命…

    2026年9月22日 用户投稿
    000
  • MySQL备份压缩与加密技巧_MySQL提升备份安全与效率

    MySQL备份压缩与加密技巧_MySQL提升备份安全与效率MySQL备份压缩与加密技巧_MySQL提升备份安全与效率MySQL备份压缩与加密技巧_MySQL提升备份安全与效率MySQL备份压缩与加密技巧_MySQL提升备份安全与效率

    mysql备份压缩与加密的核心在于减少存储空间并提升数据安全性。1. 压缩能显著降低存储成本,提升传输效率,加快恢复速度,简化备份管理,并有助于满足合规要求;2. 加密则通过防止未授权访问保障数据安全。实现方式主要有:1. 使用mysqldump结合gzip和gpg/openssl进行逻辑备份、压缩…

    2026年9月22日 用户投稿
    100
  • 石墨文档如何创建在线表格并排序_石墨文档表格处理的高效技巧

    首先创建在线表格并进行排序,提升团队协作效率。打开石墨文档点击“新建”选择“表格”,支持从Excel导入数据、多页管理及多人协同编辑;选中数据区域后通过“数据”菜单进行单列或多条件排序,注意避免合并单元格影响范围,配合筛选功能更高效;利用快捷键跳转、自动调整列宽、冻结行列、使用模板、设置格式、添加评…

    2026年9月22日
    100
  • VS Code中Dockerized PHP项目:解决PHP版本冲突的教程

    本教程旨在解决在VS Code中开发Dockerized PHP项目时,VS Code默认识别宿主机PHP版本而非容器内PHP版本的问题。核心解决方案是利用VS Code的Remote – Containers扩展,实现直接在Docker容器内部进行代码开发,从而确保VS Code及其所…

    2026年9月22日
    200
  • 蔡司2亿影像大小王,年度影像旗舰vivo X300系列发布!

    蔡司2亿影像大小王,年度影像旗舰vivo X300系列发布!蔡司2亿影像大小王,年度影像旗舰vivo X300系列发布!蔡司2亿影像大小王,年度影像旗舰vivo X300系列发布!蔡司2亿影像大小王,年度影像旗舰vivo X300系列发布!

    PConline最新资讯,vivo于今晚正式揭晓X300系列新机,定位“全焦段影像旗舰”,起售价为4399元。该系列成为首款搭载联发科天玑9500芯片的智能手机,并携手三星与索尼共同定制多颗影像传感器,在影像能力、屏幕素质及续航表现上力求全面跃升。 产品线涵盖X300与X300 Pro两款机型,价格…

    2026年9月22日 用户投稿
    000
  • 基于Swoole构建实时舆情监测服务

    基于Swoole构建实时舆情监测服务 随着社交媒体的兴起,公众对于舆情的关注程度越来越高。舆情监测成为企业和政府部门的重要任务之一。为了实时监测舆情信息,我们可以利用Swoole来构建一个高性能的实时舆情监测服务。 Swoole是一个基于PHP语言的协程网络通信引擎,其提供了一系列的网络通信相关的高…

    2026年9月22日
    300
  • 从AI场景搭建到蝴蝶号运营,全流程实战攻略

    从AI场景搭建到蝴蝶号运营,全流程实战攻略从AI场景搭建到蝴蝶号运营,全流程实战攻略从AI场景搭建到蝴蝶号运营,全流程实战攻略从AI场景搭建到蝴蝶号运营,全流程实战攻略

    做ai内容变现需先明确方向再选工具,注册蝴蝶号要模拟真实行为,用ai提升效率但需调整内容细节,流量转化重于播放量。一、先确定内容类型和风格,根据方向选择合适ai工具链搭建流程,用免费api测试效果。二、蝴蝶号注册尽量用企业主体,资料完整,养号阶段关注同类账号,保持每天发布1~2条内容,视频控制在30…

    2026年9月22日 用户投稿
    100
  • UC浏览器为什么无法登录某些网站账号_UC浏览器部分网站无法登录原因及对策

    首先关闭广告过滤功能,清除缓存与Cookie,关闭云端加速,切换网络或DNS,最后尝试桌面模式或其他浏览器解决UC浏览器登录无响应问题。 如果您尝试在UC浏览器中登录某个网站账号,但页面无响应或提示错误,则可能是由于浏览器的安全策略、缓存问题或设置限制导致无法正常加载登录界面。以下是解决此问题的步骤…

    2026年9月22日
    100
  • 优化Spring Boot应用:构建高效通用的DTO与实体映射服务

    本文旨在解决Spring Boot项目中DTO与实体间重复映射的痛点。通过引入一个基于泛型的抽象服务层,结合ModelMapper工具,我们展示了如何构建一个类型安全、可重用的通用映射机制。此方案显著减少了样板代码,提升了代码的可维护性和开发效率,避免了手动类型转换的繁琐与潜在错误。 在构建基于sp…

    2026年9月22日
    100
  • GIMP中如何利用AI裁剪图片?一步步完成高效图像裁剪方法

    GIMP虽无“一键AI裁剪”功能,但可通过智能选择工具(如前景选择、智能剪刀)精准选中主体,结合Resynthesizer插件的内容感知填充实现类AI裁剪效果;对于更高要求,可协同Remove.bg等外部AI工具完成自动抠图,再导入GIMP进行裁剪或背景替换,形成高效智能裁剪工作流。 ☞☞☞AI 智…

    2026年9月22日
    100
  • OPPO Find X9系列前瞻:外观大变 全面升级无短板

    知名数码博主“数码闲聊站”近日透露了oppo find x9的外观设计,引发广泛关注。与前代产品采用的居中圆形镜头模组不同,find x9改用左上角垂直排列的方形矩阵摄像头,整体背部布局更显规整,视觉风格焕然一新,同时提升了握持手感,展现出oppo对用户反馈的高度重视。不过随后该博主迅速撤回相关微博…

    2026年9月22日
    000
  • QQ音乐自动续费怎么停止_QQ音乐停止自动续费的详细步骤

    首先需手动取消自动续费,1.在QQ音乐App“我的”-“会员中心”-“个人中心”-“管理自动续费”中关闭;2.通过微信“服务”-“钱包”-“支付设置”-“自动续费”关闭QQ音乐会员;3.iOS用户需在“设置”-Apple ID-“订阅”中取消QQ音乐订阅,确认后当前周期结束即停止扣费。 如果您在使用…

    2026年9月22日
    200
  • MySQL字段映射表自动生成方案_Sublime一键导出JSON与结构化模板

    MySQL字段映射表自动生成方案_Sublime一键导出JSON与结构化模板MySQL字段映射表自动生成方案_Sublime一键导出JSON与结构化模板MySQL字段映射表自动生成方案_Sublime一键导出JSON与结构化模板MySQL字段映射表自动生成方案_Sublime一键导出JSON与结构化模板

    如何利用sublime text插件提升mysql字段映射表生成效率?1. 插件通过自动化提取sql语句中的表结构信息,减少手动操作;2. 支持一键导出为json或结构化模板(如markdown、html表格),提升开发效率;3. 利用sublime text的python插件机制,实现快速集成与执…

    2026年9月22日 用户投稿
    000

发表回复

登录后才能评论
关注微信