Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
Pandas数据处理:高效筛选重复记录并保留指定数量的最新数据_创想鸟

Pandas数据处理:高效筛选重复记录并保留指定数量的最新数据

Pandas数据处理:高效筛选重复记录并保留指定数量的最新数据

本教程旨在指导用户如何高效地从数据集中筛选重复记录,并为每个重复组保留指定数量(例如最后N条)的数据。我们将重点介绍Pandas中简洁高效的groupby().tail()方法,并与PySpark中基于窗口函数的方法进行对比,通过详细代码示例和最佳实践,帮助读者优化数据清洗流程。

问题场景描述

在数据清洗和预处理过程中,我们经常会遇到包含重复记录的数据集。这些重复记录可能基于一个或多个列的组合,但我们往往需要为每个重复组保留特定数量的记录,例如,只保留每个重复组中最新的n条记录。例如,在一个包含用户活动记录的dataframe中,我们可能希望针对每个用户(由first_name, last_name, sex等列定义),只保留其最新的3条活动记录。

假设我们有如下一个DataFrame:

id first_name last_name sex country

01JohnDoeMaleUSA02JohnDoeMaleCanada03JohnDoeMaleMexico04MarkKayMaleItaly05JohnDoeMaleSpain06MarkKayMaleFrance07JohnDoeMalePeru08MarkKayMaleIndia09MarkKayMaleLaos10JohnDoeMaleBenin

目标是基于first_name、last_name和sex列的组合识别重复项,并为每个组合保留最新的3条记录(根据id列的降序)。

基于Pandas的解决方案:使用groupby().tail()

对于在内存中操作的Pandas DataFrame,groupby().tail()方法提供了一种非常简洁且高效的解决方案。

核心思路

排序数据: 首先,确保DataFrame按照定义“最新”的标准进行排序。在我们的例子中,id越大表示越新,因此需要按id升序排序。分组: 按照用于识别重复项的列(例如first_name, last_name, sex)进行分组。选取尾部记录: 对每个分组应用tail(n)方法,这将返回该分组中最后N条记录。由于我们已经提前排序,这些“最后N条”就是我们想要的“最新N条”。

示例代码

import pandas as pd# 原始DataFrame数据data = {    'id': [1, 2, 3, 4, 5, 6, 7, 8, 9, 10],    'first_name': ['John', 'John', 'John', 'Mark', 'John', 'Mark', 'John', 'Mark', 'Mark', 'John'],    'last_name': ['Doe', 'Doe', 'Doe', 'Kay', 'Doe', 'Kay', 'Doe', 'Kay', 'Kay', 'Doe'],    'sex': ['Male', 'Male', 'Male', 'Male', 'Male', 'Male', 'Male', 'Male', 'Male', 'Male'],    'country': ['USA', 'Canada', 'Mexico', 'Italy', 'Spain', 'France', 'Peru', 'India', 'Laos', 'Benin']}df = pd.DataFrame(data)# 1. 根据'id'列对DataFrame进行排序,确保'tail(3)'能获取到最新的3条记录# 如果'id'本身就是递增的,此步骤可确保正确性。df_sorted = df.sort_values(by='id').copy()# 2. 按照指定列进行分组,并为每个组保留最后3条记录result_df = df_sorted.groupby(['first_name', 'last_name', 'sex']).tail(3)# 3. (可选)重置索引,使索引连续result_df = result_df.reset_index(drop=True)# 显示结果DataFrameprint("处理后的DataFrame:")print(result_df)

输出结果:

处理后的DataFrame:   id first_name last_name   sex country0   5       John       Doe  Male   Spain1   6       Mark       Kay  Male  France2   7       John       Doe  Male    Peru3   8       Mark       Kay  Male   India4   9       Mark       Kay  Male    Laos5  10       John       Doe  Male   Benin

基于PySpark的解决方案:使用窗口函数

对于大规模分布式数据集,例如在Apache Spark环境中使用PySpark,groupby().tail()方法不再适用。此时,窗口函数(Window Functions)是实现此功能的标准且高效的方式。

核心思路

定义窗口规范: 使用Window.partitionBy()定义分组的列,并使用orderBy()定义组内排序的列。为了获取“最新”的记录,排序通常是降序(例如,id降序)。生成行号: 在每个分区(即每个重复组)内,根据排序规则为每条记录生成一个行号(row_number())。过滤: 筛选出row_number小于或等于N的记录。

示例代码(PySpark风格)

from pyspark.sql import SparkSessionfrom pyspark.sql import functions as Ffrom pyspark.sql.window import Window# 假设df是一个Spark DataFrame# 这里为了示例,我们创建一个模拟的SparkSession和DataFramespark = SparkSession.builder.appName("FilterDuplicates").getOrCreate()data = [    (1, 'John', 'Doe', 'Male', 'USA'),    (2, 'John', 'Doe', 'Male', 'Canada'),    (3, 'John', 'Doe', 'Male', 'Mexico'),    (4, 'Mark', 'Kay', 'Male', 'Italy'),    (5, 'John', 'Doe', 'Male', 'Spain'),    (6, 'Mark', 'Kay', 'Male', 'France'),    (7, 'John', 'Doe', 'Male', 'Peru'),    (8, 'Mark', 'Kay', 'Male', 'India'),    (9, 'Mark', 'Kay', 'Male', 'Laos'),    (10, 'John', 'Doe', 'Male', 'Benin')]columns = ['id', 'first_name', 'last_name', 'sex', 'country']df_spark = spark.createDataFrame(data, columns)# 定义窗口规范:按first_name, last_name, sex分组,按id降序排序window_spec = Window.partitionBy('first_name', 'last_name', 'sex').orderBy(F.desc('id'))# 为每个分区内的记录生成行号df_with_row_number = df_spark.withColumn('row_number', F.row_number().over(window_spec))# 过滤,只保留行号小于等于3的记录filtered_df_spark = df_with_row_number.filter('row_number <= 3')# 移除辅助列row_numberresult_df_spark = filtered_df_spark.drop('row_number')# 显示结果print("处理后的Spark DataFrame:")result_df_spark.show()spark.stop()

输出结果:

处理后的Spark DataFrame:+---+----------+---------+----+-------+| id|first_name|last_name| sex|country|+---+----------+---------+----+-------+|  5|      John|      Doe|Male|  Spain||  7|      John|      Doe|Male|   Peru|| 10|      John|      Doe|Male|  Benin||  6|      Mark|      Kay|Male| France||  8|      Kay |      Kay|Male|  India||  9|      Mark|      Kay|Male|   Laos|+---+----------+---------+----+-------+

效率与选择考量

Pandas groupby().tail(): 对于数据集能够完全载入内存的情况,groupby().tail()方法通常非常高效且代码简洁。它是Pandas中处理此类问题的首选方法。其内部实现经过高度优化,能够有效处理分组和选择操作。PySpark 窗口函数: 对于大规模分布式数据集,当数据量超出单机内存限制时,PySpark的窗口函数是唯一的选择。虽然代码可能比Pandas版本稍长,但它能在分布式集群上高效执行,避免了数据收集到单个节点的瓶颈。Spark的优化器能够智能地处理窗口操作,确保性能。

注意事项

排序的重要性: 无论是Pandas还是PySpark,定义“最新”或“最旧”的关键在于正确的排序。如果“最新”是基于时间戳,则应按时间戳列排序。如果“最新”是基于某个ID,则按ID排序。性能优化:在Pandas中,如果DataFrame非常大,sort_values()可能会消耗较多内存和时间。确保你的系统有足够的资源。在PySpark中,窗口操作会涉及数据重分区(shuffle),这可能是一个耗时操作。合理选择partitionBy的列,避免创建过多或过少的分区,有助于优化性能。reset_index(): 在Pandas中,groupby().tail()操作会保留原始索引。如果需要一个从0开始的连续索引,记得调用reset_index(drop=True)。

总结

本文详细介绍了在数据处理中,如何根据特定分组筛选重复记录并保留指定数量(N)的最新数据。对于内存中的数据集,Pandas的df.sort_values().groupby().tail(N)组合方法提供了一个简洁高效的解决方案。而对于分布式大数据集,PySpark的窗口函数(Window.partitionBy().orderBy().row_number())则是实现相同逻辑的标准且高性能途径。理解这两种方法的适用场景和实现原理,能帮助开发者根据实际需求选择最合适的工具和策略,从而高效地完成数据清洗任务。

以上就是Pandas数据处理:高效筛选重复记录并保留指定数量的最新数据的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1370212.html

赞 (0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
数据帧中高效筛选重复项并保留最新N条记录的教程
上一篇 2025年12月14日 10:20:45
Pandas数据帧中高效筛选N个重复项并保留最后N条记录
下一篇 2025年12月14日 10:20:53

相关推荐

  • MAC的Siri无法使用怎么办_macOS Siri功能故障排查与修复

    MAC的Siri无法使用怎么办_macOS Siri功能故障排查与修复MAC的Siri无法使用怎么办_macOS Siri功能故障排查与修复MAC的Siri无法使用怎么办_macOS Siri功能故障排查与修复MAC的Siri无法使用怎么办_macOS Siri功能故障排查与修复

    首先检查网络连接是否稳定,确认Siri服务状态正常,接着在系统设置中启用Siri并授予麦克风权限,通过终端重启Siri进程,必要时重置NVRAM/PRAM,最后创建新用户账户排除配置损坏问题。 如果您在使用Mac时发现Siri无法响应或功能异常,可能是由于网络连接、系统设置或权限问题导致。以下是排查…

    2026年9月24日 • 用户投稿
    000
  • 京东plus月卡能领双11券吗?京东plus有月卡吗

    京东plus月卡能领双11券吗?京东plus有月卡吗京东plus月卡能领双11券吗?京东plus有月卡吗京东plus月卡能领双11券吗?京东plus有月卡吗京东plus月卡能领双11券吗?京东plus有月卡吗

    京东PLUS月卡用户可领双11大额券,需在优惠期内保持会员有效,通过“我的-PLUS会员”进入领券中心,按时领取满减券并结合红包口令提升优惠。 如果您想在短时间内享受京东PLUS会员的专属优惠,但又不想长期付费,可能会考虑月卡服务。关于京东PLUS月卡是否能领取双11大额优惠券的问题,以下是相关信息…

    2026年9月24日 • 用户投稿
    000
  • Java中实现PDF文档并排对比及差异高亮显示:使用pdfcompare库

    Java中实现PDF文档并排对比及差异高亮显示:使用pdfcompare库Java中实现PDF文档并排对比及差异高亮显示:使用pdfcompare库Java中实现PDF文档并排对比及差异高亮显示:使用pdfcompare库Java中实现PDF文档并排对比及差异高亮显示:使用pdfcompare库

    本文介绍了如何在Java环境中,利用开源库pdfcompare实现两个PDF文档的并排对比,并独立高亮显示其差异。针对传统方案合并PDF的痛点,pdfcompare提供了一种优雅的解决方案,确保原始文档结构不变,仅在各自副本中标记出不同之处,满足特定业务需求。 1. 背景与挑战 在处理文档版本控制或…

    2026年9月24日 • 用户投稿
    1100
  • 联想Legion风扇噪音过大?降低游戏噪音的方案

    联想Legion风扇噪音过大?降低游戏噪音的方案联想Legion风扇噪音过大?降低游戏噪音的方案联想Legion风扇噪音过大?降低游戏噪音的方案联想Legion风扇噪音过大?降低游戏噪音的方案

    首先切换Fn+Q至安静或平衡模式,再清理散热系统积灰,接着通过联想电脑管家或第三方工具自定义风扇曲线,最后优化电源设置与后台负载以降低发热量并减少风扇噪音。 如果您在使用联想Legion系列笔记本电脑时,发现风扇噪音过大影响了游戏体验或日常使用,则可能是由于散热系统高负荷运转所致。以下是解决此问题的…

    2026年9月24日 • 用户投稿
    000
  • 心理恐怖新作《破碎怪谈:切勿欺骗》公布

    心理恐怖新作《破碎怪谈:切勿欺骗》公布心理恐怖新作《破碎怪谈:切勿欺骗》公布心理恐怖新作《破碎怪谈:切勿欺骗》公布心理恐怖新作《破碎怪谈:切勿欺骗》公布

    在tgs 2025期间,serafini productions如期公布了《破碎怪谈》系列最新作《破碎怪谈:切勿欺骗(brokenlore: don’t lie)》,登陆pc steam,ps5和xbox series。目前该作已经上架pc steam,自带简体中文。发售日暂未公开。 此前,Sera…

    2026年9月24日 • 用户投稿
    1000
  • Debian系统如何实现GitLab的高可用性

    Debian系统如何实现GitLab的高可用性Debian系统如何实现GitLab的高可用性Debian系统如何实现GitLab的高可用性Debian系统如何实现GitLab的高可用性

    在debian系统上实现gitlab的高可用性可以通过以下几种方法: 通过Kubernetes进行部署 安装Redis:利用Helm部署Redis,并配置持久化存储以确保数据的持久性。安装PostgreSQL:同样通过Helm部署PostgreSQL,并设置主从复制或集群模式,以确保数据的高可用性。…

    2026年9月24日 • 用户投稿
    700
  • uc浏览器如何禁止访问某些网站_UC浏览器网站屏蔽与访问限制设置

    uc浏览器如何禁止访问某些网站_UC浏览器网站屏蔽与访问限制设置uc浏览器如何禁止访问某些网站_UC浏览器网站屏蔽与访问限制设置uc浏览器如何禁止访问某些网站_UC浏览器网站屏蔽与访问限制设置uc浏览器如何禁止访问某些网站_UC浏览器网站屏蔽与访问限制设置

    可通过UC浏览器内容过滤、设备家长控制或修改Hosts文件屏蔽网站。首先在UC浏览器中进入“隐私与安全”启用内容过滤并添加自定义屏蔽域名;其次利用手机系统“数字健康”或第三方工具设置网站访问限制,实现跨浏览器管控;最后具备Root权限的用户可编辑/system/etc/hosts文件,添加“0.0.…

    2026年9月24日 • 用户投稿
    900
  • windows提示“需要新应用来打开此ms-gamingoverlay”怎么办 “ms-gamingoverlay”弹窗的关闭方法

    windows提示“需要新应用来打开此ms-gamingoverlay”怎么办 “ms-gamingoverlay”弹窗的关闭方法windows提示“需要新应用来打开此ms-gamingoverlay”怎么办 “ms-gamingoverlay”弹窗的关闭方法windows提示“需要新应用来打开此ms-gamingoverlay”怎么办 “ms-gamingoverlay”弹窗的关闭方法windows提示“需要新应用来打开此ms-gamingoverlay”怎么办 “ms-gamingoverlay”弹窗的关闭方法

    答案:通过禁用Xbox游戏栏启动、修改注册表、重置Xbox应用及关闭游戏模式可解决“需要新应用打开ms-gamingoverlay”问题。具体步骤依次为:在设置中关闭Xbox Game Bar启动项;删除注册表中ms-gamingoverlay项;重置或重新安装Xbox应用;在游戏设置中关闭游戏模式…

    2026年9月24日 • 用户投稿
    700
  • Bing浏览器怎么使用Web选择_Bing浏览器网页内容选择工具操作

    Bing浏览器怎么使用Web选择_Bing浏览器网页内容选择工具操作Bing浏览器怎么使用Web选择_Bing浏览器网页内容选择工具操作Bing浏览器怎么使用Web选择_Bing浏览器网页内容选择工具操作Bing浏览器怎么使用Web选择_Bing浏览器网页内容选择工具操作

    首先启用Bing浏览器的Web选择工具,点击地址栏右侧图标激活;随后拖动鼠标选择内容,支持多区域选取;最后通过右键复制或使用截图功能保存所选文字、图片等内容。 如果您希望在浏览网页时快速提取或分享特定内容,Bing浏览器的Web选择工具可以帮助您实现精准选取和便捷操作。以下是使用该功能的具体步骤: …

    2026年9月24日 • 用户投稿
    700
  • Java 正则表达式非贪婪匹配替换:精准替换字符串中的特定部分

    Java 正则表达式非贪婪匹配替换:精准替换字符串中的特定部分Java 正则表达式非贪婪匹配替换:精准替换字符串中的特定部分Java 正则表达式非贪婪匹配替换:精准替换字符串中的特定部分Java 正则表达式非贪婪匹配替换:精准替换字符串中的特定部分

    本文旨在解决 Java 中使用正则表达式进行字符串替换时,如何避免过度匹配,实现对特定字符串的精准替换。通过使用单词边界 ,我们可以确保只替换独立的 $c 字符串,而不会影响到 $c_new 等包含 $c 的其他字符串。本文将提供详细的代码示例和解释,帮助开发者掌握这一技巧。 在 Java 中,使用…

    2026年9月24日 • 用户投稿
    1000
  • 如何在Debian 10(Buster)Linux上安装MySQL

    了解如何在debian 10(buster)linux上安装mysql。本指南将引导您完成在最新版本的debian系统上安装mysql 8或mysql 5.7的步骤。 第1步 – 准备工作 首先,确保您拥有Debian 10系统的shell访问权限。如果是远程系统,可以通过SSH连接。W…

    2026年9月24日
    1000
  • ubuntu vnc端口冲突怎么解决

    在ubuntu系统中,如果vnc端口发生冲突,通常意味着另一个应用程序或服务已经在使用vnc默认的端口(通常是5900)。为了解决这个问题,你可以按照以下步骤操作: 查找占用端口的进程:使用netstat或lsof命令来查找哪个进程正在使用5900端口。例如,你可以运行以下命令: sudo nets…

    2026年9月24日
    000
  • sublime怎么去除购买弹窗_sublime关闭试用版购买提示的方法

    sublime怎么去除购买弹窗_sublime关闭试用版购买提示的方法sublime怎么去除购买弹窗_sublime关闭试用版购买提示的方法sublime怎么去除购买弹窗_sublime关闭试用版购买提示的方法sublime怎么去除购买弹窗_sublime关闭试用版购买提示的方法

    答案:可通过修改hosts文件、清理授权信息或降级版本缓解Sublime Text启动弹窗。具体操作包括屏蔽验证域名license.sublimehq.com、重命名Local目录下的Registry.dat文件,或安装旧版本并关闭更新提示,但建议支持正版以获得更好体验。 Sublime Text …

    2026年9月24日 • 用户投稿
    000
  • 对话非遗簪花传承人,华硕a豆携豆叮寻香泉州 国庆假期与未来香遇

    对话非遗簪花传承人,华硕a豆携豆叮寻香泉州 国庆假期与未来香遇对话非遗簪花传承人,华硕a豆携豆叮寻香泉州 国庆假期与未来香遇对话非遗簪花传承人,华硕a豆携豆叮寻香泉州 国庆假期与未来香遇对话非遗簪花传承人,华硕a豆携豆叮寻香泉州 国庆假期与未来香遇

    即日起至10月8日,时尚数码潮创先锋华硕a豆于福建泉州限时开启「与未来香遇」 “豆叮的寻香之旅”集章打卡活动,围绕茶桌仔、泉州鲤物、有鲤天台咖啡等三处特色地标打造沉浸式城市寻香狂欢;旗下ip豆叮以头戴非遗簪花的泉州限定皮肤萌力“占领”西街,延续上海安福路街区花车巡游派对的浪漫繁花景象,以“科技与非遗…

    2026年9月24日 • 用户投稿
    900
  • windows声音图标有个红叉怎么办_声音图标红叉问题的解决方法

    windows声音图标有个红叉怎么办_声音图标红叉问题的解决方法windows声音图标有个红叉怎么办_声音图标红叉问题的解决方法windows声音图标有个红叉怎么办_声音图标红叉问题的解决方法windows声音图标有个红叉怎么办_声音图标红叉问题的解决方法

    首先检查并启动Windows音频服务,确保Windows Audio和Windows Audio Endpoint Builder服务已运行;接着更新或重装声卡驱动程序,通过设备管理器卸载后重启以重新安装驱动;若问题仍存,需通过注册表编辑器检查HKEY_LOCAL_MACHINESOFTWAREMi…

    2026年9月24日 • 用户投稿
    000
  • 铁路12306电子发票下载失败怎么解决_铁路12306电子发票下载问题解决方案

    铁路12306电子发票下载失败怎么解决_铁路12306电子发票下载问题解决方案铁路12306电子发票下载失败怎么解决_铁路12306电子发票下载问题解决方案铁路12306电子发票下载失败怎么解决_铁路12306电子发票下载问题解决方案铁路12306电子发票下载失败怎么解决_铁路12306电子发票下载问题解决方案

    首先检查网络连接并重新尝试下载电子发票,若失败可联系12306客服重发,同时查看邮箱垃圾文件夹,最后可通过个人所得税App等工具同步管理发票。 如果您在尝试下载铁路12306电子发票时遇到失败情况,可能是由于网络连接、系统状态或权限设置等问题导致。以下是针对该问题的多种解决方案。 本文运行环境:iP…

    2026年9月24日 • 用户投稿
    100
  • AI音频工具有哪些_好用的AI音频工具大全

    AI音频工具有哪些_好用的AI音频工具大全AI音频工具有哪些_好用的AI音频工具大全AI音频工具有哪些_好用的AI音频工具大全AI音频工具有哪些_好用的AI音频工具大全

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 魔音工坊:AI配音神器,轻松打造媲美真人声线 讯飞智作:科大讯飞出品的语音转换与配音利器 听脑AI:智能语音记录助手 Suno:高品质AI音乐创作平台 海绵音乐:字节旗下免费AI音乐创作与探索平…

    2026年9月24日 • 用户投稿
    300
  • 2025年最受欢迎的手机数据恢复免费软件

    2025年最受欢迎的手机数据恢复免费软件2025年最受欢迎的手机数据恢复免费软件2025年最受欢迎的手机数据恢复免费软件2025年最受欢迎的手机数据恢复免费软件

    数据恢复软件可找回误删的手机数据,推荐2025年实用工具:一、数据蛙恢复专家支持快速与深度扫描,预览后导出至电脑;二、转转大师操作简单,适合新手,可恢复多种场景数据;三、Recuva无需安装,擅长小文件快速恢复,建议启用深度扫描;四、奇客数据恢复专为安卓设计,兼容性强,无需Root即可恢复消息与媒体…

    2026年9月24日 • 用户投稿
    100
  • Java正则表达式:利用词边界实现精确的非贪婪字符串替换

    Java正则表达式:利用词边界实现精确的非贪婪字符串替换Java正则表达式:利用词边界实现精确的非贪婪字符串替换Java正则表达式:利用词边界实现精确的非贪婪字符串替换Java正则表达式:利用词边界实现精确的非贪婪字符串替换

    本教程探讨如何在Java中使用正则表达式精确替换字符串中的特定部分,特别是在目标字符串不应消耗后续字符的场景。通过分析常见错误,文章详细介绍了词边界的原理与应用,展示了如何利用它实现非贪婪且不破坏原字符串结构的替换,确保匹配的精确性与替换结果的完整性。 在处理字符串替换时,我们经常面临需要精确匹配特…

    2026年9月24日 • 用户投稿
    700
  • ubuntu如何mount一个远程目录

    在ubuntu中挂载一个远程目录,通常可以使用nfs(network file system)或者sshfs(ssh filesystem)。以下是两种方法的步骤: 方法一:使用NFS挂载远程目录 安装NFS客户端(如果尚未安装): sudo apt updatesudo apt install n…

    2026年9月24日
    700

发表回复

登录后才能评论
关注微信