数据帧中高效筛选重复项并保留最新N条记录的教程

数据帧中高效筛选重复项并保留最新N条记录的教程

本教程旨在解决数据分析中常见的挑战:如何从Pandas DataFrame中高效地筛选出基于特定列的重复项,并仅保留每组重复项中的最新N条记录。我们将探讨一种简洁且性能优越的方法,即利用groupby().tail()组合操作,并提供详细的代码示例与性能考量,以帮助读者在处理大规模数据集时做出最佳选择。

引言:数据帧重复项处理的挑战

在数据清洗和预处理阶段,处理数据帧中的重复记录是一项常见任务。有时,我们不仅需要识别重复项,还需要根据特定业务逻辑进行筛选,例如,保留每组重复项中的最新或最旧的几条记录。当数据集规模庞大时,选择一个高效的处理方法至关重要,以避免不必要的计算资源消耗和漫长的等待时间。

考虑一个场景,您有一个包含用户活动记录的数据帧,其中可能存在基于用户姓名和性别等信息的多条记录。您的目标是针对每个唯一的姓名-性别组合,仅保留其最新的三条活动记录。

常见但可能效率较低的方法(基于窗口函数)

一种常见的思路是使用窗口函数(在PySpark等分布式计算框架中尤为常见,但在Pandas中也可以通过模拟实现)。其基本步骤包括:

分区 (PartitionBy):根据重复项的定义列(例如 first_name, last_name, sex)对数据进行分组。排序 (OrderBy):在每个分区内,根据一个唯一标识符(例如 id 列,代表记录的顺序或时间戳)进行排序,通常是降序以获取最新记录。行号分配 (row_number):为每个分区内的记录分配一个行号。过滤 (Filter):筛选出 row_number 小于或等于N的记录。

以下是这种思路的示例代码(模仿Spark的Window函数概念):

# 假设df是一个Pandas DataFrame,且F是pandas的函数别名# import pandas.api.extensions as F# from pandas.core.window import RollingGroupby, ExpandingGroupby # 实际Pandas中没有直接的Window函数# 这里的代码是用户尝试的Spark风格代码,在Pandas中实现会更复杂,且可能效率不高# window_spec = Window.partitionBy('first_name', 'last_name', 'sex').orderBy(F.desc('id'))# df_with_row_number = df.withColumn('row_number', F.row_number().over(window_spec))# filtered_df = df_with_row_number.filter('row_number <= 3')# result_df = filtered_df.drop('row_number')

尽管这种方法逻辑清晰,但在处理大规模Pandas DataFrame时,手动实现复杂的窗口函数逻辑(如自定义排序和行号分配)可能涉及多次数据遍历和中间DataFrame的创建,从而导致性能开销较大,尤其是在内存使用方面。

Pandas groupby().tail() 的高效解决方案

Pandas库提供了一个更为简洁和高效的方法来解决这个问题:groupby().tail()。这个组合操作允许我们首先根据指定的列对数据帧进行分组,然后从每个组的末尾(或头部)选择指定数量的行。结合预排序,这可以非常高效地实现我们的目标。

示例代码

让我们通过一个具体的例子来演示如何使用 groupby().tail(N) 来筛选并保留每组重复项的最后N条记录。

import pandas as pd# 原始数据帧示例data = {    'id': [1, 2, 3, 4, 5, 6, 7, 8, 9, 10],    'first_name': ['John', 'John', 'John', 'Mark', 'John', 'Mark', 'John', 'Mark', 'Mark', 'John'],    'last_name': ['Doe', 'Doe', 'Doe', 'Kay', 'Doe', 'Kay', 'Doe', 'Kay', 'Kay', 'Doe'],    'sex': ['Male', 'Male', 'Male', 'Male', 'Male', 'Male', 'Male', 'Male', 'Male', 'Male'],    'country': ['USA', 'Canada', 'Mexico', 'Italy', 'Spain', 'France', 'Peru', 'India', 'Laos', 'Benin']}df = pd.DataFrame(data)print("原始数据帧:")print(df)print("-" * 30)# 步骤1: 确保数据按 'id' 列(或其他代表顺序的列)排序# 这一步至关重要,它定义了“最后N个”的含义。# 如果id越大代表越新,则按id升序排列。df_sorted = df.sort_values(by='id', ascending=True)# 步骤2: 使用 groupby() 和 tail() 保留每组的最后3条记录# 根据 'first_name', 'last_name', 'sex' 进行分组,并从每个组的末尾选择3条记录result_df = df_sorted.groupby(['first_name', 'last_name', 'sex']).tail(3)# 步骤3: 重置索引(可选)# 如果需要一个干净的、从0开始的整数索引,可以执行此步骤。result_df = result_df.reset_index(drop=True)print("n筛选后的数据帧 (保留每组最新3条):")print(result_df)

代码详解

数据准备: 首先,我们创建了一个示例 pd.DataFrame,它模拟了具有重复 first_name, last_name, sex 组合的数据。数据排序 (df.sort_values(by=’id’, ascending=True)): 这是实现“保留最新N条”的关键一步。tail(N) 方法总是从组的末尾选择行。因此,为了确保这些“末尾”的行确实是您想要的“最新”记录,您必须在执行 groupby().tail() 之前,根据一个能够表示记录顺序(例如时间戳、ID号)的列对整个数据帧进行排序。在这里,我们假设 id 值越大代表记录越新,因此按 id 升序排列分组与截取 (df_sorted.groupby([‘first_name’, ‘last_name’, ‘sex’]).tail(3)):groupby([‘first_name’, ‘last_name’, ‘sex’]):根据 first_name, last_name, sex 这三列的值将数据帧分成多个逻辑组。例如,所有 John Doe Male 的记录将形成一个组。.tail(3):对于每个分组,此方法会选择该组中最后3行。由于我们之前已经按 id 进行了排序,这确保了选出的3行是该组中 id 值最大的(即最新的)3条记录。重置索引 (result_df.reset_index(drop=True)): groupby().tail() 操作会保留原始索引。如果您希望结果数据帧拥有一个从0开始的连续新索引,可以使用 reset_index(drop=True)。drop=True 参数表示不将旧索引作为新列添加到数据帧中。

输出结果

执行上述代码后,您将得到以下结果:

原始数据帧:   id first_name last_name   sex country0   1       John       Doe  Male     USA1   2       John       Doe  Male  Canada2   3       John       Doe  Male  Mexico3   4       Mark       Kay  Male   Italy4   5       John       Doe  Male   Spain5   6       Mark       Kay  Male  France6   7       John       Doe  Male    Peru7   8       Mark       Kay  Male   India8   9       Mark       Kay  Male    Laos9  10       John       Doe  Male   Benin------------------------------筛选后的数据帧 (保留每组最新3条):   id first_name last_name   sex country0   5       John       Doe  Male   Spain1   6       Mark       Kay  Male  France2   7       John       Doe  Male    Peru3   8       Mark       Kay  Male   India4   9       Mark       Kay  Male    Laos5  10       John       Doe  Male   Benin

性能考量与最佳实践

效率对比: groupby().tail() 方法在Pandas中通常比手动实现复杂的窗口函数(如使用 apply 结合自定义逻辑)更高效。Pandas的 groupby 操作是高度优化的,并且 tail 方法直接作用于分组对象,减少了中间数据结构的创建和内存消耗。排序的重要性: 务必记住,tail(N) 总是选择组的“末尾”N行。如果“最新”或“最旧”有特定定义,您必须在 groupby 之前对数据帧进行适当的排序。要保留最新N条,按时间/ID升序排序,然后使用 tail(N)。要保留最旧N条,按时间/ID降序排序,然后使用 tail(N),或者更直接地使用 head(N) (在升序排序后)。数据规模: 对于中等规模的数据集(GB级别),Pandas的 groupby().tail() 表现优异。对于超大规模数据集(TB级别或更大),您可能需要考虑使用分布式计算框架,如PySpark,其中窗口函数是其核心功能,并能更好地利用集群资源。处理 NaN 值: groupby 操作默认会忽略分组键中的 NaN 值。如果您的分组列中可能包含 NaN,并且您希望将它们视为一个独立的组或进行特定处理,请在 groupby 之前进行适当的缺失值处理(如填充或删除)。

总结

本教程详细介绍了如何利用Pandas的 groupby().tail() 方法高效地从数据帧中筛选出基于特定列的重复项,并仅保留每组的最新N条记录。通过结合 sort_values 进行预排序,这种方法不仅代码简洁,而且在性能上通常优于手动实现的窗口函数逻辑。理解并正确应用这些Pandas操作,将极大地提升您在数据清洗和预处理任务中的效率。

以上就是数据帧中高效筛选重复项并保留最新N条记录的教程的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1370210.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
上一篇 2025年12月14日 10:20:35
下一篇 2025年12月14日 10:20:48

相关推荐

  • 列表推导式(List Comprehension)和生成器表达式(Generator Expression)的区别。

    列表推导式立即生成完整列表并占用较多内存,而生成器表达式按需生成值、内存占用小,适合处理大数据;前者适用于需多次访问或索引的场景,后者更高效于单次遍历和数据流处理。 列表推导式和生成器表达式的核心区别在于它们如何处理内存和何时生成值:列表推导式会立即在内存中构建并存储一个完整的列表,而生成器表达式则…

    2025年12月14日
    000
  • 如何解决背包问题?

    动态规划是解决0/1背包问题的核心方法,通过构建dpi表示前i件物品在容量j下的最大价值,利用状态转移方程dpi = max(dpi-1, v[i] + dpi-1])逐层求解,最终得到dpn为最优解;该方法时间复杂度O(nW),空间复杂度可优化至O(W);相比贪心算法仅适用于分数背包、回溯法效率低…

    2025年12月14日
    000
  • 数据帧重复记录筛选:高效保留指定数量的最新数据

    本教程详细探讨如何在数据帧中高效处理重复记录,并仅保留每组重复项中的指定数量(例如,最新的N条)。文章将介绍两种主流的数据处理工具:Pandas的groupby().tail()方法和PySpark的窗口函数。通过具体的代码示例和解释,帮助读者理解并应用这些技术,以优化数据清洗和预处理流程,特别是在…

    2025年12月14日
    000
  • Pandas DataFrame 中高效去除重复项并保留指定数量的最新记录

    本文档旨在介绍如何使用 Pandas DataFrame 有效地过滤掉重复项,并为每个重复组保留指定数量的最新记录。我们将演示如何根据特定列识别重复项,并利用 groupby() 和 tail() 函数实现高效的数据筛选,特别适用于大型数据集。 在数据分析和处理中,经常需要处理包含重复项的数据集。 …

    2025年12月14日
    000
  • Python中的深拷贝与浅拷贝有什么区别?

    深拷贝和浅拷贝的核心区别在于对嵌套对象的处理:浅拷贝仅复制对象顶层结构,共享嵌套对象引用,修改嵌套内容会影响原对象;深拷贝则递归复制所有层级对象,创建完全独立的副本,互不影响。Python中通过copy.copy()实现浅拷贝,适用于不可变嵌套或需共享数据的场景;copy.deepcopy()实现深…

    2025年12月14日
    000
  • Python中的元类(Metaclass)是什么?有什么使用场景?

    元类是Python中用于创建类的“类”,它通过继承type并重写__new__方法,在类定义时拦截创建过程,实现属性注入、结构验证、自动注册等功能,如为类自动添加version或表名;相比类装饰器的后处理,元类介入更早、控制更深,适用于强制契约或框架级设计,但应避免过度使用以防止复杂难维护。 Pyt…

    2025年12月14日
    000
  • Python的自省(Introspection)能力指的是什么?

    Python自省指程序运行时检查对象类型、属性、方法的能力,核心应用场景包括框架开发(如Django自动发现模型)、调试(inspect获取栈帧、源码)、元编程(动态创建类、生成代码)。inspect模块提供getmembers、getsource、signature等函数,可获取成员信息、源代码、…

    2025年12月14日
    000
  • 如何按值对字典进行排序?

    按值排序字典需用sorted()结合items()和key参数,结果为列表,可转回有序字典。 在Python中,字典本身在3.7版本之前是无序的,之后虽然保留了插入顺序,但它并不是一个按值排序的数据结构。要实现按值排序,我们通常需要将字典转换为一个可排序的序列,比如一个包含键值对元组的列表,然后利用…

    2025年12月14日
    000
  • Selenium Edge WebDriver 初始化最佳实践与常见错误解析

    本教程详细解析了Selenium中初始化Edge WebDriver时常见的AttributeError问题,指出直接传递驱动路径字符串的旧有方式不再适用。文章介绍了两种现代且推荐的解决方案:一是利用webdriver_manager库实现驱动自动管理,二是利用Selenium 4.6.0及以上版本…

    2025年12月14日
    000
  • 如何在Python模拟中实现粒子云动画而非轨迹追踪

    本文详细介绍了如何在Python物理模拟中,利用Matplotlib的FuncAnimation功能,将粒子动画从轨迹线改为离散的粒子云效果。通过调整绘图参数、优化动画播放速度以及实现动画保存,教程将帮助读者创建更直观、专业的粒子系统动态展示。 1. 引言:粒子动画的挑战与目标 在物理模拟中,可视化…

    2025年12月14日
    000
  • 谈谈你对RESTful API的理解并用Flask实现一个简单的GET/POST接口。

    RESTful API是一种以资源为中心、利用HTTP协议实现的轻量级设计风格。它强调URI标识资源、统一接口(GET/POST/PUT/DELETE)、无状态通信、客户端-服务器分离、可缓存性和分层系统,使API更直观、可扩展。与RPC/SOAP不同,RESTful不关注操作方法,而是通过标准HT…

    2025年12月14日
    000
  • 屏蔽 Google Cloud Error Reporting 中的冗余错误

    屏蔽 Google Cloud Error Reporting 中的冗余错误 Google Cloud Error Reporting (GCR) 是一个强大的工具,可以帮助开发者监控和调试应用程序。然而,在使用 FastAPI 等框架构建应用程序并部署到 Google Cloud Run 时,GC…

    2025年12月14日
    000
  • 如何重载Python运算符?

    Python通过魔术方法实现运算符重载,如__add__、__mul__等,使自定义类支持+、*等操作,需注意类型检查、行为一致性及可读性,适用于向量、矩阵等数学对象,提升代码简洁性与直观性。 Python 运算符重载,简单来说,就是让你自定义类的对象能够使用像 + , – , * , [] 这样的…

    2025年12月14日
    000
  • Flask 重定向与 after_request:优化请求后处理逻辑

    本文探讨了Flask应用中,当路由涉及重定向且需要执行请求后(after_request)处理时可能遇到的挑战。针对多个after_request装饰器导致的执行顺序混乱或“卡住”问题,教程提出并演示了将所有请求后逻辑合并到一个集中式处理函数中的解决方案,通过request.endpoint精确匹配…

    2025年12月14日
    000
  • 使用BeautifulSoup提取HTML文本段落并识别高亮状态

    本文详细介绍了如何利用Python的BeautifulSoup库解析HTML文本,以精确地提取其中的文本片段,同时保持其原始顺序,并识别哪些片段属于特定类别的高亮元素。通过结合find_all(string=True)方法遍历所有文本节点和find_parent()方法检查父元素,我们能够高效地构建…

    2025年12月14日
    000
  • 利用BeautifulSoup有序提取HTML文本并识别特定元素

    本文旨在指导读者如何使用Python的BeautifulSoup库从HTML内容中精确提取文本片段,同时保持其在文档中的原始顺序,并识别这些片段是否被特定的HTML元素(如具有特定class的标签)所包裹。通过结合find_all(string=True)和find_parent()方法,我们将展示…

    2025年12月14日
    000
  • PostgreSQL SERIALIZABLE隔离级别:告别误解,掌握其工作原理

    PostgreSQL的SERIALIZABLE隔离级别旨在确保并发事务的执行结果等同于某种串行执行,从而避免所有并发异常。它并非将事务物理上串行化,而是通过检测并阻止可能破坏串行等效性的操作来维护数据一致性。理解其核心在于“串行等效性”而非“串行执行”,这对于正确设计和调试高并发应用至关重要。 1.…

    2025年12月14日
    000
  • 什么是SQL注入?如何在Python中避免?

    SQL注入危险且易导致数据泄露或系统瘫痪,其发生源于用户输入被直接拼接进SQL语句;正确防范方式是使用参数化查询或ORM框架,如Python中sqlite3的?占位符或SQLAlchemy等ORM工具,确保用户输入被视为数据而非代码,从而彻底隔离风险。 SQL注入是一种非常危险的数据库安全漏洞,它允…

    2025年12月14日
    000
  • Python BeautifulSoup:按序提取HTML文本及高亮标识

    本教程详细介绍如何使用Python的BeautifulSoup库,从HTML文本中高效提取所有文本段落,并准确识别哪些段落被特定标签(如class=’highlight’)包裹,同时严格保持文本在原始HTML中的出现顺序。通过迭代所有文本节点并检查其父元素,实现精确的数据结构…

    2025年12月14日
    000
  • 如何用Python实现一个LRU缓存?

    答案:LRU缓存通过字典和双向链表结合实现,字典提供O(1)查找,双向链表维护访问顺序,确保插入、删除和访问更新均为O(1)操作。每次get或put操作都会将对应节点移至链表头部,当缓存满时,尾部节点被移除,从而保证最久未使用项优先淘汰。虚拟头尾节点简化边界处理,而OrderedDict虽可替代实现…

    2025年12月14日
    000

发表回复

登录后才能评论
关注微信