Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
Pandas数据帧中高效筛选N个重复项并保留最后N条记录_创想鸟

Pandas数据帧中高效筛选N个重复项并保留最后N条记录

Pandas数据帧中高效筛选N个重复项并保留最后N条记录

本教程将探讨如何在Pandas数据帧中高效处理重复数据,具体目标是针对指定列的重复组,仅保留每组的最后N条记录。我们将介绍并演示使用groupby().tail()方法的简洁实现,该方法对于在内存中处理中等规模数据集时,能提供比基于行号的窗口函数更直观和高效的解决方案。

问题描述与背景

在数据处理过程中,我们经常会遇到需要从数据集中筛选重复记录的场景。有时,我们并非要完全删除所有重复项,而是希望为每个重复组保留特定数量的记录,例如最新的n条或按某种顺序排列的最后n条记录。

考虑一个包含用户交易记录或日志条目的数据帧,其中first_name、last_name和sex可能存在大量重复,但id和country是唯一的。我们的目标是,对于每个相同的first_name、last_name和sex组合,只保留其对应的最后3条记录(通常根据id或其他时间戳字段来定义“最后”)。

原始数据帧示例如下:

id first_name last_name sex country

01JohnDoeMaleUSA02JohnDoeMaleCanada03JohnDoeMaleMexico04MarkKayMaleItaly05JohnDoeMaleSpain06MarkKayMaleFrance07JohnDoeMalePeru08MarkKayMaleIndia09MarkKayMaleLaos10JohnDoeMaleBenin

期望结果是,对于John Doe Male和Mark Kay Male这两个重复组,分别只保留其最后3条记录:

id first_name last_name sex country

05JohnDoeMaleSpain06MarkKayMaleFrance07JohnDoeMalePeru08MarkKayMaleIndia09MarkKayMaleLaos10JohnDoeMaleBenin

对于大规模数据集,尤其是在分布式计算环境如Spark中,一种常见的解决方案是使用窗口函数(Window.partitionBy().orderBy().row_number())来为每个组内的记录分配行号,然后筛选出小于等于N的记录。这种方法在Spark中是标准且高效的,但在Pandas中,我们有更简洁且同样高效的替代方案。

Pandas groupby().tail() 方法详解

Pandas库提供了一个非常直观且高效的方法groupby().tail(n)来解决上述问题。它允许我们对数据帧进行分组,然后从每个组的末尾选择指定数量的记录。

核心思想

df.groupby(by_columns).tail(n)的工作原理是:

根据by_columns指定的列将数据帧分成若干个组。对于每个独立的分组,从其末尾(即最后)选取n条记录。将这些选取的记录合并成一个新的数据帧。

需要注意的是,tail()方法中的“末尾”是基于当前数据帧的行顺序。因此,如果“最后N条”的定义是基于某个特定字段(例如时间戳或ID)的最新记录,那么在应用groupby().tail()之前,对数据帧进行相应的排序是至关重要的一步。

实现步骤

以下是使用Pandas groupby().tail() 方法的详细实现步骤:

导入必要的库:首先,我们需要导入pandas库。

创建示例数据帧:为了演示,我们使用与问题描述中相同的数据来构建一个Pandas DataFrame。

数据排序(关键步骤):由于我们希望保留“最后3条”记录,并且这个“最后”是基于id列的递增顺序来定义的,因此在执行分组和选择操作之前,必须先根据id列对整个数据帧进行升序排序。这确保了在每个组内,tail(3)操作会正确地选择具有最大id值的3条记录。

应用 groupby() 和 tail():使用groupby()方法指定分组的键(first_name, last_name, sex),然后链式调用tail(3)来保留每个组的最后3条记录。

重置索引(可选):groupby().tail()操作会保留原始数据帧的索引。如果需要一个从0开始的连续新索引,可以调用reset_index(drop=True)。

示例代码

import pandas as pd# 1. 创建示例数据帧data = {    'id': [1, 2, 3, 4, 5, 6, 7, 8, 9, 10],    'first_name': ['John', 'John', 'John', 'Mark', 'John', 'Mark', 'John', 'Mark', 'Mark', 'John'],    'last_name': ['Doe', 'Doe', 'Doe', 'Kay', 'Doe', 'Kay', 'Doe', 'Kay', 'Kay', 'Doe'],    'sex': ['Male', 'Male', 'Male', 'Male', 'Male', 'Male', 'Male', 'Male', 'Male', 'Male'],    'country': ['USA', 'Canada', 'Mexico', 'Italy', 'Spain', 'France', 'Peru', 'India', 'Laos', 'Benin']}df = pd.DataFrame(data)print("原始数据帧:")print(df)print("-" * 30)# 2. 排序数据帧:确保 '最后N条' 是根据 'id' 的最新值# 如果不排序,tail(3)会根据原始输入顺序的最后3行来取df_sorted = df.sort_values(by='id', ascending=True)# 3. 使用 groupby().tail() 保留每个组的最后3条记录# 分组键为 'first_name', 'last_name', 'sex'# tail(3) 表示保留每个组的最后3行result_df = df_sorted.groupby(['first_name', 'last_name', 'sex']).tail(3)# 4. 重置索引(可选,使索引从0开始连续)result_df = result_df.reset_index(drop=True)print("n筛选后的数据帧 (保留每个重复组的最后3条记录):")print(result_df)

输出结果

运行上述代码将得到以下输出:

原始数据帧:   id first_name last_name   sex country0   1       John       Doe  Male     USA1   2       John       Doe  Male  Canada2   3       John       Doe  Male  Mexico3   4       Mark       Kay  Male   Italy4   5       John       Doe  Male   Spain5   6       Mark       Kay  Male  France6   7       John       Doe  Male    Peru7   8       Mark       Kay  Male   India8   9       Mark       Kay  Male    Laos9  10       John       Doe  Male   Benin------------------------------筛选后的数据帧 (保留每个重复组的最后3条记录):   id first_name last_name   sex country0   5       John       Doe  Male   Spain1   6       Mark       Kay  Male  France2   7       John       Doe  Male    Peru3   8       Mark       Kay  Male   India4   9       Mark       Kay  Kay   Laos5  10       John       Doe  Male   Benin

方法比较与适用场景

Pandas groupby().tail():

优点: 代码简洁,易于理解和实现。对于在内存中能够处理的数据集(通常是中等规模),其执行效率非常高。避免了显式创建额外的行号列,减少了中间步骤。适用场景: 适用于数据量可以在单机内存中处理的场景,或者作为数据探索和预处理的快速方法。

Spark 窗口函数 (row_number()):

优点: 专为分布式计算设计,能够高效处理PB级别的大规模数据集。是Spark中处理此类分组排序筛选问题的标准和推荐方法。适用场景: 适用于需要处理超出单机内存容量的超大规模数据集,或在Hadoop/Spark集群环境中进行数据处理的场景。

选择建议:如果您正在使用Pandas处理数据,并且数据集大小适中(能够完全载入内存),那么groupby().tail()无疑是实现此目标的最佳选择,它提供了简洁性和高效性。如果您在分布式环境(如Spark)中工作,并且数据量巨大,那么使用Spark的窗口函数是更合适的策略。

注意事项

排序的重要性: 再次强调,如果“最后N条”的定义依赖于某个特定字段的顺序(例如时间戳、ID等),则在应用groupby().tail()之前,务必对数据帧进行相应的排序。否则,tail()将根据数据帧当前的物理顺序来选取行。性能考量: 尽管groupby().tail()在Pandas中效率很高,但Pandas本身是基于内存的库。对于数十GB甚至TB级别的数据,即使使用此方法,也可能遇到内存限制。在这种情况下,分布式计算框架(如Spark)是不可避免的选择。head() 与 tail(): 与tail(n)类似,Pandas也提供了groupby().head(n)方法,用于保留每个分组的前N条记录。根据具体需求,可以选择使用head()或tail()。

总结

通过本教程,我们学习了如何在Pandas数据帧中高效地筛选出每个重复组的最后N条记录。df.sort_values().groupby().tail(n).reset_index(drop=True)这一组合操作提供了一个简洁而强大的解决方案,尤其适用于在内存中处理中等规模数据集的场景。理解其背后的原理以及排序的重要性,将帮助您更灵活、更高效地进行数据清洗和预处理工作。在面对不同规模和环境的数据时,选择合适的工具和方法是数据处理成功的关键。

以上就是Pandas数据帧中高效筛选N个重复项并保留最后N条记录的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1370214.html

赞 (0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
Pandas数据处理:高效筛选重复记录并保留指定数量的最新数据
上一篇 2025年12月14日 10:20:48
解决 PyInstaller “命令未识别” 错误的完整指南
下一篇 2025年12月14日 10:21:11

相关推荐

  • 抖音主页怎么做合集?抖音合集如何创建

    抖音主页怎么做合集?抖音合集如何创建抖音主页怎么做合集?抖音合集如何创建抖音主页怎么做合集?抖音合集如何创建抖音主页怎么做合集?抖音合集如何创建

    随着抖音的不断发展,越来越多用户开始重视个人主页的运营。其中,主页合集功能成为提升账号专业度和内容可读性的关键工具。一个结构清晰、主题明确的抖音合集,不仅能增强粉丝粘性,还能有效吸引新观众。那么,如何创建并优化你的抖音主页合集呢?下面为你全面解析。 一、什么是抖音主页合集 抖音主页合集是平台提供的一…

    2026年9月28日 • 用户投稿
    500
  • firefox浏览器如何清除指定的网站数据 Firefox浏览器清除单个网站数据教程

    firefox浏览器如何清除指定的网站数据 Firefox浏览器清除单个网站数据教程firefox浏览器如何清除指定的网站数据 Firefox浏览器清除单个网站数据教程firefox浏览器如何清除指定的网站数据 Firefox浏览器清除单个网站数据教程firefox浏览器如何清除指定的网站数据 Firefox浏览器清除单个网站数据教程

    首先通过设置页面精准删除特定网站数据,进入“隐私与安全”中的“管理数据”,搜索并移除目标站点;其次可利用地址栏的站点信息面板,一键清除当前访问网站的Cookie与数据;最后可通过安装附加组件实现批量或规则化管理,提升清理效率。 如果您希望在Firefox浏览器中移除某个特定网站的浏览数据,例如缓存、…

    2026年9月28日 • 用户投稿
    200
  • linux开发vm虚拟机开发环境共享

    经过一段时间的沉寂,我终于抽出时间来整理了一个非常有用的工具。这款工具主要面向使用golang、php和java的linux开发环境。尽管java开发者通常使用图形界面工具进行开发,这里就不详细讨论了,但对于golang或php开发者来说,拥有一个与线上环境相似的linux开发虚拟机是非常必要的,因…

    2026年9月28日
    000
  • windows蓝屏代码unmountable_boot_volume怎么办 蓝屏unmountable_boot_volume的解决方法

    蓝屏错误“UNMOUNTABLE_BOOT_VOLUME”通常由硬盘、文件系统或驱动问题引起,可依次尝试安全模式下运行chkdsk修复磁盘、使用SFC和DISM修复系统文件、更新或回滚存储控制器驱动、通过安装U盘重建MBR和BCD引导信息,并利用CrystalDiskInfo等工具检测硬盘健康状况,…

    2026年9月28日
    000
  • Safari浏览器如何阻止网站跟踪我_Safari浏览器开启“智能防跟踪”功能指南

    Safari浏览器如何阻止网站跟踪我_Safari浏览器开启“智能防跟踪”功能指南Safari浏览器如何阻止网站跟踪我_Safari浏览器开启“智能防跟踪”功能指南Safari浏览器如何阻止网站跟踪我_Safari浏览器开启“智能防跟踪”功能指南Safari浏览器如何阻止网站跟踪我_Safari浏览器开启“智能防跟踪”功能指南

    1、Safari浏览器可通过启用智能防跟踪功能阻止跨站追踪,保护用户隐私。2、在设置中勾选阻止跨站跟踪并选择始终阻止Cookie可增强防护,但可能影响网站登录便利性。3、定期清除所有历史记录能消除过往跟踪数据。4、使用无痕窗口可避免本地留存浏览痕迹,适合敏感操作。 如果您在浏览网页时发现广告内容与您…

    2026年9月28日 • 用户投稿
    100
  • DeepSeek如何配置负载测试 DeepSeek压力测试方案

    DeepSeek如何配置负载测试 DeepSeek压力测试方案DeepSeek如何配置负载测试 DeepSeek压力测试方案DeepSeek如何配置负载测试 DeepSeek压力测试方案DeepSeek如何配置负载测试 DeepSeek压力测试方案

    本文将指导您如何配置DeepSeek进行负载测试,以评估其在不同压力下的性能表现。我们将详细介绍从准备工作到执行测试再到结果分析的整个流程,帮助您掌握DeepSeek压力测试的常用方法和关键步骤。通过这些方法,您可以了解DeepSeek在处理高并发请求时的稳定性和响应速度,并为优化其性能提供数据支持…

    2026年9月28日 • 用户投稿
    100
  • 计算JSON驱动的问卷调查路径数量:Java递归实现

    计算JSON驱动的问卷调查路径数量:Java递归实现计算JSON驱动的问卷调查路径数量:Java递归实现计算JSON驱动的问卷调查路径数量:Java递归实现计算JSON驱动的问卷调查路径数量:Java递归实现

    本文档旨在指导开发者如何使用Java和JSON数据,计算一个基于JSON配置的问卷调查中所有可能的路径数量。我们将通过一个实际的问卷调查JSON结构示例,展示如何使用递归算法有效地遍历所有可能的答案分支,并最终得到路径总数。重点在于理解递归在解决此类问题中的应用,以及如何根据JSON结构调整递归逻辑…

    2026年9月28日 • 用户投稿
    300
  • 为什么不同用户对同一型号硬件的评价差异很大?

    为什么不同用户对同一型号硬件的评价差异很大?为什么不同用户对同一型号硬件的评价差异很大?为什么不同用户对同一型号硬件的评价差异很大?为什么不同用户对同一型号硬件的评价差异很大?

    评价差异源于用户需求、场景、预期和敏感度不同,同一硬件在不同语境下表现各异,好与坏取决于个体参照系和使用目的。 评价差异很大,这其实很正常,因为它源于用户独特的需求、使用环境、预期值以及对硬件特性敏感度的不同。一个硬件产品,从来都不是一个孤立的“好”或“坏”的实体,它总是在特定的语境中被感知和判断。…

    2026年9月28日 • 用户投稿
    000
  • SublimeText官网下载教程_如何找到并安装正确版本

    SublimeText官网下载教程_如何找到并安装正确版本SublimeText官网下载教程_如何找到并安装正确版本SublimeText官网下载教程_如何找到并安装正确版本SublimeText官网下载教程_如何找到并安装正确版本

    首先访问官网https://www.sublimetext.com/并核对域名与证书,然后根据系统选择对应版本下载安装,最后通过“帮助-关于”确认版本信息以确保正确安装。 如果您尝试下载Sublime Text编辑器,但访问了错误的链接或选择了不兼容的版本,则可能导致安装失败或功能异常。以下是解决此…

    2026年9月28日 • 用户投稿
    500
  • win10提示“引用了一个不可用的位置”_快捷方式或文件位置不可用错误解决

    win10提示“引用了一个不可用的位置”_快捷方式或文件位置不可用错误解决win10提示“引用了一个不可用的位置”_快捷方式或文件位置不可用错误解决win10提示“引用了一个不可用的位置”_快捷方式或文件位置不可用错误解决win10提示“引用了一个不可用的位置”_快捷方式或文件位置不可用错误解决

    当快捷方式提示“引用了一个不可用的位置”时,说明目标文件路径失效。首先可尝试右键快捷方式→属性→快捷方式→查找目标,手动重新定位文件位置;若失败,则进入程序安装目录(如C:Program Files)右键主程序.exe→发送到→桌面快捷方式,重建快捷方式;对于系统性问题,以管理员身份运行命令提示符执…

    2026年9月28日 • 用户投稿
    600
  • 优化 Java 条件语句:避免嵌套和空语句,提升代码可读性

    优化 Java 条件语句:避免嵌套和空语句,提升代码可读性优化 Java 条件语句:避免嵌套和空语句,提升代码可读性优化 Java 条件语句:避免嵌套和空语句,提升代码可读性优化 Java 条件语句:避免嵌套和空语句,提升代码可读性

    本文旨在帮助开发者优化 Java 中复杂的条件语句,特别是涉及多个条件判断的情况。通过反转条件、应用德摩根定律等技巧,可以有效避免嵌套的 if 语句和空 if 块,从而提升代码的可读性和简洁性,减少潜在的错误。 在编写 Java 代码时,复杂的条件语句往往会降低代码的可读性和维护性。嵌套的 if 语…

    2026年9月28日 • 用户投稿
    000
  • Sublime安装Git插件教程_Git版本控制工具集成指南

    Sublime安装Git插件教程_Git版本控制工具集成指南Sublime安装Git插件教程_Git版本控制工具集成指南Sublime安装Git插件教程_Git版本控制工具集成指南Sublime安装Git插件教程_Git版本控制工具集成指南

    首先通过Package Control安装Git插件,其次可手动下载并放入Packages目录,然后配置系统Git路径,最后验证Git状态、提交等功能是否正常。 如果您希望在Sublime Text中实现代码的版本控制功能,但尚未集成Git插件,则可以通过安装和配置相关插件来完成。以下是实现Git与…

    2026年9月28日 • 用户投稿
    000
  • 豆包AI如何实现语音转写 豆包AI会议记录自动生成

    豆包AI如何实现语音转写 豆包AI会议记录自动生成豆包AI如何实现语音转写 豆包AI会议记录自动生成豆包AI如何实现语音转写 豆包AI会议记录自动生成豆包AI如何实现语音转写 豆包AI会议记录自动生成

    本文将详细介绍豆包AI如何实现高效的语音转写,并阐述其在会议记录自动生成方面的应用。我们将从豆包AI的核心技术、转写流程,以及如何利用其功能优化会议记录的生成过程等方面进行讲解,帮助您更好地理解和运用这项技术。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek …

    2026年9月28日 • 用户投稿
    000
  • 360极速浏览器鼠标手势怎么设置_360极速浏览器自定义鼠标手势功能详解

    360极速浏览器鼠标手势怎么设置_360极速浏览器自定义鼠标手势功能详解360极速浏览器鼠标手势怎么设置_360极速浏览器自定义鼠标手势功能详解360极速浏览器鼠标手势怎么设置_360极速浏览器自定义鼠标手势功能详解360极速浏览器鼠标手势怎么设置_360极速浏览器自定义鼠标手势功能详解

    首先启用鼠标手势功能,进入360极速浏览器设置页面,勾选“启用鼠标手势”;接着开启“启用鼠标手势提示”和“显示鼠标轨迹”以获得操作反馈;随后查看默认手势列表并熟悉预设操作;最后点击“添加新手势”,绘制自定义轨迹并分配如前进、后退等命令,完成个性化设置。 如果您希望在浏览网页时通过简单的鼠标动作快速执…

    2026年9月28日 • 用户投稿
    000
  • win11产品密钥在哪里看_查找系统激活密钥的方法

    win11产品密钥在哪里看_查找系统激活密钥的方法win11产品密钥在哪里看_查找系统激活密钥的方法win11产品密钥在哪里看_查找系统激活密钥的方法win11产品密钥在哪里看_查找系统激活密钥的方法

    1、通过命令提示符输入wmic path SoftwareLicensingService get OA3xOriginalProductKey可查询OEM设备的BIOS密钥;2、注册表路径HKEY_LOCAL_MACHINESOFTWAREMicrosoftWindows NTCurrentVer…

    2026年9月28日 • 用户投稿
    000
  • Gemini如何接入数据分析 Gemini大数据处理接口

    Gemini如何接入数据分析 Gemini大数据处理接口Gemini如何接入数据分析 Gemini大数据处理接口Gemini如何接入数据分析 Gemini大数据处理接口Gemini如何接入数据分析 Gemini大数据处理接口

    本文将详细介绍如何将 Gemini 的数据分析能力接入到大数据处理流程中,并提供具体的操作步骤,帮助您更有效地利用 Gemini 进行数据洞察和分析。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 数据接入基础准备 在开始接入之前,您需要对…

    2026年9月28日 • 用户投稿
    000
  • SublimeText如何取消正在运行的程序_CancelBuild快捷键设置

    SublimeText如何取消正在运行的程序_CancelBuild快捷键设置SublimeText如何取消正在运行的程序_CancelBuild快捷键设置SublimeText如何取消正在运行的程序_CancelBuild快捷键设置SublimeText如何取消正在运行的程序_CancelBuild快捷键设置

    可通过设置快捷键解决Sublime Text无法中断运行程序的问题:一、在Preferences→Key Bindings中添加{“keys”: [“ctrl+shift+c”], “command”: “exec&…

    2026年9月28日 • 用户投稿
    000
  • 计算JSON驱动的问卷调查的可能路径数:Java递归实现

    计算JSON驱动的问卷调查的可能路径数:Java递归实现计算JSON驱动的问卷调查的可能路径数:Java递归实现计算JSON驱动的问卷调查的可能路径数:Java递归实现计算JSON驱动的问卷调查的可能路径数:Java递归实现

    本文旨在提供一种使用Java和递归算法,计算基于JSON配置的问卷调查中所有可能的路径数量的解决方案。我们将深入探讨如何解析JSON结构,并使用递归函数遍历所有可能的答案分支,最终计算出完成问卷调查的不同方式的总数。此外,还将讨论在设计此类问卷调查逻辑时的一些注意事项。 理解JSON问卷结构 首先,…

    2026年9月28日 • 用户投稿
    000
  • 小红书如何利用话题标签增加曝光 小红书热门标签的使用秘诀

    小红书如何利用话题标签增加曝光 小红书热门标签的使用秘诀小红书如何利用话题标签增加曝光 小红书热门标签的使用秘诀小红书如何利用话题标签增加曝光 小红书热门标签的使用秘诀小红书如何利用话题标签增加曝光 小红书热门标签的使用秘诀

    选择与内容高度相关的标签,如分享美白精华心得时使用#美白精华、#淡斑等精准标签,提升平台推荐准确性;2. 结合热门标签与长尾标签,如在使用#美白精华的同时添加#敏感肌美白精华、#学生党美白精华,平衡流量与竞争;3. 积极使用品牌或官方活动标签,如参与#我的夏日穿搭挑战赛时带上官方标签,增加曝光与活动…

    2026年9月28日 • 用户投稿
    000
  • 360极速浏览器打开网页乱码怎么办_网页显示乱码问题解决方法

    360极速浏览器打开网页乱码怎么办_网页显示乱码问题解决方法360极速浏览器打开网页乱码怎么办_网页显示乱码问题解决方法360极速浏览器打开网页乱码怎么办_网页显示乱码问题解决方法360极速浏览器打开网页乱码怎么办_网页显示乱码问题解决方法

    首先尝试手动切换网页编码,点击右键选择“编码”后依次尝试UTF-8或GB2312;若无效则清除浏览器缓存,进入设置清理临时文件;同时检查系统语言区域是否设为中国且显示语言为中文;最后可重置浏览器高级设置恢复默认。 如果您在使用360极速浏览器访问网页时,发现页面内容显示为乱码,则可能是由于浏览器的字…

    2026年9月28日 • 用户投稿
    000

发表回复

登录后才能评论
关注微信