Pandas教程：高效向DataFrame添加唯一行并重置连续ID

程序猿 • 2025年12月14日 20:03:06 • 好文分享 • 阅读 0

本教程详细介绍了如何使用pandas高效地向现有dataframe添加新行，同时自动去重并确保id列的连续性。通过结合pd.concat和drop_duplicates方法，并最终重新分配id，我们能够简洁地处理数据合并与清洗任务，避免常见问题。

在数据处理和分析中，我们经常需要将新的数据记录合并到现有的数据集中。一个常见的需求是确保合并后的数据不包含重复项，并且如果存在主键（如ID列），该主键能够保持连续和唯一。直接使用循环和DataFrame.append()方法虽然可以实现添加行，但在处理大量数据时效率低下，并且在去重操作后，原始的ID列可能会出现不连续或NaN值，导致数据完整性问题。

本教程将介绍一种更高效、更符合Pandas惯用法的解决方案，以解决向DataFrame添加唯一行并维护ID序列的问题。

核心问题分析

假设我们有一个包含ID和名称的CSV文件，需要添加一组新的名称。其中，某些新名称可能已存在于原始文件中，我们希望在添加时自动去除这些重复项，并最终使ID列从0开始连续编号。

原始数据示例：

Id Name

0Alpha1Beta2Gamma3Delta

待添加数据： [“Epsilon”, “Beta”, “Zeta”]

期望结果：

Id Name

0Alpha1Beta2Gamma3Delta4Epsilon5Zeta

用户尝试使用循环append并随后drop_duplicates，发现ID列出现NaN或不连续的问题，这正是我们本教程要解决的核心痛点。

解决方案：Pandas高效去重与ID重置

Pandas提供了功能强大且优化的方法来处理这类数据合并和清洗任务。我们将采用以下步骤：

1. 准备初始DataFrame

首先，我们模拟原始的DataFrame。

import pandas as pd# 模拟原始DataFramedata = {'Id': [0, 1, 2, 3], 'Name': ['Alpha', 'Beta', 'Gamma', 'Delta']}df = pd.DataFrame(data)print("原始DataFrame:")print(df)# 待添加的新项items = ["Epsilon", "Beta", "Zeta"]

2. 将新数据转换为DataFrame

为了能够与现有DataFrame进行高效合并，首先将待添加的列表转换为一个临时的DataFrame。注意，这里我们只创建Name列。

new_items_df = pd.DataFrame({"Name": items})print("n待添加项DataFrame:")print(new_items_df)

3. 合并DataFrame并去除重复项

使用pd.concat()函数将原始DataFrame和包含新项的DataFrame垂直合并。pd.concat()是Pandas中用于组合Series或DataFrame对象的强大工具，它比循环append效率更高。

合并后，我们立即使用drop_duplicates()方法来去除基于Name列的重复项。subset=”Name”参数指定了去重时只考虑Name列的值。默认情况下，drop_duplicates()会保留第一次出现的行。

# 合并原始DataFrame和新项，然后去重# 注意：这里我们只关心Name列，Id列会在下一步重新生成combined_df = pd.concat([df, new_items_df]).drop_duplicates(subset="Name", ignore_index=True)print("n合并并去重后的DataFrame (ID尚未重置):")print(combined_df)

说明： ignore_index=True 在这里是可选的，它的作用是合并后重置索引，但由于我们最终会手动重新分配Id列，所以对最终结果影响不大，但能使中间结果的索引更整洁。

4. 重新分配连续的ID

在去重完成后，原始的Id列可能不再连续，或者对于新添加的行是缺失的。为了满足ID从0开始连续递增的要求，我们简单地为Id列重新赋值，使用range(len(combined_df))生成一个从0到DataFrame行数减1的序列。

# 重新分配连续的IDcombined_df["Id"] = range(len(combined_df))print("n最终结果 (ID已重置):")print(combined_df)

完整示例代码

将上述步骤整合到一起，形成一个完整的解决方案：

import pandas as pd# 模拟原始DataFramedata = {'Id': [0, 1, 2, 3], 'Name': ['Alpha', 'Beta', 'Gamma', 'Delta']}df = pd.DataFrame(data)# 待添加的新项items = ["Epsilon", "Beta", "Zeta"]# 1. 将新项转换为DataFramenew_items_df = pd.DataFrame({"Name": items})# 2. 合并原始DataFrame和新项，并根据'Name'列去重# ignore_index=True 在这里是可选的，但可以使合并后的索引更整洁final_df = pd.concat([df, new_items_df], ignore_index=True).drop_duplicates(subset="Name")# 3. 重新分配连续的IDfinal_df["Id"] = range(len(final_df))print(final_df)# 如果需要将结果保存到CSV文件# final_df.to_csv('output.csv', index=False)

输出结果：

   Id     Name0   0    Alpha1   1     Beta2   2    Gamma3   3    Delta4   4  Epsilon5   5     Zeta

注意事项与最佳实践

效率优先： 相较于在循环中逐行append，使用pd.concat()进行批量合并是处理DataFrame的推荐做法，尤其是在数据量较大时，其性能优势更为明显。drop_duplicates()的参数：subset: 明确指定用于识别重复项的列（或列列表）。keep: 默认为’first’，表示保留第一次出现的重复项。也可以设置为’last’或False（删除所有重复项）。ignore_index: 在去重后是否重置索引。在此教程的场景中，由于我们最终会手动重新分配Id列，ignore_index对最终Id列的值没有直接影响，但可以使中间DataFrame的索引更规整。ID列的管理： 在进行数据合并和去重操作后，ID列的连续性往往会被破坏。通过使用df[“Id”] = range(len(df))这种方式，可以简单有效地重建一个从0开始的连续ID序列。如果需要从其他数字开始，可以调整range()的参数，例如range(start_id, start_id + len(df))。文件保存： 如果需要将结果保存回CSV文件，请使用df.to_csv(‘your_file.csv’, index=False)。index=False参数非常重要，它会阻止Pandas将DataFrame的索引作为一列写入CSV文件。

总结

通过本教程介绍的方法，我们学习了如何利用Pandas的pd.concat()和drop_duplicates()函数，高效、准确地向DataFrame添加新行，同时自动处理重复项，并最终重建一个连续递增的ID列。这种方法不仅解决了ID列不连续或出现NaN的问题，也大大提升了数据处理的效率和代码的简洁性，是进行数据合并与清洗时的推荐实践。

以上就是Pandas教程：高效向DataFrame添加唯一行并重置连续ID的详细内容，更多请关注创想鸟其它相关文章！

版权声明：本文内容由互联网用户自发贡献，该文观点仅代表作者本人。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容，请发送邮件至 chuangxiangniao@163.com 举报，一经查实，本站将立刻删除。
发布者：程序猿，转转请注明出处：https://www.chuangxiangniao.com/p/1378733.html

app csv csv文件工具常见问题

打赏

微信扫一扫

支付宝扫一扫

0 0

关于作者

程序猿签约作者

414.1K 文章

0 评论

2 粉丝

这个人很懒，什么都没有留下～

Pandas分组数据中跨行计算差异的技巧

上一篇 2025年12月14日 20:03:00

在Linux环境下本地安装Python包并解决依赖冲突的教程

下一篇 2025年12月14日 20:03:19

好文分享

揭示绝对定位的缺点并提出解决方案：常见问题的规避策略

绝对定位的弊端揭秘：如何避免常见问题？绝对定位是网页设计中常用的一种布局方式，它可以让元素精确地定位在页面上的指定位置。然而，尽管绝对定位在某些情况下非常有用，但它也存在一些弊端。本文将揭示绝对定位的弊端，并提供一些方法来避免常见问题。首先，绝对定位的一个弊端是元素定位可能受到浏览器窗口大小的影…

程序猿
2025年12月24日
0000
好文分享

常见问题和解决方法：绝对定位运动指令的疑问与解答

绝对定位运动指令的常见问题及解决方法摘要：随着技术的不断进步，绝对定位运动在现代机械设备中得到了广泛应用。然而，在使用绝对定位运动指令的过程中，常常会遇到各种问题。本文将重点讨论常见的绝对定位运动指令问题，并提供相应的解决方法和具体的代码示例。一、绝对定位运动指令简介绝对定位运动指令是指根据目标…

程序猿
2025年12月24日
0000
好文分享

揭秘绝对定位故障：常见问题和解决方法曝光

绝对定位故障大揭秘：常见问题及解决方案引言：绝对定位（Absolute positioning）是CSS中常用的一种定位方式，它允许开发者将元素精确地放置在一个给定的位置上。然而，由于其特殊的性质和较为复杂的用法，绝对定位经常会出现各种问题。本文将揭示绝对定位的常见故障，并提供相应的解决方案，同…

程序猿
2025年12月24日
0000
好文分享

详解Css Flex 弹性布局中的常见问题及解决方案

详解CSS Flex弹性布局中的常见问题及解决方案引言：CSS Flex弹性布局是一种现代的布局方式，其具有优雅简洁的语法和强大的灵活性，广泛应用于构建响应式的web页面。然而，在实际应用中，经常会遇到一些常见的问题，如元素排列不如预期、尺寸不一致等。本文将详细介绍这些问题，并提供相应的解决方案，…

程序猿
2025年12月24日
2000
CSS的选择器有哪些常见问题

这次给大家带来css的选择器有哪些常见问题，处理css的选择器常见问题的注意事项有哪些，下面就是实战案例，一起来看一下。选择器常见的有哪几种？1.标签选择器p{ }/选择标签名为p的元素/2.类选择器.box{ }/选择class名为box的元素/3.ID选择器#header{ }/选择id名为h…

程序猿
好文分享 2025年12月24日
0000
HTML里的常见问题一

这次给大家带来在html里有哪些经常出现的问题？有序列表、无序列表、自定义列表如何使用？写个简单的例子。三者在语义上有什么区别？使用场景是什么？能否嵌套？有序列表是以数字进行标记的列表项目： CoffeeMilk 效果如下： CoffeeMilk 无序列表是以原点标记的列表项目： CoffeeM…

程序猿
好文分享 2025年12月24日
0000
HTML里的常见问题二

如何去查css熟悉的兼容性？比如inline-block哪些浏览器支持？a 标签的href, title, target 是什么？ title 和 alt有什么区别？如何新窗口打开链接?display: none和visibility: hidden有什么作用？有什么区别？ line-height有…

程序猿
好文分享 2025年12月24日
0000
好文分享

响应式HTML5按钮适配不同屏幕方法【方法】

实现响应式HTML5按钮需五种方法：一、CSS媒体查询按max-width断点调整样式；二、用rem/vw等相对单位替代px；三、Flexbox控制容器与按钮伸缩；四、CSS变量配合requestAnimationFrame优化的JS动态适配；五、Tailwind等框架的响应式工具类。如果您希望H…

程序猿
2025年12月23日
0000
好文分享

html5怎么加php_html5用Ajax与PHP后端交互实现数据传递【交互】

HTML5不能直接运行PHP，需通过Ajax与PHP通信：前端用fetch发送请求，PHP接收处理并返回JSON，前端解析响应更新DOM；注意跨域、编码、CSRF防护和输入过滤。 HTML5 本身是前端标记语言，不能直接运行 PHP 代码，但可以通过 Ajax（异步 JavaScript）与 PHP…

程序猿
2025年12月23日
3000
好文分享

html5 js怎么加_html5用script标签内嵌或外链引入JS代码【添加】

在HTML5中执行JavaScript需通过script标签：一、内联编写于head或body中；二、外链引入.js文件并建议放body末尾或加defer；三、defer按序执行，async独立执行；四、可动态创建script元素插入执行。如果您希望在HTML5页面中执行JavaScript代码，…

程序猿
2025年12月23日
0000
好文分享

node.js怎么运行html_node.js运行html步骤【指南】

答案是使用Node.js内置http模块、Express框架或第三方工具serve可快速搭建服务器预览HTML文件。首先通过http模块创建服务器并读取index.html返回响应；其次用Express初始化项目并配置静态文件服务；最后利用serve工具全局安装后一键启动服务器，三种方式均在浏览器访…

程序猿
2025年12月23日
3000
好文分享

html5能否插入带表单的文档_html5表单文档嵌入与数据提交【步骤】

HTML5中无法直接嵌入外部带表单的HTML文档并原生提交；可行方案有四：一、用iframe嵌入，需同源或CORS支持，并用postMessage通信；二、用fetch+DOMParser动态加载表单片段并手动绑定事件；三、在当前页面直接编写表单，最规范且兼容性好；四、用JavaScript+fet…

程序猿
2025年12月23日
0000
好文分享

html5游戏怎么修改_HT5改JS逻辑或资源文件调整游戏玩法效果【修改】

需直接编辑核心JavaScript代码或替换图片、音频等资源文件；先用浏览器开发者工具的Sources面板定位含game、main等关键词的.js文件，再搜索score++、if (health等逻辑片段进行修改。如果您下载了某个HTML5游戏的本地文件，希望调整其玩法逻辑或替换资源以改变视觉效果…

程序猿
2025年12月23日
0000
好文分享

360怎么装html5_360浏览器默认支持HTML5无需额外安装设置【说明】

HTML5是网页标准，非独立软件，360浏览器7.0+已原生支持；需确认内核为Blink/Chromium、关闭兼容模式、禁用强制兼容策略、重置Flash插件、清除HTML5本地存储、检查系统Media Foundation组件。如果您在使用360浏览器时发现HTML5网页功能异常（如视频无法播放…

程序猿
2025年12月23日
0000
好文分享

html5怎么重叠图片_html5用position:absolute或z-index让图片重叠【重叠】

在HTML5中实现图片重叠需结合CSS定位与层叠控制：一、用position:absolute+top/left精确定位，父容器设position:relative；二、用z-index设定堆叠顺序（需已定位）；三、用transform:translate()实现无文档流干扰的偏移重叠；四、用CSS…

程序猿
2025年12月23日
2000
好文分享

html如何滑动_实现HTML页面或元素滑动效果【效果】

可通过CSS scroll-behavior实现平滑锚点跳转，JavaScript scrollTo精确控制滚动位置，CSS transform模拟高性能滑动动画，或使用Swiper等第三方库实现触摸拖拽、循环播放等高级交互功能。如果您希望在网页中实现页面或特定元素的滑动效果，可以通过CSS和Ja…

程序猿
2025年12月23日
0000
好文分享

html5如何建立站点_HTML5站点建立步骤与网站搭建技巧【指南】

HTML5网站搭建需五步：一、建my-website目录及css/js/images子目录，含index.html；二、写标准HTML5骨架，含DOCTYPE、lang、meta、语义化标签；三、外链CSS与defer/async脚本；四、用http-server启本地服务；五、用email/num…

程序猿
2025年12月23日
0000
好文分享

html5怎么读取文件_html5用FileReader API读取本地文件内容或属性【读取】

HTML5的FileReader API支持读取本地文件内容及获取基本信息：一、通过input type=”file”获取File对象；二、用readAsText读取文本；三、用readAsDataURL生成Data URL预览资源；四、用readAsArrayBuffer读…

程序猿
2025年12月23日
0000
好文分享

html5怎么插入文档_HT5用object或iframe嵌入PDF/Word文档显示【插入】

可在HTML5中用iframe或object标签嵌入PDF，需设宽高及可访问路径；Word文档需借OneDrive等第三方服务代理渲染；须处理跨域限制并提供下载降级方案。如果您希望在HTML5页面中嵌入PDF或Word文档并直接显示，可以使用或标签实现。以下是几种可行的嵌入方法：一、使用ifra…

程序猿
2025年12月23日
2000
好文分享

html5能否让搜索框随滚动固定_html5positionfixed固定布局【攻略】

可使用CSS的position: fixed实现搜索框固定定位，或用position: sticky实现边界感知粘性效果，配合JavaScript动态控制、响应式适配及占位修复，确保滚动时稳定显示。如果您希望在网页滚动过程中让搜索框始终保持在可视区域的固定位置，HTML5 本身不提供直接的布局控制…

程序猿
2025年12月23日
2000