Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
基于部分字符串匹配合并 Pandas DataFrames_创想鸟

基于部分字符串匹配合并 Pandas DataFrames

基于部分字符串匹配合并 pandas dataframes

本文介绍如何基于一个 DataFrame 列中的部分文本与另一个 DataFrame 列进行匹配,并使用 Pandas 实现高效合并。我们将通过提取目标字符串,创建新的匹配列,最终完成两个 DataFrame 的合并操作,并提供详细的代码示例和注意事项。

问题背景

在数据处理中,经常会遇到需要合并两个 DataFrame 的情况,但标准的 pd.merge 函数要求两个 DataFrame 具有完全匹配的列。当一个 DataFrame 的列值包含另一个 DataFrame 列值的部分文本时,直接使用 pd.merge 无法达到预期效果。本文将提供一种解决方案,通过提取关键文本并创建新的列,实现基于部分字符串匹配的 DataFrame 合并。

解决方案

该方案的核心思想是:

从包含部分文本的 DataFrame (df1) 中,提取出与另一个 DataFrame (df2) 匹配的关键文本。将提取出的文本作为新的一列添加到 df1 中。使用新创建的列作为连接键,将 df1 和 df2 进行合并。

代码实现

假设我们有两个 DataFrame,df1 和 df2,它们的数据结构如下:

import pandas as pd# df1data1 = {'Hostname': ['ServerABC101', 'ServerABC102', 'ServerDDC103', 'ServerDDC609', 'ServerDDC103', 'ServerDDC609'],         'Region': ['US', 'US', 'PAC', 'Emea', 'PAC', 'Emea'],         'Model': ['Cisco', 'Cisco', 'Intel', 'Intel', 'Intel', 'Intel']}df1 = pd.DataFrame(data1)# df2data2 = {'Site': ['ABC', 'DDC'],         'City': ['NYC', 'DAL'],         'State': ['NY', 'TX']}df2 = pd.DataFrame(data2)print("df1:")print(df1)print("ndf2:")print(df2)

我们的目标是基于 df2[‘Site’] 中的文本与 df1[‘Hostname’] 中的部分文本匹配,将 df1 和 df2 合并。假设 df1[‘Hostname’] 中包含 “Server” 之后的三位大写字母代表 df2[‘Site’] 的值。

首先,使用正则表达式从 df1[‘Hostname’] 中提取 Site 代码:

df1['Site'] = df1['Hostname'].str.extract(r"Server([A-Z]{3})")print("ndf1 after extracting Site:")print(df1)

这里,str.extract(r”Server([A-Z]{3})”) 使用正则表达式 Server([A-Z]{3}) 从 Hostname 列中提取匹配 “Server” 后面的三个大写字母。提取的结果将作为新的 ‘Site’ 列添加到 df1 中。

接下来,使用 pd.merge 函数,基于新创建的 ‘Site’ 列将 df1 和 df2 进行合并:

df1 = pd.merge(df1, df2, on='Site', how='left')print("nFinal merged df1:")print(df1)

how=’left’ 参数指定使用左连接,即保留 df1 中的所有行,并将 df2 中匹配的行添加到 df1 中。 如果df1中的Site在df2中没有匹配项,则City和State列将填充NaN。

完整代码示例

import pandas as pd# df1data1 = {'Hostname': ['ServerABC101', 'ServerABC102', 'ServerDDC103', 'ServerDDC609', 'ServerDDC103', 'ServerDDC609'],         'Region': ['US', 'US', 'PAC', 'Emea', 'PAC', 'Emea'],         'Model': ['Cisco', 'Cisco', 'Intel', 'Intel', 'Intel', 'Intel']}df1 = pd.DataFrame(data1)# df2data2 = {'Site': ['ABC', 'DDC'],         'City': ['NYC', 'DAL'],         'State': ['NY', 'TX']}df2 = pd.DataFrame(data2)# 提取 Site 代码df1['Site'] = df1['Hostname'].str.extract(r"Server([A-Z]{3})")# 合并 DataFramedf1 = pd.merge(df1, df2, on='Site', how='left')print(df1)

注意事项

正则表达式: 正确选择和编写正则表达式至关重要。正则表达式需要准确匹配目标文本,避免提取错误的数据。连接类型: how 参数决定了连接的类型。根据实际需求选择合适的连接类型,例如 left、right、inner、outer。缺失值处理: 如果在 df1 中提取的 Site 代码在 df2 中不存在,合并后的 City 和 State 列将会出现缺失值(NaN)。需要根据实际情况处理这些缺失值,例如填充默认值或删除包含缺失值的行。性能优化: 对于大型 DataFrame,使用矢量化操作(如 str.extract)通常比循环遍历更高效。错误处理: 确保代码能够处理 Hostname 列中不包含 “Server” 加上三个大写字母的情况,避免程序崩溃。 可以使用 .fillna() 方法为这些情况设置默认值,或者使用条件语句跳过这些行。

总结

本文介绍了一种基于部分字符串匹配合并 Pandas DataFrames 的方法。通过提取关键文本并创建新的列,我们可以灵活地处理不完全匹配的连接情况。在实际应用中,需要根据具体的数据结构和业务需求,选择合适的正则表达式和连接类型,并注意处理可能出现的缺失值。

以上就是基于部分字符串匹配合并 Pandas DataFrames的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1374237.html

赞 (0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
无休止进程克隆:PyInstaller打包Python截图脚本的解决方案
上一篇 2025年12月14日 13:58:52
基于部分匹配的 Pandas DataFrame 合并教程
下一篇 2025年12月14日 13:59:00

相关推荐

  • 使用正则表达式检测字符串中的除零操作

    本文详细介绍了如何使用正则表达式精确检测字符串中潜在的除零操作。针对表达式中可能存在的变量引用(如<>)、数字、多余空格以及禁止包含引号等复杂情况,文章提供了一个高效的正则表达式模式,并深入解析其构成原理。通过具体的Java代码示例,读者将学习如何将此模式应用于实际编程场景,从而有效识别…

    2026年9月21日
    000
  • Java 正则表达式:查找双引号内所有指定字符串的出现次数

    本文旨在解决在 Java 中使用正则表达式查找双引号内特定字符串(例如 “variant”)的所有出现次数的问题。我们将提供一个完整的解决方案,包括正则表达式的构建、代码示例以及详细的解释,帮助开发者准确高效地完成此类任务。 在 Java 中,使用正则表达式查找字符串中特定模…

    2026年9月21日
    000
  • PHP错误日志怎么查看_PHP错误日志定位与查看方法

    要查看PHP错误日志,首先确定php.ini中error_log路径,若未设置则检查Web服务器(如Apache/Nginx)错误日志;确保log_errors=On、error_reporting合理配置,并通过tail、grep等工具分析日志,结合框架日志和系统日志(如syslog)全面定位问题…

    2026年9月21日
    300
  • Linux查看系统日志的常用命令

    答案是查看Linux日志需综合使用journalctl、dmesg、tail、grep等工具。journalctl用于systemd系统集中查询服务及内核日志,支持时间、优先级、字段等多维度过滤;dmesg专注内核启动与硬件问题;tail -f实时监控日志动态;cat、grep、less结合正则和管…

    用户投稿 2026年9月21日
    000
  • Linux如何查看sudo执行的历史记录

    Linux如何查看sudo执行的历史记录Linux如何查看sudo执行的历史记录Linux如何查看sudo执行的历史记录Linux如何查看sudo执行的历史记录

    要追溯sudo执行的命令,需查看系统日志或配置sudo日志;在Ubuntu/Debian中查/var/log/auth.log,CentOS/RHEL中查/var/log/secure,或使用journalctl _COMM=sudo筛选;通过配置/etc/sudoers中的Defaults log…

    2026年9月21日 • 用户投稿
    300
  • Java从文本文件随机读取多行连续内容的教程

    本教程旨在指导java开发者如何高效地从文本文件中随机读取并打印指定数量(例如5行)的连续内容,尤其适用于处理结构化文本块(如诗歌)。我们将探讨如何避免仅读取文件开头固定行数的局限,通过将文件内容一次性加载到内存并结合随机数生成器来精确选取所需的文本块,从而实现真正的随机性与灵活性。 引言与问题分析…

    2026年9月20日
    200
  • VSCode的侧边栏图标代表什么?

    资源管理器(文件夹图标)用于管理项目文件结构,支持新建、重命名、删除和拖拽操作;2. 搜索(放大镜图标)实现全局文本查找与替换,支持正则表达式及范围筛选;3. 源代码管理(分支图标)集成Git功能,可查看变更、提交代码并同步远程仓库;4. 运行和调试(虫子图标)支持断点调试、变量监控及多语言启动配置…

    2026年9月20日
    000
  • windows怎么批量重命名文件_Windows文件批量重命名方法

    可通过资源管理器选中法、CMD命令、PowerShell脚本或第三方工具实现批量重命名。首先选中多个文件后右键“重命名”可自动添加编号;其次在地址栏输入cmd使用ren命令匹配模式重命名;再者通过PowerShell脚本按顺序为文件重命名;最后可借助Bulk Rename Utility等工具进行更…

    2026年9月20日
    000
  • 如何用VSCode高效地阅读大型项目的源代码?

    掌握VSCode的导航与搜索功能可高效阅读大型项目源码。首先利用Ctrl+点击跳转定义及悬停预览,结合语言服务器实现精准符号解析;通过大纲视图和面包屑导航快速定位文件结构与当前位置;使用Ctrl+T全局符号搜索、Ctrl+Shift+F文本搜索(支持正则与路径过滤)定位目标代码;配合代码折叠聚焦关键…

    2026年9月12日
    200
  • VSCode CCS文件怎么使用_VSCode编辑和编译CCS文件配置教程

    答案:通过配置VSCode的C/C++扩展和tasks.json文件,可实现对CCS项目的高效编辑与编译。具体需安装C/C++扩展,配置c_cpp_properties.json以设置头文件路径、宏定义和编译器路径,确保代码补全与智能感知正常;再通过tasks.json调用CCS的gmake工具执行…

    2026年9月12日
    300
  • VSCode的搜索和替换有什么技巧?

    使用Ctrl+F/Cmd+F搜索,Ctrl+Shift+F全局搜索,Ctrl+H/Cmd+H替换;2. 点击“.”启用正则,如d+替换为$$&可为数字前加$;3. 用s+$匹配行尾空格并替换为空可清理空白;4. “Aa”切换大小写,“‸”全词匹配,表示换行,如,$s替换为,可合并分行语句;5…

    2026年9月12日
    000
  • 如何通过扩展让VSCode支持一门新的编程语言?

    要让VSCode支持新编程语言需通过扩展实现。1. 使用yo code生成扩展模板,包含package.json、语法高亮和语言配置文件。2. 在.tmLanguage.json中用正则定义语法高亮规则,注册到package.json。3. 通过language-configuration.json…

    2026年9月12日
    100
  • Java中从文本输入中提取和定位单词的教程

    本教程详细介绍了如何在java中从字符串或扫描器输入中提取和定位特定单词。通过构建一个独立的查找单词类,并利用字符串的`split()`方法将文本分解为单个单词,文章演示了如何遍历这些单词并准确找出目标词汇及其在文本中的位置,为文本处理和搜索场景提供了实用的编程解决方案。 在许多应用程序中,例如搜索…

    2026年9月12日
    000
  • VSCode的搜索和替换功能支持哪些正则表达式?

    VSCode的搜索替换基于JavaScript正则引擎,支持常用语法如普通字符、元字符、字符类、分组捕获($1、$2)、量词及转义;在替换中可用$&、$`、$’、$$等特殊引用;实用技巧包括匹配空行^s*$、使用t和n操作制表符与换行,并结合^和$进行多行处理;虽不支持命名捕获组…

    2026年9月12日
    000
  • Java中Pattern.compile正则表达式优化技巧

    复用Pattern对象可避免重复编译开销,建议缓存为静态常量;合理使用匹配标志如CASE_INSENSITIVE但避免不必要开销;避免贪婪量化符滥用,推荐非贪婪或精确限定;使用原子组(?>)或占有量词减少回溯;拆分复杂正则提升可维护性与性能。 在Java中使用Pattern.compile处理…

    2026年9月12日
    100
  • 如何使用Java的Regex实现复杂文本匹配

    先编译Pattern再用Matcher匹配,可高效处理字符串。例如匹配邮箱:使用Pattern.compile()定义规则,matcher.find()遍历结果,输出所有邮箱地址。处理多行文本时添加Pattern.DOTALL标志,使.匹配换行符,结合非贪婪模式.*?提取日志中的错误信息和用户。复杂…

    2026年9月11日
    200
  • VSCode的全局搜索怎么用?

    使用快捷键Ctrl+Shift+F(macOS为Cmd+Shift+F)或点击“放大镜”图标打开全局搜索,输入关键词可实时查看匹配项。2. 支持正则表达式和大小写区分,可通过勾选.和Aa按钮设置。3. 在文件筛选框输入.js、src/**等条件可缩小搜索范围,多个条件用逗号分隔。4. 展开下方替换区…

    2026年9月11日
    000
  • Linux分页查看文件命令less与more区别

    less 比 more 更优,因其支持双向滚动、高效处理大文件、提供搜索与实时跟踪功能,且内存占用低,适合现代运维与开发需求。 less 和 more 都是在 Linux 中用于分页查看文本文件的命令,但它们之间存在一个核心区别: less 允许你向前和向后滚动文件内容,而 more 主要只能向前滚…

    2026年9月11日
    100
  • 如何在Java中实现字符串拆分和合并

    答案:Java中使用split()方法按分隔符拆分字符串,支持正则表达式和限制拆分次数;使用String.join()将字符串数组或集合合并为单个字符串,建议处理复杂格式时使用专用库。 在Java中处理字符串时,拆分和合并是常见操作。合理使用内置方法可以高效完成这些任务。 字符串拆分(Split) …

    2026年9月11日
    100
  • Linux文本搜索命令grep应用实例

    Linux文本搜索命令grep应用实例Linux文本搜索命令grep应用实例Linux文本搜索命令grep应用实例Linux文本搜索命令grep应用实例

    grep是Linux中高效的文本搜索工具,通过正则表达式和多种选项(如-i、-v、-r、-C)实现精准查找,可结合zgrep、find、tail等命令处理压缩日志、递归搜索及实时监控,适用于日志分析、代码审计和配置管理,极大提升信息筛选效率。 grep 命令,在我看来,是 Linux 系统中最被低估…

    2026年9月11日 • 用户投稿
    000

发表回复

登录后才能评论
关注微信