Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
Pandas DataFrame中动态文本拼接与正则表达式数据提取教程_创想鸟

Pandas DataFrame中动态文本拼接与正则表达式数据提取教程

Pandas DataFrame中动态文本拼接与正则表达式数据提取教程

本教程旨在指导用户如何在Pandas DataFrame中高效地进行动态文本拼接,特别是结合正则表达式从现有列中提取特定数据(如数字)并将其融入新的字符串结构。文章将详细介绍使用str.findall结合str索引器、str.extract以及str.replace与反向引用这三种核心方法,并提供代码示例与注意事项,帮助读者根据不同需求选择最佳实践。

在数据处理过程中,我们经常需要根据现有数据生成新的文本字段。例如,从一个包含描述性文本的列中提取特定的数字或字符串片段,然后将其与固定的文本组合,形成一个新的、格式化的文本列。pandas提供了强大的字符串操作功能,结合正则表达式,可以高效地完成这类任务。

1. 准备示例数据

首先,我们创建一个示例DataFrame,其中包含一个名为PROJEKT[BEZEICHNUNG]的列,我们将从该列中提取数字并进行拼接。

import pandas as pd# 示例数据data = {    'PROJEKT[BEZEICHNUNG]': [        'Project Alpha 8 Beta 4',        'Task Gamma 8 Delta 5',        'Stage Epsilon 8 Zeta 5',        'Initiative Eta 7 Theta 4',        'Report 9-3',        'Another 8-4 project',        'No numbers here' # 包含没有数字的行,用于演示异常处理    ]}df = pd.DataFrame(data)print("原始DataFrame:")print(df)print("-" * 40)

2. 使用 str.findall 结合 str 索引器

str.findall(pattern)方法会返回一个Series,其中每个元素是一个列表,包含所有匹配pattern的非重叠字符串。要访问这些列表中的特定元素,我们需要使用Pandas的str索引器。

原理:

df[‘列名’].str.findall(r’d+’):这会为每一行返回一个数字字符串的列表。例如,’Project Alpha 8 Beta 4’会变成[‘8’, ‘4’]。match.str[0]和match.str[1]:这里的.str是Pandas的字符串访问器,它允许我们对Series中的每个列表执行列表操作(如索引)。match.str[0]将获取每个列表的第一个元素,match.str[1]获取第二个。.fillna(”):如果某个列表为空(即没有匹配到数字)或者索引超出范围,match.str[index]会返回NaN。为了在拼接时避免NaN导致整个结果为NaN,我们使用fillna(”)将其替换为空字符串。

示例代码:

# 方法一: 使用 str.findall 结合 str 索引器print("方法一: 使用 str.findall 结合 str 索引器")# 1. 提取所有数字序列match_findall = df['PROJEKT[BEZEICHNUNG]'].str.findall(r'd+')# match_findall 的输出示例:# 0    ['8', '4']# 1    ['8', '5']# ...# 6          []  # 没有匹配到数字的行会得到空列表# 2. 使用 .str 索引器访问每个列表中的元素,并处理NaNdf['EINGRUPPIERUNG_Method1'] = (    'P' + match_findall.str[0].fillna('') +    ' Stufe ' + match_findall.str[1].fillna(''))print(df[['PROJEKT[BEZEICHNUNG]', 'EINGRUPPIERUNG_Method1']])print("-" * 40)

3. 利用 str.extract 进行结构化提取

str.extract(pattern, expand=True)方法是专门为从字符串中提取结构化数据而设计的。它使用正则表达式中的捕获组(括号())来提取数据,并直接将其转换为新的DataFrame列。

原理:

df[‘列名’].str.extract(r'(d+).*(d+)’, expand=True):正则表达式(d+).*(d+)定义了两个捕获组,分别匹配第一个和第二个数字序列。expand=True(默认值)确保结果是一个DataFrame,其中每个捕获组对应一列。match_extract[0]和match_extract[1]:直接引用新DataFrame的列(索引为0和1)。.fillna(”):如果某行没有匹配到正则表达式,str.extract会为对应的捕获组返回NaN。同样需要使用fillna(”)进行处理。

示例代码:

# 方法二: 利用 str.extract 进行结构化提取print("方法二: 利用 str.extract 进行结构化提取")# 1. 使用正则表达式捕获组直接提取数字# 正则表达式中的括号 () 定义了捕获组# expand=True 会将捕获组作为独立的列返回一个DataFramematch_extract = df['PROJEKT[BEZEICHNUNG]'].str.extract(r'(d+).*?(d+)', expand=True)# match_extract 的输出示例:#      0    1# 0    8    4# 1    8    5# ...# 6  NaN  NaN # 没有匹配的行# 2. 直接拼接DataFrame的列,并处理NaNdf['EINGRUPPIERUNG_Method2'] = (    'P' + match_extract[0].fillna('') +    ' Stufe ' + match_extract[1].fillna(''))print(df[['PROJEKT[BEZEICHNUNG]', 'EINGRUPPIERUNG_Method2']])print("-" * 40)

4. 结合 str.replace 和正则表达式反向引用

str.replace(pattern, repl, regex=True)方法可以根据正则表达式pattern匹配字符串,并用repl字符串替换匹配的部分。在repl中,可以使用反向引用(1, 2等)来引用pattern中的捕获组。

原理:

df[‘列名’].str.replace(r’.*?(d+).*?(d+).*’, r’P1 Stufe 2′, regex=True):.*?(d+).*?(d+).*:这个正则表达式尝试匹配整个字符串,捕获第一个和第二个数字序列。.*?是非贪婪匹配,确保尽可能少地匹配字符。r’P1 Stufe 2’:替换字符串,其中1引用第一个捕获组(第一个数字),2引用第二个捕获组(第二个数字)。注意事项: 如果原始字符串不完全匹配pattern,str.replace将不会进行替换,而是保留原始字符串。这与前两种方法在处理无匹配项时的行为不同。

示例代码:

# 方法三: 结合 str.replace 和正则表达式反向引用print("方法三: 结合 str.replace 和正则表达式反向引用")# 使用 (.*?) 匹配任意字符,(d+) 捕获数字# r'P1 Stufe 2' 中的 1 和 2 引用捕获组# 注意:如果字符串不匹配整个模式,str.replace不会改变它df['EINGRUPPIERUNG_Method3'] = df['PROJEKT[BEZEICHNUNG]'].str.replace(    r'.*?(d+).*?(d+).*',    r'P1 Stufe 2',    regex=True)# 对于不匹配的行(如'No numbers here'),str.replace会保留原始字符串。# 如果期望不匹配的行也为空字符串,需要额外处理,例如:df['EINGRUPPIERUNG_Method3'] = df['EINGRUPPIERUNG_Method3'].where(    df['EINGRUPPIERUNG_Method3'].str.contains(r'Pd+ Stufe d+', na=False), # 检查是否包含期望的模式    '' # 不包含则设置为空字符串)print(df[['PROJEKT[BEZEICHNUNG]', 'EINGRUPPIERUNG_Method3']])print("-" * 40)

5. 注意事项与最佳实践

处理缺失匹配 (Handling Missing Matches):str.findall和str.extract在没有匹配时会产生空列表或NaN。在拼接前,务必使用.fillna(”)或.apply(lambda x: x if pd.notna(x) else ”)等方法处理这些值,避免最终结果出现NaN。str.replace在不匹配时会保留原字符串。如果需要将不匹配的行也转换为空字符串或其他默认值,需要额外的逻辑(如上述示例中的where方法)。正则表达式的精准性 (Regex Precision): 编写精确的正则表达式至关重要,它直接决定了数据提取的准确性。不当的模式可能导致提取错误或遗漏。性能考量 (Performance Considerations):对于大型数据集,str.extract通常比str.findall后进行列表索引更高效,因为它直接将捕获组转换为DataFrame列,减少了中间操作。str.replace在进行整串替换时也表现良好,尤其是在模式匹配和替换逻辑相对简单时。expand参数: 在str.extract中,expand=True(默认值)会返回一个DataFrame,而expand=False会返回一个Series of tuples。通常使用expand=True更方便后续操作。错误处理 (Error Handling): 除了处理缺失匹配,还应考虑正则表达式可能因数据格式异常而产生意外结果的情况。在关键业务逻辑中,可能需要更健壮的错误捕获机制。

总结

Pandas结合正则表达式提供了多种灵活且强大的方法来处理DataFrame中的字符串数据。

str.findall + str 索引器适用于需要提取所有匹配项,然后从列表中选择特定项的场景。str.extract 是进行结构化数据提取的首选,它能将捕获组直接转换为DataFrame的列,便于后续操作和拼接。str.replace + 反向引用适用于通过替换整个匹配模式来直接转换字符串格式的场景,但需要注意其对不匹配行的处理方式。

选择哪种方法取决于具体的业务需求、数据特性以及对性能和代码可读性的偏好。理解这些方法的内部机制和行为差异,将帮助您更高效、准确地完成Pandas中的文本数据处理任务。

以上就是Pandas DataFrame中动态文本拼接与正则表达式数据提取教程的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1373121.html

赞 (0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
Python中按行和列索引访问CSV文件数据:两种高效方法详解
上一篇 2025年12月14日 12:55:20
Pandas DataFrame:基于分组条件高效填充新列
下一篇 2025年12月14日 12:55:34

相关推荐

  • 如何在MindSpore中训练AI大模型?华为AI框架的训练教程

    如何在MindSpore中训练AI大模型?华为AI框架的训练教程如何在MindSpore中训练AI大模型?华为AI框架的训练教程如何在MindSpore中训练AI大模型?华为AI框架的训练教程如何在MindSpore中训练AI大模型?华为AI框架的训练教程

    答案:MindSpore通过自动并行、混合精度、优化器状态分片等技术,结合Profiler工具调试性能瓶颈,实现大模型高效分布式训练。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 在MindSpore中训练AI大模型,核心在于巧妙地利用其…

    2026年9月21日 • 用户投稿
    300
  • Java ConcurrentSkipListMap在并发场景下应用

    ConcurrentSkipListMap是基于跳跃表实现的线程安全有序映射,支持高并发读写与高效范围查询,适用于需排序的并发场景,如排行榜系统;相比ConcurrentHashMap,它提供有序性与导航操作,但插入查找为O(log n),内存开销较大,适合读多写少或需区间扫描的业务。 在高并发场景…

    2026年9月21日
    100
  • Steam游戏平台下载缓存怎么清理_Steam清理下载缓存的方法

    清理Steam下载缓存可解决下载慢、中断或安装失败问题。首先可通过客户端设置中的“清除下载缓存”功能操作,随后重新登录账户;若无效,可手动删除Steam安装目录下的appcache和depotcache文件夹;此外,重置网络配置并执行netsh winsock reset与ipconfig /flu…

    2026年9月21日
    000
  • 如何使用Ribbet的AI功能裁剪图片?快速实现精准图像裁剪

    答案:Ribbet的AI裁剪功能可快速智能识别主体并推荐裁剪方案,支持手动微调与多种比例选择,结合亮度、色彩等编辑工具优化效果,适用于制作符合社交媒体尺寸要求的封面图,操作简便且大部分功能免费,适合追求效率的普通用户。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepS…

    2026年9月21日
    400
  • 卢伟冰:功能手机、智能手机之后 手机行业正进入新周期

    9月4日,小米集团总裁卢伟冰表示,继功能机时代与智能机时代之后,全球手机产业正迈入一个全新时代。 卢伟冰今日在社交平台发文提到:“我从2002年进入手机行业,有幸完整见证了功能手机和智能手机两大发展阶段。如今,AI时代已经到来,整个行业正在酝酿深刻变革,步入全新的发展周期。” 回望过去,功能手机时期…

    2026年9月21日
    200
  • Java 正则表达式:查找双引号内所有指定字符串的出现次数

    本文旨在解决在 Java 中使用正则表达式查找双引号内特定字符串(例如 “variant”)的所有出现次数的问题。我们将提供一个完整的解决方案,包括正则表达式的构建、代码示例以及详细的解释,帮助开发者准确高效地完成此类任务。 在 Java 中,使用正则表达式查找字符串中特定模…

    2026年9月21日
    000
  • MySQL 大型历史数据表结构设计与优化指南

    本文旨在为处理大量客户历史交易数据的MySQL数据库设计提供专业指导。我们将探讨如何构建高效、可扩展的表结构,重点关注主键设计、数据分区、实时数据摄入以及性能优化策略,以确保系统能够稳定支持百万级乃至亿级数据量的查询需求。 MySQL大型历史数据表结构设计与优化 在处理大量历史数据,特别是涉及到多用…

    2026年9月21日
    000
  • 百度极速版如何开启数据同步_百度极速版数据同步的设置方法

    用同一百度账号登录百度极速版是开启数据同步的关键,进入【我的】→【设置】→开启【书签同步】,完成账号绑定后,书签和搜索记录即可在多设备间自动同步。 想在不同设备上无缝使用百度极速版,开启数据同步是关键。只要用同一个百度账号登录,你的书签、搜索记录等信息就能自动保持一致。操作本身不难,主要是找到正确的…

    2026年9月21日
    000
  • MySQL重复数据检测与清理逻辑_Sublime脚本批量处理历史冗余记录

    MySQL重复数据检测与清理逻辑_Sublime脚本批量处理历史冗余记录MySQL重复数据检测与清理逻辑_Sublime脚本批量处理历史冗余记录MySQL重复数据检测与清理逻辑_Sublime脚本批量处理历史冗余记录MySQL重复数据检测与清理逻辑_Sublime脚本批量处理历史冗余记录

    处理mysql重复数据的核心步骤是识别并清理,可使用group by或窗口函数定位重复项,再通过分批删除或倒腾法安全清理;sublime text可用于高效生成和编辑sql语句。1. 识别重复数据常用group by+having或row_number()窗口函数;2. 清理策略包括分批删除、使用临…

    2026年9月21日 • 用户投稿
    100
  • 如何用PyTorch训练AI大模型?构建高效神经网络的完整教程

    如何用PyTorch训练AI大模型?构建高效神经网络的完整教程如何用PyTorch训练AI大模型?构建高效神经网络的完整教程如何用PyTorch训练AI大模型?构建高效神经网络的完整教程如何用PyTorch训练AI大模型?构建高效神经网络的完整教程

    PyTorch大模型训练需综合运用分布式训练、内存优化与高效计算策略。首先采用DistributedDataParallel实现多GPU并行,配合DistributedSampler确保数据均衡;通过混合精度训练、梯度累积和激活检查点缓解显存压力;使用torch.compile优化模型计算效率;选择…

    2026年9月21日 • 用户投稿
    100
  • win10打开图片提示“没有注册类”怎么办_win10图片打开注册类错误解决方案

    首先重置照片应用并修复系统文件,再通过PowerShell重新注册应用包,最后调整默认应用关联以解决“没有注册类”错误。 如果您尝试在Windows 10中打开图片文件,但系统弹出“没有注册类”的错误提示,则可能是由于默认图片查看应用的注册信息丢失或损坏。以下是解决此问题的步骤: 本文运行环境:De…

    2026年9月21日
    200
  • MySQL自动化性能测试方案_MySQL持续监控调优数据库效率

    MySQL自动化性能测试方案_MySQL持续监控调优数据库效率MySQL自动化性能测试方案_MySQL持续监控调优数据库效率MySQL自动化性能测试方案_MySQL持续监控调优数据库效率MySQL自动化性能测试方案_MySQL持续监控调优数据库效率

    mysql自动化性能测试和持续监控的核心在于构建闭环反馈系统,包含模拟真实负载、全面数据采集、自动化执行与分析、数据驱动的持续调优四大环节。①测试环境需与生产一致并隔离,使用docker、虚拟机或云沙盒,解决数据同步与脱敏问题;②负载生成工具如sysbench、jmeter、locust或自定义脚本…

    2026年9月21日 • 用户投稿
    200
  • PHP面向对象编程:解决父类构造器传递值在子对象方法中为空的问题

    本文探讨了PHP中一个常见的面向对象编程问题:当父类构造器接收并初始化一个子对象时,如何确保该子对象内部的方法能正确访问到父类传递的值,避免出现null。文章将通过示例代码,详细介绍两种核心解决方案:通过控制器提供内部对象的访问器(Getter),以及采用依赖注入(Dependency Inject…

    2026年9月21日
    400
  • CyberLinkMediaSuite如何制作AI视频?多功能工具快速剪辑的方法

    CyberLinkMediaSuite如何制作AI视频?多功能工具快速剪辑的方法CyberLinkMediaSuite如何制作AI视频?多功能工具快速剪辑的方法CyberLinkMediaSuite如何制作AI视频?多功能工具快速剪辑的方法CyberLinkMediaSuite如何制作AI视频?多功能工具快速剪辑的方法

    答案:CyberLink MediaSuite(核心为PowerDirector)通过AI艺术风格转换、智能对象选取、AI天空替换、音频降噪与运动追踪等功能,显著提升视频制作效率与创意表现。结合模板应用、快捷键操作、媒体库管理及代理编辑等实战技巧,可实现快速剪辑与专业输出,适用于Vlog创作、教育视…

    2026年9月21日 • 用户投稿
    300
  • Win10与Ubuntu 18.04双系统安装。(Win10引导Linux)[通俗易懂]

    Win10与Ubuntu 18.04双系统安装。(Win10引导Linux)[通俗易懂]Win10与Ubuntu 18.04双系统安装。(Win10引导Linux)[通俗易懂]Win10与Ubuntu 18.04双系统安装。(Win10引导Linux)[通俗易懂]Win10与Ubuntu 18.04双系统安装。(Win10引导Linux)[通俗易懂]

    大家好,很高兴再次与大家见面,我是你们的老朋友全栈君。 作为一个初学者,为了满足自己的求知欲,我按照几位大神写的教程尝试了一遍安装过程,现在来和大家分享一下。 1、Win10安装(如果已经安装,请跳过) 1)制作系统U盘(参考微信公众号“软件安装管家”): https://www.php.cn/li…

    2026年9月21日 • 用户投稿
    400
  • 百家号视频怎么隐藏?百家号怎么设置仅自己可见

    随着短视频平台的快速发展,其已成为人们获取资讯和休闲娱乐的重要方式。作为国内知名的自媒体平台之一,百家号吸引了大量用户。然而,在享受便捷的同时,隐私安全问题也日益突出。本文将介绍百家号视频隐藏的方法,帮助用户更好地保护个人内容,维护隐私安全。 一、百家号视频隐藏方法 设置隐私权限 在百家号后台,用户…

    2026年9月21日
    200
  • MySQL数据库如何设计适合大数据量的表结构_案例分析?

    MySQL数据库如何设计适合大数据量的表结构_案例分析?MySQL数据库如何设计适合大数据量的表结构_案例分析?MySQL数据库如何设计适合大数据量的表结构_案例分析?MySQL数据库如何设计适合大数据量的表结构_案例分析?

    设计适合大数据量的mysql表结构,核心在于数据类型选对、索引用好、适当拆分。1. 合理选择字段类型,如根据数据范围选用tinyint/smallint代替bigint,固定值字段用enum类型,大文本字段单独拆表;2. 精准建立索引,高频查询字段建联合索引并遵循最左前缀原则,避免低区分度字段建索引…

    2026年9月21日 • 用户投稿
    100
  • windows10如何查看S.M.A.R.T.硬盘状态_windows10硬盘S.M.A.R.T.状态查看方法

    电脑运行慢、蓝屏或文件损坏可能是硬盘故障前兆,可通过S.M.A.R.T.技术检测健康状况。1、使用WMIC命令行工具输入“wmic diskdrive get model,status”查看状态,显示Pred Fail需立即备份数据;2、CrystalDiskInfo可深度分析S.M.A.R.T.参…

    2026年9月21日
    200
  • Photopea的AI功能怎么裁剪图片?快速实现高效图片裁剪技巧

    Photopea的AI功能怎么裁剪图片?快速实现高效图片裁剪技巧Photopea的AI功能怎么裁剪图片?快速实现高效图片裁剪技巧Photopea的AI功能怎么裁剪图片?快速实现高效图片裁剪技巧Photopea的AI功能怎么裁剪图片?快速实现高效图片裁剪技巧

    Photopea的AI功能通过智能选择工具与内容感知技术结合,实现高效图片裁剪。首先使用对象选择、快速选择或魔棒工具智能识别主体或背景,再通过“选择并遮住”精细调整边缘,尤其适用于复杂轮廓如发丝。随后可应用图层蒙版透明化背景,并用裁剪工具调整画布范围。结合内容感知填充可移除干扰元素并自动补全画面,内…

    2026年9月21日 • 用户投稿
    300
  • 小红书从哪里看私信记录?私信记录如何清理?

    在小红书上与朋友或喜欢的博主互动时,私信是必不可少的沟通方式。不少新手用户常常困惑于如何查找过往的聊天内容。本文将为你详细说明查看私信记录的具体步骤,并分享几种实用的清理方法,帮助你轻松管理私信箱,让对话界面更清爽。 一、如何找到小红书的私信记录? 查看私信的操作非常直观,只需几个简单步骤即可完成。…

    2026年9月21日
    000

发表回复

登录后才能评论
关注微信