Python处理非标准分隔符文本文件转换为CSV的实战指南

Python处理非标准分隔符文本文件转换为CSV的实战指南

在数据处理领域,我们经常会遇到格式不规范的文本文件,这些文件因其不一致的分隔符而被称为“坏”文本文件。尤其当分隔符是空格时,问题会更加复杂:字段之间可能存在不同数量的空格,甚至字段内部也可能包含看似分隔符的空格。在这种情况下,诸如pandas read_csv标准库函数往往难以直接处理,因为它无法准确区分真正的字段边界和字段内的内容。本教程将指导您如何使用python正则表达式来处理这类挑战性的文本文件,并将其转换为规范的csv格式。

挑战:不规范文本文件的特点

一个典型的“坏”文本文件可能具有以下特点:

不一致的字段分隔符: 字段之间可能由2个、3个、甚至更多数量的空格分隔,没有统一的模式。字段内包含空格: 某些字段的值本身就包含空格,这些空格可能与字段分隔符的空格数量相近,导致误判。头部和数据行的分隔符模式不同: 文件头可能遵循一种分隔模式,而数据行则遵循另一种,甚至数据行内部也无固定模式。存在空行: 文件中可能包含不应被解析的空行。

对于这类文件,尝试使用pd.read_csv并指定sep=’t’或sep=r’s{2,}’通常会失败,因为这些方法无法处理上述的复杂性和歧义性。

import pandas as pd# 尝试使用制表符分隔,对于空格分隔的文件无效# df = pd.read_csv('file1.txt', sep='t', index_col=False, dtype='object')# 尝试使用2个或更多空格作为分隔符,但可能无法区分字段内空格# df = pd.read_csv("file1.txt", sep=r"s{2,}", engine="python")# 这些方法对于不规范文件通常无法得到预期结果

解决方案:自定义Python解析器

处理这种“坏”文本文件的最有效方法是编写一个自定义的解析器,逐行读取文件,并利用正则表达式进行精确的模式匹配和替换。核心思想是:

逐行处理: 遍历文件的每一行。区分头部、空行和数据行: 对不同类型的行采用不同的解析策略。正则表达式替换函数: 使用re.sub结合自定义的替换函数,根据上下文智能地将字段分隔符的空格替换为统一的制表符(或其他明确的分隔符)。

下面是一个具体的Python实现示例:

巧文书 巧文书

巧文书是一款AI写标书、AI写方案的产品。通过自研的先进AI大模型,精准解析招标文件,智能生成投标内容。

巧文书 61 查看详情 巧文书

立即学习“Python免费学习笔记(深入)”;

import reimport csvimport sysdef parse_bad_txt_to_csv(input_filepath, output_filepath):    """    解析不规范的空格分隔文本文件,并将其转换为CSV格式。    Args:        input_filepath (str): 输入的不规范文本文件路径。        output_filepath (str): 输出的CSV文件路径。    """    table = []    with open(input_filepath, 'r', encoding='utf-8') as f:        lines = f.readlines()    for i, line in enumerate(lines):        line = line.rstrip('n') # 移除行尾换行符        if i == 0:            # 第一行通常是标题行,可以假设字段间没有内部空格            # 简单地按2个或更多空格分割            row = re.split(r' {2,}', line)            table.append(row)            continue        if not line.strip(): # 检查是否是空行            # 忽略空行            continue        # 对于数据行,需要更复杂的逻辑来处理空格        def replfunc(match_obj):            """            自定义替换函数,用于区分字段分隔符和字段内部空格。            根据匹配到的空格长度及其上下文决定如何替换。            """            L = len(match_obj.group(0)) # 匹配到的连续空格的长度            # 特殊情况处理:例如,某些字段值内部的“Rejected at  level.”            # 这里的2个空格是字段内容的一部分,而非分隔符            start, end = match_obj.span()            if L == 2 and line[:start].endswith('Rejected at') and line[end:].startswith('level.'):                return ' ' # 替换为单个空格,保持为字段内容            # 其他情况:根据空格长度判断为字段分隔符,替换为制表符            # 这些长度是根据具体数据文件观察得出的,需要根据实际文件调整            if L < 2:                # 理论上不会出现,因为我们匹配的是2个或更多空格                return match_obj.group(0)             elif 2 <= L <= 12:                return 't' # 2到12个空格视为一个字段分隔符            elif L == 17:                return 'tt' # 17个空格视为两个字段分隔符(如果字段是空的)            elif L == 43:                return 'ttt' # 43个空格视为三个字段分隔符            elif L == 61:                return 'ttttt' # 61个空格视为五个字段分隔符            elif L == 120 or L == 263:                return 't' # 特殊长度的空格,视为一个字段分隔符            else:                # 如果遇到未预期的空格长度,可以打印警告或返回原始匹配                sys.stderr.write(f"Warning: Unexpected space length {L} at line {i+1}n")                return f'' # 用特殊标记包裹,方便后续检查        # 使用replfunc替换所有连续2个或更多空格        tabbed_line = re.sub(r's{2,}', replfunc, line)        # 按照制表符分割行,得到字段列表        row = tabbed_line.split('t')        table.append(row)    # 将处理后的数据写入CSV文件    with open(output_filepath, 'w', newline='', encoding='utf-8') as csvfile:        csv_writer = csv.writer(csvfile)        csv_writer.writerows(table)    print(f"文件已成功转换为CSV:{output_filepath}")# 示例用法if __name__ == "__main__":    # 创建一个模拟的“坏”文本文件    sample_data = """HP TRA ID        CL ID              IN/EId      No    Loop  Element Name                    Freq  STATUS         Error Severity  Error ID         Message                                                                                                                                                                                                                                                                                                       Report Source13ZI       20712800032                                                             1     Denied         Error           HP_DOSOlderTh  Date of service is older than 12 months                                                                                                                                                                                                                                                                       HP           13ZI       20712800032                 1                                           1     Rejected      Error           CA16            Rejected at  level. DupKeyID:0 is a Rejected of DupKeyID:0 from EncounterID:15C7XE9GV00 Claim ID:P_20712800032ALPHA_1649845496_19961109508100_716.                                                                                                                        HP           13ZI       20712800032                 2                                           1     Rejected      Error           CA16            Rejected at  level. DupKeyID:1 is a Rejected of DupKeyID:1 from EncounterID:15C7XE9GV00 Claim ID:P_20712800032ALPHA_1649845496_19961109508100_716.                                                                                                                        HP           13ZI       20712800032                 3                                           1     Rejected      Error           CA16            Rejected at  level. DupKeyID:2 is a Rejected of DupKeyID:2 from EncounterID:15C7XE9GV00 Claim ID:P_20712800032ALPHA_1649845496_19961109508100_716.                                                                                                                        HP           1P8TY0J25       20712805263                                                             1     Denied         Error           HP_DOSOlderTh  Date of service is older than 12 months """    with open('input.txt', 'w', encoding='utf-8') as f:        f.write(sample_data)    parse_bad_txt_to_csv('input.txt', 'output.csv')    # 验证输出 (可选)    # df_output = pd.read_csv('output.csv')    # print(df_output.head())

注意事项与代码适应性

数据特异性: 上述replfunc中的空格长度判断(L == 2, 2 <= L <= 12, L == 17等)是高度依赖于提供的示例数据的。在实际应用中,您必须仔细分析自己的“坏”文本文件,观察不同字段分隔符对应的空格长度,并相应地调整replfunc中的条件。这通常需要手动检查几行数据,找出规律。上下文敏感性: replfunc中处理“Rejected at level.”的逻辑展示了上下文敏感性。如果您的数据中存在其他类似的字段内部空格模式,您需要添加更多if条件来识别和处理它们。鲁棒性: 如果文件中出现未预料到的空格长度,else分支会打印警告并返回一个特殊标记(如)。这有助于您发现新的模式并进一步完善replfunc。性能: 对于非常大的文件,逐行读取和正则表达式操作可能会有性能开销。但对于大多数常见大小的文件,这种方法是高效且可行的。空字段处理: 当多个制表符连续出现时(例如tt),split(‘t’)会自动将其解析为空字段,这符合CSV的预期行为。

总结

处理不规范的文本文件并将其转换为CSV是一项常见的挑战。虽然标准库函数在大多数情况下表现良好,但面对具有复杂、模糊分隔符的“坏”文件时,自定义解析器是必不可少的。通过结合Python的字符串处理能力和正则表达式的强大模式匹配功能,我们可以创建出灵活且精确的解决方案,即使是最棘手的数据格式也能迎刃而解。关键在于对数据模式的深入理解和re.sub配合自定义替换函数的巧妙运用。请记住,此方法的成功高度依赖于您对特定输入文件结构的分析和适应。

以上就是Python处理非标准分隔符文本文件转换为CSV的实战指南的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/576815.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
蛙漫2入口官网地址更新 漫蛙Manwa2正版阅读平台直达
上一篇 2025年11月10日 08:51:38
文心一言网页版登录 文心一言网页版入口
下一篇 2025年11月10日 08:51:42

相关推荐

  • mysql安装完如何诊断 mysql慢查询分析与优化方法

    要解决 mysql 慢查询问题,首先要开启慢查询日志,其次使用 mysqldumpslow 分析日志,再通过 explain 查看执行计划,最后根据常见优化建议改进 sql 和索引。具体步骤如下:一、修改配置文件或动态开启慢查询日志,并设置阈值和路径;二、使用 mysqldumpslow 工具分析慢…

    2026年9月22日
    100
  • 主板供电相数对CPU超频稳定性的影响:14相 vs. 20相实测

    20相供电主板在超频下表现更稳,实测显示其VRM温度更低、电压波动更小、性能输出更一致,尤其适合极限超频和高负载场景,而14相供电配合优质用料也能满足主流超频需求,普通用户无需盲目追求高相数。 主板供电相数直接影响CPU在高负载和超频状态下的电压稳定性和温度控制。很多人在选择主板时会看到“14相”或…

    2026年9月22日
    200
  • mysql安装后怎么建表 mysql创建数据表的详细步骤

    mysql安装后怎么建表 mysql创建数据表的详细步骤mysql安装后怎么建表 mysql创建数据表的详细步骤mysql安装后怎么建表 mysql创建数据表的详细步骤mysql安装后怎么建表 mysql创建数据表的详细步骤

    安装完 mysql 后,建表的关键在于先创建数据库并选择使用,然后通过 create table 语句定义表结构。1. 创建数据库:使用 create database mydatabase; 创建数据库;2. 使用数据库:通过 use mydatabase; 选择当前操作的数据库;3. 建表语法:…

    2026年9月22日 用户投稿
    200
  • 夸克浏览器电脑网页版访问入口 夸克官网主页链接地址

    夸克浏览器电脑网页版访问入口是https://www.quark.cn/,用户可直接在浏览器地址栏输入该链接访问,其界面采用极简设计并集成智能搜索、网盘服务与跨设备同步等功能。 立即进入“☞☞☞☞☞点击夸克资源网(永久免费)入口☜☜☜☜☜”; 立即进入“☞☞☞☞☞点击夸克浏览器电脑网页版访问入口☜☜…

    2026年9月22日
    500
  • 如何查询命令所属包 yum provides反向查找

    如何查询命令所属包 yum provides反向查找如何查询命令所属包 yum provides反向查找如何查询命令所属包 yum provides反向查找如何查询命令所属包 yum provides反向查找

    使用 yum provides 可以查找某个命令或文件属于哪个软件包,解决“command not found”问题。1. 使用时建议带上完整路径,如 yum provides /usr/sbin/ifconfig;2. 支持通配符模糊查找,如 yum provides */python3;3. 若…

    2026年9月22日 用户投稿
    000
  • RAID 0阵列对NVMe SSD性能的提升与数据安全风险分析

    RAID 0通过多NVMe SSD并行提升读写性能,理论速度翻倍且显著优化高负载响应,但无冗余导致任一硬盘故障即全阵列崩溃,数据恢复极难,仅建议用于可接受高风险的临时工作或性能优先场景,并必须配合外部备份。 raid 0通过将数据条带化分布在多个存储设备上,理论上可提升读写性能。在搭配nvme ss…

    用户投稿 2026年9月22日
    200
  • SonyCatalyst如何制作高质量AI视频?专业工具剪辑AI内容的指南

    Sony Catalyst通过素材筛选、视觉修正、色彩校正、细节雕琢与音频优化,将AI生成的粗胚视频精修为具备叙事感与视觉一致性的专业作品,其强大色彩管理、稳定器与降噪工具有效解决AI视频的抖动、噪点、色彩偏差等问题,并支持高分辨率素材处理与跨平台输出,实现AI内容与传统剪辑流程的高效融合。 ☞☞☞…

    2026年9月22日
    000
  • 谷歌浏览器窗口透明边框显示异常如何修复

    首先尝试修改快捷方式添加–disable-gpu –disable-software-rasterize参数,若可正常运行则关闭硬件加速,并重置chrome://flags实验功能及清除ShaderCache缓存文件。 谷歌浏览器出现窗口透明边框显示异常,通常和硬件加速或GP…

    2026年9月22日
    000
  • VSCode配合Quartus开发FPGA(环境设置教程,提高开发效率)

    使用VSCode配合Quartus开发FPGA可提升效率,核心是结合VSCode的代码编辑功能与Quartus的编译仿真能力。首先安装Quartus、VSCode及Python,再安装VHDL/Verilog插件和Makefile Tools等扩展。配置系统环境变量,将Quartus命令路径加入PA…

    2026年9月22日
    100
  • 如何在Dask中训练AI大模型?分布式数据处理的AI训练技巧

    如何在Dask中训练AI大模型?分布式数据处理的AI训练技巧如何在Dask中训练AI大模型?分布式数据处理的AI训练技巧如何在Dask中训练AI大模型?分布式数据处理的AI训练技巧如何在Dask中训练AI大模型?分布式数据处理的AI训练技巧

    Dask在处理超大规模数据集时的独特优势在于其Python原生的分布式计算能力,能无缝扩展Pandas和NumPy的工作流,突破单机内存限制,实现高效的数据预处理与模型训练。它通过惰性计算、分块处理和内存溢写机制,支持TB级数据的并行操作,相比Spark提供了更贴近Python数据科学生态的API和…

    2026年9月22日 用户投稿
    100
  • 如何设置Linux用户磁盘配额 xfs_quota配置完整流程

    如何设置Linux用户磁盘配额 xfs_quota配置完整流程如何设置Linux用户磁盘配额 xfs_quota配置完整流程如何设置Linux用户磁盘配额 xfs_quota配置完整流程如何设置Linux用户磁盘配额 xfs_quota配置完整流程

    linux用户磁盘配额是通过xfs_quota工具配置,以限制用户或组的磁盘空间和文件数量。1. 确认文件系统为xfs并安装xfsprogs;2. 修改/etc/fstab启用usrquota和grpquota后重新挂载;3. 使用xfs_quota初始化数据库;4. 用limit命令设置用户或组的…

    2026年9月22日 用户投稿
    000
  • php-gd怎么应用复古滤镜_php-gd图像怀旧色调处理

    使用PHP-GD库实现复古滤镜主要通过色调偏移和色彩调整模拟老照片效果。1. 色调偏黄褐色:先转灰度,再用imagefilter添加棕黄色调;2. 手动像素级调整:逐像素计算灰度并赋予暖色系值,降低饱和度;3. 增强质感:结合对比度降低与轻微模糊提升真实感;4. 示例流程包括加载图像、应用滤镜、输出…

    2026年9月22日
    100
  • 家庭NAS搭建:硬件选型与RAID模式对传输速度的影响

    家庭NAS搭建需综合考虑CPU、内存、硬盘接口、网络和RAID模式。CPU至少四核,内存8GB起,推荐N5105/N100或AMD嵌入式处理器;千兆网口成瓶颈,应升级至2.5G/10G;SATA III限制SSD性能,建议支持NVMe主板。RAID 0提升速度但无冗余,RAID 1保障安全但写速低,…

    2026年9月22日
    100
  • VSCode调试FPGA的UART通信(串口数据分析,调试技巧)

    使用VSCode调试FPGA的UART通信,核心是通过其扩展生态集成串口监视与数据分析。首先确保FPGA的UART模块正常工作并输出调试信息,然后在VSCode中安装“Serial Monitor”等串口扩展,配置波特率、端口号以捕获数据。为解析十六进制或自定义协议数据,可结合Python脚本通过t…

    2026年9月22日
    000
  • 如何扫描Linux本地网络 nmap基础扫描技巧

    如何扫描Linux本地网络 nmap基础扫描技巧如何扫描Linux本地网络 nmap基础扫描技巧如何扫描Linux本地网络 nmap基础扫描技巧如何扫描Linux本地网络 nmap基础扫描技巧

    快速扫描整个子网可使用 sudo nmap -sn 192.168.1.0/24,用于发现活跃主机;若防火墙屏蔽icmp请求,可加 -pe 参数提高准确性。2. 扫描单台设备开放端口用 sudo nmap 192.168.1.100,默认扫描1000个常见端口,或加 -p- 扫描全部端口,并可用 -…

    2026年9月22日 用户投稿
    100
  • win10无法修改默认应用_Win10设置中更改默认程序失败的解决方法

    首先通过“设置”应用重新分配默认程序,若无效则使用PowerShell移除预装应用障碍,最后可手动修改注册表重置文件关联,三步解决Windows 10默认程序无法保存问题。 如果您尝试在Windows 10的设置中更改文件类型的默认打开程序,但发现设置无法保存或立即恢复为原程序,则可能是由于系统策略…

    2026年9月22日
    500
  • 如何在mysql中监控用户操作日志

    MySQL默认不记录用户操作日志,但可通过启用通用查询日志记录所有SQL操作,或使用二进制日志追踪数据变更,也可部署审计插件实现细粒度监控,结合独立账号管理和日志轮转策略提升安全性与可追溯性。 MySQL 本身不默认记录用户的所有操作日志,但可以通过启用特定的日志功能来实现对用户行为的监控。以下是几…

    2026年9月22日
    100
  • Android自定义开关UI实现教程

    本文详细介绍了在Android应用中实现自定义开关UI的两种主要方法:一是通过集成第三方库如StickySwitch,快速实现美观且功能丰富的开关;二是通过结合Drawable XML和ToggleButton,实现高度定制化的开关外观。文章提供了详细的代码示例和配置说明,旨在帮助开发者灵活地创建符…

    2026年9月22日
    000
  • 爱应用pc版官网访问地址 爱应用pc版平台官方链接直达首页

    爱应用PC版官网访问地址是http://www.xapcn.com/,该软件为WP7/WP8手机提供资源管理、软件游戏免费安装等服务。 爱应用pc版官网访问地址在哪里?这是不少网友都关注的,接下来由PHP小编为大家带来爱应用pc版平台官方链接直达首页,感兴趣的网友一起随小编来瞧瞧吧! http://…

    2026年9月22日
    100
  • 宇宙级编辑器VSCode你真的会用吗?这些隐藏功能让效率翻倍​​

    VSCode的真正潜力在于深度使用命令面板、多光标编辑、用户代码片段、集成终端与任务、自定义快捷键及扩展生态,通过主动探索设置、状态栏功能、官方文档与社区资源,结合个性化主题与高效扩展,将其从基础编辑器升级为高度定制化、自动化、无缝集成的专属开发利器,显著提升编码效率与体验。 你可能以为自己会用VS…

    2026年9月22日
    000

发表回复

登录后才能评论
关注微信