处理大型CSV文件中混合日期格式的挑战:迭代式解析与数据清洗

处理大型CSV文件中混合日期格式的挑战:迭代式解析与数据清洗

理解Pandas to_datetime 的局限性

在处理大规模数据集时,尤其当日期字段包含多种格式(例如 dd/mm/yyyy 和 dd/mm/yyyy hh/mm/ss)时,我们常常会倾向于使用pandas库提供的pd.to_datetime函数,并配合format=’mixed’参数,期望它能智能地识别并转换这些混合格式。然而,对于数据质量不高或包含大量非标准、甚至完全未知的日期格式时,这种方法可能会遇到瓶颈,导致outofboundsdatetime等错误。

OutOfBoundsDatetime错误通常发生在Pandas尝试将日期字符串解析为日期时间对象时,由于格式识别失败或误判,导致解析出的年份超出了datetime对象所能表示的范围(例如,将06.11.2021误解析为06.11.8020)。即使我们使用了chunksize参数分块读取数据,或者设置了low_memory=False,也无法从根本上解决由于未知或意外日期格式导致的解析问题。format=’mixed’虽然功能强大,但它依赖于内部的启发式算法,当数据中存在它无法预期的格式时,便会失效。

迭代式日期解析与数据清洗策略

为了应对这种挑战,一种更为健壮且可控的策略是采用迭代式、交互式的日期解析方法。其核心思想是:

预定义已知格式: 明确数据中可能存在的日期时间格式列表。逐行尝试解析: 对于每一行数据,尝试使用预定义的格式列表进行解析。分流异常数据: 如果所有已知格式都无法成功解析,则将该行数据视为“异常”并将其隔离到一个单独的文件中。迭代优化: 检查隔离的异常数据文件,识别新的日期格式,并将其添加到预定义格式列表中,然后重新运行解析过程,直至异常数据文件为空或达到可接受的程度。

这种方法将数据清洗过程融入到解析过程中,不仅能有效处理混合格式,还能帮助我们发现数据中的潜在质量问题,实现对数据格式的全面理解和控制。

实现自定义日期解析流程

我们将使用Python的内置csv模块进行文件读写,以及datetime模块进行日期时间解析。这种方法避免了Pandas在处理极端混合格式时的内部复杂性,提供了更精细的控制。

1. 定义已知日期格式

首先,我们需要列出所有我们已知或预期可能出现的日期时间格式。这些格式字符串将用于datetime.strptime()函数。

import csvfrom datetime import datetime# 定义一个包含所有已知日期时间格式的列表# 注意:格式字符串必须与实际数据严格匹配fmts = [    r"%d/%m/%Y",          # 例如: 01/01/2001    r"%d/%m/%Y %H/%M/%S", # 例如: 02/02/2002 12/34/56    # 更多格式将在迭代中添加]

2. 自定义解析函数 parse_dt

创建一个辅助函数parse_dt,它将尝试使用fmts列表中的每个格式来解析给定的日期字符串。如果任何一个格式成功,则返回解析后的datetime对象;如果所有格式都失败,则返回None。

def parse_dt(s: str) -> datetime | None:    """    尝试使用预定义的格式列表解析日期时间字符串。    如果成功,返回datetime对象;否则返回None。    """    for fmt in fmts:        try:            dt = datetime.strptime(s, fmt)            return dt        except ValueError:            # 当前格式不匹配,尝试下一个            continue    # 所有格式都尝试失败    return None

3. 处理大型CSV文件:分流好坏数据

接下来,我们将编写主脚本来读取输入CSV文件,并根据解析结果将数据分流到“已过滤”和“异常”两个输出文件。

# 定义输出文件路径output_filtered_path = "output_filtered.csv"output_bad_path = "output_bad.csv"input_csv_path = "input.csv" # 假设这是你的大型CSV文件# 打开输出文件以供写入# 使用newline=''以防止csv模块在Windows上写入额外空行filtered_writer = csv.writer(    open(output_filtered_path, "w", newline="", encoding='utf-8'),    delimiter=",",)bad_writer = csv.writer(    open(output_bad_path, "w", newline="", encoding='utf-8'),    delimiter=",",)# 打开输入CSV文件以供读取reader = csv.reader(    open(input_csv_path, newline="", encoding='utf-8'),    delimiter=",",)# 定义过滤条件:例如,只保留2002年1月1日之前的合同# 实际应用中,这可能是一个动态的报告日期report_date = datetime(2002, 1, 1)# 逐行处理CSV数据for row in reader:    # 假设日期字段在第二列(索引为1)    date_str = row[1]    dt = parse_dt(date_str)    if dt is None:        # 如果日期解析失败,将整行写入“异常”文件        bad_writer.writerow(row)        continue # 继续处理下一行    # 如果日期解析成功,则进行业务逻辑过滤    if dt < report_date:        # 将日期标准化为ISO格式,方便后续处理        row[1] = dt.isoformat()        filtered_writer.writerow(row)    else:        # 满足过滤条件的行(例如,未过期的合同)        # 在这里可以根据需要选择打印或写入另一个文件        print(f"丢弃的记录 (过期或不符合条件): {dt} - 原始行: {row}")print(f"处理完成。过滤后的数据在: {output_filtered_path}")print(f"无法解析的异常数据在: {output_bad_path}")# 注意:在实际应用中,记得关闭文件句柄,# 或者使用with语句确保文件自动关闭# with open(...) as f:#     writer = csv.writer(f)#     ...

4. 示例代码(模拟数据和完整流程)

为了更好地演示,我们创建一个input.csv文件并运行上述脚本。

input.csv内容示例:

文心大模型 文心大模型

百度飞桨-文心大模型 ERNIE 3.0 文本理解与创作

文心大模型 56 查看详情 文心大模型

1,1/1/20012,2/2/2002 12/34/563,3.3.20034,6.1.20015,7.1.2001-5:38:196,01/01/2023

运行上述Python脚本后,初始输出:

output_bad.csv:

3,3.3.20034,6.1.20015,7.1.2001-5:38:19

output_filtered.csv:

1,2001-01-01T00:00:00

控制台输出 (部分):

丢弃的记录 (过期或不符合条件): 2002-02-02 12:34:56 - 原始行: ['2', '2/2/2002 12/34/56']丢弃的记录 (过期或不符合条件): 2023-01-01 00:00:00 - 原始行: ['6', '01/01/2023']

优化与迭代:处理未知日期格式

通过检查output_bad.csv,我们发现有三行数据未能成功解析:3.3.2003、6.1.2001 和 7.1.2001-5:38:19。这些日期格式显然不在我们最初定义的fmts列表中。

根据这些新的格式,我们可以更新fmts列表:

fmts = [    r"%d/%m/%Y",    r"%d/%m/%Y %H/%M/%S",    r"%d.%m.%Y",            # 新增: 例如 3.3.2003, 6.1.2001    r"%d.%m.%Y-%H:%M:%S",   # 新增: 例如 7.1.2001-5:38:19]

更新fmts列表后,重新运行脚本。

重新运行后的输出:

output_bad.csv: (将变为空,或只包含其他未发现的异常格式)output_filtered.csv:

1,2001-01-01T00:00:004,2001-01-06T00:00:005,2001-01-07T05:38:19

控制台输出 (部分):

丢弃的记录 (过期或不符合条件): 2002-02-02 12:34:56 - 原始行: ['2', '2/2/2002 12/34:56']丢弃的记录 (过期或不符合条件): 2003-03-03 00:00:00 - 原始行: ['3', '3.3.2003']丢弃的记录 (过期或不符合条件): 2023-01-01 00:00:00 - 原始行: ['6', '01/01/2023']

可以看到,经过迭代优化后,output_bad.csv已为空(或显著减少),所有符合过滤条件的日期都已成功解析并标准化。

注意事项与最佳实践

文件编码: 在打开CSV文件时,务必指定正确的编码(如encoding=’utf-8’),以避免字符编码错误。性能考量: 对于极大规模的数据集(如数十亿行),虽然csv模块的逐行处理效率较高,但频繁的磁盘I/O仍可能成为瓶颈。可以考虑将处理逻辑封装在一个生成器中,或者在内存允许的情况下,一次性读取少量行进行处理。错误日志: 除了将异常数据写入文件,还可以考虑将解析失败的具体原因(ValueError)记录到日志中,以便更深入地诊断问题。何时回归Pandas: 一旦通过迭代过程,大部分日期格式都已被识别并清洗干净,数据集的质量得到显著提升,你可以选择将清洗后的数据重新加载到Pandas DataFrame中,利用Pandas更丰富的数据分析功能。日/月优先: 在pd.to_datetime中,dayfirst=True参数可以帮助处理dd/mm/yyyy和mm/dd/yyyy的模糊情况。而datetime.strptime则通过明确的格式字符串(如%d/%m/%Y或%m/%d/%Y)来消除歧义。如果你的数据中存在这种模糊性,请确保在fmts列表中包含所有可能的解释。完整性检查: 在完成所有迭代后,务必检查output_bad.csv文件,确保其中没有遗漏的关键数据,或者其中包含的数据确实是应该被剔除的。

通过这种迭代式、自定义的日期解析策略,我们可以有效地应对大型CSV数据库中复杂多变的日期格式问题,确保数据清洗的彻底性和后续分析的准确性。

以上就是处理大型CSV文件中混合日期格式的挑战:迭代式解析与数据清洗的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/580121.html

赞 (0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
华为手机怎样截屏 华为手机截屏的5种常用方法汇总
上一篇 2025年11月10日 10:34:40
怎么给mysql添加用户名和密码
下一篇 2025年11月10日 10:34:46

相关推荐

  • 关闭超线程对现代游戏性能的提升与损失评估

    关闭超线程对现代游戏性能的提升与损失评估关闭超线程对现代游戏性能的提升与损失评估关闭超线程对现代游戏性能的提升与损失评估关闭超线程对现代游戏性能的提升与损失评估

    关闭超线程对游戏性能影响因硬件和场景而异,部分老游戏或竞技类游戏在Intel平台上可能提升帧稳定性,但现代多线程优化游戏及AMD Ryzen平台通常会因关闭而性能下降,需结合具体使用场景测试决定。 关闭超线程对现代游戏性能的影响因具体应用场景而异,不能一概而论。多数情况下,现代游戏更依赖高主频和单核…

    2026年9月29日 • 用户投稿
    000
  • SublimeText如何编译运行C++_MinGW环境配置与BuildSystem设置

    SublimeText如何编译运行C++_MinGW环境配置与BuildSystem设置SublimeText如何编译运行C++_MinGW环境配置与BuildSystem设置SublimeText如何编译运行C++_MinGW环境配置与BuildSystem设置SublimeText如何编译运行C++_MinGW环境配置与BuildSystem设置

    c++kquote>首先确认MinGW已正确安装并配置环境变量,再在Sublime Text中创建自定义Build System:将g++添加到PATH后,新建名为C++_MinGW.sublime-build的JSON文件,写入编译运行指令,保存至User目录;随后通过Ctrl+B编译、Ct…

    2026年9月29日 • 用户投稿
    000
  • VSCode如何设置调试时自动调整窗口布局方便查看 VSCode调试自动调整窗口布局的新颖配置技巧​

    在vscode中实现调试时自动调整窗口布局的核心方法是通过tasks.json定义布局任务,并在launch.json中使用prelaunchtask触发,从而在调试启动前自动切换到预设视图;具体步骤为:1. 在tasks.json中创建任务,使用vscode内部命令(如workbench.acti…

    2026年9月29日
    100
  • 360极速浏览器如何导入Firefox火狐浏览器书签_从火狐同步收藏夹数据方法

    360极速浏览器如何导入Firefox火狐浏览器书签_从火狐同步收藏夹数据方法360极速浏览器如何导入Firefox火狐浏览器书签_从火狐同步收藏夹数据方法360极速浏览器如何导入Firefox火狐浏览器书签_从火狐同步收藏夹数据方法360极速浏览器如何导入Firefox火狐浏览器书签_从火狐同步收藏夹数据方法

    首先通过360极速浏览器内置功能可直接从Firefox导入书签,或通过导出HTML文件中转实现跨浏览器迁移,具体步骤包括选择源浏览器、导出书签为HTML及从HTML文件导入等操作。 如果您需要在更换浏览器时保留重要的收藏夹数据,可以将火狐浏览器的书签迁移到360极速浏览器中。以下是完成此操作的具体步…

    2026年9月29日 • 用户投稿
    000
  • windows怎么打开任务管理器_Windows任务管理器打开方式汇总

    windows怎么打开任务管理器_Windows任务管理器打开方式汇总windows怎么打开任务管理器_Windows任务管理器打开方式汇总windows怎么打开任务管理器_Windows任务管理器打开方式汇总windows怎么打开任务管理器_Windows任务管理器打开方式汇总

    快捷键Ctrl+Shift+Esc可直接打开任务管理器;02. 右键任务栏选择“任务管理器”;03. Win+R输入taskmgr启动;04. 开始菜单搜索“任务管理器”并点击;05. 文件资源管理器地址栏输入taskmgr:回车开启。 如果您发现电脑运行缓慢或某个程序无响应,可能需要查看系统资源使…

    2026年9月29日 • 用户投稿
    000
  • 惠普ZBook风扇不转如何处理?专业设备维护技巧

    惠普ZBook风扇不转如何处理?专业设备维护技巧惠普ZBook风扇不转如何处理?专业设备维护技巧惠普ZBook风扇不转如何处理?专业设备维护技巧惠普ZBook风扇不转如何处理?专业设备维护技巧

    首先检查BIOS中风扇转速及温控设置,确保电源管理为高性能模式并卸载冲突软件;接着重置EC控制器并清理散热模组积尘;再检测风扇供电与接口状态,确认电压正常且连接稳固;随后评估轴承状态,必要时进行润滑或更换;最后根据型号匹配原则更换兼容风扇组件,确保系统识别与调速正常。 如果您发现惠普ZBook笔记本…

    2026年9月29日 • 用户投稿
    100
  • 抖音直播画面卡顿怎么办 抖音直播画面优化与网络调整技巧

    先确认上行网速是否达标,再优化设备编码设置。使用有线连接、关闭占用程序、开启硬编码并匹配分辨率与码率,结合平台工具调试,可有效解决抖音直播卡顿问题。 抖音直播画面卡顿,核心问题通常出在网络上传带宽不足或电脑编码性能不够。很多人以为家里宽带是千兆就一定流畅,其实直播看的是上行网速,这才是关键。下面从网…

    2026年9月29日
    100
  • 如何在Java中使用用户输入退出for或while循环

    如何在Java中使用用户输入退出for或while循环如何在Java中使用用户输入退出for或while循环如何在Java中使用用户输入退出for或while循环如何在Java中使用用户输入退出for或while循环

    本文旨在介绍如何在Java程序中,通过用户输入来灵活地中断for或while循环的执行。我们将探讨如何使用BufferedReader类来接收用户输入,并在循环内部判断输入是否为特定退出指令,从而实现程序的动态控制。同时,也会提供代码示例和注意事项,帮助你编写更健壮、更易维护的Java代码。 使用B…

    2026年9月29日 • 用户投稿
    000
  • 怎么用豆包AI帮我生成Docker配置 用AI快速创建最佳容器化方案的秘诀

    怎么用豆包AI帮我生成Docker配置 用AI快速创建最佳容器化方案的秘诀怎么用豆包AI帮我生成Docker配置 用AI快速创建最佳容器化方案的秘诀怎么用豆包AI帮我生成Docker配置 用AI快速创建最佳容器化方案的秘诀怎么用豆包AI帮我生成Docker配置 用AI快速创建最佳容器化方案的秘诀

    豆包ai能高效生成并优化docker配置,关键在于提问方式和信息完整度。1. 明确应用类型、依赖及部署需求,如服务语言、数据库、端口暴露等;2. 提供现有配置文件让ai检查安全与性能问题;3. 常见优化建议包括使用alpine镜像、多阶段构建、非root运行等;4. 可要求生成不同环境的配置文件(开…

    2026年9月29日 • 用户投稿
    100
  • Java中将当前时间转换为秒数

    Java中将当前时间转换为秒数Java中将当前时间转换为秒数Java中将当前时间转换为秒数Java中将当前时间转换为秒数

    本文介绍了如何在Java中将当前时间转换为自当天开始的秒数,并提供使用java.time.LocalTime类的示例代码。通过LocalTime.now()获取当前时间,并使用toSecondOfDay()方法将其转换为秒数。同时,还介绍了如何处理时区问题以及如何使用更易读的方式定义目标时间。 在J…

    2026年9月29日 • 用户投稿
    100
  • windows怎么安装补丁包.msu文件_windows .msu格式补丁包的安装方法

    windows怎么安装补丁包.msu文件_windows .msu格式补丁包的安装方法windows怎么安装补丁包.msu文件_windows .msu格式补丁包的安装方法windows怎么安装补丁包.msu文件_windows .msu格式补丁包的安装方法windows怎么安装补丁包.msu文件_windows .msu格式补丁包的安装方法

    首先通过命令提示符使用wusa命令安装.msu补丁,其次可双击文件图形化安装,最后也可用PowerShell调用wusa.exe完成部署,三种方法均需按提示重启系统应用更新。 如果您下载了Windows系统的补丁包但不确定如何正确安装.msu格式的更新文件,可能是由于系统未正确识别或手动安装流程不熟…

    2026年9月29日 • 用户投稿
    100
  • 使用 Java 比较版本号:正则表达式的替代方案

    使用 Java 比较版本号:正则表达式的替代方案使用 Java 比较版本号:正则表达式的替代方案使用 Java 比较版本号:正则表达式的替代方案使用 Java 比较版本号:正则表达式的替代方案

    本文介绍了一种在 Java 中比较版本号的有效方法,避免了使用正则表达式的复杂性和潜在问题。通过自定义 Version 类并实现 Comparable 接口,可以将版本号字符串转换为整数数组,从而实现准确的版本比较。该方法不仅清晰易懂,而且具有更好的可维护性和可扩展性。 在软件开发中,经常需要比较版…

    2026年9月29日 • 用户投稿
    000
  • 如何在Power BI中集成AI Power BI使用AI视觉分析数据

    如何在Power BI中集成AI Power BI使用AI视觉分析数据如何在Power BI中集成AI Power BI使用AI视觉分析数据如何在Power BI中集成AI Power BI使用AI视觉分析数据如何在Power BI中集成AI Power BI使用AI视觉分析数据

    在power bi中集成ai需多步骤实现,而非简单添加模块。1. 使用内置ai视觉分析功能如“分解树”和“关键影响因素”快速识别数据模式;2. 通过azure服务如anomaly detector进行复杂数据分析并可视化结果;3. 在power query中利用ai辅助清洗数据,提升效率;4. 自行…

    2026年9月29日 • 用户投稿
    100
  • 怎样为公司批量安装Sublime_Sublime企业部署安装指南

    怎样为公司批量安装Sublime_Sublime企业部署安装指南怎样为公司批量安装Sublime_Sublime企业部署安装指南怎样为公司批量安装Sublime_Sublime企业部署安装指南怎样为公司批量安装Sublime_Sublime企业部署安装指南

    首先准备标准化安装包和配置文件,再通过组策略或脚本批量部署,随后配置中央许可,最后验证安装与设置一致性。 如果您需要为公司内的多台计算机安装Sublime Text编辑器,以实现统一开发环境配置,则可以通过自动化脚本和集中化配置管理来完成批量部署。以下是实现企业级批量安装的具体步骤: 一、准备安装包…

    2026年9月29日 • 用户投稿
    400
  • 为什么GPU在深度学习任务中比CPU更高效?

    为什么GPU在深度学习任务中比CPU更高效?为什么GPU在深度学习任务中比CPU更高效?为什么GPU在深度学习任务中比CPU更高效?为什么GPU在深度学习任务中比CPU更高效?

    GPU因高度并行架构和高带宽内存系统,能高效处理深度学习中海量矩阵运算,而CPU擅长串行任务,在数据预处理、模型调度等方面仍不可或缺,二者协同工作提升整体效率。 GPU在深度学习任务中表现出远超CPU的效率,核心原因在于其高度并行的架构和为大规模数据吞吐量设计的内存系统,这与深度学习中海量的矩阵运算…

    2026年9月29日 • 用户投稿
    100
  • windows怎么连接蓝牙_Windows连接蓝牙设备操作步骤

    windows怎么连接蓝牙_Windows连接蓝牙设备操作步骤windows怎么连接蓝牙_Windows连接蓝牙设备操作步骤windows怎么连接蓝牙_Windows连接蓝牙设备操作步骤windows怎么连接蓝牙_Windows连接蓝牙设备操作步骤

    首先开启蓝牙功能并确保系统可检测设备,接着通过设置添加蓝牙设备完成配对;检查硬件开关或功能键启用蓝牙模块,重启蓝牙支持服务恢复后台运行,最后更新或重装蓝牙驱动程序以解决连接问题。 如果您尝试在Windows电脑上连接蓝牙设备,但发现设备无法配对或连接不稳定,可能是由于蓝牙服务未开启或驱动程序存在问题…

    2026年9月29日 • 用户投稿
    200
  • 如何设置winrar打开压缩包不弹框_设置WinRAR无弹框打开

    如何设置winrar打开压缩包不弹框_设置WinRAR无弹框打开如何设置winrar打开压缩包不弹框_设置WinRAR无弹框打开如何设置winrar打开压缩包不弹框_设置WinRAR无弹框打开如何设置winrar打开压缩包不弹框_设置WinRAR无弹框打开

    通过调整WinRAR设置可实现无弹框静默打开压缩文件:一、修改关联程序行为,取消默认程序注册并精简关联菜单;二、启用内部查看模式,在WinRAR窗口中打开文件并允许重复调用;三、创建带静默参数的快捷方式,使用“-iimg”减少提示;四、禁用消息提示框,关闭完成对话框和打开确认提示。 如果您在使用Wi…

    2026年9月29日 • 用户投稿
    300
  • Mac上怎么用Homebrew装Sublime_Homebrew安装Sublime教程

    Mac上怎么用Homebrew装Sublime_Homebrew安装Sublime教程Mac上怎么用Homebrew装Sublime_Homebrew安装Sublime教程Mac上怎么用Homebrew装Sublime_Homebrew安装Sublime教程Mac上怎么用Homebrew装Sublime_Homebrew安装Sublime教程

    首先确认Mac上已安装Homebrew,若未安装需通过官方脚本进行安装;随后使用brew install –cask sublime-text命令安装Sublime Text;最后创建软链接ln -s /Applications/Sublime Text.app/Contents/Sha…

    2026年9月29日 • 用户投稿
    100
  • firefox浏览器工具栏不见了怎么调出来 Firefox浏览器找回消失的工具栏技巧

    firefox浏览器工具栏不见了怎么调出来 Firefox浏览器找回消失的工具栏技巧firefox浏览器工具栏不见了怎么调出来 Firefox浏览器找回消失的工具栏技巧firefox浏览器工具栏不见了怎么调出来 Firefox浏览器找回消失的工具栏技巧firefox浏览器工具栏不见了怎么调出来 Firefox浏览器找回消失的工具栏技巧

    首先检查是否误触F11进入全屏模式,按F11退出后工具栏应恢复;若未解决,点击右上角菜单按钮→“自定义…”→开启“导航工具栏”和“书签工具栏”;仍无效时进入“设置”→“恢复默认设置”重置界面;最后可尝试在about:support页面备份并重建用户配置文件以修复可能的损坏。 如果您在使用…

    2026年9月29日 • 用户投稿
    200
  • 使用 Java 比较版本号:一种更健壮的方法

    使用 Java 比较版本号:一种更健壮的方法使用 Java 比较版本号:一种更健壮的方法使用 Java 比较版本号:一种更健壮的方法使用 Java 比较版本号:一种更健壮的方法

    本文介绍了一种在 Java 中比较版本号的有效方法,避免了使用正则表达式进行复杂匹配的局限性。通过将版本号解析为整数数组并实现 Comparable 接口,我们可以轻松地比较版本号的大小,从而实现版本控制和依赖管理等功能。这种方法更易于理解、维护和扩展,且能更准确地处理各种版本号格式。 在软件开发中…

    2026年9月29日 • 用户投稿
    200

发表回复

登录后才能评论
关注微信