Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
使用Python从CSV文件匹配JSON日志条目并提取相关信息_创想鸟

使用Python从CSV文件匹配JSON日志条目并提取相关信息

使用python从csv文件匹配json日志条目并提取相关信息

本文详细介绍了如何利用Python处理CSV和JSON两种不同格式的数据,实现基于CSV中IP地址和时间戳等关键信息,从JSON日志文件中筛选并提取匹配日志条目的需求。教程涵盖了数据读取、匹配逻辑构建、示例代码及性能优化等关键环节,旨在帮助读者高效地进行异构数据关联与分析。

在日常的数据处理工作中,我们经常会遇到需要从不同格式的数据源中关联信息的需求。例如,有一个包含用户行为或系统事件关键信息的CSV文件,而日志系统则以JSON格式记录了详细的运行日志。此时,我们可能需要根据CSV文件中的特定标识(如IP地址和时间戳)来筛选出JSON日志中对应的条目。本教程将指导您如何使用Python高效地完成这一任务。

1. 理解问题与挑战

我们的目标是:

读取一个CSV文件,其中包含 clientip 和 timestamp 等字段。读取一个JSON日志文件,其中每行是一个JSON对象,包含日志信息。如果JSON日志条目中的某些内容(例如,日志信息中包含的IP地址和日志时间)与CSV文件中的 clientip 和 timestamp 匹配,则将该JSON日志条目提取出来并保存到新文件。

挑战在于:

CSV和JSON的数据结构不一致,字段名称和组织方式可能不同。JSON日志中的IP地址可能不是一个独立的字段,而是嵌入在某个字符串(如 info 字段)中。需要高效地遍历和比较大量数据。

传统的Shell命令(如 join 或 awk)在处理结构化数据时非常强大,但对于这种需要解析复杂JSON结构并在字符串中进行模式匹配的场景,Python提供了更灵活和强大的解决方案。

立即学习“Python免费学习笔记(深入)”;

2. 核心工具:Python的csv和json模块

Python标准库中的 csv 和 json 模块是处理这两种数据格式的利器。

csv 模块:用于读写CSV(逗号分隔值)文件。csv.DictReader 特别方便,它将每一行读取为字典,其中键是CSV文件的标题行。json 模块:用于编码和解码JSON(JavaScript对象表示法)数据。json.loads() 可以将JSON字符串解析为Python对象(如字典或列表),json.dumps() 则可以将Python对象转换为JSON字符串。

3. 数据准备与示例

为了演示,我们先模拟CSV和JSON数据。在实际应用中,您将直接从文件中读取这些数据。

示例 CSV 数据 (data.csv)

"clientip","destip","dest_hostname","timestamp""127.0.0.1","0.0.0.0","randomhost","2023-09-09T04:18:22.542Z""192.168.1.10","0.0.0.0","anotherhost","2023-09-09T05:00:00.000Z"

示例 JSON 日志数据 (logs.json)

[    {"log": "09-Sept-2023", "rate-limit": "somethingelse?", "info": "client @xyz 127.0.0.1", "stream":"stderr", "time": "2023-09-09T04:18:22.542Z"},    {"log": "09-Sept-2023", "rate-limit": "another_event", "info": "client @abc 192.168.1.10", "stream":"stdout", "time": "2023-09-09T05:00:00.000Z"},    {"log": "10-Sept-2023", "rate-limit": "unrelated", "info": "client @def 10.0.0.1", "stream":"stderr", "time": "2023-09-10T06:00:00.000Z"}]

注意:上述JSON数据是经过修正的,以确保其是有效的JSON格式,并且 time 字段被正确地表示为字符串。原始问题中提供的JSON示例可能存在格式问题,在实际处理前需要确保JSON数据的有效性。

4. 实现匹配逻辑

我们将通过以下步骤实现匹配:

读取CSV文件,逐行获取 clientip 和 timestamp。读取JSON日志文件,解析所有日志条目。对于CSV中的每一行,遍历JSON日志条目,检查 timestamp 是否精确匹配,并检查 clientip 是否作为子字符串存在于JSON日志条目的 info 字段中。将所有匹配的JSON日志条目写入一个新的输出文件。

以下是实现此逻辑的Python代码:

import ioimport csvimport jsonimport re # 导入re模块,用于更灵活的字符串匹配,尽管本例中'in'操作符已足够def extract_matched_json_logs(csv_filepath, json_filepath, output_filepath):    """    根据CSV文件中的IP和时间戳,从JSON日志文件中提取匹配的日志条目。    Args:        csv_filepath (str): CSV文件的路径。        json_filepath (str): JSON日志文件的路径。        output_filepath (str): 匹配结果输出文件的路径。    """    matched_entries_count = 0    try:        # 1. 读取CSV数据        # 使用'with'语句确保文件正确关闭        with open(csv_filepath, 'r', encoding='utf-8') as csv_file:            csv_reader = csv.DictReader(csv_file)            csv_data_list = list(csv_reader) # 将CSV数据加载到内存中,方便多次遍历        # 2. 读取JSON日志数据        with open(json_filepath, 'r', encoding='utf-8') as json_file:            json_data = json.load(json_file) # 加载整个JSON文件内容        # 3. 遍历CSV数据并与JSON日志进行匹配        with open(output_filepath, 'w', encoding='utf-8') as outfile:            for csv_row in csv_data_list:                csv_ip = csv_row.get('clientip')                csv_timestamp = csv_row.get('timestamp')                # 确保关键字段存在                if not csv_ip or not csv_timestamp:                    print(f"警告: CSV行缺少'clientip'或'timestamp'字段,跳过: {csv_row}")                    continue                for json_entry in json_data:                    json_time = json_entry.get('time')                    json_info = json_entry.get('info', '') # 使用.get()并提供默认值,防止KeyError                    # 匹配条件:                    # 1. 时间戳精确匹配                    # 2. CSV中的IP地址作为子字符串存在于JSON日志的'info'字段中                    if json_time == csv_timestamp and csv_ip in json_info:                        # 找到匹配,将JSON条目写入输出文件                        outfile.write(json.dumps(json_entry, ensure_ascii=False) + 'n')                        matched_entries_count += 1                        # 如果一个CSV行只应匹配一个JSON条目,可以在这里添加break                        # break        print(f"匹配完成!共找到 {matched_entries_count} 条匹配的JSON日志条目,已保存到 '{output_filepath}'。")    except FileNotFoundError:        print(f"错误: 文件未找到。请检查路径: {csv_filepath} 或 {json_filepath}")    except json.JSONDecodeError:        print(f"错误: JSON文件格式无效。请检查文件: {json_filepath}")    except Exception as e:        print(f"发生未知错误: {e}")# --- 运行示例 ---# 创建模拟文件with open('data.csv', 'w', encoding='utf-8') as f:    f.write('"clientip","destip","dest_hostname","timestamp"n')    f.write('"127.0.0.1","0.0.0.0","randomhost","2023-09-09T04:18:22.542Z"n')    f.write('"192.168.1.10","0.0.0.0","anotherhost","2023-09-09T05:00:00.000Z"')with open('logs.json', 'w', encoding='utf-8') as f:    f.write('''[    {"log": "09-Sept-2023", "rate-limit": "somethingelse?", "info": "client @xyz 127.0.0.1", "stream":"stderr", "time": "2023-09-09T04:18:22.542Z"},    {"log": "09-Sept-2023", "rate-limit": "another_event", "info": "client @abc 192.168.1.10", "stream":"stdout", "time": "2023-09-09T05:00:00.000Z"},    {"log": "10-Sept-2023", "rate-limit": "unrelated", "info": "client @def 10.0.0.1", "stream":"stderr", "time": "2023-09-10T06:00:00.000Z"}]''')# 调用函数进行匹配extract_matched_json_logs('data.csv', 'logs.json', 'matched_json_logs.txt')

5. 代码解析与注意事项

文件读取:csv.DictReader 将CSV文件的每一行转换为字典,方便通过列名访问数据。json.load() 用于读取整个JSON文件并解析为Python对象。如果JSON文件非常大,一行一个JSON对象(JSON Lines格式),则需要逐行读取并使用 json.loads() 解析每行。错误处理:使用 try-except 块来捕获 FileNotFoundError 和 json.JSONDecodeError 等常见错误,提高程序的健壮性。字典的 get() 方法:在访问字典字段时,使用 json_entry.get(‘time’) 而不是 json_entry[‘time’] 是一个好习惯。get() 方法允许您指定一个默认值(例如 ” 或 None),以防止当键不存在时引发 KeyError。IP地址匹配:由于JSON日志中的IP地址可能嵌入在字符串中,我们使用了 csv_ip in json_info 进行子字符串匹配。如果需要更精确的IP地址提取(例如,确保匹配的是完整的IP地址而不是部分数字),可以使用正则表达式 re.search(r’b’ + re.escape(csv_ip) + r’b’, json_info)。输出文件:匹配到的JSON条目被写入 output_filepath 指定的文件。json.dumps(json_entry, ensure_ascii=False) 将Python字典转换回JSON字符串,ensure_ascii=False 确保中文字符不会被转义。n 用于在每个JSON条目后添加换行符,使输出文件易于阅读。性能考虑:对于小型文件,将CSV和JSON数据一次性加载到内存中(如 csv_data_list = list(csv_reader) 和 json_data = json.load(json_file))是可行的。对于非常大的文件,一次性加载可能会导致内存不足。此时,可以考虑使用生成器(generator)逐行读取文件,或者将其中一个文件(通常是较小的那个)加载到内存中,然后流式处理另一个文件。例如,如果JSON日志文件非常大,您可以先将CSV数据构建成一个查找结构(如字典),然后逐行读取JSON日志并进行查找。

6. 总结

通过Python的 csv 和 json 模块,我们可以灵活地处理不同格式的数据,并实现复杂的匹配和提取逻辑。本教程提供了一个通用的框架,您可以根据实际需求调整匹配条件、数据结构和性能优化策略。理解数据格式、选择合适的工具以及编写健壮的代码是成功进行异构数据处理的关键。

以上就是使用Python从CSV文件匹配JSON日志条目并提取相关信息的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1369227.html

赞 (0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
macOS 14环境下解决google-re2安装编译错误的专业指南
上一篇 2025年12月14日 09:28:42
使用Python根据CSV数据筛选JSON日志条目
下一篇 2025年12月14日 09:28:56

相关推荐

  • Laravel中的Blade模板引擎基础用法

    blade模板引擎在laravel中用于简化视图开发。具体使用方法如下:1.输出变量:{{ $variable }}。2.条件判断:@if、@else、@elseif。3.循环:@foreach。4.模板继承:@extends、@section、@yield。blade让视图代码更简洁易读,但需注意…

    2026年9月21日
    000
  • Windows10重置此电脑卡住不动了怎么办_Windows10重置电脑卡住修复方法

    重置电脑卡住时,先等待2-4小时观察硬盘灯是否闪烁,确认系统是否仍在运行;若无响应,可尝试断开网络避免更新下载、调整BIOS关闭Secure Boot并启用Legacy模式;或使用Windows安装U盘启动,进入修复模式执行启动修复、chkdsk磁盘检查,以及通过三次强制关机触发恢复环境重试重置。 …

    2026年9月21日
    000
  • Linux查看系统日志的常用命令

    答案是查看Linux日志需综合使用journalctl、dmesg、tail、grep等工具。journalctl用于systemd系统集中查询服务及内核日志,支持时间、优先级、字段等多维度过滤;dmesg专注内核启动与硬件问题;tail -f实时监控日志动态;cat、grep、less结合正则和管…

    用户投稿 2026年9月21日
    000
  • Java中设计可扩展类的技巧与经验

    设计可扩展类应优先组合而非继承,通过接口解耦;明确开放protected扩展点并封闭关键逻辑;提供详细文档说明扩展规则;谨慎处理状态与初始化,避免构造器中调用可重写方法;多数场景推荐接口与组合,必要时才允许继承。 在Java中设计可扩展类时,核心目标是让类既能满足当前需求,又便于未来被安全、可控地继…

    2026年9月21日
    100
  • mysql如何实现后台管理系统

    答案:基于MySQL的%ignore_a_1%需设计用户、权限、日志等表结构,通过后端语言实现安全的CRUD接口与JWT认证,前端展示数据并控制权限,确保系统安全稳定。 实现一个基于 MySQL 的后台管理系统,核心是构建一个安全、稳定、可扩展的系统架构,将数据库作为数据存储层,配合后端语言和前端界…

    2026年9月21日
    000
  • Workerman服务启动失败的排查步骤

    workerman服务启动失败的排查步骤如下:1. 检查配置文件,确保无语法错误;2. 查看系统日志,寻找错误线索;3. 检查端口占用情况,确保端口未被占用;4. 调整文件权限,确保workerman有足够权限;5. 检查php环境,确保版本兼容且扩展已安装。 关于Workerman服务启动失败的排…

    2026年9月21日
    200
  • 如何为VSCode设置自定义的代码高亮颜色?

    答案:通过settings.json中的editor.tokenColorCustomizations可自定义VSCode代码高亮颜色,支持全局或特定主题下修改关键字、字符串等元素颜色,结合textMateRules和作用域精确控制,提升代码可读性。 为 VSCode 设置自定义的代码高亮颜色,可以…

    2026年9月21日
    000
  • 百度浏览器自动跳转怎么办 百度浏览器页面跳转广告拦截方法

    百度浏览器自动跳转通常由恶意软件或设置被篡改引起,需检查浏览器设置、清除异常插件、修复快捷方式与注册表,并使用安全软件扫描清理,同时启用广告拦截与隐私保护功能以彻底解决问题。 百度浏览器出现自动跳转,通常不是浏览器本身的问题,而是由恶意软件、插件或设置被篡改导致的。解决这个问题需要从多个方面入手,检…

    2026年9月21日
    100
  • 压力测试(Benchmark)Swoole服务的工具与方法

    进行swoole服务的压力测试是为了确保服务在高负载下稳定运行。1. 选择工具:apache jmeter、wrk、locust。2. 使用方法:jmeter通过脚本配置,wrk通过命令行,locust通过python脚本。3. 注意事项:环境隔离、数据监控、脚本设计。4. 优化点:内存泄漏、连接池…

    2026年9月21日
    000
  • Windows11内存占用率过高怎么解决_Windows11内存占用过高修复方法

    1、通过任务管理器结束高内存占用进程;2、禁用Superfetch(SysMain)服务以降低内存负担;3、优化启动项减少后台负载;4、升级物理内存条提升系统性能。 如果您发现Windows 11系统运行缓慢,并且任务管理器显示内存占用率持续处于高位,这可能是由于后台进程过多、系统服务占用资源或硬件…

    2026年9月21日
    100
  • mysql常用存储引擎有哪些

    InnoDB是现代MySQL应用的首选存储引擎,因其支持事务(ACID)、行级锁、外键约束、崩溃恢复和MVCC,适用于高并发、数据完整性要求高的OLTP场景;MyISAM虽读取快但仅支持表级锁且无事务和外键,适用于读多写少的简单场景,已逐渐被淘汰;Memory引擎将数据存于内存,速度快但易失,适合临…

    2026年9月21日
    000
  • 在Java中多态是如何通过虚方法实现的

    多态通过动态方法调度实现,JVM利用虚方法表(vtable)在运行时根据对象实际类型确定方法调用。Java中除private、static、final方法和构造器外均为虚方法,子类重写方法后其vtable指向新实现,调用时JVM通过对象类型查找vtable定位具体方法。如Animal a = new…

    2026年9月21日
    000
  • 谷歌浏览器图片无法显示怎么办 谷歌浏览器图片加载失败修复方法

    首先检查浏览器图片显示设置是否允许,确认无误后清除缓存和Cookie数据,接着排查扩展程序干扰,最后更新浏览器并检查硬件加速设置。 谷歌浏览器图片加载不出来,通常不是大问题,多数情况通过几个简单操作就能解决。下面列出几种常见且有效的排查方法。 检查图片显示设置 最直接的原因可能是浏览器被设置为阻止图…

    2026年9月21日
    000
  • 如何配置VSCode来完美支持Vue.js开发?

    安装Volar、TypeScript Vue Plugin、ESLint和Prettier扩展,禁用Vetur,在settings.json中配置vetur.enabled为false,设置ESLint保存时自动修复并指定Prettier为默认格式化工具,关联.vue文件语言,启用TypeScrip…

    2026年9月21日
    000
  • Potplayer如何修复卡顿问题_Potplayer解决播放卡顿的实用方案

    更换视频渲染器、更新显卡驱动、调整色彩格式、关闭叠加层特效及修复视频文件可解决PotPlayer播放卡顿问题。 如果您在使用PotPlayer播放视频时遇到画面卡顿、播放不流畅的情况,这可能是由于渲染器设置不当、硬件加速冲突或系统资源占用过高导致的。以下是解决此问题的具体步骤: 本文运行环境:Del…

    2026年9月21日
    100
  • 利用蝴蝶号搭建多账号无人直播系统的完整方案

    利用蝴蝶号搭建多账号无人直播系统的完整方案利用蝴蝶号搭建多账号无人直播系统的完整方案利用蝴蝶号搭建多账号无人直播系统的完整方案利用蝴蝶号搭建多账号无人直播系统的完整方案

    搭建多账号无人直播系统并非一键操作,而是通过“蝴蝶号”实现自动化流程。首先,“蝴蝶号”负责多账号的生命周期管理,包括登录、状态维护、ip代理分配和设备指纹模拟;其次,内容调度系统决定直播内容及播放时间,可为预录视频或动态生成流;再次,推流引擎将内容实时推送至平台,推荐使用ffmpeg结合python…

    2026年9月21日 • 用户投稿
    100
  • 数据库运维开发环境的调试模式演进

    数据库运维开发环境的调试模式演进数据库运维开发环境的调试模式演进数据库运维开发环境的调试模式演进数据库运维开发环境的调试模式演进

    这是学习笔记的第2393篇文章。 昨日,同事反馈了一个问题,原本的办公机环境中的虚拟机可以将办公机的IP暴露出来,提供数据库运维的API服务。例如,办公机的IP为192.168.10.100,而使用VirtualBox的虚拟机采用主机模式,其IP可能为192.168.56.100,那么192.168…

    2026年9月21日 • 用户投稿
    100
  • MySQL数据库日志审计与合规性实现_保护敏感数据与满足法规需求

    MySQL数据库日志审计与合规性实现_保护敏感数据与满足法规需求MySQL数据库日志审计与合规性实现_保护敏感数据与满足法规需求MySQL数据库日志审计与合规性实现_保护敏感数据与满足法规需求MySQL数据库日志审计与合规性实现_保护敏感数据与满足法规需求

    mysql日志审计是合规性的基石,因为它提供了数据库操作的完整证据链,记录用户身份、操作类型和时间戳等关键信息,满足gdpr、hipaa等法规要求,并支持事后追溯与事前震慑。1. mysql自身提供错误日志、通用查询日志、慢查询日志和二进制日志,其中通用查询日志记录所有sql语句,二进制日志用于数据…

    2026年9月21日 • 用户投稿
    100
  • 谷歌浏览器官方在线访问 最新版Chrome官网登录

    谷歌浏览器官方在线访问入口是https://www.google.cn/chrome/,提供简洁界面、跨设备同步、高效内核、安全防护和丰富扩展生态。 谷歌浏览器官方在线访问入口在哪里?这是不少网友都关注的,接下来由PHP小编为大家带来最新版Chrome官网登录地址,想要获取纯净浏览体验的网友一起随小…

    2026年9月21日
    200
  • Java Collections.singletonList如何创建单元素集合

    Collections.singletonList(T item) 返回只含一个元素的不可变列表,传入指定对象后生成轻量级只读集合,适用于需高效传递单元素场景。该列表禁止修改操作,否则抛出异常,允许 null 元素,内部优化减少内存开销,常用于 API 参数传递或流处理中的临时数据构造。 Java …

    2026年9月21日
    100

发表回复

登录后才能评论
关注微信