Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
Python:基于名称匹配从JSON和文本文件提取关联数据_创想鸟

Python:基于名称匹配从JSON和文本文件提取关联数据

Python:基于名称匹配从JSON和文本文件提取关联数据

本教程详细阐述了如何使用Python处理非结构化文本文件和结构化JSON数据,实现跨文件的数据关联与提取。核心内容包括:加载JSON和文本文件、利用正则表达式从文本中高效提取关键设备名称,以及遍历JSON数据结构,根据匹配的设备名称定位并输出相应的URL信息。文章通过清晰的代码示例,指导读者完成从数据读取到信息输出的全过程,并提供了重要的注意事项和扩展建议。

在现代数据处理场景中,我们经常需要从不同格式的数据源中关联和提取信息。本教程将聚焦于一个典型案例:如何从一个包含设备名称的非结构化文本文件(.txt)中识别设备,并利用这些名称在一个结构化的json文件(.json)中查找并提取对应的详细url信息。我们将使用python的json模块进行json解析,以及re模块进行正则表达式匹配。

1. 准备数据文件

首先,我们需要准备两个示例文件:一个JSON文件(test.json)和一个文本文件(test.txt)。

test.json 文件内容示例:

{  "results": [    {      "url": "https://api.server.com/cables/100/",      "termination_a": {        "url": "https://api.server.com/interfaces/250/",        "device": {          "url": "https://api.server.com/devices/10/",          "display": "device-number1-2023-08 myname (1718)",          "name": "device-number1-2023-08 myname"        }      }    },    {      "url": "https://api.server.com/cables/200/",      "termination_a": {        "url": "https://api.server.com/interfaces/160/",        "device": {          "url": "https://api.server.com/devices/22/",          "display": "device-number3-2023-08 myname (2245)",          "name": "device-number1-2023-08 myname1"        }      }    },    {      "url": "https://api.server.com/cables/300/",      "termination_a": {        "url": "https://api.server.com/interfaces/260/",        "device": {          "url": "https://api.server.com/devices/73/",          "display": "device-number8-2023-08 myname (3678)",          "name": "device-number8-2023-08 myname"        }      }    }  ]}

test.txt 文件内容示例:

this is device-number1-2023-08 myname1 and it is good.this is device-number3-2023-08 myname3 and it is not good.this is device-number8-2023-08 myname8 and it is.

我们的目标是:从 test.txt 中提取 device-numberX-YYYY-MM mynameZ 这样的设备名称,然后用这些名称去 test.json 中匹配 results 列表里每个对象的 termination_a.device.name 字段。一旦匹配成功,就输出该JSON对象中的 url 和 termination_a.url。

立即学习“Python免费学习笔记(深入)”;

2. 实现数据关联与提取

我们将分步完成这个任务:首先加载数据,然后从文本文件中提取设备名称,最后遍历JSON数据进行匹配和输出。

2.1 加载数据文件

使用Python的 with open() 语句安全地打开并读取文件。json.load() 用于解析JSON文件,而 text_file.read() 则用于读取整个文本文件内容。

import jsonimport re# 加载JSON文件with open("test.json", "r", encoding="utf-8") as json_file:    json_data = json.load(json_file)# 加载文本文件with open("test.txt", "r", encoding="utf-8") as text_file:    text_content = text_file.read()print("JSON数据已加载。")print("文本内容已加载。")

2.2 从文本文件中提取设备名称

为了从非结构化的文本中准确提取设备名称,正则表达式是理想工具。根据 device-number1-2023-08 myname1 这种模式,我们可以构建一个正则表达式来匹配它。

正则表达式模式解释:

device-:匹配字面字符串 “device-“。w+:匹配一个或多个字母、数字或下划线(用于 “number1” 和 “myname1” 部分)。d+:匹配一个或多个数字(用于年份和月份)。-:匹配字面字符串 “-“。` `:匹配一个空格。():捕获组,用于提取匹配到的完整设备名称。

# 使用正则表达式从文本内容中提取所有设备名称# 模式:(device-w+-d+-d+ w+)# 示例匹配:device-number1-2023-08 myname1txt_device_names = re.findall(r"(device-w+-d+-d+ w+)", text_content)print("n从文本文件中提取的设备名称:", txt_device_names)

输出示例:

从文本文件中提取的设备名称: ['device-number1-2023-08 myname1', 'device-number3-2023-08 myname3', 'device-number8-2023-08 myname8']

2.3 关联与提取JSON数据

现在我们有了从文本文件中提取的设备名称列表。接下来,我们将遍历JSON数据中的 results 列表,检查每个 device 的 name 字段是否在我们的设备名称列表中。如果匹配成功,就打印出所需的URL信息。

print("n开始匹配JSON数据并提取URL:")found_matches = Falsefor item in json_data["results"]:    # 提取JSON中设备的名称    json_device_name = item["termination_a"]["device"]["name"]    # 检查JSON设备的名称是否在文本文件提取的名称列表中    if json_device_name in txt_device_names:        found_matches = True        print(f"n匹配成功,设备名称:{json_device_name}")        print(f"tt全局URL: {item['url']}")        print(f"tttermination_a URL: {item['termination_a']['url']}")        print(f"tttermination_a device URL: {item['termination_a']['device']['url']}")if not found_matches:    print("未找到任何匹配项。请检查数据或正则表达式。")

3. 完整示例代码

将上述所有步骤整合到一起,形成一个完整的Python脚本:

import jsonimport redef extract_and_match_data(json_filepath, text_filepath):    """    从JSON文件和文本文件关联数据并提取URL信息。    Args:        json_filepath (str): JSON文件的路径。        text_filepath (str): 文本文件的路径。    """    try:        # 1. 加载JSON文件        with open(json_filepath, "r", encoding="utf-8") as json_file:            json_data = json.load(json_file)        print(f"成功加载JSON文件: {json_filepath}")        # 2. 加载文本文件        with open(text_filepath, "r", encoding="utf-8") as text_file:            text_content = text_file.read()        print(f"成功加载文本文件: {text_filepath}")        # 3. 使用正则表达式从文本内容中提取所有设备名称        # 模式:(device-w+-d+-d+ w+)        txt_device_names = re.findall(r"(device-w+-d+-d+ w+)", text_content)        print("n从文本文件中提取的设备名称列表:", txt_device_names)        # 4. 遍历JSON数据,进行匹配并输出        print("n开始匹配JSON数据并提取URL:")        found_matches = False        for item in json_data["results"]:            json_device_name = item["termination_a"]["device"]["name"]            if json_device_name in txt_device_names:                found_matches = True                print(f"n匹配成功,设备名称:{json_device_name}")                print(f"tt全局URL: {item['url']}")                print(f"tttermination_a URL: {item['termination_a']['url']}")                print(f"tttermination_a device URL: {item['termination_a']['device']['url']}")        if not found_matches:            print("未找到任何匹配项。请检查数据或正则表达式。")    except FileNotFoundError:        print(f"错误:文件未找到。请检查路径: {json_filepath} 或 {text_filepath}")    except json.JSONDecodeError:        print(f"错误:JSON文件格式不正确: {json_filepath}")    except KeyError as e:        print(f"错误:JSON数据结构不符合预期,缺少键: {e}")    except Exception as e:        print(f"发生未知错误: {e}")# 调用函数执行数据关联和提取if __name__ == "__main__":    extract_and_match_data("test.json", "test.txt")

4. 运行与输出示例

假设您的 test.json 和 test.txt 文件内容如教程开头所示,运行上述代码将得到类似以下输出:

成功加载JSON文件: test.json成功加载文本文件: test.txt从文本文件中提取的设备名称列表: ['device-number1-2023-08 myname1', 'device-number3-2023-08 myname3', 'device-number8-2023-08 myname8']开始匹配JSON数据并提取URL:匹配成功,设备名称:device-number1-2023-08 myname        全局URL: https://api.server.com/cables/100/        termination_a URL: https://api.server.com/interfaces/250/        termination_a device URL: https://api.server.com/devices/10/匹配成功,设备名称:device-number1-2023-08 myname1        全局URL: https://api.server.com/cables/200/        termination_a URL: https://api.server.com/interfaces/160/        termination_a device URL: https://api.server.com/devices/22/匹配成功,设备名称:device-number8-2023-08 myname        全局URL: https://api.server.com/cables/300/        termination_a URL: https://api.server.com/interfaces/260/        termination_a device URL: https://api.server.com/devices/73/

注意: 原始JSON和TXT文件在匹配时可能存在细微差异。例如,原始JSON中的 device-number1-2023-08 myname 和TXT中的 device-number1-2023-08 myname1 并不完全一致。为了演示匹配成功,本教程的示例JSON数据已做微调,确保 termination_a.device.name 字段能与TXT文件中的提取名称精确匹配。

5. 注意事项与总结

正则表达式的准确性: 正则表达式 r”(device-w+-d+-d+ w+)” 是本解决方案的关键。它精确地定义了我们希望从文本中提取的设备名称格式。如果您的文本文件中的设备名称格式有所不同,您需要相应地调整正则表达式。编码问题: 在打开文件时,明确指定 encoding=”utf-8″ 是一个好习惯,可以避免因文件编码不匹配而导致的错误。错误处理: 示例代码包含了 try-except 块来处理常见错误,如文件未找到 (FileNotFoundError)、JSON格式错误 (json.JSONDecodeError) 或JSON数据结构不符 (KeyError)。在生产环境中,完善的错误处理至关重要。性能优化: 对于非常大的文本文件,re.findall() 会一次性读取所有内容。如果内存受限,可以考虑逐行读取文本文件并进行匹配。对于大型JSON数据,将 txt_device_names 转换为 set 可以将 in 操作的平均时间复杂度从 O(N) 降低到 O(1),从而提高查找效率。

txt_device_names_set = set(txt_device_names)# 之后使用 if json_device_name in txt_device_names_set:

数据清洗: 实际应用中,文本数据可能更“脏”,包含拼写错误、额外的空格或不一致的格式。这可能需要更复杂的正则表达式、字符串处理或甚至自然语言处理(NLP)技术来确保准确匹配。

通过本教程,您应该已经掌握了如何使用Python有效地关联和提取来自不同数据源(JSON和文本文件)的信息。这种模式在日志分析、配置管理和数据集成等多种场景中都非常有用。

以上就是Python:基于名称匹配从JSON和文本文件提取关联数据的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1377097.html

赞 (0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
使用 FFmpeg 直接解码 Mu-law 编码音频缓冲区数据
上一篇 2025年12月14日 16:29:59
使用Pandas精准定位首个条件满足后的指定行并进行数据操作
下一篇 2025年12月14日 16:30:10

相关推荐

  • Linux sudoers文件配置方法

    使用visudo编辑sudoers文件可安全配置用户权限,避免语法错误。通过用户、主机、命令别名简化管理,合理分配无需密码或特定命令权限,禁止赋予shell类命令无限制权限,并将规则写入/etc/sudoers.d/目录便于维护,配置后需测试并备份以防出错。 sudoers 文件用于配置 Linux…

    2026年9月23日
    100
  • 使用 PHP 解析 JSON 文件并在网页中显示特定数据

    本文档旨在指导初学者如何使用 PHP 解析 JSON 文件,并提取其中的特定数据,最终将其展示在网页上。我们将通过一个简单的例子,演示如何读取 JSON 文件,解码 JSON 数据,并使用 PHP 的数组操作和 HTML 元素将数据呈现出来。 读取 JSON 文件并解码 首先,我们需要准备一个 JS…

    2026年9月23日
    000
  • mysql添加索引命令 mysql创建普通唯一复合索引教程

    mysql添加索引命令 mysql创建普通唯一复合索引教程mysql添加索引命令 mysql创建普通唯一复合索引教程mysql添加索引命令 mysql创建普通唯一复合索引教程mysql添加索引命令 mysql创建普通唯一复合索引教程

    在mysql中给表加索引的核心目的是提升查询效率。解决方案是通过create index或alter table语句创建不同类型的索引:1. 普通索引用于加快非唯一列的查询;2. 唯一索引确保列值唯一性并提升性能;3. 复合索引支持多列组合查询,遵循最左前缀原则;4. 复合唯一索引结合复合和唯一特性…

    2026年9月23日 • 用户投稿
    000
  • VSCode快速配置React:JSX支持、中文文档、组件调试

    首先确保安装es7 react/redux/graphql/react-native snippets扩展并配置jsconfig.json文件以启用jsx语法高亮;通过安装中文语言包汉化界面,并结合浏览器书签、翻译工具及笔记软件高效查阅react中文文档;调试react组件时需安装debugger …

    2026年9月23日
    100
  • PaintToolSAI的AI功能如何裁剪图片?教你精准实现裁剪方法

    PaintToolSAI的AI功能如何裁剪图片?教你精准实现裁剪方法PaintToolSAI的AI功能如何裁剪图片?教你精准实现裁剪方法PaintToolSAI的AI功能如何裁剪图片?教你精准实现裁剪方法PaintToolSAI的AI功能如何裁剪图片?教你精准实现裁剪方法

    PaintToolSAI没有AI裁剪功能,其裁剪依赖手动操作。用户需使用选区工具框选区域,再通过“画布→裁剪”完成,过程基础但精确,适合专注绘画而非复杂图像处理的场景。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ PaintToolSAI…

    2026年9月23日 • 用户投稿
    100
  • D盘和C盘有什么区别_D盘与C盘功能及用途对比解析

    C盘是系统核心,负责电脑启动和运行,存放操作系统及关键文件,需谨慎操作并预留至少20%空间;D盘为数据存储区,用于保存个人文件和软件,可自由管理但需定期整理与备份。 电脑里的C盘和D盘虽然都是用来存东西的,但它们的角色完全不同。简单说,C盘是系统的大本营,管着电脑能不能正常开机运行;D盘是你的私人仓…

    2026年9月23日
    000
  • X 旗下 Grok 推出即时语音搜索功能 向 Google 发起挑战?

    近日,X 平台的人工智能助手 Grok 正式上线“即时语音搜索”功能,用户现在可通过语音直接提问,触发实时网络检索,并迅速获得整合后的精准答复。这项新能力意在优化信息查询流程,推动人机互动向更自然、高效的形态发展。 根据官方说明与实际用户体验,Grok 的语音搜索实现了“说话即搜、即时回应”的流畅体…

    2026年9月23日
    100
  • Java JUnit assertThrows 与异常消息比对:避免常见陷阱

    本教程深入探讨在 Java JUnit 中使用 assertThrows 进行异常测试时常见的 assertEquals 误用问题。它详细解释了为何不能直接将期望的字符串消息与捕获到的异常对象进行比对,并提供了正确的解决方案:通过 e.getMessage() 获取异常消息进行精确断言,确保测试的准…

    2026年9月23日
    000
  • win11怎么看电脑配置信息_win11查看电脑配置信息操作教程

    通过系统设置可快速查看处理器、内存等核心配置;使用“msinfo32”获取BIOS、主板等详细信息;运行“systeminfo”命令导出完整配置清单;借助设备管理器检查硬件设备及驱动状态。 如果您想了解自己电脑的硬件和系统详情,Windows 11 提供了多种内置方法来查看配置信息,无需安装额外软件…

    2026年9月23日
    000
  • 为什么iPhoneSE2022收款语音不响?教你配置微信语音播报的方法

    最常见的原因是iPhone系统或微信设置问题,如静音、勿扰模式开启或通知权限关闭。需检查手机音量、专注模式,并确保微信通知和收款语音提醒已开启。 最常见的原因是iPhone的系统通知设置、微信应用内部设置,或简单地开启了“勿扰模式”或“专注模式”导致。这通常不是手机硬件故障,而是软件配置上的疏忽。 …

    2026年9月23日
    200
  • safari浏览器如何导入Netscape格式的书签文件_safari浏览器导入Netscape书签方法

    Safari无法直接读取Netscape格式书签时,可通过HTML文件转换、第三方工具修复或借助Chrome/Firefox中转导入。首先确认书签文件含标准结构,尝试直接导入Safari;若失败,使用Linkman Lite等工具修复格式后导入;或通过Chrome先行导入再导出标准HTML文件,最后…

    2026年9月23日
    000
  • VSCode如何通过AI优化内存使用 VSCode智能内存分析调试插件

    ai并不能直接优化vscode的内存占用,而是通过赋能智能化的内存分析调试插件,间接提升vscode的运行效率和开发体验;2. 这类插件通过采集堆快照、cpu性能数据、gc日志和扩展资源消耗等运行时信息,结合ai的模式识别与异常检测能力,精准识别内存泄漏、未清理的事件监听器、循环引用等问题;3. a…

    2026年9月23日
    200
  • PHP容器与依赖注入怎么理解_PHP中DI容器概念与Pimple等库应用

    依赖注入通过外部传入依赖解耦代码,容器如Pimple集中管理对象创建与依赖解析,提升可测试性与维护性,适用于中小型项目。 PHP中的容器和依赖注入(Dependency Injection,简称DI)是现代开发中解耦代码、提升可测试性和可维护性的核心技术。理解它们的关键在于掌握“控制反转”(Inve…

    2026年9月23日
    100
  • 如何在iPhone13设置密码?为你的手机添加安全保护的实用方法

    设置iPhone 13密码需进入“设置”→“面容ID与密码”,选择六位或自定义字母数字密码,配合面容ID实现双重安全;推荐使用复杂密码或密码管理器提升安全性,同时开启“查找我的iPhone”和数据加密功能,防止信息泄露;若忘记密码,可通过恢复模式或iCloud远程抹除并从备份恢复数据,前提是提前开启…

    2026年9月23日
    900
  • VS Code算法实战:竞赛编程与调试环境搭建

    首先安装编程语言环境及VS Code扩展,如C/C++、Code Runner和LeetCode;接着配置Code Runner支持编译运行与输入重定向;最后通过代码片段提升编码速度,形成高效竞赛开发环境。 在竞赛编程中,高效的开发环境能大幅提升编码速度与调试效率。VS Code凭借轻量、可扩展和强…

    2026年9月23日
    000
  • win8任务计划程序怎么用_Win8任务计划程序使用教程

    win8任务计划程序怎么用_Win8任务计划程序使用教程win8任务计划程序怎么用_Win8任务计划程序使用教程win8任务计划程序怎么用_Win8任务计划程序使用教程win8任务计划程序怎么用_Win8任务计划程序使用教程

    答案:可通过任务计划程序实现。在Windows 8中,使用任务计划程序可创建基本或高级任务,设置触发器(如定时或开机启动)并指定操作(如运行程序、脚本或显示消息),通过向导或高级配置完成自动化。 如果您需要在Windows 8系统中自动执行特定程序、脚本或操作,可以通过任务计划程序来实现定时或触发式…

    2026年9月23日 • 用户投稿
    100
  • 字节入局,AR眼镜掀起新“风口”?

    近日,关于老凤祥与字节跳动合作推出AI眼镜的消息在网络上引发热议。据相关媒体报道,老凤祥计划联合字节跳动旗下的火山引擎共同开发多款AI眼镜,并由豆包大模型提供技术支持,预计将在今年7月正式发布。 对此,6月12日,火山引擎方面进行了澄清。其负责人表示,并未有与老凤祥合作研发AI智能眼镜的计划。而豆包…

    2026年9月23日
    000
  • VSCode如何设置代码自动补全触发 VSCode智能提示触发条件的优化

    要解决vscode代码自动补全的触发、准确性、禁用和速度问题,需按以下步骤操作:1. 调整editor.quicksuggestions控制提示触发条件,如设置”other”: true, “comments”: false, “strin…

    2026年9月23日
    200
  • 在无Maven或Eclipse环境下手动构建Java Web应用WAR包的教程

    本教程详细介绍了如何在不依赖Maven或Eclipse等集成开发环境的情况下,为Java Web应用程序手动生成WAR(Web Application Archive)文件。文章首先阐述了WAR文件的基本结构,随后通过一个Ant构建脚本的实例,指导读者完成从源代码编译、文件组织到最终WAR包生成的全…

    2026年9月23日
    000
  • AdobePhotoshop的AI混合工具怎么用?掌握智能图像编辑的教程

    Photoshop的AI混合工具以生成式填充和神经网络滤镜为代表,通过语义理解实现智能图像融合。生成式填充可依据文本提示添加、移除或扩展内容,自动匹配光影与纹理;神经网络滤镜如和谐化则优化颜色与光照匹配。与传统基于像素计算的混合模式不同,AI工具理解图像内容,实现“生成并融合”。使用时需精准输入英文…

    2026年9月23日
    100

发表回复

登录后才能评论
关注微信