Python HTML内容到自定义JSON结构的转换教程

Python HTML内容到自定义JSON结构的转换教程

本教程旨在解决将html内容转换为特定json格式的需求,特别是当直接使用`html_to_json`等库无法满足自定义键值对和层级结构时。文章将深入探讨如何利用python的`beautifulsoup`库对html进行语义解析,提取所需文本信息,并将其重构为用户定义的json格式,包括嵌套的子元素,以实现更灵活和精确的数据转换。

在数据处理和Web抓取场景中,将HTML文档转换为结构化的JSON数据是一种常见需求。然而,许多现成的HTML到JSON转换库,如html_to_json,通常会生成一个反映HTML DOM(文档对象模型)结构的JSON表示,其中包含了大量的HTML标签信息,这往往与用户期望的、仅包含业务逻辑键值对的扁平或自定义层级结构不符。当需要从HTML中提取特定的文本内容,并将其组织成具有自定义key、value和child数组的JSON格式时,直接的DOM转换工具显得力不从心。此时,我们需要采用更精细的HTML解析方法。

理解问题:为何直接转换不适用

像html_to_json这样的库,其设计目的是将HTML的标签、属性和文本内容完整地映射到JSON结构中。例如,一个标签内的文本会被表示为{“span”: [{“_value”: “文本内容”}]}。这种方式保留了原始HTML的完整性,但当我们的目标是:

去除所有HTML标签,只保留纯文本内容。根据HTML的语义结构(而非DOM结构)构建JSON,例如将标题、段落等作为独立的键值对。创建自定义的层级关系,如child数组来表示嵌套内容。

此时,我们需要一个能够灵活导航HTML树、提取特定元素内容并手动构建JSON对象的工具。Python的BeautifulSoup库正是为此类任务而生。

解决方案:使用BeautifulSoup进行语义解析

BeautifulSoup是一个用于从HTML和XML文件中提取数据的Python库。它能够将复杂的HTML文档转换成一个Python对象,使得开发者可以方便地通过标签名、属性、CSS选择器等方式搜索、导航和修改解析树。

立即学习“Python免费学习笔记(深入)”;

以下是使用BeautifulSoup实现HTML到自定义JSON转换的基本步骤:

加载HTML内容:将HTML文件读取为字符串。创建BeautifulSoup对象:将HTML字符串解析为可操作的树结构。定位目标元素:使用find(), find_all(), select()等方法查找需要提取数据的HTML元素。提取数据:从定位到的元素中提取文本内容(.get_text())或属性值([‘attribute_name’])。构建自定义JSON结构:根据提取的数据和预期的JSON格式,手动创建Python字典和列表,最终转换为JSON字符串。

示例代码:构建自定义JSON结构

为了演示如何将HTML内容转换为如{“key”: “1”, “value”: “内容”, “child”: []}这样的自定义JSON格式,我们将假设有一个结构化的HTML片段,其中包含带有特定标识(如data-key属性)的章节和子章节。

假设的HTML文件 (sample.html) 内容:

    文档标题    

第一章

这是第一章的主要内容。

星绘
星绘

豆包旗下 AI 写真、P 图、换装和视频生成

星绘 429
查看详情 星绘

可能还有其他描述。

第二章

这是第二章的主体内容。

第二章第一节

本节详细阐述了子内容A。

第二章第二节

本节详细阐述了子内容B。

第二章第二节第一小节

这是更深层次的细节。

Python代码实现:

import jsonfrom bs4 import BeautifulSoupdef extract_structured_data_from_html(html_content):    """    从HTML内容中提取结构化数据,并转换为自定义JSON格式。    此函数递归处理嵌套的章节。    """    soup = BeautifulSoup(html_content, 'html.parser')    # 定义一个递归函数来处理嵌套结构    def parse_section(element):        data_list = []        # 查找当前元素下的所有直接子章节        # 这里我们假设'section', 'subsection', 'sub-subsection'是层级结构        # 并且它们都包含一个'data-key'属性        # 遍历当前层级的直接子元素,寻找符合条件的“章节”        # 注意:这里需要根据实际HTML结构调整选择器        # 例如,如果所有层级都用同一个class(如'item'),则需要更复杂的逻辑判断嵌套        # 简化处理:查找当前element下的所有'div',并根据class或data-key判断层级        # 为了演示,我们假设直接子div是下一级        # 获取当前元素的所有文本内容(不包含子元素文本,需要更精确的控制)        # 或者,我们可以从标题标签中获取value        # 示例中,我们假设每个section/subsection/sub-subsection都有一个H标签作为标题        # 查找当前元素下的直接子section/subsection/sub-subsection        # 使用CSS选择器来获取直接子元素        # 获取当前元素的直接文本内容(排除子标签)        # current_value = ' '.join(element.find_all(text=True, recursive=False)).strip()        # 针对示例HTML结构进行解析        # 优先从H标签中提取标题作为value        title_tag = element.find(['h1', 'h2', 'h3'], recursive=False)        value_text = title_tag.get_text(strip=True) if title_tag else ""        # 获取当前层级的纯文本内容(不包含标题和子章节的文本)        # 找到所有直接的

标签,并连接它们的文本 paragraph_texts = [p.get_text(strip=True) for p in element.find_all('p', recursive=False)] if paragraph_texts: value_text += "n" + "n".join(paragraph_texts) current_key = element.get('data-key') children = [] # 查找当前元素下的直接子 div,这些 div 可能是下一级章节 # 这里的逻辑需要根据HTML的实际嵌套方式来确定 # 例如,如果子章节总是紧跟在父章节的直接子div中 # 查找所有直接子 div,并判断它们是否是章节 direct_child_sections = element.find_all('div', recursive=False) for child_section in direct_child_sections: if child_section.has_attr('data-key'): # 确保是带有data-key的章节元素 children.extend(parse_section(child_section)) # 递归处理子章节 if current_key: data_list.append({ "key": current_key, "value": value_text.strip(), "child": children }) return data_list # 从body开始解析,查找所有顶层section top_level_sections = soup.body.find_all('div', class_='section', recursive=False) final_json_data = [] for section in top_level_sections: final_json_data.extend(parse_section(section)) return final_json_data# 读取HTML文件html_file_path = "sample.html"with open(html_file_path, "r", encoding="utf-8") as f: html_data = f.read()# 转换数据output_structured_json = extract_structured_data_from_html(html_data)# 将结果保存到JSON文件output_json_file_path = "structured_output.json"with open(output_json_file_path, "w", encoding="utf-8") as outfile: json.dump(output_structured_json, outfile, indent=4, ensure_ascii=False)print(f"结构化JSON已保存到:{output_json_file_path}")print(json.dumps(output_structured_json, indent=4, ensure_ascii=False))

预期的输出 (structured_output.json):

[    {        "key": "1",        "value": "第一章n这是第一章的主要内容。n可能还有其他描述。",        "child": []    },    {        "key": "2",        "value": "第二章n这是第二章的主体内容。",        "child": [            {                "key": "2.1",                "value": "第二章第一节n本节详细阐述了子内容A。",                "child": []            },            {                "key": "2.2",                "value": "第二章第二节n本节详细阐述了子内容B。",                "child": [                    {                        "key": "2.2.1",                        "value": "第二章第二节第一小节n这是更深层次的细节。",                        "child": []                    }                ]            }        ]    }]

注意事项与最佳实践

了解HTML结构:在编写解析代码之前,务必仔细检查目标HTML文档的结构。了解标签的嵌套关系、类名、ID或自定义属性是成功提取数据的关键。选择合适的解析器:BeautifulSoup支持多种解析器,如html.parser(Python内置)、lxml(速度快,功能强大)和html5lib(容错性好)。根据HTML的质量和性能要求选择。精确选择器:使用find(), find_all(), select()方法时,尽量使用最精确的选择器来定位元素,避免意外捕获不相关的元素。CSS选择器(select())通常非常强大和灵活。处理文本内容:.get_text(strip=True)方法可以获取元素的纯文本内容并去除首尾空白。如果需要保留内部的换行符或空格,可以调整参数。对于复杂的文本提取,可能需要遍历元素的contents或children。错误处理:在实际应用中,HTML结构可能不总是完美的。在尝试访问元素的属性或文本之前,最好检查元素是否存在(例如,if element:)。性能考虑:对于非常大的HTML文件,BeautifulSoup可能会占用较多内存。如果性能是关键因素,可以考虑使用lxml直接进行XPath或CSS选择器查询,或者分块处理HTML。递归解析:对于嵌套的HTML结构,如示例中的章节和子章节,递归函数是处理层级关系的最佳方式。

总结

将HTML内容转换为自定义的JSON格式,不仅仅是简单的结构转换,更是一种语义提取和数据重构的过程。虽然html_to_json等库能提供DOM层面的JSON表示,但当需求涉及到去除标签、提取特定文本并构建自定义层级结构时,BeautifulSoup结合Python的灵活性,提供了强大而精确的解决方案。通过理解HTML结构、运用合适的选择器和递归处理方法,开发者可以高效地将非结构化的HTML数据转化为满足特定业务需求的结构化JSON数据。

以上就是Python HTML内容到自定义JSON结构的转换教程的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1598112.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
使用JavaScript实现点击链接后改变元素背景色的教程
上一篇 2025年12月23日 12:38:53
JavaScript与HTML交互:获取文本框输入并调用函数
下一篇 2025年12月23日 12:39:06

相关推荐

  • 夸克AI怎么进行投资分析_夸克AI金融市场数据分析方法

    使用夸克AI可简化金融分析,先通过输入股票代码获取基本面财务摘要与AI解读;2. 切换至技术分析标签查看AI标注的支撑阻力位及MACD、RSI等指标状态;3. 下滑至资讯区阅读AI聚合的新闻摘要与情绪指数,并启用事件提醒,实现多维度智能辅助决策。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索,…

    2026年8月31日
    000
  • 谷歌电脑进化史下载指南_谷歌电脑发展历史的资源获取与下载方法

    要获取谷歌电脑发展历史的相关资源和下载方法,核心是通过官方档案、学术论文、科技媒体、数字博物馆和社区论坛等多渠道综合挖掘。首先,谷歌的google arts & culture、官方博客(如google ai blog、google developers blog)提供了产品演进的第一手资料…

    2026年8月31日
    000
  • Vue+ElementUI表格异步加载导致字段缺失:如何解决数据渲染与加载时机不匹配问题?

    Vue+ElementUI表格异步加载字段缺失问题详解及解决方案 在Vue和ElementUI项目中,异步加载数据经常导致表格部分字段缺失,本文将深入分析此问题,并提供有效的解决方案。 问题描述: 使用el-table组件显示数据时,从后端获取部分数据(例如申请人ID),然后通过异步请求获取剩余字段…

    2026年8月31日
    000
  • win8管理员权限怎么获取_win8提升用户账户为管理员权限教程

    1、通过netplwiz将账户组成员更改为管理员;2、使用本地用户和组管理器添加至Administrators组;3、用命令提示符执行net localgroup命令提升权限;4、创建新的管理员账户替代原账户,适用于权限无法修改的情况。 如果您需要对Windows 8系统进行深层设置或安装特定软件,…

    2026年8月31日
    000
  • 如何解决Laravel项目中的媒体管理问题?使用filament/spatie-laravel-media-library-plugin可以!

    可以通过一下地址学习composer:学习地址 在开发一个laravel项目时,媒体文件的管理一直是一个挑战。用户上传的图片、视频和文档需要高效的存储、分类和展示,同时还要提供一个友好的用户界面来管理这些文件。最初,我尝试使用laravel的内置文件系统,但发现它在处理大量文件和提供用户友好的界面方…

    用户投稿 2026年8月31日
    000
  • 快兔网盘下载文件失败怎么办_快兔网盘下载失败问题排查

    下载失败通常由网络、软件或设备设置引起。先检查Wi-Fi或切换数据网络,重启路由器;更新快兔网盘至v1.1.38版,清除缓存或重装应用;确保手机有足够存储空间并授予App存储权限;核对下载路径设置。若问题仍存,可能是服务器问题,建议稍后重试或联系客服。 快兔网盘下载文件失败,通常和网络、软件状态或设…

    2026年8月31日
    000
  • stimulsoft oracle,Stimulsoft Reports

    stimulsoft oracle,Stimulsoft Reportsstimulsoft oracle,Stimulsoft Reportsstimulsoft oracle,Stimulsoft Reportsstimulsoft oracle,Stimulsoft Reports

    大家好,很高兴再次与大家见面,我是你们的老朋友全栈君。 Stimulsoft Reports 一站式报表解决方案,支持 .NET、JavaScript、Java 和 PHP。 软件商:Stimulsoft 当前版本:2020.3 发布日期:2020/6/12 推荐: 以下是“Reports.Web”…

    2026年8月31日 用户投稿
    1400
  • 欧美建晶圆厂耗时、烧钱程度是中国台湾两倍

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 全球半导体产业蓬勃发展,台湾地区在晶圆厂建设速度和效率方面占据显著优势。数据表明,台湾地区晶圆厂建设周期约为19个月,而美国则需耗时38个月。这主要源于美国冗长的许可审批流程以及非全天候的施工模…

    2026年8月31日
    000
  • 如何解决PHP项目中的日志管理问题?使用GoogleCloudLogging可以!

    可以通过以下地址学习 composer:学习地址 在开发一个大型 PHP 项目时,我遇到了一个棘手的问题:如何高效地管理和分析来自不同服务的日志数据。由于项目部署在 Google Cloud Platform 上,我希望找到一个能够与之无缝集成的解决方案。经过一番探索,我选择了 Google Clo…

    用户投稿 2026年8月31日
    000
  • 解决”找不到 msvcp140_codecvt_ids.dll”错误的完整方法

    解决”找不到 msvcp140_codecvt_ids.dll”错误的完整方法解决”找不到 msvcp140_codecvt_ids.dll”错误的完整方法解决”找不到 msvcp140_codecvt_ids.dll”错误的完整方法解决”找不到 msvcp140_codecvt_ids.dll”错误的完整方法

    在windows操作系统中,运行部分应用程序或游戏时,许多用户可能会看到“程序无法启动,因为计算机缺少 msvcp140_codecvt_ids.dll”这类提示。该问题通常源于系统未安装或丢失关键的运行库文件。本文将为您全面介绍几种有效的解决方案,帮助您迅速修复该错误,恢复正常运行。 一、借助 D…

    2026年8月31日 用户投稿
    200
  • Java如何高效模拟JavaScript字典结构?

    java高效模拟javascript字典结构 本文探讨如何在Java中高效模拟JavaScript或Python字典的结构,并提供一种基于枚举和Lombok的简洁解决方案。JavaScript字典的典型用法如下: policy = { “expiration”:”2021-02-02t12:00:0…

    2026年8月31日
    000
  • 一款超级经典复古的 Windows 9x 主题风格 Avalonia UI 控件库,满满的回忆杀!

    一款超级经典复古的 Windows 9x 主题风格 Avalonia UI 控件库,满满的回忆杀!一款超级经典复古的 Windows 9x 主题风格 Avalonia UI 控件库,满满的回忆杀!一款超级经典复古的 Windows 9x 主题风格 Avalonia UI 控件库,满满的回忆杀!一款超级经典复古的 Windows 9x 主题风格 Avalonia UI 控件库,满满的回忆杀!

    前言 今天为大家带来一款极具情怀的复古风 windows 9x 主题 avalonia ui 控件库——classic.avalonia,带你一秒穿越回经典的桌面时代,满满的回忆扑面而来。 项目介绍 Classic.Avalonia 是一个基于 .NET 的开源(MIT 许可证)UI 控件库,专为还…

    2026年8月31日 用户投稿
    000
  • 如何解决PHP单元测试中内置函数的模拟问题?使用Composer可以!

    可以通过以下地址学习Composer:学习地址 在进行php单元测试时,模拟内置函数(如time())是一个常见但棘手的问题。直接模拟这些函数不仅复杂,而且可能会受到各种限制和约束。最近在进行一个项目的单元测试时,我遇到了这样的难题:如何在不影响其他测试的前提下,准确地模拟time()函数的返回值?…

    用户投稿 2026年8月31日
    000
  • CSS如何实现图片中所示的底部弧形边框?

    CSS打造底部弧形边框:巧妙运用border-radius 在网页设计中,创建特定形状的边框,例如图片所示的底部弧形边框,常常需要一些技巧。单纯的border-radius属性难以直接实现这种效果。本文将详细讲解如何通过CSS技巧,精确绘制出这种底部弧形边框。 许多开发者尝试使用border-rad…

    2026年8月31日
    100
  • 电脑丢失dll文件怎么办 教你解决DLL丢失问题

    电脑丢失dll文件怎么办 教你解决DLL丢失问题电脑丢失dll文件怎么办 教你解决DLL丢失问题电脑丢失dll文件怎么办 教你解决DLL丢失问题电脑丢失dll文件怎么办 教你解决DLL丢失问题

    在使用电脑时,不少用户可能遇到这样的问题:运行某个程序时,系统提示“找不到指定的dll文件”或“xxx.dll缺失”。dll文件作为windows系统和各类应用程序正常运行的重要组成部分,一旦丢失或损坏,就可能导致软件无法启动或运行异常。本文将为您详细介绍当电脑提示dll文件丢失时的几种有效解决方法…

    2026年8月31日 用户投稿
    000
  • 高德导航如何下载安装_高德导航下载安装的详细步骤

    首先需下载安装高德地图才能使用导航功能。通过App Store搜索“高德地图”,确认开发者后点击获取安装;或通过豌豆荚等平台下载官方APK,开启未知来源权限后安装;还可扫描官网二维码快速下载安装。 如果您尝试在手机上使用高德地图导航,但尚未安装该应用,则无法正常使用路线规划与语音导航功能。以下是完成…

    2026年8月31日
    000
  • MySQL安全加密存储数据实践_MySQL敏感字段加密设计

    MySQL安全加密存储数据实践_MySQL敏感字段加密设计MySQL安全加密存储数据实践_MySQL敏感字段加密设计MySQL安全加密存储数据实践_MySQL敏感字段加密设计MySQL安全加密存储数据实践_MySQL敏感字段加密设计

    应用层加密是mysql敏感字段安全存储的核心策略。即数据在写入数据库前由应用加密,读取后由应用解密,确保即使数据库被入侵,攻击者也无法获取明文数据。1. 加密算法首选aes-256 gcm模式,提供强加密和认证功能;2. 初始化向量(iv)必须唯一且随机,与密文一同存储;3. 密钥管理应避免硬编码,…

    2026年8月31日 用户投稿
    100
  • deepseek电脑版怎么下载 DeepSeek电脑安装教程

    deepseek电脑版怎么下载 DeepSeek电脑安装教程deepseek电脑版怎么下载 DeepSeek电脑安装教程deepseek电脑版怎么下载 DeepSeek电脑安装教程deepseek电脑版怎么下载 DeepSeek电脑安装教程

    如何在电脑上安装和使用DeepSeek 截至目前,DeepSeek尚未发布独立的桌面客户端,官方仅提供网页版服务。用户只需访问其官方网站,点击“开始对话”按钮,即可直接使用。 虽然网页版操作便捷,但其运行效果受网络状况和服务器负载影响较大。在网络稳定、服务器空闲时,响应速度快、交互流畅;但一旦遇到高…

    2026年8月31日 用户投稿
    000
  • 笔记本电脑中病毒了一直下软件怎么办

    笔记本电脑中病毒了一直下软件怎么办笔记本电脑中病毒了一直下软件怎么办笔记本电脑中病毒了一直下软件怎么办笔记本电脑中病毒了一直下软件怎么办

    在日常使用笔记本电脑时,如果误下载了来源不明的病毒文件,可能会导致电脑感染病毒,进而出现频繁自动下载软件的问题。那么,当电脑中了病毒并且不停地下载软件时,该如何处理呢?接下来就为大家详细介绍具体的解决办法。 工具/原料: 系统版本:Windows 7系统 设备型号:笔记本电脑 软件版本:小白一键重装…

    2026年8月31日 用户投稿
    000
  • 红果漫剧夜间模式在哪里开启_红果漫剧夜间模式设置方法

    开启红果漫剧夜间模式可减少夜间阅读对眼睛的刺激,具体方法有三种:一、在阅读界面轻触屏幕调出菜单,点击“夜间模式”按钮即可切换;二、进入“我的”-“设置”-“阅读设置”,开启“夜间模式”并可设置定时启用;三、部分安卓设备可通过下拉通知栏开启系统深色模式,并确保App允许“跟随系统主题”以实现自动同步。…

    2026年8月31日
    000

发表回复

登录后才能评论
关注微信