Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
Python使用BeautifulSoup从嵌套HTML中提取带继承样式的文本_创想鸟

Python使用BeautifulSoup从嵌套HTML中提取带继承样式的文本

Python使用BeautifulSoup从嵌套HTML中提取带继承样式的文本

本教程将指导您如何使用Python和BeautifulSoup库,从包含嵌套标签的HTML字符串中,递归地提取所有文本片段及其计算后的CSS样式属性。文章通过一个实用的递归函数,详细讲解了如何处理样式继承,最终生成一个包含文本和对应样式的字典列表,适用于需要精细化文本样式分析的场景。

在处理复杂的html结构时,尤其是当标签存在嵌套关系且样式可以通过css继承时,准确地获取每个文本片段的最终样式是一个常见的挑战。例如,一个标签内的文本可能继承了其父级标签的样式,同时又拥有自己的特定样式。传统的beautifulsoup解析方法可能难以直接捕获这种继承关系,导致难以获取每个独立文本块的完整样式信息。

核心思路:递归解析与样式继承

解决此问题的关键在于采用递归解析方法,并显式地处理样式继承。BeautifulSoup库提供了children属性,可以方便地遍历一个HTML元素的直接子节点,这些子节点可以是纯文本(NavigableString类型)或子标签(Tag类型)。

我们的策略是:

遍历子节点:对于当前处理的HTML元素,遍历其所有直接子节点。样式传递:维护一个当前层级已继承的样式字典。当遇到一个子标签时,先将当前继承的样式作为基础,然后解析该子标签自身的style属性,更新样式字典,并将这个更新后的样式字典传递给递归调用,以便子标签内的文本或更深层的子标签能够继承这些样式。文本处理:当遇到纯文本节点时,将其与当前已计算出的继承样式一同存储。

通过这种方式,每个文本片段都能获得其所在上下文环境下的最终计算样式。

实现细节

我们将创建一个名为get_as_list的递归函数,它接收一个BeautifulSoup对象(通常是Tag类型)和一个可选的外部样式字典(extstyle),用于传递父级继承的样式。

立即学习“Python免费学习笔记(深入)”;

import bs4from bs4 import BeautifulSoup, NavigableString, Tagdef get_as_list(obj, extstyle=None):    """    递归函数,用于从HTML元素中提取文本及其继承的样式。    参数:    obj (bs4.element.Tag): 当前要处理的BeautifulSoup标签对象。    extstyle (dict, optional): 从父级元素继承的样式字典。    返回:    list: 包含字典的列表,每个字典包含'text'和'styles'。    """    alldata = []    # 初始化当前元素的样式字典,包含需要关注的样式属性    # 默认值为None,表示未指定    current_style = {        "color": None,        "font-weight": None,        "font-style": None,        "text-decoration": None    }    # 如果有外部继承样式,则先应用外部样式    if extstyle is not None:        current_style.update(extstyle) # 使用update合并,确保继承的优先级    # 解析当前元素的style属性,并更新样式字典    if 'style' in obj.attrs:        # obj.attrs['style'] 示例: 'color: #55FF55; font-weight: bold;'        style_str = obj.attrs['style']        # 简单地按分号分割,然后按冒号分割键值对        for part in style_str.split(';'):            part = part.strip()            if part:                try:                    key, value = part.split(':', 1) # 只分割第一个冒号                    key = key.strip()                    value = value.strip()                    if key in current_style: # 只更新我们关心的样式                        current_style[key] = value                except ValueError:                    # 忽略格式不正确的样式声明                    pass    # 遍历当前元素的所有子节点    for x in obj.children:        if isinstance(x, NavigableString):            # 如果是纯文本节点,将其文本和当前计算的样式添加到结果列表            text_content = str(x).strip()            if text_content: # 仅添加非空文本                alldata.append({'text': text_content, 'styles': current_style.copy()})                # 使用.copy()确保每个文本片段都有独立的样式字典副本        elif isinstance(x, Tag):            # 如果是子标签,递归调用get_as_list,并将当前样式作为extstyle传递            alldata.extend(get_as_list(x, current_style))    return alldata

示例代码

下面是一个完整的示例,展示如何使用上述get_as_list函数来解析一个包含嵌套标签的HTML字符串。

import bs4from bs4 import BeautifulSoup, NavigableString, Tag# 定义上述的 get_as_list 函数def get_as_list(obj, extstyle=None):    alldata = []    current_style = {        "color": None,        "font-weight": None,        "font-style": None,        "text-decoration": None    }    if extstyle is not None:        current_style.update(extstyle)    if 'style' in obj.attrs:        style_str = obj.attrs['style']        for part in style_str.split(';'):            part = part.strip()            if part:                try:                    key, value = part.split(':', 1)                    key = key.strip()                    value = value.strip()                    if key in current_style:                        current_style[key] = value                except ValueError:                    pass    for x in obj.children:        if isinstance(x, NavigableString):            text_content = str(x).strip()            if text_content:                alldata.append({'text': text_content, 'styles': current_style.copy()})        elif isinstance(x, Tag):            alldata.extend(get_as_list(x, current_style))    return alldata# 示例HTML字符串html_string = """NormalBold BoldAndItalicItalic"""# 使用BeautifulSoup解析HTMLsoup = BeautifulSoup(html_string, 'html.parser')final_output = []# 定义默认样式,用于顶级文本节点default_styles = {    "color": None,    "font-weight": None,    "font-style": None,    "text-decoration": None}# 遍历soup的直接内容(包括文本和标签)for element in soup.contents:    if isinstance(element, NavigableString):        # 处理顶级纯文本节点        text_content = str(element).strip()        if text_content:            final_output.append({'text': text_content, 'styles': default_styles.copy()})    elif isinstance(element, Tag):        # 处理顶级标签节点,传入默认样式作为初始继承样式        final_output.extend(get_as_list(element, default_styles))# 打印结果import jsonprint(json.dumps(final_output, indent=2, ensure_ascii=False))

输出结果:

[  {    "text": "Normal",    "styles": {      "color": null,      "font-weight": null,      "font-style": null,      "text-decoration": null    }  },  {    "text": "Bold",    "styles": {      "color": null,      "font-weight": "bold",      "font-style": null,      "text-decoration": null    }  },  {    "text": " ",    "styles": {      "color": null,      "font-weight": "bold",      "font-style": null,      "text-decoration": null    }  },  {    "text": "BoldAndItalic",    "styles": {      "color": null,      "font-weight": "bold",      "font-style": "italic",      "text-decoration": null    }  },  {    "text": "Italic",    "styles": {      "color": null,      "font-weight": null,      "font-style": "italic",      "text-decoration": null    }  }]

注意事项

样式属性解析的健壮性:示例代码中的style属性解析(split(‘:’, 1))假定CSS样式声明格式严格为key: value;。在实际生产环境中,HTML中的style属性可能更复杂,例如包含!important、多个空格、URL值等。为了更健壮地解析,建议使用正则表达式或专门的CSS解析库(如cssutils)来处理style属性。处理的标签范围:当前解决方案主要针对标签及其嵌套。如果需要处理其他标签(如、、

等)的样式,get_as_list函数需要进行扩展,以识别并解析这些标签的样式。

样式属性的扩展:示例中只关注了color、font-weight、font-style和text-decoration。如果需要提取更多CSS属性,只需在current_style字典中添加相应的键。NavigableString的copy():在将current_style添加到alldata时,务必使用current_style.copy()。这是因为current_style在递归过程中会被修改,如果不copy,所有文本片段可能会引用同一个字典对象,导致最终结果不正确。顶级文本节点:HTML字符串中可能存在不被任何标签包裹的顶级文本节点(如示例中的”Normal”)。主程序循环需要单独处理这些NavigableString,并为其分配默认样式。性能考虑:对于非常庞大且深度嵌套的HTML文档,递归深度可能成为一个限制。但对于大多数常见场景,此递归方法是高效且易于理解的。

总结

通过结合BeautifulSoup的DOM遍历能力和递归函数的样式传递机制,我们能够有效地从复杂的、包含嵌套标签的HTML字符串中,提取出每个独立文本片段及其准确的计算样式。这种方法对于需要对HTML内容进行精细化分析、转换或重新渲染的场景非常有用,例如内容管理系统、富文本编辑器或数据抓取后的清洗工作。通过灵活调整get_as_list函数中的样式解析逻辑和关注的样式属性,可以适应更广泛的需求。

以上就是Python使用BeautifulSoup从嵌套HTML中提取带继承样式的文本的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1580971.html

赞 (0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
React与原生JavaScript中动态创建元素事件绑定失效问题解析与最佳实践
上一篇 2025年12月22日 21:55:38
Spring Boot 中终止并重启后台任务的实现方法
下一篇 2025年12月22日 21:55:51

相关推荐

  • 王者荣耀大仙杯报名指南

    王者荣耀大仙杯报名指南王者荣耀大仙杯报名指南王者荣耀大仙杯报名指南王者荣耀大仙杯报名指南

    进入《王者荣耀》游戏后,点击进入微赛事平台。 在赛事列表中找到大仙杯,点击并完成报名操作。 NameGPT名称生成器 免费AI公司名称生成器,AI在线生成企业名称,注册公司名称起名大全。 0 查看详情 打开王者营地APP,搜索并关注主播张大仙的官方账号。 关注成功后,前往活动页面领取专属语音包,完成…

    2026年9月25日 • 用户投稿
    100
  • win10去除快捷方式小箭头方法

    win10去除快捷方式小箭头方法win10去除快捷方式小箭头方法win10去除快捷方式小箭头方法win10去除快捷方式小箭头方法

    1. 如何移除win10快捷方式的小箭头 首先,在桌面上创建一个新的文本文档,接着将以下代码粘贴进去: reg add “HKEY_LOCAL_MACHINESOFTWAREMicrosoftWindowsCurrentVersionExplorerShell Icons” …

    2026年9月25日 • 用户投稿
    100
  • Java ParallelStream线程池管理:定制并发与I/O优化

    Java ParallelStream线程池管理:定制并发与I/O优化Java ParallelStream线程池管理:定制并发与I/O优化Java ParallelStream线程池管理:定制并发与I/O优化Java ParallelStream线程池管理:定制并发与I/O优化

    本文深入探讨了Java ParallelStream的线程池管理,特别是如何在I/O密集型任务(如数据库查询)中定制其并发行为。我们将介绍如何通过自定义ForkJoinPool来限制ParallelStream的线程数量,并强调在处理数据库操作时,除了线程池大小,还需关注数据库连接数等关键资源,并讨…

    2026年9月25日 • 用户投稿
    100
  • sublime怎么连接sftp服务器_sublime SFTP服务器连接教程

    sublime怎么连接sftp服务器_sublime SFTP服务器连接教程sublime怎么连接sftp服务器_sublime SFTP服务器连接教程sublime怎么连接sftp服务器_sublime SFTP服务器连接教程sublime怎么连接sftp服务器_sublime SFTP服务器连接教程

    首先安装SFTP插件并配置sftp-config.json文件,设置host、user、remote_path等参数,保存后可通过右键菜单上传下载文件,支持自动同步与SSH密钥认证,注意避免密码泄露和编码问题。 使用Sublime Text连接SFTP服务器,可以通过安装SFTP插件实现文件的远程编…

    2026年9月25日 • 用户投稿
    000
  • 抖音巨量千川账户余额怎么提现?抖音巨量千川的钱怎么退

    抖音巨量千川账户余额怎么提现?抖音巨量千川的钱怎么退抖音巨量千川账户余额怎么提现?抖音巨量千川的钱怎么退抖音巨量千川账户余额怎么提现?抖音巨量千川的钱怎么退抖音巨量千川账户余额怎么提现?抖音巨量千川的钱怎么退

    在当今这个短视频盛行的时代,抖音无疑成为了许多人展示才华、分享生活的舞台。而抖音旗下的巨量千川广告平台,更是让许多商家和创作者通过广告实现了商业变现。在使用巨量千川的过程中,如何提取账户余额成为了一个让人头疼的问题。今天,就让我来为大家详细解析一下抖音巨量千川账户余额提现的全过程,让你轻松提取,安全…

    2026年9月25日 • 用户投稿
    100
  • 控制Java ParallelStream线程池大小与并发优化:策略与最佳实践

    控制Java ParallelStream线程池大小与并发优化:策略与最佳实践控制Java ParallelStream线程池大小与并发优化:策略与最佳实践控制Java ParallelStream线程池大小与并发优化:策略与最佳实践控制Java ParallelStream线程池大小与并发优化:策略与最佳实践

    本文探讨如何有效管理Java ParallelStream的线程池大小,特别是在涉及数据库查询等I/O密集型操作时。我们将介绍通过自定义ForkJoinPool来限制ParallelStream线程的方法,并强调在处理I/O任务时,结合CompletableFuture与专用执行器的重要性。同时,文…

    2026年9月25日 • 用户投稿
    100
  • Java Stream API:高效处理列表数据,按组合键去重并选择最新记录

    Java Stream API:高效处理列表数据,按组合键去重并选择最新记录Java Stream API:高效处理列表数据,按组合键去重并选择最新记录Java Stream API:高效处理列表数据,按组合键去重并选择最新记录Java Stream API:高效处理列表数据,按组合键去重并选择最新记录

    本文详细介绍了如何利用Java Stream API,特别是Collectors.toMap,对包含重复条目的对象列表进行高级过滤。教程将演示如何根据对象的多个字段(如姓名组合)确定唯一性,并在出现重复时,根据特定字段(如日期)选择最新或最符合条件的记录,从而实现数据的高效聚合与筛选。 业务场景与问…

    2026年9月25日 • 用户投稿
    200
  • 微软确认Windows 11和10打印问题,HP Smart App引发疑虑

    微软确认Windows 11和10打印问题,HP Smart App引发疑虑微软确认Windows 11和10打印问题,HP Smart App引发疑虑微软确认Windows 11和10打印问题,HP Smart App引发疑虑微软确认Windows 11和10打印问题,HP Smart App引发疑虑

    N软网报道,微软近期确认,Windows 11与10用户正经历一系列令人头疼的打印故障。问题的核心在于HP Smart App,其相关文档已在官方Windows健康仪表板中更新,详细描述了这一异常状况。据反馈,HP Smart App可能会未经授权地侵入电脑,更改打印机名称及图标设置,导致诸如点击打…

    2026年9月25日 • 用户投稿
    200
  • mysql如何读取数据库数据

    mysql如何读取数据库数据mysql如何读取数据库数据mysql如何读取数据库数据mysql如何读取数据库数据

    MySQL 读取数据库数据有两种常用方法:SELECT 语句,用于从表中提取数据,语法为:SELECT [列名] FROM [表名] [条件] [分组] [条件] [排序] [限制]。fetchall() 方法,用于将所有结果行存储在一个元组列表中。 MySQL 读取数据库数据 MySQL 提供了多…

    2026年9月25日 • 用户投稿
    100
  • 悟空浏览器如何屏蔽图片加载_悟空浏览器无图模式开启方法

    悟空浏览器如何屏蔽图片加载_悟空浏览器无图模式开启方法悟空浏览器如何屏蔽图片加载_悟空浏览器无图模式开启方法悟空浏览器如何屏蔽图片加载_悟空浏览器无图模式开启方法悟空浏览器如何屏蔽图片加载_悟空浏览器无图模式开启方法

    1、可通过设置菜单开启无图模式,进入浏览器设置后启用“节省流量”功能;2、可临时切换当前页面为无图浏览,点击底部操作栏的“省流模式”按钮实现快速切换;3、高级用户能通过自定义脚本,在用户脚本管理中添加CSS代码隐藏所有图片。 如果您在使用悟空浏览器时希望减少数据流量消耗或提升网页加载速度,可以选择关…

    2026年9月25日 • 用户投稿
    200
  • sublime如何高亮vue文件语法 _sublime Vue语法高亮方法

    sublime如何高亮vue文件语法 _sublime Vue语法高亮方法sublime如何高亮vue文件语法 _sublime Vue语法高亮方法sublime如何高亮vue文件语法 _sublime Vue语法高亮方法sublime如何高亮vue文件语法 _sublime Vue语法高亮方法

    安装Vue Syntax Highlight插件可让Sublime Text正确高亮.vue文件,支持template、script和style区块的语法着色,提升编辑体验。 要让 Sublime Text 正确高亮 Vue 文件语法,关键是将 .vue 文件识别为支持的语法格式。Vue 单文件组件…

    2026年9月25日 • 用户投稿
    300
  • 快手如何加入快接单_快手加入快接单的条件与流程

    快手如何加入快接单_快手加入快接单的条件与流程快手如何加入快接单_快手加入快接单的条件与流程快手如何加入快接单_快手加入快接单的条件与流程快手如何加入快接单_快手加入快接单的条件与流程

    要开通快手快接单功能,需先满足粉丝门槛:加入工会者需超10万粉丝,未加入者需达30万以上。达标后通过创作者中心或服务列表查看入口,完善信息并等待审核,通过后可在任务广场浏览并承接广告任务,按时完成推广内容以实现变现。 如果您希望在快手平台通过发布广告内容实现收益变现,但发现无法找到或开通快接单功能,…

    2026年9月25日 • 用户投稿
    000
  • Hadoop MapReduce实现累计电量数据的最大小时耗电量计算

    本文详细介绍了如何使用Hadoop MapReduce从累计电量读数中计算出所有住户和所有日期内的最大小时耗电量。教程将分析原始代码的问题,包括自定义Writable类的序列化错误和逻辑缺陷,并提供一个基于两阶段MapReduce任务的完整解决方案,涵盖自定义数据类型、Mapper、Reducer的…

    2026年9月25日
    000
  • sublime怎么快速切换文件语法类型_sublime修改文件语言类型的方法

    sublime怎么快速切换文件语法类型_sublime修改文件语言类型的方法sublime怎么快速切换文件语法类型_sublime修改文件语言类型的方法sublime怎么快速切换文件语法类型_sublime修改文件语言类型的方法sublime怎么快速切换文件语法类型_sublime修改文件语言类型的方法

    点击状态栏语言名可快速切换语法类型,立即应用高亮规则;2. 用Ctrl+Shift+P或Cmd+Shift+P打开命令面板,输入Set Syntax选择目标语言;3. 通过“Open all with current extension as…”设置默认语法关联,或手动编辑配置文件,使特…

    2026年9月25日 • 用户投稿
    300
  • 公众号文章如何插入图片_在公众号文章中插入图片的正确方法

    公众号文章如何插入图片_在公众号文章中插入图片的正确方法公众号文章如何插入图片_在公众号文章中插入图片的正确方法公众号文章如何插入图片_在公众号文章中插入图片的正确方法公众号文章如何插入图片_在公众号文章中插入图片的正确方法

    插入图片可提升公众号文章可读性与美观度,常用方法有四种:一、通过微信后台直接上传,操作简单;二、使用秀米等第三方工具排版后同步,功能丰富;三、用Markdown编辑并转HTML导入,适合高效写作;四、借助壹伴等工具批量上传,提升多图处理效率。 如果您在编辑公众号文章时希望增强内容的可读性和吸引力,插…

    2026年9月25日 • 用户投稿
    000
  • LINUX怎么查找包含特定内容的文件_LINUX使用grep命令查找文件内容

    LINUX怎么查找包含特定内容的文件_LINUX使用grep命令查找文件内容LINUX怎么查找包含特定内容的文件_LINUX使用grep命令查找文件内容LINUX怎么查找包含特定内容的文件_LINUX使用grep命令查找文件内容LINUX怎么查找包含特定内容的文件_LINUX使用grep命令查找文件内容

    使用grep命令可快速查找Linux系统中包含特定文本的文件。首先通过grep -r “关键词” /路径/ 实现目录递归搜索,如grep -r “error” /home/user/;添加-i参数忽略大小写,-n显示行号。结合find与grep可按文件…

    2026年9月25日 • 用户投稿
    100
  • 小红书怎么查注册日期?小红书怎么查注册日期和时间

    小红书怎么查注册日期?小红书怎么查注册日期和时间小红书怎么查注册日期?小红书怎么查注册日期和时间小红书怎么查注册日期?小红书怎么查注册日期和时间小红书怎么查注册日期?小红书怎么查注册日期和时间

    随着社交媒体的不断发展,小红书已经成为了一个热门的分享平台。在这个平台上,我们可以发现各种有趣的内容,结交志同道合的朋友,甚至还能找到生活中的灵感。你是否好奇过自己是在什么时间注册的小红书呢?今天,就让我来带你了解一下,如何在小红书上查找注册日期。 一、登录小红书账号 当然是要确保你已经成功注册了小…

    2026年9月25日 • 用户投稿
    100
  • VSCode如何搭建ClojureScript开发 VSCode配置Clojure前端项目环境

    要在vscode里搭建clojurescript前端开发环境,核心是使用calva扩展结合shadow-cljs构建工具。1. 安装vscode、jdk 11+、node.js;2. 通过npm全局安装shadow-cljs:npm install -g shadow-cljs;3. 安装vscod…

    2026年9月25日
    000
  • 抖音带货技巧全解析

    抖音带货技巧全解析抖音带货技巧全解析抖音带货技巧全解析抖音带货技巧全解析

    许多电商创业者都在探索如何通过抖音实现商品变现。具体该如何操作?流程又是怎样的呢?下面将为你逐步解析抖音带货的实用方法与核心步骤。 1、 打开抖音App,启动应用。 2、 进入个人主页,点击头像或“我”页面。 3、 在右上角找到并点击三条横线菜单按钮。 4、 选择进入“创作者服务中心”。 AI抖音 …

    2026年9月25日 • 用户投稿
    000
  • sublime怎么配置Angular开发环境_sublime搭建Angular开发环境步骤

    sublime怎么配置Angular开发环境_sublime搭建Angular开发环境步骤sublime怎么配置Angular开发环境_sublime搭建Angular开发环境步骤sublime怎么配置Angular开发环境_sublime搭建Angular开发环境步骤sublime怎么配置Angular开发环境_sublime搭建Angular开发环境步骤

    首先安装Sublime Text并更新至最新版,然后通过Package Control安装Emmet、TypeScript、AngularJS等插件以支持Angular开发,配置TypeScript语法识别,启用代码片段和智能提示,结合外部终端使用Angular CLI生成文件,最后通过保存项目和设…

    2026年9月25日 • 用户投稿
    100

发表回复

登录后才能评论
关注微信