使用Selenium高效抓取层级式网页内容:H2标题与对应P段落的结构化提取

使用Selenium高效抓取层级式网页内容:H2标题与对应P段落的结构化提取

本教程详细介绍了如何利用selenium和xpath表达式,从复杂html结构中高效提取h2标题及其后续所有p标签内容。通过构建一个字典,将h2标题作为键,其关联p标签文本作为值进行聚合,最终将数据转化为结构化的列表字典形式,实现网页内容的精准抓取与整理,适用于需要处理标题-内容对的场景。

在网页抓取任务中,经常会遇到需要提取具有层级关系的内容,例如文章的标题(通常是

)及其下方的所有段落(

)。直接按顺序抓取所有

和所有

标签,然后尝试匹配它们,可能会因为HTML结构复杂性而变得困难。本教程将展示如何利用Selenium的强大定位能力结合XPath的层级选择器,高效且准确地实现这一目标。

准备工作:设置Selenium环境

首先,确保您的Python环境中已安装Selenium库和对应的WebDriver。这里我们使用webdriver_manager来自动管理Chrome浏览器驱动。

from selenium import webdriverfrom selenium.webdriver.common.by import Byfrom selenium.webdriver.chrome.service import Servicefrom webdriver_manager.chrome import ChromeDriverManager# 初始化WebDriver# driver = webdriver.Chrome(service=Service(ChromeDriverManager().install()))# 对于新的Selenium版本,可以直接这样初始化driver = webdriver.Chrome(ChromeDriverManager().install())# 示例HTML内容,用于演示html_content = '''

Title1

text I want

text I want

Title2

text I want

text I want

text I want

Title3

text I want

text I want

'''# 加载HTML内容到浏览器driver.get("data:text/html;charset=utf-8," + html_content)

核心策略:利用字典和XPath关联H2与P标签

我们的目标是将每个

标题与其后紧跟的所有

标签内容关联起来。一种有效的方法是先识别所有的

标签,并以此为基础构建一个数据结构,然后遍历所有的

标签,通过XPath找到它们所属的

,并将内容追加到对应的数据结构中。

初始化数据结构:我们使用一个字典来存储抓取到的数据,其中

的文本内容作为键,初始值为空字符串,用于后续累加

标签的文本。

# 查找所有h2标签,并以其文本初始化字典# 注意:如果h2内部有span等其他标签,.text会获取所有可见文本data = dict((e.text, '') for e in driver.find_elements(By.CSS_SELECTOR, 'h2'))# 此时 data 示例: {'Title1': '', 'Title2': '', 'Title3': ''}

遍历P标签并关联H2:接下来,遍历页面上所有的

标签。对于每一个

标签,我们需要确定它属于哪个

标题。XPath的preceding-sibling::h2[1]表达式能够精确地找到当前元素(

)之前最近的一个

同级元素。

# 遍历所有p标签,并将其内容追加到对应的h2键下for p_element in driver.find_elements(By.CSS_SELECTOR, 'p'):    # 使用XPath找到当前p标签前面最近的h2同级元素    # preceding-sibling::h2[1] 表示获取所有h2同级元素中,位于当前元素之前且最接近的那个    try:        associated_h2_text = p_element.find_element(By.XPATH, './preceding-sibling::h2[1]').text        # 将p标签的文本内容追加到字典中对应的h2键下        data[associated_h2_text] += ' ' + p_element.text    except Exception as e:        # 处理没有前置h2的情况,或日志记录        print(f"Warning: p tag '{p_element.text}' found without a preceding h2. Error: {e}")# 此时 data 示例:# {'Title1': ' text I want text I want',#  'Title2': ' text I want text I want text I want',#  'Title3': ' text I want text I want'}

这里我们添加了try-except块,以应对某些p标签可能没有前置h2的情况,提高代码的健壮性。

结构化输出:列表字典形式

虽然上述data字典已经包含了所需信息,但在实际应用中,将数据整理成更结构化的列表字典(List of Dictionaries)形式通常更便于后续处理和存储。

无限画 无限画

千库网旗下AI绘画创作平台

无限画 467 查看详情 无限画

# 将字典转换为列表字典的格式,更便于数据处理structured_output = [{'title': title, 'content': content.strip()} for title, content in data.items()]# 打印最终结果print(structured_output)

完整示例代码:

from selenium import webdriverfrom selenium.webdriver.common.by import Byfrom selenium.webdriver.chrome.service import Servicefrom webdriver_manager.chrome import ChromeDriverManager# 1. 初始化WebDriverdriver = webdriver.Chrome(ChromeDriverManager().install())# 2. 示例HTML内容html_content = '''

Title1

text I want

text I want

Title2

text I want

text I want

text I want

Title3

text I want

text I want

Standalone paragraph without preceding h2

'''# 3. 加载HTML内容driver.get("data:text/html;charset=utf-8," + html_content)# 4. 初始化数据字典data = dict((e.text, '') for e in driver.find_elements(By.CSS_SELECTOR, 'h2'))# 5. 遍历p标签并关联H2for p_element in driver.find_elements(By.CSS_SELECTOR, 'p'): try: associated_h2_text = p_element.find_element(By.XPATH, './preceding-sibling::h2[1]').text data[associated_h2_text] += ' ' + p_element.text except Exception: # 如果p标签没有前置h2,则跳过或按需处理 print(f"Warning: p tag '{p_element.text}' found without a preceding h2. Skipping.") pass # 或者可以将其归类到'未分类'等键下# 6. 转换为结构化输出structured_output = [{'title': title, 'content': content.strip()} for title, content in data.items()]# 7. 打印结果print(structured_output)# 8. 关闭浏览器driver.quit()

预期输出:

[{'title': 'Title1', 'content': 'text I want text I want'}, {'title': 'Title2', 'content': 'text I want text I want text I want'}, {'title': 'Title3', 'content': 'text I want text I want'}]

请注意,输出中的Standalone paragraph without preceding h2由于没有前置h2,在处理时会被跳过,不会出现在最终的structured_output中。如果需要处理这类情况,可以修改except块的逻辑。

注意事项与总结

XPath的精确性: preceding-sibling::h2[1] 是本方案的关键。它确保了每个

标签只与它最近的、位于其之前的

标签关联,避免了跨标题内容的混淆。CSS选择器与XPath: 对于简单的元素定位,CSS选择器通常更简洁。但对于复杂的层级关系或条件判断,XPath提供了更强大的表达能力。错误处理: 在实际网页抓取中,HTML结构可能不总是完美的。添加try-except块来处理find_element可能找不到元素的情况,可以提高代码的健壮性。文本清理: 在将p.text添加到内容时,我们使用了content.strip()来移除开头或结尾可能多余的空格,确保内容的整洁。数据结构选择: 字典是聚合数据的良好中间结构,而列表字典则提供了更标准化的输出格式,便于后续的数据分析、存储(如JSON、CSV)或API响应。

通过上述方法,您可以高效地从具有清晰标题-内容层级关系的网页中提取数据,并将其整理成易于处理的结构化格式。

以上就是使用Selenium高效抓取层级式网页内容:H2标题与对应P段落的结构化提取的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/915844.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
上一篇 2025年11月29日 05:08:51
下一篇 2025年11月29日 05:12:54

相关推荐

  • AO3镜像站备用镜像网址_AO3镜像站快速访问官网

    AO3镜像站备用网址包括ao3mirror.com和xiaozhan.icu,当主站archiveofourown.org无法访问时可切换使用,二者均同步更新内容并支持多语言检索与离线下载功能。 AO3镜像站备用镜像网址在哪里?这是不少网友都关注的,接下来由PHP小编为大家带来AO3镜像站快速访问官…

    2025年12月6日 软件教程
    000
  • jm漫画官方正版入口 jm漫画官方网站登录链接

    JM漫画作为一个致力于为广大漫画爱好者服务的全方位的数字漫画阅读平台,凭借其海量的资源储备、卓越的阅读体验和人性化的功能设计,在众多同类平台中脱颖而出。它不仅收录了来自世界各地的热门连载与经典完结作品,更通过智能推荐算法,精准地将符合用户口味的精彩内容呈现眼前,让每一位用户都能在这里找到属于自己的精…

    2025年12月6日 软件教程
    000
  • 怎么下载安装快手极速版_快手极速版下载安装详细教程

    1、优先通过华为应用市场搜索“快手极速版”,确认开发者为北京快手科技有限公司后安装;2、若应用商店无结果,可访问快手极速版官网下载APK文件,需手动开启浏览器的未知来源安装权限;3、也可选择豌豆荚、应用宝等可信第三方平台下载官方版本,核对安全标识后完成安装。 如果您尝试在手机上安装快手极速版,但无法…

    2025年12月6日 软件教程
    000
  • 哔哩哔哩的视频卡在加载中怎么办_哔哩哔哩视频加载卡顿解决方法

    视频加载停滞可先切换网络或重启路由器,再清除B站缓存并重装应用,接着调低播放清晰度并关闭自动选分辨率,随后更改播放策略为AVC编码,最后关闭硬件加速功能以恢复播放。 如果您尝试播放哔哩哔哩的视频,但进度条停滞在加载状态,无法继续播放,这通常是由于网络、应用缓存或播放设置等因素导致。以下是解决此问题的…

    2025年12月6日 软件教程
    000
  • REDMI K90系列正式发布,售价2599元起!

    10月23日,redmi k90系列正式亮相,推出redmi k90与redmi k90 pro max两款新机。其中,redmi k90搭载骁龙8至尊版处理器、7100mah大电池及100w有线快充等多项旗舰配置,起售价为2599元,官方称其为k系列迄今为止最完整的标准版本。 图源:REDMI红米…

    2025年12月6日 行业动态
    000
  • Linux中如何安装Nginx服务_Linux安装Nginx服务的完整指南

    首先更新系统软件包,然后通过对应包管理器安装Nginx,启动并启用服务,开放防火墙端口,最后验证欢迎页显示以确认安装成功。 在Linux系统中安装Nginx服务是搭建Web服务器的第一步。Nginx以高性能、低资源消耗和良好的并发处理能力著称,广泛用于静态内容服务、反向代理和负载均衡。以下是在主流L…

    2025年12月6日 运维
    000
  • TikTok视频无法下载怎么办 TikTok视频下载异常修复方法

    先检查链接格式、网络设置及工具版本。复制以https://www.tiktok.com/@或vm.tiktok.com开头的链接,删除?后参数,尝试短链接;确保网络畅通,可切换地区节点或关闭防火墙;更新工具至最新版,优先选用yt-dlp等持续维护的工具。 遇到TikTok视频下载不了的情况,别急着换…

    2025年12月6日 软件教程
    000
  • Linux命令行中wc命令的实用技巧

    wc命令可统计文件的行数、单词数、字符数和字节数,常用-l统计行数,如wc -l /etc/passwd查看用户数量;结合grep可分析日志,如grep “error” logfile.txt | wc -l统计错误行数;-w统计单词数,-m统计字符数(含空格换行),-c统计…

    2025年12月6日 运维
    000
  • jm漫画网页网址 jm漫画网页版进入 jm漫画网站网页版

    在广阔的数字漫画世界中,无数爱好者渴望寻得一个能够汇集海量作品、提供流畅阅读体验的综合性平台。这样的平台不仅是追更新、补旧番的乐园,更是连接创作者与读者的桥梁,让每一个精彩的故事都能被发现和分享。它以其丰富的资源和人性化的设计,成为了漫画迷们探索奇妙二次元世界的理想起点,满足了从热门大作到小众佳作的…

    2025年12月6日 软件教程
    000
  • 「世纪传奇刀片新篇」飞利浦影音双11声宴开启

    百年声学基因碰撞前沿科技,一场有关声音美学与设计美学的影音狂欢已悄然引爆2025“双十一”! 当绝大多数影音数码品牌还在价格战中挣扎时,飞利浦影音已然开启了一场跨越百年的“声”活革命。作为拥有深厚技术底蕴的音频巨头,飞利浦影音及配件此次“双十一”精准聚焦“传承经典”与“设计美学”两大核心,为热爱生活…

    2025年12月6日 行业动态
    000
  • Vue.js应用中配置环境变量:灵活管理后端通信地址

    在%ignore_a_1%应用中,灵活配置后端api地址等参数是开发与部署的关键。本文将详细介绍两种主要的环境变量配置方法:推荐使用的`.env`文件,以及通过`cross-env`库在命令行中设置环境变量。通过这些方法,开发者可以轻松实现开发、测试、生产等不同环境下配置的动态切换,提高应用的可维护…

    2025年12月6日 web前端
    000
  • JavaScript动态生成日历式水平日期布局的优化实践

    本教程将指导如何使用javascript高效、正确地动态生成html表格中的日历式水平日期布局。重点解决直接操作`innerhtml`时遇到的标签闭合问题,通过数组构建html字符串来避免浏览器解析错误,并利用事件委托机制优化动态生成元素的事件处理,确保生成结构清晰、功能完善的日期展示。 在前端开发…

    2025年12月6日 web前端
    000
  • JavaScript响应式编程与Observable

    Observable是响应式编程中处理异步数据流的核心概念,它允许随时间推移发出多个值,支持订阅、操作符链式调用及统一错误处理,广泛应用于事件监听、状态管理和复杂异步逻辑,提升代码可维护性与可读性。 响应式编程是一种面向数据流和变化传播的编程范式。在前端开发中,尤其面对复杂的用户交互和异步操作时,J…

    2025年12月6日 web前端
    000
  • 微信如何开启翻译功能_微信翻译功能的语言切换

    首先开启微信翻译功能,长按外文消息选择翻译并设置“始终翻译此人消息”;接着在“我-设置-通用-多语言”中切换目标语言以优化翻译方向;若效果不佳,可复制内容至第三方工具如Google翻译进行高精度处理。 如果您在使用微信与不同语言的联系人沟通时,发现聊天内容无法理解,则可能是未开启微信内置的翻译功能或…

    2025年12月6日 软件教程
    000
  • 如何在mysql中分析索引未命中问题

    答案是通过EXPLAIN分析执行计划,检查索引使用情况,优化WHERE条件写法,避免索引失效,结合慢查询日志定位问题SQL,并根据查询模式合理设计索引。 当 MySQL 查询性能下降,很可能是索引未命中导致的。要分析这类问题,核心是理解查询执行计划、检查索引设计是否合理,并结合实际数据访问模式进行优…

    2025年12月6日 数据库
    000
  • VSCode入门:基础配置与插件推荐

    刚用VSCode,别急着装一堆东西。先把基础设好,再按需求加插件,效率高还不卡。核心就三步:界面顺手、主题舒服、功能够用。 设置中文和常用界面 打开软件,左边活动栏有五个图标,点最下面那个“扩展”。搜索“Chinese”,装上官方出的“Chinese (Simplified) Language Pa…

    2025年12月6日 开发工具
    000
  • VSCode性能分析与瓶颈诊断技术

    首先通过资源监控定位异常进程,再利用开发者工具分析性能瓶颈,结合禁用扩展、优化语言服务器配置及项目设置,可有效解决VSCode卡顿问题。 VSCode作为主流的代码编辑器,虽然轻量高效,但在处理大型项目或配置复杂扩展时可能出现卡顿、响应延迟等问题。要解决这些性能问题,需要系统性地进行性能分析与瓶颈诊…

    2025年12月6日 开发工具
    000
  • php查询代码怎么写_php数据库查询语句编写技巧与实例

    在PHP中进行数据库查询,最常用的方式是使用MySQLi或PDO扩展连接MySQL数据库。下面介绍基本的查询代码写法、编写技巧以及实用示例,帮助你高效安全地操作数据库。 1. 使用MySQLi进行查询(面向对象方式) 这是较为推荐的方式,适合大多数中小型项目。 // 创建连接$host = ‘loc…

    2025年12月6日 后端开发
    000
  • VSCode的悬浮提示信息可以自定义吗?

    可以通过JSDoc、docstring和扩展插件自定义VSCode悬浮提示内容,如1. 添加JSDoc或Python docstring增强信息;2. 调整hover延迟与粘性等显示行为;3. 使用支持自定义提示的扩展或开发hover provider实现深度定制,但无法直接修改HTML结构或手动编…

    2025年12月6日 开发工具
    000
  • php数据库如何实现数据缓存 php数据库减少查询压力的方案

    答案:PHP结合Redis等内存缓存系统可显著提升Web应用性能。通过将用户信息、热门数据等写入内存缓存并设置TTL,先查缓存未命中再查数据库,减少数据库压力;配合OPcache提升脚本执行效率,文件缓存适用于小型项目,数据库缓冲池优化和读写分离进一步提升性能,推荐Redis为主并防范缓存穿透与雪崩…

    2025年12月6日 后端开发
    000

发表回复

登录后才能评论
关注微信