Python Web Scraping技巧:处理同名类标签并精确筛选数据

Python Web Scraping技巧:处理同名类标签并精确筛选数据

本文详细介绍了如何利用Python的requests和BeautifulSoup库进行网页数据抓取,特别是当网页中存在多个具有相同HTML类名的元素时,如何精确筛选出所需信息。文章着重演示了如何通过高级CSS选择器,例如:-soup-contains(),来排除不符合条件的数据(如“在线视频咨询”),从而实现高效且准确的数据提取。

网页数据抓取中的常见挑战

在进行网页数据抓取(web scraping)时,开发者经常会遇到一个普遍的问题:网页上的不同类型的信息可能被包裹在具有相同html类名(class name)的标签中。例如,一个医生可能有多个执业地点,包括实体医院和在线咨询服务,而这些地点信息可能都使用相同的

标签和class属性。如果我们的目标是仅获取实体医院的地点信息,而排除在线咨询,就需要一种有效的方法来区分和筛选这些数据。

工具准备

要解决上述问题,我们将使用Python中两个强大的库:

requests: 用于向目标网站发送HTTP请求,获取网页的HTML内容。BeautifulSoup: 一个解析HTML和XML文档的库,能够方便地从复杂结构中提取数据。

在开始之前,请确保已安装这些库:

pip install requests beautifulsoup4

核心问题:同名类标签与数据筛选

假设我们正在抓取医生信息,每个医生可能在多个地点提供服务。这些地点(无论是实体医院还是在线咨询)都可能使用相同的CSS类名(例如listing-locations)。我们的目标是只获取医生提供的实体医院服务地点,并忽略任何“在线视频咨询”的地点。

解决方案详解

解决此问题的关键在于利用BeautifulSoup提供的强大CSS选择器功能,特别是:-soup-contains()伪类选择器,它允许我们根据元素内包含的文本内容进行筛选。

立即学习“Python免费学习笔记(深入)”;

1. 获取网页内容

首先,我们需要使用requests库获取目标网页的HTML内容。

import requestsfrom bs4 import BeautifulSoupurl = "https://oladoc.com/pakistan/lahore/gynecologist"# 发送GET请求并获取响应response = requests.get(url)# 检查请求是否成功response.raise_for_status() # 使用BeautifulSoup解析HTML内容soup = BeautifulSoup(response.content, "html.parser")

2. 定位医生信息

通常,网页上的每个独立信息块(例如,每个医生的完整信息)都会被一个特定的HTML元素包裹。我们需要找到这些主要的容器。根据示例,每个医生的信息都包含在class=”gynecologist”的元素中。

# 遍历所有医生信息块for g in soup.select(".gynecologist"):    # 提取医生姓名    doctor_name = g.h2.get_text(strip=True)    print("姓名:", doctor_name)    # ... 接下来是提取地点信息

3. 精确筛选医院位置

这是解决问题的核心步骤。我们需要选择所有具有listing-locations类的元素,但同时排除那些文本内容包含“Online Video Consultation”的元素。BeautifulSoup的select()方法支持复杂的CSS选择器,包括:-soup-contains()。

listing-locations: 选择所有class为listing-locations的元素。:-soup-contains(‘Online Video Consultation’): 选择包含特定文本“Online Video Consultation”的元素。:not(…): 否定选择器,排除括号内匹配的元素。

结合起来,”.listing-locations:not(:-soup-contains(‘Online Video Consultation’))”将选择所有class为listing-locations,但不包含“Online Video Consultation”文本的元素。

    # 筛选医院地点:选择所有class为listing-locations,且不包含“Online Video Consultation”文本的元素    hospitals = g.select(        ".listing-locations:not(:-soup-contains('Online Video Consultation'))"    )    # 提取每个筛选出的医院名称    hospital_names = [h.span.text.strip() for h in hospitals]    print("医院:", hospital_names)    print("-" * 30) # 分隔线,使输出更清晰

4. 完整代码示例

将以上步骤整合,得到完整的Python抓取脚本:

import requestsfrom bs4 import BeautifulSoup# 目标URLurl = "https://oladoc.com/pakistan/lahore/gynecologist"try:    # 发送GET请求并获取网页内容    response = requests.get(url)    response.raise_for_status()  # 检查请求是否成功,如果状态码不是200,则抛出异常    # 使用BeautifulSoup解析HTML    soup = BeautifulSoup(response.content, "html.parser")    # 遍历页面上所有的医生信息块    for g in soup.select(".gynecologist"):        # 提取医生姓名        doctor_name = g.h2.get_text(strip=True)        print("姓名:", doctor_name)        # 筛选医院地点:        # 选择所有class为"listing-locations"的元素,        # 但排除那些内部文本包含"Online Video Consultation"的元素。        hospitals = g.select(            ".listing-locations:not(:-soup-contains('Online Video Consultation'))"        )        # 提取每个筛选出的医院名称,并去除首尾空白        hospital_names = [h.span.text.strip() for h in hospitals]        print("医院:", hospital_names)        print("-" * 40) # 打印分隔线except requests.exceptions.RequestException as e:    print(f"请求失败: {e}")except Exception as e:    print(f"发生错误: {e}")

输出示例:

姓名: Dr. Ayesha Azam Khan医院: ['National Hospital & Medical Centre  (DHA)', 'Surgimed Hospital (Gulberg)']----------------------------------------姓名: Dr. Maliha Amjad医院: ['Omar Hospital & Cardiac Centre (Johar Town) (Johar Town)', 'Shalamar Hospital (Mughalpura)']----------------------------------------姓名: Dr. Sara Rasul医院: ['Hameed Latif Hospital (New Garden Town)', 'Hameed Latif Medical Center (DHA)']----------------------------------------# ... 更多医生信息

注意事项

网页结构变化: 网页的HTML结构可能会随时更新。如果目标网站的HTML类名、标签结构或文本内容发生变化,上述CSS选择器可能需要调整。伦理与法律: 在进行网页抓取时,请务必遵守网站的robots.txt协议和使用条款。避免对网站造成过大负载,可以设置请求间隔(time.sleep())。错误处理: 在实际项目中,应加入更健壮的错误处理机制,例如处理网络连接问题、页面元素不存在的情况等。上述代码已加入基本的try-except块。进一步筛选: 如果您严格要求每个医生只获取一个地点(例如,只取第一个物理地点),可以在hospital_names列表不为空的情况下,进一步选择hospital_names[0]。代理与用户代理: 对于某些网站,可能需要设置请求头(User-Agent)或使用代理IP来避免被反爬机制阻止。

总结

通过本教程,我们学习了如何利用Python的requests和BeautifulSoup库,结合强大的CSS选择器(特别是:-soup-contains()和:not()),有效地处理网页抓取中同名类标签的挑战。这种方法不仅能够精确地筛选出所需数据,还能排除不必要或干扰性的信息,从而提高数据抓取的准确性和效率。掌握这些技巧,将使您在面对复杂网页结构时更加游刃有余。

以上就是Python Web Scraping技巧:处理同名类标签并精确筛选数据的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1372372.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
如何将PEFT LoRA适配器与基础模型合并以创建独立模型
上一篇 2025年12月14日 12:16:30
Pandas DataFrame 大数据分批处理与外部API调用优化指南
下一篇 2025年12月14日 12:16:42

相关推荐

  • 如何利用 Composer 解决 PHP 项目中的旧版库依赖问题

    在我的项目中,karelwintersky/steamboatengine 最后一次使用是在 doctorpiter 项目中,版本为 1.3.6。虽然这个库已经不再维护,但我仍然需要它来保持项目的正常运行。然而,继续使用一个已废弃的库显然不是长久之计。 首先,我决定通过 Composer 来管理这个…

    用户投稿 2026年9月2日
    000
  • 笔记本电脑开不了机怎么解决_笔记本无法开机如何解决

    首先检查电源适配器、插座和电源线是否正常,确认供电无问题;2. 卸下电池(若可拆卸)仅用适配器开机,或对内置电池机型进行硬重置(拔掉所有线缆并长按电源键15-30秒);3. 断开所有外接设备,排除外设导致的启动失败;4. 若开机有声音但屏幕不亮,尝试连接外接显示器并切换显示模式,或重新插拔、清洁内存…

    2026年9月2日
    200
  • 掌握HTML、CSS、JS、PHP、MySQL等技能,毕业生前端开发就业前景如何?

    掌握HTML、CSS、JavaScript、XAMPP、PHP和MySQL技能的毕业生,在前端开发领域的前景如何? 临近毕业,许多学生都面临着就业压力,技术水平直接影响着求职成功率。这位同学具备HTML、CSS、JavaScript、XAMPP、PHP和MySQL技能,能够独立完成前后端网站开发,但…

    2026年9月2日
    000
  • OpenVidu-Call-React中如何优雅地处理缺少摄像头或麦克风的客户端?

    使用OpenVidu-Call-React构建视频会议应用时,如何优雅地处理客户端缺少摄像头或麦克风的情况? 简单地设置publishAudio和publishVideo为false并不足以解决所有问题,因为这只会阻止发布流,而不会处理应用可能出现的错误。本文将介绍如何在OpenVidu-Call-…

    2026年9月2日
    100
  • 如何使用 Composer 解决 OpenEMR 的传真和短信需求

    可以通过一下地址学习composer:学习地址 在使用 OpenEMR 管理医疗信息时,我遇到了一个棘手的问题:系统需要支持传真和短信功能,但 Twilio 已经停止了对其传真 API 的支持。这导致原有的传真功能无法使用,虽然 Twilio 的短信功能依然可用,但传真功能的缺失使我不得不寻找替代方…

    用户投稿 2026年9月2日
    000
  • safari浏览器如何为特定网站设置缩放比例_safari浏览器特定网站缩放设置

    可通过双指缩放、添加网站到主屏幕或使用读取器视图改善Safari浏览体验:1、双指张开/捏合调整页面缩放,当前会话有效;2、将网站添加至主屏幕以独立窗口打开,获得更稳定清晰的显示效果;3、对支持读取器模式的网站点击书本图标并调整字体大小,提升阅读一致性。 如果您发现访问某些网站时字体过小或页面布局难…

    2026年9月2日
    000
  • 使用 Composer 轻松集成 Goutte 到 Laravel 项目中

    可以通过以下地址学习 composer:学习地址 在开发过程中,我需要从多个网站抓取数据并进行分析。由于 Laravel 框架本身并不提供直接的网页抓取功能,我开始寻找合适的解决方案。经过一番搜索,我发现了 Goutte,这是一个简单易用的 PHP 网页抓取工具。然而,如何将它集成到 Laravel…

    用户投稿 2026年9月2日
    100
  • 深海迷航幽灵利维坦终极猎杀手册:零伤亡征服深海巨兽

    在《深海迷航》那令人窒息的深蓝世界中,幽灵利维坦无疑是无数探险者心中最恐怖的存在!这头庞然巨物不仅体型遮天蔽日,更具备闪电般的速度、难以撼动的血量以及毁灭性的攻击力,堪称全方位的深海霸主。别慌!这份终极猎杀指南,将为你揭开征服这头深渊巨兽的致命艺术! 一、核心战术:锁定弱点,掌控节奏! 幽灵利维坦虽…

    2026年9月2日
    500
  • Flexbox布局下如何实现文字始终跟随尾行?

    巧用Flexbox实现文字尾部跟随效果 本文将深入探讨如何利用CSS Flexbox布局,实现文字始终跟随尾行的效果,并有效处理文本换行问题。 目标是在Flexbox布局下,无论文本内容多少(单行或多行),都能确保文字紧贴尾部。 文章将针对单行文本跟随和多行文本换行后的跟随效果进行详细分析。 此前,…

    2026年9月2日
    000
  • win10 svchost进程占用内存高怎么办_win10 svchost进程占用内存高解决方案

    定位高内存占用的svchost.exe进程,通过任务管理器映射到具体服务;2. 禁用Connected User Experiences and Telemetry服务以减少资源消耗;3. 将Background Intelligent Transfer Service设为手动或禁用;4. 禁用Su…

    2026年9月2日
    100
  • 苏丹的游戏免于恐惧的自由思潮获得方法 思潮免于恐惧的自由合成攻略

    在《苏丹的游戏》中,思潮常常能够左右剧情的发展方向。其中,“免于恐惧的自由”是一项铜级思潮,它揭示了一个事实:对于许多统治者而言,恐惧是维持权力的重要工具。当民众开始追求更加安定与幸福的生活时,局势便可能发生变化。 以下是关于“免于恐惧的自由”思潮的获取方式和相关机制: 一、卡牌说明 对多数君主而言…

    2026年9月2日
    300
  • 使用 Composer 解决 LDAP 认证难题:ovidentia/authldap 库的实践应用

    可以通过一下地址学习composer:学习地址 在项目开发中,我需要实现一个用户认证系统,能够支持多个 LDAP 或 AD 服务器,并且能够按照特定的顺序进行查询和同步。然而,在实际操作中,我发现直接编写代码来处理这些需求非常复杂且容易出错。特别是在需要处理不同服务器的配置和状态时,问题变得更加棘手…

    用户投稿 2026年9月2日
    000
  • Flexbox能否实现文字尾行跟随效果?如何解决文字过长导致换行后跟随效果失效的问题?

    Flexbox实现文字尾行跟随效果的深入探讨 在CSS布局中,实现文字紧跟特定元素,并在文字过长换行后依然保持跟随效果,是一个常见挑战。本文分析使用Flexbox实现这一效果的可能性,并探讨解决换行后跟随失效的问题。 Flexbox的局限性: 单纯依靠Flexbox难以完美实现“尾行跟随”。Flex…

    2026年9月2日
    100
  • 电脑黑屏无BIOS显示

    电脑黑屏无BIOS显示电脑黑屏无BIOS显示电脑黑屏无BIOS显示电脑黑屏无BIOS显示

    电脑开机黑屏且f8无效,由于硬件配置不同,故障原因多种多样,可参考以下方法逐步排查,或能有效解决问题,详细操作如下: 1、设备长时间运行可能因过热引发死机,建议定期清理风扇积尘,对散热部件进行润滑或更换。台式机用户可在机箱内加装临时风扇辅助降温,待内部温度恢复正常后,通常可顺利开机,确保系统具备良好…

    2026年9月2日 用户投稿
    000
  • Flexbox能否实现文字尾行跟随效果?

    CSS布局技巧:巧用Flexbox和inline-block实现文字尾行跟随 本文探讨如何利用CSS布局,特别是结合Flexbox和inline-block,实现文字尾行跟随效果,并解决内容过长导致折行以及如何处理折行情况。 我们将重点关注如何利用Flexbox提升布局效率,并对比传统浮动布局的不足…

    2026年9月2日
    100
  • 使用 Composer 管理和验证 p7m 文件的实用工具:valepuri/p7manager

    composer在线学习地址:学习地址 在处理数字签名文件时,我遇到了一个难题:需要验证和提取 p7m 文件中的内容。这些文件通常用于电子签名和加密文档,但在处理它们时,我发现传统方法不仅繁琐,而且容易出错。经过一番探索,我找到了一个名为 valepuri/p7manager 的 Composer …

    用户投稿 2026年9月2日
    100
  • VSCode里怎么卸载TS_VSCode移除TypeScript及相关依赖包教程

    答案:彻底卸载TypeScript需禁用VSCode内置服务、卸载相关扩展并清理项目与全局的TypeScript包。首先在设置中调整typescript.tsdk路径或禁用自动类型获取,将.ts文件关联为纯文本;其次通过扩展面板卸载所有TypeScript相关插件;最后删除项目中的typescrip…

    2026年9月2日
    000
  • 标题: 如何使用 Composer 简化百度小程序开发:houyingcai/baidu-mini-sdk 的应用

    可以通过一下地址学习composer:学习地址 文章内容 在开发百度智能小程序的过程中,我遇到了一个棘手的问题:百度官方尚未发布完整的PHP SDK,仅有的百度收银台SDK也只支持生成和验证签名,无法满足实际开发需求。面对这种情况,我尝试了多种方法,最终找到了houyingcai/baidu-min…

    用户投稿 2026年9月2日
    000
  • 系统性能监视器_Windows资源监控工具

    性能监视器是诊断windows系统性能瓶颈的核心工具,能深入分析cpu、内存、磁盘和网络的使用情况;2. 通过实时查看% processor time、available mbytes、pages/sec、avg. disk queue length等关键计数器,可快速定位资源瓶颈;3. 数据收集器…

    2026年9月2日
    100
  • Maya 2019中文版下载

    Maya 2019中文版下载Maya 2019中文版下载Maya 2019中文版下载Maya 2019中文版下载

    maya软件被广泛运用于动画制作、环境建模、动态视觉设计、虚拟现实开发以及三维角色创建等领域,能够高效支持用户完成高精度的专业设计任务。 1、 右键点击下载完成的Maya 2019安装包,选择“解压到当前文件夹”。解压完成后,双击进入该文件夹,其中包含软件安装程序及用于激活的注册工具。 2、 双击运…

    2026年9月2日 用户投稿
    100

发表回复

登录后才能评论
关注微信