Web scraping中同名标签的处理:多地点信息提取与过滤

Web scraping中同名标签的处理:多地点信息提取与过滤

在Web scraping过程中,我们经常会遇到这样的挑战:目标数据所在的HTML元素共享相同的类名,导致直接提取会获取到所有相关信息,而我们可能只希望获取其中的一部分,或者对数据进行特定的过滤。例如,在抓取医生信息时,一位医生可能在多个地点提供服务,这些服务地点的HTML标签可能都拥有相同的类名。本文将详细阐述如何使用Python的requests和BeautifulSoup库来解决这一问题,实现精准的数据提取与过滤。

1. Web scraping中同名标签的挑战

假设我们需要从一个医生列表中提取每位医生的姓名及其服务地点。网站的html结构可能如下:

Dr. Ayesha Azam Khan

National Hospital & Medical Centre (DHA)
Surgimed Hospital (Gulberg)
Online Video Consultation

在这个例子中,National Hospital、Surgimed Hospital和Online Video Consultation都使用了相同的listing-locations类。如果我们的目标是仅获取物理服务地点,并排除在线咨询,那么简单的通过select(“.listing-locations”)会把所有三项都抓取出来,这不符合我们的需求。

2. 核心工具:Requests与BeautifulSoup

为了解决上述问题,我们将使用以下Python库:

requests: 用于向网页发送HTTP请求,获取网页的HTML内容。BeautifulSoup: 一个强大的Python库,用于从HTML或XML文件中提取数据。它能够解析文档,并提供多种查找和导航节点的方式。

3. 解决方案:精准定位与条件过滤

解决同名标签问题的关键在于结合上下文信息,并利用BeautifulSoup强大的CSS选择器功能进行条件过滤。

3.1 遍历父节点

首先,我们需要识别每个独立的数据单元(例如,每个医生信息块)。通常,这些单元会有一个共同的父级类名。在本例中,每个医生的信息都包含在class=”gynecologist”的div标签中。我们可以先遍历这些父节点。

import requestsfrom bs4 import BeautifulSoupurl = "https://oladoc.com/pakistan/lahore/gynecologist"response = requests.get(url)soup = BeautifulSoup(response.content, "html.parser")# 遍历每个医生信息块for doctor_block in soup.select(".gynecologist"):    # 在这里处理每个医生的数据    pass

3.2 提取医生姓名

在每个医生信息块内部,我们可以很容易地提取出医生的姓名,通常它会有一个独特的标签或类名。

    # 提取医生姓名    doctor_name = doctor_block.h2.get_text(strip=True)    print("Name:", doctor_name)

3.3 使用CSS选择器 :-soup-contains() 进行排除

BeautifulSoup支持多种CSS选择器,其中一个非常有用的伪类是:-soup-contains()。它允许我们选择包含特定文本内容的元素。结合:not()伪类,我们可以排除掉包含特定文本的元素。

在本例中,我们要排除包含“Online Video Consultation”的地点信息,因此可以使用选择器:.listing-locations:not(:-soup-contains(‘Online Video Consultation’))

这个选择器的含义是:选择所有类名为listing-locations的元素,但排除掉那些内部包含文本“Online Video Consultation”的元素。

3.4 完整示例代码

下面是结合上述步骤的完整代码示例:

import requestsfrom bs4 import BeautifulSoup# 目标URLurl = "https://oladoc.com/pakistan/lahore/gynecologist"# 发送HTTP请求并获取网页内容response = requests.get(url)soup = BeautifulSoup(response.content, "html.parser")# 遍历每个医生信息块for doctor_block in soup.select(".gynecologist"):    # 提取医生姓名    doctor_name = doctor_block.h2.get_text(strip=True)    print("Name:", doctor_name)    # 提取所有物理服务地点,排除“Online Video Consultation”    # 使用CSS选择器 :-soup-contains() 结合 :not() 进行过滤    physical_hospitals = doctor_block.select(        ".listing-locations:not(:-soup-contains('Online Video Consultation'))"    )    # 提取每个物理地点的文本    hospital_names = [h.span.text for h in physical_hospitals]    print("Hospitals:", hospital_names)    print("-" * 30) # 分隔线,便于阅读

示例输出(部分):

Name: Dr. Ayesha Azam KhanHospitals: ['National Hospital & Medical Centre (DHA)', 'Surgimed Hospital (Gulberg)']------------------------------Name: Dr. Maliha AmjadHospitals: ['Omar Hospital & Cardiac Centre (Johar Town) (Johar Town)', 'Shalamar Hospital (Mughalpura)']------------------------------Name: Dr. Sara RasulHospitals: ['Hameed Latif Hospital (New Garden Town)', 'Hameed Latif Medical Center (DHA)']------------------------------...

4. 代码详解与工作原理

requests.get(url): 发起GET请求,获取网页的原始HTML内容。BeautifulSoup(response.content, “html.parser”): 将获取到的HTML内容解析成一个BeautifulSoup对象,方便后续的数据查找和提取。soup.select(“.gynecologist”): 使用CSS选择器.gynecologist来查找页面上所有类名为gynecologist的div元素。这通常代表了页面上的每个医生信息块。doctor_block.h2.get_text(strip=True): 在每个医生信息块内部,查找h2标签,并使用get_text(strip=True)方法提取其文本内容,strip=True用于去除文本两端的空白字符。doctor_block.select(“.listing-locations:not(:-soup-contains(‘Online Video Consultation’))”): 这是核心过滤步骤。doctor_block.select(…): 表示在当前的doctor_block(即当前医生信息块)内部进行查找,确保我们只处理当前医生的地点信息。.listing-locations: 选择所有类名为listing-locations的元素。:not(:-soup-contains(‘Online Video Consultation’)): 这是一个组合选择器。:-soup-contains(‘…’): 是BeautifulSoup特有的伪类,用于选择包含指定文本内容的元素。:not(…): 是CSS的否定伪类,用于排除符合其内部选择器条件的元素。因此,整个表达式的含义是:选择所有类名为listing-locations的元素中,不包含文本“Online Video Consultation”的元素。[h.span.text for h in physical_hospitals]: 这是一个列表推导式,用于遍历所有筛选出的物理地点元素,并提取每个地点span标签内的文本内容。

5. 进一步思考:如何仅获取一个地点

原始问题中提到“I just want one location for every doctor”。虽然上述解决方案提供了所有物理地点,如果确实只需要一个地点(例如,只取第一个可用的物理地点),可以在获取physical_hospitals列表后,再进行一步处理:

    # ... (前面的代码保持不变) ...    # 提取所有物理服务地点    physical_hospitals = doctor_block.select(        ".listing-locations:not(:-soup-contains('Online Video Consultation'))"    )    # 如果只需要一个地点,可以取列表的第一个元素    if physical_hospitals:        single_location = physical_hospitals[0].span.text        print("Single Location:", single_location)    else:        print("Single Location: N/A")

这样,即使医生有多个物理地点,也只会提取第一个。

6. 注意事项与最佳实践

网站结构变化:Web scraping高度依赖于目标网站的HTML结构。如果网站更新,选择器可能会失效,需要重新检查和调整。User-Agent:某些网站可能会阻止默认的requests请求。可以尝试在请求头中添加User-Agent,模拟浏览器访问:

headers = {    "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/91.0.4472.124 Safari/537.36"}response = requests.get(url, headers=headers)

错误处理:在实际项目中,应加入错误处理机制,例如try-except块来处理网络请求失败、元素未找到等情况。遵守Robots.txt:在进行Web scraping之前,务必检查网站的robots.txt文件,了解网站对爬虫的限制和规定。请求频率:避免对网站发起过高频率的请求,以免给服务器造成负担,甚至导致IP被封禁。可以加入time.sleep()来控制请求间隔。

7. 总结

通过本文的讲解,我们学习了如何在Web scraping中处理同名标签带来的挑战。关键在于利用BeautifulSoup的强大功能,特别是通过遍历父节点、结合CSS选择器(如:-soup-contains()和:not())进行精准定位和条件过滤。这种方法不仅能够帮助我们从复杂网页中提取所需数据,还能提高数据清洗的效率和准确性,是Web scraping中一项非常实用的技巧。

以上就是Web scraping中同名标签的处理:多地点信息提取与过滤的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1372342.html

赞 (0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
Python怎么分割字符串_Python字符串分割方法与实践
上一篇 2025年12月14日 12:15:03
利用Protocol为可排序且可哈希的参数创建精确类型提示
下一篇 2025年12月14日 12:15:09

相关推荐

  • K8s为啥要启用bridge-nf-call-iptables内核参数?用案例给你讲明白!

    使用 kubernetes 遇到最多的 70%问题都可以归于网络问题,最近发现如果内核参数: bridge-nf-call-iptables设置不当的话会影响 kubernetes 中 node 节点上的 pod 通过 clusterip 去访问同 node上的其它 pod 时会有超时现象,复盘记录…

    2026年9月26日
    000
  • 多模态AI能否理解视频内容 视频处理能力分析与使用建议

    多模态AI能否理解视频内容 视频处理能力分析与使用建议多模态AI能否理解视频内容 视频处理能力分析与使用建议多模态AI能否理解视频内容 视频处理能力分析与使用建议多模态AI能否理解视频内容 视频处理能力分析与使用建议

    多模态AI处理视频是一个涉及多个数据流融合的技术领域。本文旨在探讨多模态AI如何理解视频内容,分析其当前的处理能力,并提供一些使用上的建议,帮助读者更好地认识和应用这项技术。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 多模态AI理解视频…

    2026年9月26日 • 用户投稿
    400
  • vivo浏览器如何设置电脑版UA_vivo浏览器切换电脑版网页标识方法

    vivo浏览器如何设置电脑版UA_vivo浏览器切换电脑版网页标识方法vivo浏览器如何设置电脑版UA_vivo浏览器切换电脑版网页标识方法vivo浏览器如何设置电脑版UA_vivo浏览器切换电脑版网页标识方法vivo浏览器如何设置电脑版UA_vivo浏览器切换电脑版网页标识方法

    可通过修改用户代理(UA)标识使vivo浏览器访问电脑版网页。首先尝试在设置中将UA标识切换为“Desktop”模式;若不支持,可手动输入电脑版UA字符串;还可安装UA切换插件实现一键切换,刷新页面后即可加载桌面版网站内容。 如果您在使用vivo浏览器时希望访问电脑版网页,但页面自动跳转至移动版,可…

    2026年9月26日 • 用户投稿
    400
  • 请描述Java的内存区域(运行时数据区)

    请描述Java的内存区域(运行时数据区)请描述Java的内存区域(运行时数据区)请描述Java的内存区域(运行时数据区)请描述Java的内存区域(运行时数据区)

    Java运行时数据区分为程序计数器、Java虚拟机栈、本地方法栈、Java堆和方法区,其中堆和方法区为线程共享,其余为线程私有;程序计数器记录线程执行位置,虚拟机栈管理方法调用的栈帧,本地方法栈服务Native方法,堆存放对象实例并由GC管理,方法区存储类元数据和常量池;JDK 8后方法区由元空间替…

    2026年9月26日 • 用户投稿
    100
  • 小红书动态无法点赞怎么办

    小红书动态无法点赞怎么办小红书动态无法点赞怎么办小红书动态无法点赞怎么办小红书动态无法点赞怎么办

    先检查账号状态、网络环境及客户端问题。确认账号无违规、笔记可推广,避免异常操作;刷新登录、切换网络、清缓存、更新App;换设备测试排除风控,禁用多开软件;若均无效,联系客服解决。 小红书动态无法点赞,通常由账号状态、网络环境或客户端问题引起。可以按以下步骤逐一排查解决。 检查账号与内容状态 账号或发…

    2026年9月26日 • 用户投稿
    500
  • 苹果最新的耳机是什么型号

    苹果最新的耳机是什么型号苹果最新的耳机是什么型号苹果最新的耳机是什么型号苹果最新的耳机是什么型号

    苹果于 2022 年 9 月发布了 AirPods Pro 2,其主要功能包括:改进的主动降噪 (ANC)自适应透明模式个性化空间音频触控控制H2 芯片提供更好的声音质量和更长的电池续航时间耐汗和防水 (IPX4)ANC 开启时可播放长达 6 小时,配合充电盒可播放长达 30 小时 苹果最新耳机型号…

    2026年9月26日 • 用户投稿
    100
  • sublime怎么设置python虚拟环境_sublime配置Python虚拟环境教程

    sublime怎么设置python虚拟环境_sublime配置Python虚拟环境教程sublime怎么设置python虚拟环境_sublime配置Python虚拟环境教程sublime怎么设置python虚拟环境_sublime配置Python虚拟环境教程sublime怎么设置python虚拟环境_sublime配置Python虚拟环境教程

    配置Sublime Text使用Python虚拟环境需先确定虚拟环境路径,Windows为Scripts/python.exe,macOS/Linux为bin/python。2. 在Sublime中创建新构建系统,编辑JSON文件指定虚拟环境中的Python解释器路径。3. 保存为PythonVen…

    2026年9月26日 • 用户投稿
    200
  • windows怎么查看事件日志_事件查看器使用与日志分析方法

    windows怎么查看事件日志_事件查看器使用与日志分析方法windows怎么查看事件日志_事件查看器使用与日志分析方法windows怎么查看事件日志_事件查看器使用与日志分析方法windows怎么查看事件日志_事件查看器使用与日志分析方法

    答案:通过事件查看器可排查Windows系统错误。打开eventvwr.msc,浏览系统、应用程序和安全性日志,筛选错误或警告事件,导出.evtX文件分析,并根据事件ID查询解决方案。 如果您在使用Windows系统时遇到系统错误、应用程序崩溃或安全相关的问题,可以通过事件日志来排查异常行为。事件查…

    2026年9月26日 • 用户投稿
    600
  • Firefox浏览器电脑版下载 火狐手机版官方安装包

    Firefox浏览器电脑版下载 火狐手机版官方安装包Firefox浏览器电脑版下载 火狐手机版官方安装包Firefox浏览器电脑版下载 火狐手机版官方安装包Firefox浏览器电脑版下载 火狐手机版官方安装包

    Firefox浏览器官方下载地址为https://www.mozilla.org/zh-CN/firefox/new/,提供电脑版与手机版安装包;其核心功能包括标签式浏览、弹出窗口拦截、追踪器屏蔽、跨设备数据同步及密码加密存储等。 Firefox浏览器电脑版下载、火狐手机版官方安装包在哪里?这是不少…

    2026年9月26日 • 用户投稿
    200
  • DeepSeek能做代码生成吗 使用DeepSeek进行编程任务的能力测试

    DeepSeek能做代码生成吗 使用DeepSeek进行编程任务的能力测试DeepSeek能做代码生成吗 使用DeepSeek进行编程任务的能力测试DeepSeek能做代码生成吗 使用DeepSeek进行编程任务的能力测试DeepSeek能做代码生成吗 使用DeepSeek进行编程任务的能力测试

    本文将探讨名为DeepSeek的语言模型在代码生成领域的表现。针对“DeepSeek能做代码生成吗?”这一问题,我们将阐述其在编程任务上的能力,并模拟进行一次能力测试的描述,帮助读者了解DeepSeek作为编程助手的潜力及其适用场景。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量…

    2026年9月26日 • 用户投稿
    200
  • 可能是目前效果最好的开源生图模型,混元生图 3.0 来了

    可能是目前效果最好的开源生图模型,混元生图 3.0 来了可能是目前效果最好的开源生图模型,混元生图 3.0 来了可能是目前效果最好的开源生图模型,混元生图 3.0 来了可能是目前效果最好的开源生图模型,混元生图 3.0 来了

    腾讯混元最新发布并开源原生多模态生图模型——混元图像 3.0(hunyuanimage 3.0)! 模型参数规模高达 80B,是目前参数量最大的开源生图模型。 同时,HunyuanImage 3.0 将理解与生成一体化融合,也是首个开源工业级原生多模态生图模型,效果对标业界头部闭源模型,堪称目前开源…

    2026年9月26日 • 用户投稿
    400
  • 如何用Java制作个人任务提醒应用

    使用Java创建任务提醒应用,核心功能包括任务管理与定时提醒。2. 设计Task类封装标题、描述、截止时间与完成状态,用LocalDateTime处理时间。3. 任务存储于List中,通过ObjectOutputStream序列化实现持久化。4. 利用ScheduledExecutorService…

    2026年9月26日
    200
  • 一键PHP环境可以同时跑多个PHP版本吗_多版本共存实现

    多PHP版本共存可行。通过宝塔、phpStudy等集成环境或手动配置Nginx+多PHP-FPM,可实现不同站点使用不同PHP版本,需注意扩展兼容性、端口冲突及安全维护。 一键PHP环境通常指的是集成化的开发环境工具,比如 XAMPP、WAMP、宝塔面板 或 phpStudy 这类软件。这类工具默认…

    2026年9月26日
    100
  • Google浏览器官网入口一键直达

    Google浏览器官网入口一键直达Google浏览器官网入口一键直达Google浏览器官网入口一键直达Google浏览器官网入口一键直达

    Google浏览器官网入口一键直达地址是https://www.google.cn/chrome/,该网址提供简洁界面、多标签管理、智能搜索、网页翻译等功能,并支持跨设备同步书签、历史记录和密码,具备高效性能与安全更新。 Google浏览器官网入口一键直达在哪里?这是不少网友都关注的,接下来由PHP…

    2026年9月26日 • 用户投稿
    100
  • Win7系统如何让壁纸变换淡入淡出

    Win7系统如何让壁纸变换淡入淡出Win7系统如何让壁纸变换淡入淡出Win7系统如何让壁纸变换淡入淡出Win7系统如何让壁纸变换淡入淡出

    在windows 7操作系统里,除了常规方式更换桌面背景之外,还有一种更为高级的切换模式——即淡入淡出效果。接下来,win10系统之家的小编将为您详细讲解具体的操作步骤。 首先,准备好您想要用于淡入淡出效果的桌面背景图片,并调整更换时间间隔为10秒(当然,您可以依据需要自行调整此参数),如下图所示:…

    2026年9月26日 • 用户投稿
    100
  • 抖音内容怎么吸引流量_抖音内容吸引流量的核心方法

    抖音内容怎么吸引流量_抖音内容吸引流量的核心方法抖音内容怎么吸引流量_抖音内容吸引流量的核心方法抖音内容怎么吸引流量_抖音内容吸引流量的核心方法抖音内容怎么吸引流量_抖音内容吸引流量的核心方法

    答案:提升抖音推荐需优化开头3秒、内容结构、互动率、AI工具和垂直领域。打造强钩子如结果前置、冲突制造、高悬念提问;采用痛点—解决—升华结构,每30秒设信息点;引导评论、挑战和点赞;用AI生成素材与分析数据;明确账号定位并连续发布同领域内容10条以上,前3-5天模拟用户行为助系统打标。 如果您发布的…

    2026年9月26日 • 用户投稿
    400
  • AI辩论教练:用豆包AI+Character模拟对手训练逻辑反应

    AI辩论教练:用豆包AI+Character模拟对手训练逻辑反应AI辩论教练:用豆包AI+Character模拟对手训练逻辑反应AI辩论教练:用豆包AI+Character模拟对手训练逻辑反应AI辩论教练:用豆包AI+Character模拟对手训练逻辑反应

    你可以使用豆包ai和character.ai进行辩论训练,具体步骤包括:1.选择合适的平台,豆包ai适合快速访问,character.ai适合丰富角色设定;2.创建或选择辩论角色并设定背景、立场和风格;3.明确辩题并输入给ai;4.轮流发言并及时记录分析;5.利用豆包ai进行观点碰撞、论据挖掘和模拟…

    2026年9月26日 • 用户投稿
    100
  • Epic禁止自动启动设置_开机不启动Epic解决方案

    Epic禁止自动启动设置_开机不启动Epic解决方案Epic禁止自动启动设置_开机不启动Epic解决方案Epic禁止自动启动设置_开机不启动Epic解决方案Epic禁止自动启动设置_开机不启动Epic解决方案

    可通过客户端设置、任务管理器、启动文件夹或注册表编辑器禁用Epic自动启动。首先在Epic设置中关闭“启动时启动”选项;其次在任务管理器“启动”选项卡中禁用Epic Games Launcher;然后检查并删除“shell:startup”启动文件夹中的相关快捷方式;最后通过注册表编辑器删除HKEY…

    2026年9月26日 • 用户投稿
    100
  • Linux网络配置与防火墙设置

    Linux网络配置与防火墙设置Linux网络配置与防火墙设置Linux网络配置与防火墙设置Linux网络配置与防火墙设置

    本文介绍了linux网络配置和防火墙设置方法。1. 配置网络接口需修改/etc/network/interfaces或netplan配置文件,设置静态ip、子网掩码、网关和dns服务器;2. 使用iptables命令管理防火墙,例如sudo iptables -a input -p tcp &#82…

    2026年9月26日 • 用户投稿
    000
  • Java项目质量保障体系:静态分析、单元测试与集成测试

    Java项目质量保障体系:静态分析、单元测试与集成测试Java项目质量保障体系:静态分析、单元测试与集成测试Java项目质量保障体系:静态分析、单元测试与集成测试Java项目质量保障体系:静态分析、单元测试与集成测试

    静态分析是Java质量保障的第一道防线,因其能在代码运行前发现潜在缺陷。SonarQube等工具通过集成Checkstyle、PMD等规则集,实现代码规范、安全、性能的全面扫描,及早暴露空指针、资源泄漏等问题,减少技术债。它作为“预检系统”,避免低级错误流入后续阶段,提升整体代码整洁度,为单元与集成…

    2026年9月26日 • 用户投稿
    000

发表回复

登录后才能评论
关注微信