如何使用Scrapy和XPath高效抓取div中可变数量的p标签并合并存储

如何使用Scrapy和XPath高效抓取div中可变数量的p标签并合并存储

本文详细介绍了如何利用scrapy框架和xpath表达式,从网页中准确提取特定`div`元素内数量不定的`

`标签内容,并将其合并为单个字符串进行存储。通过分析常见问题,提供了一种简洁高效的解决方案,确保所有段落内容都能被正确抓取并导出到csv文件,避免只存储最后一个段落的错误。

在进行网页抓取时,经常会遇到需要提取一个父级div元素内多个子级

标签内容的情况,且这些

标签的数量在不同页面上可能不固定。例如,某些页面可能只有一个段落,而另一些页面可能有十个甚至更多。本教程将指导您如何使用Python的Scrapy框架和XPath表达式,有效地解决这一挑战,并将所有提取的段落内容合并到一个变量中,以便于后续存储。

场景描述与HTML结构

假设我们面对的HTML结构如下所示,其中一个具有特定类名的div包含了一系列

标签,这些

标签可能包含文本、空白或换行符:

title text

text text text...

text text text...


text text text...

<!-- 更多

标签 -->

text text text...

text text text...

我们的目标是从这个div中提取所有

标签的文本内容,并将它们拼接成一个单一的字符串。

初始尝试与存在的问题

许多初学者可能会尝试遍历所有p标签,然后将它们赋值给一个变量:

divs = response.xpath('/html/body/div[6]/div/section[2]/article/div/div/div')for p in divs.xpath('.//p'):    print(p.get()) # 这会打印所有 

标签的HTML内容 story = p # 问题所在:每次循环都会覆盖 story 变量yield { 'story': story}

尽管print(p.get())能够正确地输出所有

标签的HTML内容,但当story = p这行代码在循环内部执行时,story变量会在每次迭代中被最新的p元素覆盖。因此,当循环结束后,story将只保留最后一个

标签的内容。当通过yield将其导出到CSV文件时,CSV中也只会记录最后一个段落。

高效解决方案:XPath与列表推导式结合

为了解决上述问题,我们需要一种方法来一次性选择所有目标

标签,并将其内容合并。Scrapy结合XPath和Python的列表推导式提供了一个简洁而强大的解决方案。

核心思想是:

使用XPath选择所有目标

标签。

使用列表推导式遍历这些选中的标签,提取它们的文本内容。使用str.join()方法将所有提取的文本内容拼接成一个字符串。

以下是具体的实现代码:

import scrapyclass MySpider(scrapy.Spider):    name = 'paragraph_scraper'    start_urls = ['http://example.com/your_target_page'] # 替换为实际的目标URL    def parse(self, response):        # 假设目标div的XPath是 '/html/body/div[6]/div/section[2]/article/div/div/div'        # 更健壮的方法是使用类名或其他属性定位,例如 '//div[@class="div_name"]'        # 1. 使用XPath选择所有 

标签 # 注意:这里使用了原始问题中提供的长XPath路径。 # 在实际应用中,建议使用更具鲁棒性的相对XPath或基于属性的XPath, # 例如 '//div[@class="div_name"]//p' p_elements = response.xpath('//div[6]/div/section[2]/article/div/div/div//p') # 2. 使用列表推导式提取每个

标签的文本内容并去除空白 # x.get() 获取标签的HTML内容,.strip() 去除首尾空白字符 # 如果只需要文本内容,可以使用 x.xpath('./text()').get() # 但考虑到


text

这样的结构,x.get() 配合 strip() 更通用 # 进一步优化:如果需要纯文本,且不包含HTML标签,可以这样提取: # p_texts = [x.xpath('string(.)').get().strip() for x in p_elements if x.xpath('string(.)').get().strip()] # 这里为了保持与原始答案的接近,并处理

等情况,使用 x.get() # 实际解决方案:获取每个

标签的HTML内容,去除空白 p_contents = [x.get().strip() for x in p_elements] # 3. 将所有内容用空格连接成一个字符串 story = ' '.join(p_contents) # 打印结果进行验证 self.logger.info(f"Extracted story: {story[:200]}...") # 打印前200字符 # 4. 封装为Scrapy Item并yield yield { 'story': story }

代码解析:

response.xpath(‘//div[6]/div/section[2]/article/div/div/div//p’): 这个XPath表达式直接定位到目标div内部的所有

标签。//p表示在当前路径下的任何深度查找所有

标签。

[x.get().strip() for x in p_elements]: 这是一个Python的列表推导式。for x in p_elements: 遍历之前XPath选择到的每一个

标签对象。

x.get(): 对于每个

标签对象x,get()方法会返回其完整的HTML内容(包括标签本身)。如果只需要纯文本,可以尝试x.xpath(‘./text()’).get(),但需要注意处理可能存在的子标签或混合内容。考虑到原始HTML中

text

的情况,get()更易于处理。.strip(): 对获取到的字符串内容进行处理,去除字符串开头和结尾的空白字符(包括空格、制表符、换行符等)。这对于清理

 

这类只包含空白内容的标签非常有用,可以将其处理为空字符串。’ ‘.join(…): Python的join()方法用于将一个可迭代对象(这里是列表推导式生成的字符串列表)中的所有字符串元素连接起来,并使用指定的字符串(这里是单个空格’ ‘)作为分隔符。最终,所有段落内容被合并成一个单一的字符串。

处理空标签与内容清理

在HTML中,经常会遇到

 

text

这类标签。x.get().strip()会处理掉

 

中的 在HTML解析后的空白,使其变为一个空字符串。对于

text

,x.get()会得到”

text

“,strip()后仍为”

text

“. 如果需要提取纯文本,忽略HTML标签,可以考虑使用x.xpath(‘string(.)’).get().strip()。string(.)XPath函数会提取当前节点及其所有子节点的文本内容,并将其连接成一个字符串,有效去除HTML标签。

改进的文本提取方式(纯文本):

# ...p_elements = response.xpath('//div[6]/div/section[2]/article/div/div/div//p')# 提取纯文本内容,并过滤掉完全为空的段落p_texts = []for p_tag in p_elements:    text_content = p_tag.xpath('string(.)').get().strip()    if text_content: # 仅添加非空字符串        p_texts.append(text_content)story = ' '.join(p_texts)# ...

这种方式能够更精确地获取用户可见的纯文本内容,并避免将完全空白的段落(如 或只含br)也作为有效内容加入。

Scrapy导出到CSV的配置

为了将抓取到的数据(包括合并后的story字段)导出到CSV文件,您需要在Scrapy项目的settings.py文件中进行相应的配置:

# settings.py# 爬虫深度限制 (0 表示无限深度)DEPTH_LIMIT = 0# Feed Export Settings (数据导出设置)FEED_FORMAT = "csv" # 导出格式为CSVFEED_URI = "output_%(name)s.csv" # 导出文件名,%(name)s 会被替换为爬虫的名称

通过以上配置,当您的爬虫运行并yield出包含story字段的字典时,Scrapy会自动将这些数据写入到指定的CSV文件中。

总结

通过本教程,您学会了如何利用Scrapy和XPath高效地从HTML中提取数量不定的

标签内容,并将其合并成一个单一的字符串。关键在于使用XPath一次性选择所有目标元素,并通过Python的列表推导式和str.join()方法进行内容提取和拼接。这种方法不仅解决了只存储最后一个段落的问题,还提高了代码的简洁性和效率,使得动态内容的抓取和存储变得更加可靠。在实际应用中,请务必根据目标网页的实际HTML结构,选择最健壮的XPath表达式。

以上就是如何使用Scrapy和XPath高效抓取div中可变数量的p标签并合并存储的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1603472.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
优化HTML页面box-shadow显示:解决滚动内容区域阴影不完整问题
上一篇 2025年12月23日 17:14:20
JavaScript中变量空值与空白字符的健壮性检查
下一篇 2025年12月23日 17:14:28

相关推荐

  • [UWP]推荐一款很Fluent Design的bilibili UWP客户端 : 哔哩

    [UWP]推荐一款很Fluent Design的bilibili UWP客户端 : 哔哩[UWP]推荐一款很Fluent Design的bilibili UWP客户端 : 哔哩[UWP]推荐一款很Fluent Design的bilibili UWP客户端 : 哔哩[UWP]推荐一款很Fluent Design的bilibili UWP客户端 : 哔哩

    最近,uwp平台上又多了一个新的bilibili客户端: 哔哩 – Microsoft Store 开发者云之幻是一位在UWP设计领域颇有建树的开发者,我从他那里学到了许多设计技巧。他同时也是Bilibili的Up主,主要分享PowerPoint和UWP相关的教学内容。 云之幻的个人空间…

    2026年8月28日 用户投稿
    100
  • 高德地图怎么设置躲避拥堵最快的路线_高德地图躲避拥堵路线设置

    首先在高德地图中设置躲避拥堵偏好,进入【我的】-【设置】-【导航设置】-【路线偏好】选择【躲避拥堵】;其次可在路线规划时点击【偏好设置】选择【躲避拥堵】重新计算路线;最后导航途中可点击【更多】-【路线偏好】切换为【躲避拥堵】模式,系统将动态调整路径避开拥堵。 如果您正在使用高德地图进行导航,但发现路…

    2026年8月28日
    000
  • ios16怎么隐藏照片

    一、通过相册自带功能隐藏 打开“照片”应用,定位到你想隐藏的图片。点击右上角的“选择”,勾选目标照片后,点击左下角的“分享”按钮。在分享菜单中向左滑动,找到“隐藏”选项并点击确认。此时,所选照片将自动移入“隐藏”相册。如需查看这些内容,只需进入“相簿”页面,向下滚动即可找到“隐藏”相册。 二、利用A…

    2026年8月28日
    000
  • 拼多多退货时间有限制吗_拼多多退货时间限制详细说明

    拼多多退货时间有限制吗_拼多多退货时间限制详细说明拼多多退货时间有限制吗_拼多多退货时间限制详细说明拼多多退货时间有限制吗_拼多多退货时间限制详细说明拼多多退货时间有限制吗_拼多多退货时间限制详细说明

    签收次日起7天内可申请无理由退货,15天内可因质量问题退货,生鲜商品需在2小时内提交变质证据,申请通过后须7天内寄出商品,换货商品签收后7天内可再次退货。 如果您在拼多多平台购物后需要申请退货,平台对不同类型的订单和商品都设定了明确的时间节点。了解这些时间限制能有效保障您的权益。以下是关于退货申请、…

    2026年8月28日 用户投稿
    600
  • 233乐园新用户怎么快速上手_233乐园新手入门完全攻略

    下载安装233乐园官方应用后注册登录账号,完善个人资料;2. 浏览推荐与分类选择游戏,点击开始并完成新手引导;3. 利用设置、消息中心和社交功能提升体验。 如果您刚下载233乐园并首次打开应用,面对丰富的游戏库和功能可能会感到无从下手。以下是帮助新用户快速熟悉平台并顺利开始游戏的详细步骤: 一、下载…

    2026年8月28日
    000
  • 手把手教你们Python配置OpenCV环境,小白看一遍就会了

    手把手教你们Python配置OpenCV环境,小白看一遍就会了手把手教你们Python配置OpenCV环境,小白看一遍就会了手把手教你们Python配置OpenCV环境,小白看一遍就会了手把手教你们Python配置OpenCV环境,小白看一遍就会了

    ?️‍?1、简介?1.1、Opecv介绍 开课之前,我们先给大家讲讲opecv是一个基于bsd许可(开源)发行的跨平台计算机视觉和机器学习软件库,可以运行在linux、windows、android和mac os操作系统上。 [1] 它轻量级而且高效——由一系列 c 函数和少量 c++ 类构成,同时…

    2026年8月28日 用户投稿
    300
  • VSCode怎么建立外部样式_VSCode链接外部CSS文件方法教程

    首先创建style.css文件并编写样式,然后在HTML的head中通过link标签引入,最后用Live Server插件实现实时预览;若样式未生效,需检查路径、语法、优先级、缓存及HTML结构,并利用开发者工具调试;大型项目应按模块或页面拆分CSS,结合预处理器、BEM规范和CSS Reset提升…

    2026年8月28日
    000
  • React前端与PHP后端联调:高效定位与解决PHP错误

    本文针对React前端与PHP后端集成时,PHP错误难以追踪的问题,提供了两种高效调试策略。核心在于通过配置PHP服务器端错误日志,将详细错误信息记录到文件,以及利用浏览器开发者工具的网络面板直接检查API的原始响应,从而避免JSON解析错误并快速定位后端问题。 问题剖析:React前端下PHP错误…

    2026年8月28日
    000
  • 抖音网页版怎么反馈问题_抖音网页版意见反馈渠道入口

    最有效反馈方式是通过手机App提交。打开抖音App,进入“我”页面,点击右上角“⋯”,选择“反馈与帮助”,按分类提交问题并附描述和截图;网页端可尝试右下角“?”按钮,登录后查看是否有意见反馈窗口;若需紧急处理,可检查消息列表中是否存有“抖音客服”对话记录,直接联系获取回复。 抖音网页版目前没有直接的…

    2026年8月28日
    500
  • 美团拼好饭app怎么添加地区

    在使用美团拼好饭 app 或美团外卖时,正确设置所在地区和详细地址是十分关键的步骤,这能确保你所点的美食准时、准确送达。接下来,将为你一步步讲解如何添加地区与收货地址。 美团拼好饭 app 添加地区方法 启动美团拼好饭 app 后,进入首页你会看到顶部通常会显示当前默认或自动定位的地区名称。点击该地…

    2026年8月28日
    100
  • 懂车帝怎样搜索特定车型资讯_懂车帝车型信息精准搜索

    捷途纵横G700豪华电混越野SUV将于10月19日上市,预售价34.99万-42.99万元,定位中大型“全领域”车型,现已开启预售并提供4种配置。 如果您想在懂车帝上查找某款特定车型的最新资讯或详细信息,但面对海量内容感到无从下手,可以通过平台提供的多种精准搜索功能来快速定位目标。以下是实现高效查询…

    2026年8月28日
    000
  • 高德地图导航提示路线不一致怎么办 高德地图路线对比与修复方法

    先排查定位不准或数据延迟问题,依次检查设备定位服务是否开启、高德地图权限设置、选择高精度模式并手动校准位置;更新地图包和APP版本,清除缓存;保持网络稳定,避开信号遮挡区,必要时重启设备;调整导航设置如路线偏好和关闭多路线推荐,若问题持续通过报错功能反馈。 高德地图导航提示路线不一致,多半是定位不准…

    2026年8月28日
    200
  • Win7如何更改默认浏览器?

    浏览器是一种能够展示网页服务器或文件系统中的html文档内容,并支持用户与之互动的软件。许多用户的电脑上都安装了多个浏览器,但很少有人了解如何设定默认浏览器。今天,小编就为大家讲解一下如何设置默认浏览器。 如何更改IE浏览器的默认设置 打开IE浏览器,在主界面上找到并点击工具菜单,随后在下拉列表中选…

    2026年8月28日
    100
  • Spark vs. Flink — 核心技术点

    Spark vs. Flink — 核心技术点Spark vs. Flink — 核心技术点Spark vs. Flink — 核心技术点Spark vs. Flink — 核心技术点

    引言 Apache Spark 是一个综合性且高效的分布式计算引擎,兼具批处理和流计算能力,利用内存进行并行计算。官方数据表明,Spark的内存计算速度比MapReduce快100倍。作为当前最流行的计算框架,Spark已展现出其卓越的性能。 Apache Flink 是一个分布式大数据处理引擎,提…

    2026年8月28日 用户投稿
    300
  • Windows + Claude Code + Cursor 安装、配置和激活!揭秘最全指南!

    Windows + Claude Code + Cursor 安装、配置和激活!揭秘最全指南!Windows + Claude Code + Cursor 安装、配置和激活!揭秘最全指南!Windows + Claude Code + Cursor 安装、配置和激活!揭秘最全指南!Windows + Claude Code + Cursor 安装、配置和激活!揭秘最全指南!

    前言 用过ai编程工具的小伙伴,肯定都知道claude。claude 系列模型在编程领域的口碑绝对是佼佼者!很多ai工具都接入claude的模型! 图片 鉴于Claude 系列模型的优秀表现,官方也推出自己的编程工具 Claude Code ,也是收费的。 图片 另外,单独的Claude模型需要一些…

    2026年8月28日 用户投稿
    100
  • 如何将包含重复元素的集合拆分成多个不包含重复元素的子集?

    将含重复元素集合拆分为无重复元素子集 本文介绍如何将包含重复元素的集合拆分成多个不包含重复元素的子集。 我们通过一个例子来说明问题和解决方案。 假设有一个集合:29, 36, 37, 37, 39, 39, 955, 955, 955, 961, 961, 962, 962。 目标是将其拆分成多个子…

    2026年8月28日
    200
  • 百度小说如何筛选小说类型_百度小说小说分类筛选功能

    打开百度小说APP后,通过首页顶部分类导航栏点击“悬疑”等标签进入对应题材;2. 若分类不全,可点击左上角“☰”图标进入侧边菜单的“全部分类”选择细分类型;3. 结合“排行榜”中的“畅销榜”或“人气榜”,在特定分类下筛选最受欢迎小说。 如果您在百度小说中难以快速找到特定类型的小说,可以通过其内置的分…

    2026年8月28日
    000
  • Win10系统没有投影功能该如何解决?

    Win10系统没有投影功能该如何解决?Win10系统没有投影功能该如何解决?Win10系统没有投影功能该如何解决?Win10系统没有投影功能该如何解决?

    在win10操作系统里,投影到此电脑的功能可以让其他设备借助无线网络将画面投射到本机屏幕上,然而部分用户反映自己的设备并未显示该选项。若遇到此类情况,可尝试按照以下步骤重新添加此功能。有需求的朋友不妨参考一下。 具体操作如下: 1、在开始菜单上点击鼠标右键,然后从出现的列表中选取“Windows P…

    2026年8月28日 用户投稿
    200
  • 极光影票团购券怎么用_极光影票团购优惠券使用教程

    首先确认极光影票团购券可通过官方App、影院前台或第三方平台三种方式使用:1、官方App内登录账户,选场次后用券抵扣并取票;2、持身份证和券码至影城柜台人工核销并补差价;3、在猫眼、淘票票等合作平台下单时绑定券码完成支付。 如果您已经购买了极光影票的团购券,但在兑换或使用时遇到困难,则可能是由于操作…

    2026年8月28日
    000
  • VSCode怎么设置代码对齐_VSCode代码对齐与缩进规则配置教程

    答案:VSCode通过配置格式化工具和扩展实现代码对齐,需安装对应语言的工具(如Prettier、autopep8),启用formatOnSave自动格式化,或使用Shift+Alt+F手动格式化;通过.editorconfig统一团队风格,检查文件类型识别和扩展冲突解决格式化失效问题;在setti…

    2026年8月28日
    100

发表回复

登录后才能评论
关注微信