无XHR请求时提取JavaScript动态生成内容的教程

无XHR请求时提取JavaScript动态生成内容的教程

本教程探讨了在爬取网页时,当目标内容由javascript动态生成且无明显xhr请求时的数据提取策略。我们将揭示数据可能已内嵌于初始htmljs代码中,并演示如何通过检查页面源代码、识别关键标识符来定位并提取这些隐藏的json格式数据,从而实现高效的网页内容抓取。

挑战:JavaScript动态内容与XHR请求缺失

在进行网页数据抓取时,我们经常会遇到内容由JavaScript动态生成的情况。传统的爬虫通常通过解析服务器返回的原始HTML来提取数据,例如使用XPath或CSS选择器。然而,当页面内容在浏览器端通过JavaScript执行后才呈现,且在网络请求中观察不到明显的XHR(XMLHttpRequest)或Fetch API请求来获取这些数据时,传统的静态解析方法便会失效。这给爬虫开发者带来了挑战,因为这意味着数据并非通过异步请求独立加载,而是以某种方式“隐藏”在初始页面加载中。

例如,对于以下HTML结构,如果其内容 Darkmoon Faire 是由JavaScript动态填充的:

直接使用XPath查询如 //*[contains(@id, “EU-group-holiday-line”)] 可能无法获取到完整或最新的内容,因为在爬虫获取原始HTML时,JavaScript尚未执行。

核心洞察:数据内嵌于初始加载

当网站使用JavaScript生成内容但没有发起额外的XHR请求时,一个关键的推断是:所需数据很可能已经包含在最初加载的HTML文档或内联/外部JavaScript文件中。这意味着数据在页面加载时就已经存在于代码中,只是在DOM构建完成并执行JavaScript后才被“激活”或渲染到用户界面上。

立即学习“Java免费学习笔记(深入)”;

实践步骤:定位内嵌数据

要提取这类数据,我们需要改变思路,不再仅仅关注渲染后的DOM结构,而是深入检查页面的原始源代码。

查看页面源代码:使用浏览器(如Chrome、Firefox)打开目标网页,然后通过“查看页面源代码”(通常是 Ctrl+U 或右键菜单)来获取未经JavaScript处理的原始HTML内容。

利用特征字符串搜索:在原始源代码中,搜索那些在渲染页面上可见的、具有唯一性的关键词或模式。例如,如果渲染后的链接中包含 event=479 或 event=643 这样的标识符,那么在源代码中搜索这些字符串,很可能会定位到包含这些数据的JavaScript变量、JSON字符串或HTML注释。

示例分析:以 https://www.wowhead.com/today-in-wow 为例,如果我们要提取类似 event=479/darkmoon-faire 的事件信息,在原始页面源代码中搜索 event=643 (一个类似的事件ID),我们可能会发现以下JSON格式的子字符串:

{   "icon": "calendar_weekendmistsofpandariastart",   "name": "Timewalking Dungeon Event",   "side": "both",   "url": "/event=643/timewalking-dungeon-event"},

这个发现证实了我们的推断:所需数据以JSON格式直接嵌入在页面的初始加载内容中。

数据提取方法

一旦定位到内嵌的数据,我们可以采用以下方法进行提取:

正则表达式与JSON解析:对于像上面示例中发现的JSON格式数据,我们可以使用正则表达式从原始HTML字符串中匹配并提取出完整的JSON字符串。

Python 示例:

import requestsimport reimport jsonurl = "https://www.wowhead.com/today-in-wow"response = requests.get(url)html_content = response.text# 使用正则表达式匹配包含事件数据的JSON结构# 这里的正则表达式需要根据实际情况调整,以精确匹配目标JSON块# 假设我们知道数据在一个特定的JavaScript变量赋值或特定模式中# 这是一个简化示例,实际可能需要更复杂的匹配逻辑match = re.search(r'[s*{[^}]*"url":s*"/event=643/[^}]*}s*(?:,s*{[^}]*})*s*]', html_content)if match:    json_str = match.group(0)    try:        # 有时匹配到的可能不是一个完整的JSON数组,而是一个对象列表的一部分        # 需要根据实际情况判断是否需要手动补齐或调整匹配        # 假设我们匹配到的是一个完整的JSON数组或其一部分        data = json.loads(json_str)        for item in data:            if item.get("url") == "/event=643/timewalking-dungeon-event":                print("找到目标事件:")                print(f"名称: {item.get('name')}")                print(f"URL: {item.get('url')}")                print(f"图标: {item.get('icon')}")    except json.JSONDecodeError as e:        print(f"JSON解析错误: {e}")        print(f"匹配到的字符串: {json_str[:200]}...") # 打印部分字符串帮助调试else:    print("未找到匹配的JSON数据。")

注意: 上述正则表达式是一个示意,实际应用中需要根据目标网站的HTML结构和JavaScript代码,编写更精确和鲁棒的正则表达式来捕获完整的JSON字符串或包含数据的JavaScript变量赋值。

无头浏览器(备选方案):如果数据确实是在JavaScript执行后才完全构建到DOM中,并且无法在原始源代码中找到易于解析的JSON或变量,那么使用无头浏览器(如Selenium或Puppeteer)仍然是一个选择。无头浏览器可以模拟真实浏览器环境,执行JavaScript并等待页面完全渲染,然后通过其提供的API(如 page.evaluate() 或 driver.find_element_by_xpath())来提取数据。然而,对于本教程探讨的场景(数据已内嵌但无XHR),直接解析源代码通常更高效、资源消耗更低。

注意事项与总结

网站特异性: 这种数据内嵌的方法高度依赖于目标网站的实现方式。每次抓取前都需要对目标页面进行详细的源代码分析。正则表达式的脆弱性: 使用正则表达式匹配HTML或JavaScript代码中的数据可能不够健壮。如果网站的HTML结构或JavaScript代码发生微小变化,正则表达式可能失效。因此,需要定期检查和更新爬虫逻辑。维护成本: 相比于解析结构化的API响应,从原始HTML/JS中提取数据通常需要更高的维护成本。遵守规则: 在进行网页抓取时,务必遵守网站的 robots.txt 协议、使用条款,并注意抓取频率,避免对网站造成不必要的负担。

通过理解“无XHR请求时JavaScript生成内容”的本质,即数据很可能已内嵌于初始加载中,我们可以通过检查源代码和运用字符串匹配、JSON解析等技术,有效地提取这些看似难以获取的数据。这种方法提供了一种在传统爬虫和无头浏览器之间,更高效、更轻量级的解决方案。

无XHR请求时提取JavaScript动态生成内容的教程

以上就是无XHR请求时提取JavaScript动态生成内容的教程的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1532546.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
JavaScript无障碍访问性实现
上一篇 2025年12月20日 23:48:49
解决 Cloudinary 上传后临时文件夹未删除的问题
下一篇 2025年12月20日 23:49:03

相关推荐

  • Laravel应用常见安全威胁和防护措施

    laravel应用中常见的安全威胁包括sql注入、跨站脚本攻击(xss)、跨站请求伪造(csrf)和文件上传漏洞。防护措施包括:1. 使用eloquent orm和query builder进行参数化查询,避免sql注入。2. 对用户输入进行验证和过滤,确保输出安全,防止xss攻击。3. 在表单和a…

    2026年8月27日
    000
  • 百家号发文章的三个步骤是什么?百家号发文章方法

    在信息高速传播的今天,百家号作为国内主流自媒体平台之一,汇聚了大量内容创作者。面对激烈的竞争环境,如何让你的文章脱颖而出、吸引用户点击与关注?本文将围绕百家号发文章的三大核心步骤展开说明,帮助你高效运营账号,提升内容影响力。 一、选题策划:聚焦热点,明确方向 1. 紧跟热门趋势:热点事件往往能迅速引…

    2026年8月27日
    100
  • 如何解决临时文件管理问题?使用neutron/temporary-filesystem可以!

    可以通过一下地址学习composer:学习地址 在开发过程中,临时文件和目录的管理一直是个不小的挑战。无论是处理图片处理、数据缓存,还是需要在不同进程之间进行文件交换,我们经常会遇到以下问题: 权限问题:在某些系统上,临时文件的创建和删除可能会因为权限不足而失败。路径冲突:多进程同时操作临时文件时,…

    用户投稿 2026年8月27日
    100
  • DNS是什么意思_DNS是什么

    dns解析缓慢可通过更换公共dns(如114.114.114.114、8.8.8.8、223.5.5.5)、清除本地dns缓存(如windows执行ipconfig /flushdns)和检查网络环境来优化;dns记录类型包括1. a记录(域名指向ipv4地址)、2. cname记录(域名别名,指向…

    2026年8月27日
    300
  • 聊聊flink的Tumbling Window

    序 本文主要研究一下flink的tumbling window WindowAssigner flink-streaming-java_2.11-1.7.0-sources.jar!/org/apache/flink/streaming/api/windowing/assigners/WindowA…

    2026年8月27日
    100
  • Piti插件如何智能生成封面页_Piti插件智能生成封面页教程

    首先启用Piti插件中的智能生成封面页功能,输入主副标题后系统将推荐多种模板,用户可选择并自定义颜色字体,最后支持手动更换背景图片以完成个性化设计。 如果您在使用Piti插件时希望快速生成美观且符合内容主题的封面页,但不清楚如何操作,可以通过插件内置的智能识别功能自动匹配标题、风格与图像元素。以下是…

    2026年8月27日
    100
  • 3月14日创芯海门·全国行首站上海,聚焦硬科技!

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ “2025创芯海门·全国行”上海站盛大启幕! 3月正式开启的“2025创芯海门·全国行”系列活动,首站选择上海,将于3月14日在浦东嘉里大酒店举办南通市海门区集成电路产业(上海)推介会。 海门,…

    2026年8月27日
    000
  • 如何用Swoole构建微服务架构?

    使用swoole构建微服务架构可以通过以下步骤实现:1)利用swoole的高性能网络通信和异步i/o处理能力,搭建独立运行的微服务;2)结合consul或etcd实现服务的注册与发现;3)使用haproxy或nginx进行负载均衡;4)通过swoole的协程和异步i/o优化性能。 如何用Swoole…

    2026年8月27日
    000
  • 外媒列出iPhone 17 Air五大特点:今年最特殊的苹果手机

    随着2025年9月苹果秋季发布会的临近,关于全新iphone 17系列的爆料层出不穷。其中,新命名的iphone 17 air引起了广泛关注。近日,有国外媒体报道,总结了这款新机最值得关注的五大亮点。 第一是轻盈纤薄的机身设计。根据此前曝光的工程样机视频,iPhone 17 Air将成为苹果迄今为止…

    2026年8月27日
    100
  • 如何进入调试模式_怎样启用开发者调试模式

    启用开发者调试模式的具体步骤因设备或软件环境而异,最常见的场景是网页浏览器和安卓设备;在chrome浏览器中可通过f12快捷键或右键“检查”开启开发者工具,其中包含元素、控制台、网络等调试功能;安卓设备需在“关于手机”中连续点击“版本号”七次以激活“开发者选项”,随后可启用usb调试等功能。2. 调…

    2026年8月27日
    100
  • 使用Java将单词编码为数字序列

    本文详细介绍了如何使用Java将一个单词根据给定的字母表编码为数字序列。通过示例代码,展示了如何处理大小写问题,以及如何正确地按照单词的原始顺序进行编码。同时,还提供了将编码结果转换为字符串的方法,以便于后续处理和展示。 ### 单词编码实现在许多应用场景中,我们需要将单词按照一定的规则进行编码,例…

    2026年8月27日
    100
  • 如何在ThinkPHP中实现请求(Request)参数过滤?

    在thinkphp中,可以通过全局过滤器、自定义验证器和中间件高效地实现请求参数过滤。1. 全局过滤器在apphttpmiddleware.php中添加,适用于所有请求的统一处理。2. 自定义验证器在appvalidate目录下创建,适合针对特定模型进行细致验证。3. 中间件在appmiddlewa…

    2026年8月27日
    000
  • 微信小程序后端API开发指南

    开发微信小程序的后端api需要以下步骤:1. 熟悉restful api设计模式和相关技术;2. 设计简洁明了的api接口;3. 确保api的安全性;4. 处理并发请求和优化api性能;5. 实施api版本控制。 开发微信小程序的后端API,这可不是一件简单的事儿啊!但别担心,我会带你一步步揭开这层…

    2026年8月27日
    000
  • 168.0.1登录入口在哪里?路由器管理页面进入方法​​

    路由器管理地址通常为192.168.1.1或192.168.0.1,而非168.0.1,最准确的方法是查看路由器背面标签获取默认ip、用户名和密码;2. 若标签缺失,可通过设备查询:windows使用ipconfig命令查看“默认网关”,macos在“系统设置-网络-tcp/ip”中查看“路由器”地…

    2026年8月27日
    100
  • 微软Bing搜索加持全新Windows Search Bar

    微软近期在其官方博客中分享了关于新版windows search bar的最新进展。这款功能强大的工具依托于bing搜索引擎,堪称一款袖珍版的网络浏览器。 借助Bing的支持,用户能够通过Windows Search Bar获取任何他们感兴趣的信息,甚至包括数学计算。这种改进使得其操作方式与谷歌Ch…

    2026年8月27日
    200
  • Nothing Essential Space更新 新增日历同步与编辑功能

    此前nothing在其phone (3)及cmf phone产品中推出了“essential space”功能,该功能允许用户通过essential key保存日常使用手机时的重要信息。近日,nothing为phone (3)系列带来了该功能的更新版本。 据悉,此次更新无需系统升级,将通过Googl…

    2026年8月27日
    100
  • Laravel与社交媒体登录(OAuth)集成

    在laravel框架中集成社交媒体登录可以通过使用laravel socialite包来实现。1.安装socialite包:使用composer require laravel/socialite。2.配置服务提供者和别名:在config/app.php中添加相关配置。3.设置api凭证:在.env…

    2026年8月27日
    000
  • ai豆包网页版在线入口2025

    豆包AI网页版([https://www.php.cn/link/83d81ef47f0e9a205fb66a100f3179bf](https://www.php.cn/link/83d81ef47f0e9a205fb66a100f3179bf))是一款功能强大的AI,具备海量知识储备,涵盖科学、…

    2026年8月27日
    000
  • 微软计划首先让macOS获取Chromium版Edge浏览器

    微软承诺,基于chromium内核的全新微软edge浏览器将会兼容windows 7、8和8.1版本,同时也支持windows 10系统。此外,微软还宣布新浏览器也将适用于mac os平台。不过,现阶段chromium内核的edge浏览器预览版仅限于windows 10用户使用,微软表示后续会逐步扩…

    2026年8月27日
    300
  • 敏感数据加密传输(AES/RSA)

    使用aes和rsa可以确保敏感数据在传输过程中的安全性。1)rsa用于加密aes密钥,2)aes用于加密实际传输的数据,这种混合加密方案既高效又安全。 你问到了敏感数据加密传输的问题,使用AES和RSA是非常常见且有效的做法。让我们从我个人的经验出发,深入探讨一下如何利用AES和RSA来确保数据在传…

    2026年8月27日
    200

发表回复

登录后才能评论
关注微信