Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
R语言网络爬虫:高效解析HTML中内嵌的JSON数据_创想鸟

R语言网络爬虫:高效解析HTML中内嵌的JSON数据

R语言网络爬虫:高效解析HTML中内嵌的JSON数据

本教程详细介绍了如何使用R语言从包含JSON数据的HTML页面中提取并解析所需信息。针对网页源代码中JSON数据被HTML标签包裹的情况,我们将利用rvest包获取页面内容,并通过html_text()提取原始文本,随后借助jsonlite包的parse_json()函数将JSON字符串转换为R数据结构,最终实现对嵌套数据的精确抽取。

1. 引言:解析HTML中JSON的挑战

在进行网络爬虫时,我们通常会遇到两种主要的数据格式:html和json。传统上,rvest包擅长处理标准的html结构,通过css选择器或xpath来定位和提取元素。然而,有些网站会将json数据直接嵌入到html页面的

标签内,而不是作为独立的api响应。在这种情况下,直接使用html_nodes()等html解析函数将无法识别这些被包裹的json内容,因为它们不是标准的html元素

例如,如果网页源代码看起来像这样:

[ {"title1": "abc 123", "title2": "bca 321", ...}, ...]

rvest会将其视为一个包含文本内容的

标签,而不是一个可直接解析的JSON结构。本教程的目标就是解决这一挑战,展示如何有效地从这类HTML页面中提取并解析JSON数据。

2. 环境准备与数据获取

首先,我们需要加载处理HTML和JSON的R包:rvest用于网页抓取,jsonlite用于JSON解析。

# 安装(如果尚未安装)# install.packages("rvest")# install.packages("jsonlite")# 加载必要的库library(rvest)library(jsonlite)# 目标URL(请替换为实际网址)# 假设这个URL返回的HTML内容中包含JSON字符串url <- "https://mywebsite.com/data.json" # 示例URL,实际可能是一个普通的HTML页面page <- read_html(url)# 查看初始加载结果print(page)# 结果可能类似:# {html_document}# # [1] 

[n{n"title1" : "abc 123",n"title2" : "bca 321",n"title3" : "cba 213 ...

从print(page)的输出中可以看出,尽管我们使用read_html加载了页面,但内容仍然被

等HTML标签包裹,且内部文本是JSON格式。此时,直接尝试page %>% html_nodes(“title4”)将返回空结果,因为title4并非HTML标签,而是JSON内部的一个键。

立即学习“前端免费学习笔记(深入)”;

3. 从HTML文档中提取原始JSON字符串

解决问题的关键在于将html_document对象中包含JSON的原始文本内容提取出来。rvest包的html_text()函数正是为此设计的。它能够获取指定HTML节点内的所有文本内容,忽略HTML标签本身。

由于我们的JSON数据被包裹在

标签内,我们可以尝试获取整个页面的文本内容,或者更精确地定位到包含JSON的特定节点。在多数情况下,如果JSON是页面唯一或主要的文本内容,直接对整个html_document对象使用html_text()即可。

# 提取整个HTML文档的文本内容json_string <- html_text(page)# 查看提取出的字符串# print(json_string)# 此时,json_string 应该是一个纯粹的JSON字符串,例如:# "[n{n"title1" : "abc 123",n"title2" : "bca 321", ...}]"

现在,我们得到了一个纯净的JSON格式字符串,可以进行下一步的解析。

4. 解析JSON字符串为R数据结构

有了JSON字符串后,jsonlite包的parse_json()函数就派上用场了。这个函数可以将JSON格式的字符串转换为R中的列表(list)或数据框(data.frame)等数据结构。

一个非常实用的参数是simplifyDataFrame = TRUE。当JSON结构允许时,它会尝试将嵌套的JSON对象自动转换为数据框,从而大大简化后续的数据操作。

# 使用jsonlite::parse_json解析JSON字符串# simplifyDataFrame = TRUE 会尝试将JSON数组和对象转换为数据框parsed_data <- jsonlite::parse_json(json_string, simplifyDataFrame = TRUE)# 查看解析后的数据结构str(parsed_data)# 结果可能类似:# 'data.frame': 2 obs. of  4 variables:#  $ title1: chr  "abc 123" "aec 183"#  $ title2: chr  "bca 321" "bga 351"#  $ title3: chr  "cba 213" "cha 293"#  $ title4:'data.frame':   2 obs. of  2 variables:#   ..$ title5: chr  "title6" "title6"#   ..$ title7:List of 2#   .. ..$ : num  -17662 987622#   .. ..$ : num  -1.62e+09 6.52e+08

从str(parsed_data)的输出可以看到,JSON数据已经被成功解析为一个R数据框。其中title4本身又是一个嵌套的数据框,而title7则是一个包含数字向量的列表。

5. 数据提取与整理

现在数据已经转换为R对象,我们可以通过标准的R数据访问方式(如$操作符)来提取所需的信息。根据原始问题,我们希望提取每个“块”中title7的值。

parsed_data现在是一个数据框,我们可以通过parsed_data$title4访问到嵌套的title4数据框,再通过parsed_data$title4$title7访问到title7列表。由于title7是一个包含多个数字向量的列表,我们可以使用do.call(rbind, …)将其合并成一个矩阵。

# 提取 title7 的数据title7_matrix <- do.call(rbind, parsed_data$title4$title7)# 查看结果print(title7_matrix)# 预期输出:#               [,1]        [,2]# [1,] -1.766235e+04    987621.8# [2,] -1.621626e+09 652238322.1# 如果需要将其转换为数据框并添加ID列final_result <- as.data.frame(title7_matrix)colnames(final_result) <- c("title7_1", "title7_2")final_result$id <- 1:nrow(final_result)final_result <- final_result[, c("id", "title7_1", "title7_2")] # 调整列顺序print(final_result)# 预期输出:#   id      title7_1    title7_2# 1  1 -1.766235e+04    987621.8# 2  2 -1.621626e+09 652238322.1

通过以上步骤,我们成功地从HTML页面中提取并整理出了所需的JSON数据。

6. 注意事项与最佳实践

URL类型识别: 在某些情况下,如果URL直接指向一个纯JSON文件(例如以.json结尾),则可以直接使用jsonlite::fromJSON(url, simplifyDataFrame = TRUE)来一步到位地获取和解析数据,而无需rvest。本教程的方法适用于JSON被HTML标签包裹的情况。JSON结构理解: 在进行数据提取前,务必通过查看原始JSON字符串或使用str()函数了解其结构。这有助于正确地使用$操作符进行访问。错误处理: 网络请求可能失败,或者JSON字符串可能格式不正确。建议在实际项目中加入错误处理机制,例如使用tryCatch来捕获潜在的错误。simplifyDataFrame的权衡: simplifyDataFrame = TRUE虽然方便,但在某些极端复杂的嵌套JSON结构中可能无法完全将所有数据转换为数据框,此时可能需要手动处理列表结构。字符编码 确保在读取和解析过程中正确处理字符编码,避免乱码问题。rvest通常能较好地处理常见编码,但如果遇到特殊情况,可能需要手动指定编码。

7. 总结

本教程展示了在R语言中处理HTML页面内嵌JSON数据的完整流程。通过结合rvest包的read_html()和html_text()函数来获取原始JSON字符串,再利用jsonlite包的parse_json()函数进行高效解析,最终能够灵活地提取和整理出所需的数据。这种方法弥补了传统HTML解析在面对此类特定场景时的不足,极大地扩展了R语言在网络数据抓取方面的能力。掌握这一技巧,将使您在处理各种复杂网页数据时更加游刃有余。

以上就是R语言网络爬虫:高效解析HTML中内嵌的JSON数据的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1580474.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
使用CSS Flexbox创建分段式高度的水平边框线
上一篇 2025年12月22日 21:30:31
生成持久化自增代理码的Web实现教程
下一篇 2025年12月22日 21:30:49

相关推荐

  • AffinityDesigner如何导出AI生成的矢量图片?保存图像的步骤

    答案是选择合适的矢量格式并调整导出设置。在Affinity Designer中导出AI生成的矢量图时,应根据用途选择SVG(适用于Web)、PDF(适用于打印和跨平台分享)或EPS(适用于老旧系统);导出前需检查文本是否转曲、颜色模式是否正确,并优化路径与位图设置以平衡质量与文件大小;从其他AI工具…

    2026年9月22日
    000
  • PHPJSON数据怎么解析_PHP处理JSON数据格式

    PHP使用json_decode()解析JSON数据,传入字符串和true参数可转为数组,适用于API响应、文件读取等场景,需配合json_last_error()检查解析是否成功。 PHP解析JSON数据非常简单,主要依靠内置的两个函数:json_decode() 和 json_encode()。…

    2026年9月22日
    100
  • PHP框架日志系统怎么记录错误_PHP框架日志系统配置指南

    PHP框架通过配置日志级别、通道和处理器,结合Monolog库实现错误记录。以Laravel和Symfony为例,可在配置文件中定义多通道(如文件、Slack)、设置不同级别(ERROR、CRITICAL),并通过门面或服务在代码中捕获异常并写入上下文信息。 PHP框架的日志系统记录错误,核心在于通…

    2026年9月22日
    000
  • Spring Boot自定义Kafka配置与动态Bean注册最佳实践

    本文探讨了在Spring Boot应用中通过自定义注解简化Kafka配置的挑战与解决方案。重点介绍了如何利用META-INF/spring.factories实现早期自动配置,并详细阐述了使用ImportBeanDefinitionRegistrar在应用上下文初始化早期动态注册Kafka生产者工厂…

    2026年9月22日
    100
  • 构建VSCode多媒体编程界面与实时音视频处理

    答案:VSCode通过配置Node.js、Python扩展及FFmpeg等工具,结合OpenCV、PyAudio等框架,可构建高效音视频处理环境。1. 安装Python和Node.js支持,启用Pylance、Jupyter插件提升数据处理体验;2. 配置终端与Code Runner实现脚本一键执行…

    2026年9月22日
    100
  • 在Java中如何开发简易问答社区

    答案是Java结合Spring Boot可快速构建问答社区,通过设计questions、answers、users三张表实现数据存储,使用JPA进行持久化,前端用HTML+JS调用后端API完成用户提问、回答、查看与互动功能。 开发一个简易问答社区,核心是实现用户提问、回答、查看问题和互动功能。Ja…

    2026年9月22日
    100
  • PHP 数组元素按日期条件过滤与删除:避免常见陷阱

    本教程详细介绍了如何在 PHP 中根据日期条件动态删除数组(或对象数组)中的元素。文章将重点讲解如何正确进行日期比较,特别是当数据源为 JSON 格式时,以及 unset 函数在遍历过程中移除元素时的正确用法,帮助开发者避免常见的字符串日期比较和对象属性访问错误。 简介 在数据处理中,根据特定条件过…

    2026年9月22日
    100
  • 如何用Blender打造AI生成3D视频?免费软件制作AI视频的步骤

    如何用Blender打造AI生成3D视频?免费软件制作AI视频的步骤如何用Blender打造AI生成3D视频?免费软件制作AI视频的步骤如何用Blender打造AI生成3D视频?免费软件制作AI视频的步骤如何用Blender打造AI生成3D视频?免费软件制作AI视频的步骤

    答案是可行,通过Blender与免费AI工具结合,构建以AI辅助概念设计、纹理生成和动作参考,Blender主导建模、动画与渲染的混合工作流,实现高效3D视频创作。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 用Blender制作AI生成…

    2026年9月22日 用户投稿
    200
  • Java类中Jackson @JsonNaming策略的运行时内省

    本文介绍如何在运行时动态内省Java类上通过@JsonNaming注解配置的Jackson PropertyNamingStrategy。通过利用ObjectMapper的SerializationConfig和JacksonAnnotationIntrospector,开发者可以编程方式获取类的命…

    2026年9月22日
    600
  • 解决PHP扩展缺失错误:phpinfo验证与服务重启指南

    本文旨在解决%ignore_a_1%脚本运行时提示特定扩展(如json、mbstring)缺失的问题,即便用户已在php配置中手动启用。核心解决方案是利用`phpinfo()`函数验证扩展的实际加载状态,并强调在修改php配置后,必须重启相关的web服务器或php-fpm服务,以确保新的配置生效。 …

    2026年9月22日
    400
  • PHP数组中JSON字符串值的解析与访问教程

    本教程将详细指导如何在PHP中处理包含JSON字符串的数组。通过利用json_decode()函数,您可以轻松地将这些JSON字符串转换为可操作的PHP数组,进而提取并访问其中嵌套的shortname、fullname等具体字段,从而实现对复杂数据结构的有效管理和利用。 理解问题:PHP数组中的JS…

    2026年9月22日
    100
  • mac怎么设置动态壁纸_mac设置动态壁纸方法

    可通过系统设置直接启用macOS自带的动态桌面;2. 利用iCloud同步功能实现Apple设备间的动态壁纸共享;3. 安装第三方应用扩展更多动态效果如视频或实时天气;4. 手动将.heic或.mov格式文件添加至指定目录以设置自定义动态壁纸。 如果您希望为Mac增添个性化视觉体验,可以将动态壁纸设…

    2026年9月22日
    300
  • unix怎么安装php_unix系统安装php环境指南

    首先确认系统环境并检查是否已安装相关软件,然后选择包管理器或源码编译方式安装PHP;推荐使用包管理器快速安装,如Debian/Ubuntu用apt,CentOS/RHEL/Fedora用yum或dnf,FreeBSD用pkg;安装后配置Web服务器,Apache需加载mod_php或集成PHP-FP…

    2026年9月22日
    300
  • itextpdf freemarker渲染

    关于打印pdf操作的需求,经过研究,发现以下两种方法: 在现有的模板上进行编辑,这种方法操作难度较大。而通过FreeMarker生成静态页面,然后转换为HTML,操作更为顺畅。动态生成PDF的方法在网上参考较多,经过对比,我认为使用FreeMarker结合IText生成PDF最为简单。参考链接为ht…

    2026年9月22日
    500
  • 设计VSCode三维图形编程界面与WebGL实时预览模块

    VSCode通过集成WebGL预览插件实现三维图形编程的实时反馈,利用扩展架构提供GLSL语法支持、文件关联及命令注册,并通过Webview嵌入渲染窗口,结合消息通信与动态编译技术实现实时预览,配合保存自动刷新、错误定位与多视图布局优化交互体验,构建高效闭环开发环境。 在使用 VSCode 进行三维…

    2026年9月22日
    200
  • 密码管理器是如何安全地存储和填充大量复杂密码的,其工作原理是什么?

    密码管理器通过主密码生成加密密钥,在设备端使用AES-256等算法加密数据,结合PBKDF2或Argon2密钥派生函数增强安全性;加密后数据经HTTPS同步至云端,服务商无法访问明文,实现零知识存储;登录时浏览器插件匹配URL与表单,用户确认后在内存中解密并填充凭证,不暴露数据库或明文;支持生成唯一…

    2026年9月22日
    100
  • 使用Sublime管理MySQL数据库结构_高效编辑表结构与字段定义脚本

    使用Sublime管理MySQL数据库结构_高效编辑表结构与字段定义脚本使用Sublime管理MySQL数据库结构_高效编辑表结构与字段定义脚本使用Sublime管理MySQL数据库结构_高效编辑表结构与字段定义脚本使用Sublime管理MySQL数据库结构_高效编辑表结构与字段定义脚本

    用 sublime text 管理 mysql 数据库结构脚本高效且灵活。1. 适合习惯文本编辑、需自定义流程的开发者;2. 启动快、资源占用低,支持多光标、正则替换,插件丰富,易配合 git;3. 建议每张表单独文件、按模块分目录、主脚本汇总建表语句,索引外键单独文件;4. 推荐插件有 sqlto…

    2026年9月22日 用户投稿
    200
  • laravel Spatie/laravel-medialibrary包高级用法_Laravel Spatie Medialibrary高级功能使用方法

    Spatie/laravel-medialibrary 支持自定义磁盘路径、响应式图像、WebP格式、媒体集合分类、自定义属性存储及签名URL安全访问,并可通过队列异步处理文件转换,提升性能与安全性。 在 Laravel 应用中,Spatie/laravel-medialibrary 是处理文件上传…

    2026年9月22日
    1300
  • 米侠浏览器网页字体乱码怎么办 米侠浏览器字体显示异常修复方法

    字体乱码通常因编码错误、缓存问题或字体缺失引起。2. 首先尝试在米侠浏览器中切换网页编码为UTF-8、GBK或GB2312。3. 清除缓存、Cookie和网站数据可解决加载异常。4. 确保设备安装了常用中文字体如思源黑体或微软雅黑。5. 更新或重装最新版米侠浏览器以排除兼容性问题。6. 若仍无效,可…

    2026年9月22日
    100
  • Spring Boot集成MongoDB Atlas:正确配置与故障排除

    本教程详细指导如何在Spring Boot应用中正确配置与连接MongoDB Atlas集群。我们将重点讲解如何获取并使用正确的Atlas连接URI,安全地处理用户认证信息,以及准确指定目标数据库。通过实例代码和常见错误排查,帮助开发者避免连接失败,确保应用与MongoDB Atlas的顺畅集成。 …

    2026年9月22日
    600

发表回复

登录后才能评论
关注微信