R语言网页抓取:从HTML文档中提取内嵌JSON数据

R语言网页抓取:从HTML文档中提取内嵌JSON数据

本教程详细阐述了如何使用R语言从看似HTML但实际包含JSON字符串的网页中高效提取数据。核心步骤包括利用rvest库获取页面文本内容,然后结合jsonlite库将提取到的JSON字符串解析为R数据结构,最终实现对嵌套数据的精准抽取与整理,特别适用于处理API响应或动态加载的数据。

1. 引言:理解问题与挑战

在进行网页数据抓取(web scraping)时,我们通常会遇到各种数据格式。一种常见但容易令人困惑的情况是,网页的源代码(html)中并没有清晰的html标签来组织我们所需的数据,而是将完整的json格式数据直接嵌入到某个html元素(如

)的文本内容中。

例如,一个网页的HTML结构可能看起来像这样:

[ { "title1": "abc 123", "title2": "bca 321", "title3": "cba 213", "title4": {"title5": "title6", "title7": [ -17662.3456, 987621.7654]} }, ...]

在这种情况下,如果我们尝试使用rvest库的html_nodes()函数去查找像title4这样的”标签”,将会一无所获,因为title4并非HTML标签,而是JSON对象中的一个键。正确的做法是识别出内嵌的JSON字符串,并将其作为纯文本提取出来,再进行JSON解析。

2. 所需R包

为了解决这个问题,我们需要以下两个R包:

rvest: 用于从网页读取HTML内容并提取文本。jsonlite: 用于解析JSON格式的字符串数据。

如果尚未安装,请使用以下命令安装它们:

立即学习“前端免费学习笔记(深入)”;

install.packages(c("rvest", "jsonlite"))

3. 抓取并初步检查网页内容

首先,我们需要使用rvest库来加载目标网页。read_html()函数会读取URL并将其解析为一个HTML文档对象。

library(rvest)library(jsonlite) # 提前加载jsonlite# 示例URL,请替换为您的实际URL# 注意:本示例使用了一个假设的URL,实际操作中请替换为包含JSON的真实网页url <- "https://mywebsite.com/data.json" # 假设这是一个直接返回JSON的URL,或包含JSON的HTML页面page <- read_html(url)# 检查页面对象print(page)# 预期输出可能类似:# {html_document}# # [1] 

[n{n"title1" : "abc 123",n"title2" : "bca 321", ...

从print(page)的输出中,我们可以看到JSON数据被包裹在HTML标签(如

)中。str(page)则会显示这是一个xml_document或html_document对象,而不是一个可以直接操作的JSON结构。

4. 提取原始JSON字符串

这是解决问题的关键一步。由于JSON数据是作为HTML元素(例如

标签)的文本内容存在的,我们需要使用html_text()函数来提取这些文本。如果JSON数据是整个页面的主要内容,直接对整个page对象使用html_text()即可。如果JSON数据位于某个特定的HTML标签内,则需要先定位到该标签,再提取其文本。

在本例中,假设JSON数据是页面主体内容,直接提取整个页面的文本通常是有效的:

# 提取整个HTML文档的纯文本内容json_string <- html_text(page)# 打印前几行查看提取到的字符串cat(substr(json_string, 1, 500)) # 打印前500个字符

此时,json_string变量中存储的就是我们需要的完整JSON格式字符串。

5. 解析JSON数据

有了纯净的JSON字符串后,我们就可以使用jsonlite库的parse_json()函数来将其解析为R中的数据结构。

parse_json()函数会将JSON字符串转换为R的列表(list)结构。一个非常有用的参数是simplifyDataFrame = TRUE,它会尝试将嵌套的JSON对象和数组自动转换为R的数据框(data.frame),从而大大简化了后续的数据操作。

# 使用jsonlite解析JSON字符串parsed_data <- parse_json(json_string, simplifyDataFrame = TRUE)# 检查解析后的数据结构str(parsed_data)

通过str(parsed_data)的输出,我们可以清晰地看到JSON数据已经被成功转换为R中的列表和数据框的组合。例如,它可能显示parsed_data是一个包含多个观测值的列表,每个观测值又是一个包含title1、title2、title3和title4的数据框。而title4本身又是一个数据框,其中包含title5和title7。title7则是一个列表,每个元素是包含两个数值的向量。

6. 访问和整理目标数据

根据str(parsed_data)的输出,我们可以通过$符号逐级访问到我们感兴趣的数据。我们的目标是提取所有“块”中的title7数据,并将其整理成一个包含id、title7_1和title7_2列的数据框。

# 访问目标数据:parsed_data$title4$title7# 此时parsed_data$title4$title7是一个列表,每个元素是一个包含两个数值的向量# 将列表转换为矩阵extracted_title7_matrix <- do.call(rbind, parsed_data$title4$title7)# 将矩阵转换为数据框final_df <- as.data.frame(extracted_title7_matrix)# 为数据框的列命名colnames(final_df) <- c("title7_1", "title7_2")# 添加id列final_df$id <- 1:nrow(final_df)# 调整列的顺序以符合预期输出final_df <- final_df[, c("id", "title7_1", "title7_2")]# 打印最终结果print(final_df)

最终的final_df数据框将包含id、title7_1和title7_2三列,满足了我们对数据提取和整理的要求。

7. 注意事项与最佳实践

URL的准确性: 确保您提供的URL确实是包含目标JSON数据的页面。有时JSON数据是通过JavaScript动态加载的,直接抓取HTML可能无法获取到。在这种情况下,您可能需要检查浏览器的开发者工具(Network标签页)来找到实际加载JSON数据的API请求。JSON结构的理解: 在解析之前,通过浏览器开发者工具或在线JSON格式化工具检查JSON的实际结构非常重要。这将帮助您理解数据的嵌套层级,从而正确地使用$符号进行访问。错误处理: 在实际应用中,网页抓取容易遇到各种问题,例如网络连接失败、页面结构变化、JSON格式错误等。建议使用tryCatch或其他错误处理机制来提高代码的健壮性。parse_json() vs fromJSON(): jsonlite包提供了parse_json()和fromJSON()两个函数。parse_json()更底层,返回R列表;fromJSON()则更高级,可以直接读取文件或URL,并尝试将JSON数据直接转换为数据框。对于复杂或嵌套结构,parse_json()结合simplifyDataFrame = TRUE通常更灵活,能更好地控制解析过程。数据类型转换: jsonlite在解析时会尝试推断数据类型。如果JSON中的数值是字符串形式,或者存在混合类型,可能需要手动进行类型转换。性能考虑: 对于非常大的JSON文件或频繁的抓取,考虑缓存数据或优化解析逻辑。

8. 总结

通过本教程,我们学习了如何使用R语言有效处理网页中内嵌的JSON数据。核心流程包括:

利用rvest::read_html()加载网页。使用rvest::html_text()从HTML文档中提取包含JSON的纯文本字符串。借助jsonlite::parse_json()(配合simplifyDataFrame = TRUE)将JSON字符串解析为R中的数据结构。通过列表和数据框的索引操作,精准提取并整理出所需的数据。

掌握这一技巧,将使您能够更灵活地从各种网页源中获取和处理数据,特别是那些依赖JSON进行数据交换的现代Web应用。

以上就是R语言网页抓取:从HTML文档中提取内嵌JSON数据的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1580390.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
上一篇 2025年12月22日 21:26:01
下一篇 2025年12月22日 21:26:13

相关推荐

  • 如何利用JS脚本在浏览器中获取IP地址和地理位置信息?

    如何在浏览器中获取ip地理位置信息 要获取ip地址和地理位置信息,可以利用http://ip.tanwan.com/index.php?action=ipinfo&format=js提供的js脚本,但该脚本请求类型为文档,并不适用于ajax请求。 解决方法:像cdn一样引入脚本 一种可行的解…

    2025年12月24日
    100
  • 如何使用Ajax从远程JS文件获取IP信息并展示在HTML元素中?

    如何利用ajax获取远程数据并赋值给html元素? 你提供的url是一个js文件,其中包含了ip信息。虽然该文件可以通过ajax获取,但需要注意的是,对于document类型的请求是无法使用ajax的。因此,通常会采取类似cdn引入的方式来获取这类数据。 代码演示: 在html文件中加入必要的脚本引…

    2025年12月24日
    000
  • 为什么CSS中多个类选择器声明时,最后声明的样式会覆盖前面的样式?

    探究类选择器样式的覆盖规则 给定如下html和css代码: html: 展示的内容立即学习“前端免费学习笔记(深入)”; css: .a1 { color: red;}.a2 { color: green;}.a3 { color: blue;} 元素的文本显示为蓝色,这是为什么? 答案: 由于cs…

    2025年12月24日
    000
  • 如何用 style.css 覆盖页面中的内联样式?

    样式覆盖:在 style.css 中覆盖内联样式 对于css样式覆盖的问题,您提到无法在style.css中使用max-width覆盖页面中的.goods_dialog样式,即使加了!important,这确实是一个常见的问题。 解决方法是增加css选择器的权重。权重是css选择器的一个属性,它决定…

    2025年12月24日
    000
  • 如何使用 CSS clip-path 在长方形中创建直角梯形?

    长方形中实现直接梯形,利用clip-path一招搞定 如何在长方形中实现一个直接梯形,这个问题让许多开发者伤透脑筋。不过,利用css的clip-path属性,就可以轻松解决。 clip-path属性可以让我们使用多边形(polygon)来裁剪元素的形状。在我们的例子中,我们将使用以下多边形来创建一个…

    2025年12月24日
    000
  • offsetWidth 为什么出错了?

    offsetWidth为何报错? 在网页中,您希望获取offsetWidth值,却无故报错。 问题根源: 使用offsetWidth时,需要确保元素具有可见的宽度。 解决方案: 根据您提供的代码片段,您试图获取一个带有focus类名的元素的offsetWidth。以下是可能导致问题的两个原因: 您使…

    2025年12月24日
    000
  • CSS(层叠样式表):网页的样式和布局

    css(层叠样式表)是使网页具有视觉吸引力的重要工具。 html(超文本标记语言) 提供网页的结构和内容,而 css 负责设计、布局和整体呈现。 css 允许开发人员控制网站的外观和感觉,从颜色和字体到间距和布局,确保用户体验既具有视觉吸引力,又在不同设备上保持一致。 本文将介绍 css 的基础知识…

    2025年12月24日
    000
  • HTML/CSS 课程 – 课程或年级

    html/css 课程 – 第 1 课细分 第 1 课:基本 html 回顾和高级 html 元素简介 目标: 刷新基础 html 标签。引入中级html元素来构建更多功能性网页。 1。 html结构简介 首先简要说明 html 如何使用标签组织网页内容。强调html(超文本标记语言)用…

    2025年12月24日
    000
  • css伪类选择器怎么用

    CSS伪类选择器是一种选择特定状态或行为元素的特殊选择器,使用element:pseudo-class语法,常见伪类包括:hover(悬停)、active(激活)、focus(焦点)、link(链接)和visited(访问过)。可用于为元素悬停、激活、获得焦点、链接和访问时应用样式,例如为按钮悬停时…

    2025年12月24日
    000
  • div在css中是什么意思

    在CSS中,DIV表示一个块级元素,用于创建可通过CSS样式化的容器,包含任何类型的HTML内容,并可用于组织、分组,并通过CSS灵活布局,并可添加语义信息。与SPAN不同,DIV是块级元素用于创建容器,而SPAN是内联元素用于样式化文本。 DIV在CSS中的含义 在层叠样式表(CSS)中,DIV是…

    2025年12月24日
    000
  • ridge在css中是什么意思

    ridge是CSS中的边框样式,用于创建具有浮雕效果的3D边框,具体表现为一条凸起的山脊状线条。 什么是ridge? ridge是CSS中的一种边框样式,用于创建具有浮雕效果的3D边框。 ridge样式的具体效果 ridge样式的边框呈现为一条凸起的、类似于山脊的线条。在较新的浏览器上,ridge样…

    2025年12月24日
    000
  • css样式表里优先级别最高的是哪个

    CSS样式表中优先级最高的样式是内联样式,它直接嵌入到HTML元素中,作用于特定的元素。其语法为文本,并高于嵌入式样式和外部样式。 CSS样式表中优先级最高的样式 CSS样式表中优先级最高的样式是内联样式。 内联样式直接嵌入到HTML元素中,使用style属性。由于它作用于特定的元素,因此优先级高于…

    2025年12月24日
    000
  • css样式写在哪个位置

    CSS样式可写入以下三个位置:行内样式:直接写入HTML元素的style属性中。内部样式表:在标签内的元素中编写。外部样式表:写在单独的.css文件中,并通过标签链接到HTML页面。通常,根据具体情况选择最合适的样式写入位置。 CSS样式写入位置 CSS(Cascading Style Sheets…

    2025年12月24日
    000
  • css选择器优先级最高的是什么

    CSS 选择器优先级最高的是内联样式,它直接写在 HTML 元素的 style 属性中,具有最高的优先级,其他优先级依次为:ID 选择器、类选择器、元素选择器、通配符选择器。 CSS选择器优先级最高的是什么? 在CSS中,选择器优先级决定了哪些样式规则将被应用到元素上。优先级最高的规则将覆盖优先级较…

    2025年12月24日
    000
  • 常见的CSS3选择器有哪些?

    CSS3是一种用于网页设计的样式表语言,它具有丰富的选择器,这些选择器可以帮助我们更精确地指定要样式化的HTML元素。下面将介绍一些常用的CSS3选择器,并给出相应的代码示例。 元素选择器(Element Selector)元素选择器是最基本的选择器,可以选择HTML文档中的特定元素进行样式化。例如…

    2025年12月24日
    000
  • 使用CSS Transform进行元素的变换

    CSS中Transform的用法 CSS的Transform属性是一种非常强大的工具,可以对HTML元素进行平移、旋转、缩放和倾斜等操作。它可以极大地改变元素的外观,使网页更富有创意和动感。在本文中,我们将详细介绍Transform的各种用法,并提供具体的代码示例。 一、平移(Translate) …

    2025年12月24日
    000
  • CSS样式无法正常显示的解决方式

    CSS显示不出来怎么办,需要具体代码示例 CSS(层叠样式表)是一种用于描述网页元素样式的标记语言,通过设定不同的样式规则,可以控制网页的布局、颜色、字体等外观效果。然而,有时候我们会遇到CSS显示不出来的问题,导致网页无法正常呈现所设定的样式。本文将介绍一些常见的CSS显示问题,并提供具体的代码示…

    2025年12月24日
    000
  • css的尺寸单位有哪些

    CSS的尺寸单位有很多种,每种单位都有其适用的场景和用途。下面将详细介绍常用的CSS尺寸单位,并提供相应的代码示例。 像素(px)像素是最常用的尺寸单位之一。它是相对于屏幕的物理像素来进行度量的,具有固定的大小。在书写CSS样式时,可以直接使用像素作为宽度、高度、边框、内外边距等属性的值。例如: d…

    2025年12月24日
    000
  • css层叠样式表的三种应用方式是什么

    CSS层叠样式表是一种用于控制网页样式和布局的语言,具有广泛的应用。在CSS中,有三种应用方式,分别是内联样式、内部样式和外部样式。下面将为您详细介绍这三种应用方式,并附上具体的代码示例。 内联样式(Inline Style):内联样式是将CSS样式直接写在HTML元素的style属性中。这种方式的…

    2025年12月24日
    000
  • css中hover怎么使用

    CSS中的hover伪类是一个非常常用的选择器,它允许我们在鼠标悬停在元素上时改变其样式。本文将为大家介绍hover的用法,并提供具体的代码示例。 一、基本用法要使用hover,我们需要先为该元素定义一个样式,然后使用:hover伪类来制定鼠标悬停时对应的样式。例如,我们有一个button元素,当鼠…

    2025年12月24日
    000

发表回复

登录后才能评论
关注微信