使用 PySpark 将 JSON 属性数据透视为表格列

程序猿 • 2025年12月14日 08:28:09 • 好文分享 • 阅读 0

本教程详细介绍了如何使用 PySpark 将 Oracle REST API 返回的 JSON 数组数据（其中属性名和属性值以键值对形式存在）转换为结构化的表格格式。通过 PySpark 读取 JSON 数据并结合 Spark SQL 的 MAX(CASE WHEN …) 语句，实现将动态属性名称（如 ‘LOG_ID’ 和 ‘BUSINESS_UNIT’）透视为独立的列，从而方便数据分析和处理。

在数据集成和处理过程中，我们经常会遇到来自 rest api 的响应数据，其结构可能并非传统的行列表格形式。例如，某些 api 会以键值对数组的形式返回数据，其中每个对象包含一个属性名（attributename）和对应的属性值（attributevalue）。当需要将这些动态的属性名转换为固定的列，并将其对应的属性值填充到这些列中时，传统的转换方法可能不够灵活。本教程将展示如何利用 pyspark 的强大能力，特别是结合 spark sql，高效地实现这种数据透视操作。

问题描述

假设我们从 Oracle REST API 获得以下 JSON 响应数据：

[    {        "attributeId": 300000000227671,        "attributeName": "BUSINESS_UNIT",        "attributeType": "Number",        "attributeValue": "300000207138371",        "timeBuildingBlockId": 300000300319699,        "timeBuildingBlockVersion": 1    },    {        "attributeId": 300000000226689,        "attributeName": "LOG_ID",        "attributeType": "Number",        "attributeValue": "300000001228038",        "timeBuildingBlockId": 300000300319699,        "timeBuildingBlockVersion": 1    }]

我们的目标是将 attributeName 为 ‘LOG_ID’ 和 ‘BUSINESS_UNIT’ 的 attributeValue 提取出来，并将其转换为以下表格形式：

LOG_ID BUSINESS_UNIT

300000001228038300000207138371

解决方案：使用 PySpark 和 Spark SQL

PySpark 提供了强大的数据处理能力，结合 Spark SQL，可以非常灵活地处理这种数据透视场景。核心思路是先将 JSON 数据加载到 DataFrame 中，然后利用 Spark SQL 的条件聚合函数（CASE WHEN 和 MAX）实现透视。

步骤一：加载 JSON 数据到 DataFrame

首先，我们需要将 JSON 响应数据加载到 PySpark DataFrame 中。假设 json_data 是包含上述 JSON 字符串的变量。

from pyspark.sql import SparkSession# 初始化 SparkSessionspark = SparkSession.builder.appName("JsonPivotTutorial").getOrCreate()sc = spark.sparkContext# 模拟 JSON 数据，实际应用中可能是从文件或API响应获取json_data = """[    {        "attributeId": 300000000227671,        "attributeName": "BUSINESS_UNIT",        "attributeType": "Number",        "attributeValue": "300000207138371",        "timeBuildingBlockId": 300000300319699,        "timeBuildingBlockVersion": 1    },    {        "attributeId": 300000000226689,        "attributeName": "LOG_ID",        "attributeType": "Number",        "attributeValue": "300000001228038",        "timeBuildingBlockId": 300000300319699,        "timeBuildingBlockVersion": 1    }]"""# 将 JSON 字符串转换为 RDD 并读取为 DataFrame# 注意：如果 json_data 是一个列表，可以直接使用 spark.createDataFrame()# 但如果是一个多行 JSON 字符串，或者需要更灵活地处理，spark.read.json(sc.parallelize([json_data])) 是一个有效方法df = spark.read.json(sc.parallelize([json_data]))# 查看原始 DataFrame 结构df.printSchema()df.show(truncate=False)

执行上述代码后，df 将包含解析后的 JSON 数据，每行对应 JSON 数组中的一个对象。

步骤二：创建临时视图

为了方便使用 Spark SQL 进行查询，我们将 DataFrame 注册为一个临时视图（Temporary View）。

df.createOrReplaceTempView("myTable")

现在，我们可以像操作传统数据库表一样，通过 SQL 语句查询 myTable。

步骤三：使用 Spark SQL 进行数据透视

透视的核心在于使用 CASE WHEN 语句根据 attributeName 的值选择对应的 attributeValue，并通过聚合函数（如 MAX）将每个组中的非空值提取出来。由于我们希望将所有相关属性（例如 LOG_ID 和 BUSINESS_UNIT，它们共享相同的 timeBuildingBlockId 和 timeBuildingBlockVersion）聚合到一行，因此需要对这些共享字段进行隐式分组。

result = spark.sql("""    SELECT        MAX(CASE WHEN attributeName = 'LOG_ID' THEN attributeValue END) AS LOG_ID,        MAX(CASE WHEN attributeName = 'BUSINESS_UNIT' THEN attributeValue END) AS BUSINESS_UNIT    FROM myTable    GROUP BY timeBuildingBlockId, timeBuildingBlockVersion -- 根据业务逻辑分组，确保同一逻辑实体的数据聚合到一行""")result.show()

SQL 逻辑解释：

CASE WHEN attributeName = ‘LOG_ID’ THEN attributeValue END: 这部分逻辑会检查 attributeName 是否为 ‘LOG_ID’。如果是，则返回对应的 attributeValue；否则返回 NULL。MAX(…) AS LOG_ID: 由于每个 attributeName 对应的 attributeValue 在原始数据中只出现一次（对于特定的逻辑实体），所以 MAX 函数会从 CASE WHEN 表达式生成的多个 NULL 值和一个非 NULL 值中选择那个非 NULL 的 attributeValue。这有效地将特定属性的 attributeValue 提升为新的列。GROUP BY timeBuildingBlockId, timeBuildingBlockVersion: 这一步至关重要。原始 JSON 数据中，LOG_ID 和 BUSINESS_UNIT 属于同一个逻辑实体，它们共享相同的 timeBuildingBlockId 和 timeBuildingBlockVersion。通过对这些字段进行分组，我们可以确保属于同一逻辑实体（即同一组）的所有属性值被聚合到同一行中。如果没有 GROUP BY，或者分组字段选择不当，可能会导致结果不正确（例如，所有属性聚合到一行，或者数据被错误地分割）。

输出结果：

+---------------+-------------------+|LOG_ID         |BUSINESS_UNIT      |+---------------+-------------------+|300000001228038|300000207138371|+---------------+-------------------+

这正是我们期望的透视结果。

注意事项与总结

动态列处理： 上述方法适用于列名（LOG_ID, BUSINESS_UNIT）已知的情况。如果 attributeName 的种类是动态变化的，并且需要在运行时确定列名，则需要结合 PySpark 的 DataFrame API 中的 pivot 函数，或者在 Spark SQL 中使用动态 SQL 生成技术。然而，对于固定的少量列，CASE WHEN 语句更直接和高效。聚合函数选择： 除了 MAX，也可以根据实际需求选择其他聚合函数，如 MIN、SUM、AVG 等。但对于这种将单个值提升为列的场景，MAX（或 MIN）是最常见的选择，因为它会忽略 NULL 值并返回唯一的非 NULL 值。分组键的重要性： GROUP BY 子句的选择至关重要。它决定了哪些原始行的数据会被聚合成新的一行。在上述示例中，timeBuildingBlockId 和 timeBuildingBlockVersion 共同标识了一个唯一的业务实体，因此它们是理想的分组键。务必根据您的数据模型和业务需求来确定正确的分组键。性能考量： 对于非常大的数据集，Spark SQL 能够有效地并行处理数据。然而，过多的 CASE WHEN 表达式或过于复杂的分组逻辑可能会影响性能。在实际应用中，应根据数据量和集群资源进行调优。

通过 PySpark 和 Spark SQL 的结合，我们可以灵活高效地处理各种复杂的数据转换需求，将非结构化或半结构化的 JSON 数据转换为易于分析的表格格式。

以上就是使用 PySpark 将 JSON 属性数据透视为表格列的详细内容，更多请关注创想鸟其它相关文章！

版权声明：本文内容由互联网用户自发贡献，该文观点仅代表作者本人。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容，请发送邮件至 chuangxiangniao@163.com 举报，一经查实，本站将立刻删除。
发布者：程序猿，转转请注明出处：https://www.chuangxiangniao.com/p/1368066.html

oracle 聚合函数键值对

打赏

微信扫一扫

支付宝扫一扫

0 0

关于作者

程序猿签约作者

414.1K 文章

0 评论

2 粉丝

这个人很懒，什么都没有留下～

Python源码实现在线视频转字幕利用ASR模型的Python源码对接流程

上一篇 2025年12月14日 08:28:05

Python函数如何用闭包保存函数内部状态 Python函数闭包基础用法的入门操作指南

下一篇 2025年12月14日 08:28:19

好文分享

如何直接访问 Sass 地图变量的值？

直接访问 sass 地图变量的值在 sass 中，我们可以使用地图变量来存储一组键值对。而有时候，我们可能需要直接访问其中的某个值。可以通过 map-get 函数直接从地图中获取特定的值。语法如下： map-get($map, $key) 其中： $map 是我们要获取值的 sass 地图变量。…

程序猿
2025年12月24日
0000
好文分享

我如何编写 CSS 选择器

CSS 方法有很多，但我都讨厌它们。有些多（顺风等），有些少（BEM、OOCSS 等）。但归根结底，它们都有缺陷。当然，人们使用这些方法有充分的理由，并且解决的许多问题我也遇到过。因此，在这篇文章中，我想写下我自己的关于如何保持 CSS 井井有条的指南。这并不是一个任何人都可以开始使用的完整描述…

程序猿
2025年12月24日
0000
好文分享

html5怎么写样式_html5用style内嵌或外部css文件写元素样式【写法】

HTML5样式设置有三种方式：一、内联style属性，仅作用于当前元素；二、标签内嵌CSS，作用于整个文档；三、引入外部CSS文件，实现结构与样式分离；优先级为内联>内嵌/外部，后加载覆盖先加载。如果您希望为HTML5文档中的元素设置样式，可以通过内嵌style属性或引入外部CSS文件来实现…

程序猿
2025年12月23日
0000
好文分享

HTML如何获取URL参数_GET请求处理技术【指南】

应使用URLSearchParams接口解析查询参数，它兼容现代浏览器且语法简洁；若需兼容老旧浏览器，则可手动分割字符串并解码；推荐封装为parseUrlParams()函数，并注意对键值进行decodeURIComponent解码及HTML转义以防XSS。如果您需要在HTML页面中提取当前URL…

程序猿
2025年12月23日
0000
好文分享

vscode设置html5环境_插件配置与代码片段设置【教程】

若VS Code中HTML文件缺乏语法高亮、智能补全及HTML5结构快速生成，需安装Auto Close Tag、Auto Rename Tag、CSS class IntelliSense和HTML Boilerplate插件，启用Emmet并配置html关联与格式化设置。如果您在 Visual…

程序猿
2025年12月23日
0000
好文分享

HTML如何重置表单数据_JavaScript清空操作指南【教程】

可通过五种JavaScript方法清空HTML表单：一、调用form.reset()恢复默认值；二、遍历控件手动设空或重置状态；三、重置innerHTML但需重新绑定事件；四、操作FormData对象删除键值；五、单独清空指定字段。如果您在网页中使用了HTML表单，但需要将所有输入字段恢复为初始状…

程序猿
2025年12月23日
0000
好文分享

html5清除缓存方法_本地存储与缓存清理技巧【教程】

HTML5应用异常多因缓存或本地存储残留旧数据，需分别清除浏览器常规缓存与Cookie、localStorage/sessionStorage、IndexedDB、Service Worker缓存，开发时可禁用缓存调试。如果您在使用HTML5应用时遇到页面内容未更新、数据错乱或加载异常等问题，很可…

程序猿
2025年12月23日
0000
好文分享

html如何存储_使用Web Storage等存储HTML页面数据【数据】

可在浏览器中用Web Storage API持久化保存HTML数据：一、localStorage永久存键值对；二、sessionStorage暂存标签页级数据；三、存取HTML字符串片段；四、IndexedDB存复杂结构化数据；五、结合data-*属性批量序列化表单。如果需要在浏览器中持久化保存H…

程序猿
2025年12月23日
0000
好文分享

HTML如何向页面传参_URL参数传递技术解析【技巧】

URL参数传递有五种方法：一、JavaScript解析URLSearchParams；二、手动拼接编码后的URL跳转；三、表单GET提交自动组装参数；四、锚点hash模拟传参；五、服务端预注入参数到HTML。如果您需要在HTML页面之间传递数据，URL参数是一种轻量且广泛支持的方式。以下是实现UR…

程序猿
2025年12月23日
0000
好文分享

html5如何合并表单_html5表单合并实现步骤【表单处理】

HTML5表单合并可通过四种方式实现：一、用form属性关联独立控件；二、用JavaScript收集多表单数据统一提交；三、嵌套fieldset语义化合并；四、用FormData接口动态追加字段。如果您需要将多个HTML5表单整合为一个统一提交入口，或在单页应用中动态聚合分散的表单数据，则需通过结…

程序猿
2025年12月23日
0000
好文分享

HTML如何实现记忆功能_本地存储应用方案【技巧】

网页记忆功能可通过五种本地存储机制实现：一、localStorage持久化键值对；二、sessionStorage限于当前会话；三、JSON序列化存取复杂数据；四、cookies支持跨页面与服务端共享；五、IndexedDB处理大规模结构化数据。如果您希望网页在用户关闭后仍能保留之前输入的数据或设…

程序猿
2025年12月23日
0000
好文分享

HTML如何定义数据属性_自定义属性使用教程【技巧】

可使用data属性存储页面行为相关元数据。需以data-开头、全小写命名，通过dataset API（驼峰式）或getAttribute/setAttribute（连字符式）读写，并支持CSS属性选择器匹配。如果您希望在HTML元素中存储与页面行为相关的额外信息，而又不希望这些信息影响样式或布局，…

程序猿
2025年12月23日
0000
HTML如何获取URL参数_GET请求数据处理方法【解析】

推荐使用URLSearchParams接口解析URL查询参数，它兼容主流浏览器、语法简洁且支持增删改查；旧版浏览器可手动解析location.search字符串；还可封装函数支持默认值与类型转换，或通过URL构造器解析任意URL。如果您在HTML页面中需要读取当前URL中的查询参数（即类似?nam…

程序猿
好文分享 2025年12月23日
0000
好文分享

HTML如何获取输入框数值_JavaScript取值方法【教程】

获取用户输入数值需按场景选择方法：一、getElementById+value；二、querySelector+value；三、form.elements+name/index；四、监听input事件实时获取；五、FormData批量提取。如果您在网页中使用HTML创建了输入框，并希望借助Java…

程序猿
2025年12月23日
0000
好文分享

如何解释html5_HTML5技术解释与核心概念入门指南【教程】

HTML5是HTML第五版，整合语义化标签、原生音视频、Canvas绘图及localStorage/sessionStorage存储。1、语义标签如提升结构与可访问性；2、支持免插件多媒体，含；3、配合JS实现2D绘图；4、localStorage持久存储，sessionStorage限会话期。一…

程序猿
2025年12月23日
0000
好文分享

JavaScript中Data属性的获取与元素选择教程

本文详细介绍了如何在javascript中有效地获取html元素的自定义`data-*`属性值，以及如何利用css属性选择器来定位和操作不依赖`id`或`class`的html元素。通过`htmlelement.dataset` api和`document.queryselector`/`query…

程序猿
2025年12月23日
0000
好文分享

JS如何保存HTML修改内容_本地存储实现方案【指南】

可通过localStorage、sessionStorage、JSON序列化、IndexedDB及MutationObserver五种方式持久化JavaScript修改的HTML：localStorage长期保存innerHTML；sessionStorage仅限会话期；JSON结构化存储多区域修改…

程序猿
2025年12月23日
0000
好文分享

HTML如何重置表单数据_JavaScript清空方法【教程】

可通过JavaScript重置HTML表单：一、调用form.reset()恢复初始值；二、遍历元素设value为空字符串；三、单独设置特定字段value为空；四、结合FormData API捕获数据后清空。如果您在网页中使用了HTML表单，但需要在用户提交后或特定操作时将所有输入字段恢复为初始状…

程序猿
2025年12月23日
0000
好文分享

JavaScript中无ID和Class获取HTML Data属性值教程

本文详细介绍了如何在不依赖id和class选择器的情况下，利用javascript高效获取html元素的自定义数据属性（`data-*`）值。通过讲解`htmlelement.dataset` api和css属性选择器（如`[attribute]`和`[attribute=”value&…

程序猿
2025年12月23日
0000
好文分享

JSON数据如何转为HTML表格_动态渲染技术解析【方案】

实现JSON数据网页表格展示有五种技术方案：一、原生JavaScript遍历渲染；二、模板字符串拼接HTML；三、DocumentFragment批量插入；四、CSS-in-JS动态绑定类名；五、事件委托支持交互功能。当您拥有JSON格式的数据并希望在网页中以表格形式动态展示时，需要将结构化数据转…

程序猿
2025年12月23日
0000