WHERE arrays_overlap(, array())
然而,当尝试将这种逻辑直接转换为PySpark时,许多用户会遇到困难。一个常见的错误尝试是:
from pyspark.sql.functions import col, array, arrays_overlap# 假设 target_list 是一个 Python 列表,如 ['apple', 'banana']df.filter(arrays_overlap(col("array_column"), array(target_list)))
这段代码通常会导致AnalysisException,错误信息类似于[UNRESOLVED_COLUMN.WITH_SUGGESTION] A column or function parameter with name ” cannot be resolved.。这是因为array()函数在接收非列参数时,期望的是字面量表达式(literal expressions),而不是原始的Python列表元素。虽然array_contai ns函数可以处理单个元素,但它无法满足与整个列表进行交集判断的需求。
2. 解决方案:结合 lit 函数
解决这个问题的关键在于,将Python列表中的每个元素转换为Spark的字面量表达式(literal expression),然后再用array函数将其组合成一个字面量数组。这可以通过pyspark.sql.functions.lit函数来实现。
lit函数的作用是将一个Python值转换为一个Spark列表达式,这个表达式代表着一个常量值。当我们将列表中的每个元素都通过lit转换后,再将这些字面量表达式传递给array函数,array函数就能正确地构建一个包含这些字面量值的数组。
正确的PySpark实现如下:
from pyspark.sql import SparkSessionfrom pyspark.sql.functions import col, array, arrays_overlap, lit# 1. 初始化 SparkSessionspark = SparkSession.builder.appName("ArrayColumnFilter").getOrCreate()# 2. 准备示例数据data = [ (1, ["apple", "banana", "orange"]), (2, ["grape", "kiwi"]), (3, ["banana", "strawberry"]), (4, ["mango", "pineapple"]), (5, ["apple", "grape"])]df = spark.createDataFrame(data, ["id", "fruits_array"])df.printSchema()df.show()# 3. 定义用于过滤的 Python 列表target_list = ["banana", "grape", "lemon"]# 4. 构建正确的过滤条件# 使用 map(lit, target_list) 将列表中的每个元素转换为 lit 表达式# 使用 * 解包这些 lit 表达式作为 array 函数的参数# 最后,使用 arrays_overlap 进行比较filtered_df = df.filter( arrays_overlap(col("fruits_array"), array(*map(lit, target_list))))# 5. 显示过滤结果print(f"n原始DataFrame:")df.show()print(f"n过滤列表:{target_list}")print("n过滤后的DataFrame(fruits_array与target_list有交集):")filtered_df.show()# 6. 停止 SparkSessionspark.stop()
运行结果示例:
root |-- id: long (nullable = true) |-- fruits_array: array (nullable = true) | |-- element: string (nullable = true)+---+--------------------+| id| fruits_array|+---+--------------------+| 1|[apple, banana, o...|| 2| [grape, kiwi]|| 3|[banana, strawber...|| 4|[mango, pineapple]|| 5| [apple, grape]|+---+--------------------+原始DataFrame:+---+--------------------+| id| fruits_array|+---+--------------------+| 1|[apple, banana, o...|| 2| [grape, kiwi]|| 3|[banana, strawber...|| 4|[mango, pineapple]|| 5| [apple, grape]|+---+--------------------+过滤列表:['banana', 'grape', 'lemon']过滤后的DataFrame(fruits_array与target_list有交集):+---+--------------------+| id| fruits_array|+---+--------------------+| 1|[apple, banana, o...|| 2| [grape, kiwi]|| 3|[banana, strawber...|| 5| [apple, grape]|+---+--------------------+
从结果可以看出,id为1、2、3、5的行被保留,因为它们的fruits_array列与[“banana”, “grape”, “lemon”]存在交集(例如,id=1包含”banana”,id=2包含”grape”,id=3包含”banana”,id=5包含”grape”)。
3. 关键概念与注意事项
arrays_overlap(array1, array2) : 这个函数用于判断两个数组是否有共同的元素。如果存在任何共同元素,则返回True;否则返回False。它是进行数组交集判断的核心。lit(value) : lit函数将一个Python字面量(如字符串、数字、布尔值)转换为一个Spark SQL的字面量列。这是在PySpark中构建常量值表达式的常用方法。*`array( expressions)**:array`函数有两种主要用法:当参数是列名时,它将这些列的值组合成一个新的数组列。例如:array(col(“col1”), col(“col2”))。当参数是字面量表达式时,它会创建一个包含这些字面量值的字面量数组。例如:array(lit(“a”), lit(“b”))。我们这里的解决方案属于第二种情况,map(lit, target_list)生成了一系列字面量表达式,*操作符将它们解包作为array函数的独立参数。错误避免 : 理解array函数对参数类型的期望是避免AnalysisException的关键。直接传递Python列表array(target_list)会被Spark误解为target_list中的第一个元素是一个列名,因此无法解析。
4. 总结
在PySpark中,当需要使用一个Python列表与DataFrame的数组列进行交集过滤时,务必记住使用pyspark.sql.functions.lit函数将列表中的每个元素转换为Spark字面量表达式。然后,通过array(*map(lit, your_list))的方式构建一个字面量数组,并将其作为arrays_overlap函数的第二个参数。这种模式是处理这类复杂数组过滤逻辑的标准且正确的方法,能够确保代码的健壮性和准确性。
以上就是在PySpark中利用数组列与列表交集进行DataFrame过滤的正确姿势的详细内容,更多请关注创想鸟其它相关文章!
版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1373239.html
赞 (0)
打赏
微信扫一扫
支付宝扫一扫
相关推荐
Procreate无内置AI导出功能,但可通过导出高质量图像(如PSD、TIFF、PNG)供外部AI工具优化;选择格式需根据用途,PSD适合协作,TIFF用于印刷,PNG支持透明背景,JPEG慎用以避免压缩损失;画布应高DPI创建,色彩配置优先sRGB,印刷时后期转CMYK更精准。 ☞☞☞AI 智能…
Chrome浏览器最新官方下载网址是https://www.google.cn/chrome/,提供安卓版和手机版下载,界面简洁,支持书签同步、网页翻译、点按搜索等功能,确保快速安全的浏览体验。 chrome浏览器最新官方网址下载在哪里?这是不少网友都关注的,接下来由PHP小编为大家带来chrome…
首先检查iCloud钥匙串是否在所有设备上开启且使用同一Apple ID,确认已启用双重认证;接着重启设备并重新开启钥匙串功能以修复临时故障;然后确保网络稳定并查看Apple服务器状态正常;最后通过退出并重新登录Apple ID重建同步授权,恢复密码自动填充与跨设备同步。 如果您在使用Safari浏…
安装JDK和sbt后,在VSCode中安装Metals扩展,即可快速搭建Scala开发环境;2. Metals通过LSP和BSP协议实现代码补全、错误检查、重构及sbt项目自动导入;3. 支持通过sbt shell启动REPL或使用Run Worksheet实现交互式编程;4. 虽无内置中文文档,但…
优麒麟 25.10 正式版现已上线,此版本将提供长达9个月的支持周期,基于最新的 linux 6.17 内核打造,在基础库、子系统及核心组件等方面实现了全面升级,显著提升了系统的稳定性与兼容性,同时推出了焕然一新的软件商店。 新增特性 1. 搭载 Linux 6.17 内核 优麒麟 25.10 集成…
优雅关机的三大法宝:拔电源、shutdown、poweroff 及其对硬件和数据的影响 在讨论关机方法之前,先了解一下机械硬盘的内部结构。 那固态硬盘SSD呢? FTL工作示意图。FTL表对SSD至关重要,如果在FTL写回Flash之前突然断电,内存数据丢失,FTL表也将丢失。因此,高端SSD和服务…
本文旨在指导读者如何定义和实现自定义PHP函数,以解决“Call to undefined function”错误。通过 prev_id() 函数的创建示例,详细阐述了函数的基本语法、参数传递、返回值以及在实际应用(如数据库查询)中的集成方法,并提供了关键注意事项,帮助开发者编写模块化、可维护的代码…
在处理fasta序列时,我们常常需要知道每条序列的长度。今天小编将与大家分享四种获取fasta序列长度的方法。 一、使用awk 以下是使用awk获取fasta序列长度的代码: awk ‘/^>/{if (l!=””) print l; print; l=0; next}{l+=length($…
vscode通过scm视图直接对比工作区与head的差异;2. 点击已暂存文件可查看暂存区与head的差异;3. 通过命令面板、scm历史记录或右键菜单可对比任意版本或文件;4. 差异视图支持并排和内联模式,并提供跳转导航;5. 时间线视图可追溯文件级提交历史并对比各版本;6. gitlens扩展增…
本文探讨了在Java中利用栈(Stack)数据结构验证JSON字符串结构有效性的方法。我们将分析一个常见的基于栈的实现示例,指出其在处理字符串内部字符、引号平衡以及转义字符方面的潜在缺陷。文章将提供一个改进的解决方案,并强调此方法主要用于结构匹配,而非完整的JSON语法验证,同时建议生产环境中使用专…
快手极速版官方网页版地址在哪里?这是不少网友都关注的,接下来由PHP小编为大家带来快手极速版官方网页版地址及App下载相关信息,感兴趣的网友一起随小编来瞧瞧吧! https://www.kuaishou.com/ 1、小步骤内容。进入官网后可直接浏览平台首页推荐内容,涵盖生活记录、才艺展示等多个领域…
答案:Adobe Fresco支持PNG、JPG、PSD、PDF和MP4等导出格式。PNG适合透明背景和高质量网络展示;JPG适用于小文件、快速分享的有损压缩图像;PSD保留图层与矢量信息,便于在Photoshop中继续编辑;PDF适合打印和跨平台文档共享;MP4用于导出创作延时视频。选择格式时需根…
本文旨在解决 Laravel Nova 中耗时操作(如数分钟)的响应消息(Toast)短暂显示问题。针对默认 Action::message() 无法提供持久化反馈的局限性,我们将深入探讨如何利用 Laravel Nova 4 的通知功能,实现更持久、可交互且用户友好的操作完成提示,确保用户不会错过…
在mac++os上用vscode配置c/c++环境的关键是安装xcode command line tools以获取clang编译器和lldb调试器,然后安装vscode的c/c++扩展,接着创建项目文件夹和源文件,通过配置tasks.json定义编译任务,确保使用clang编译当前文件并生成可执行…
要将xxl-job集成到spring boot项目中,可以按照以下步骤进行操作: 首先,从Gitee拉取xxl-job的源码,并将其配置为Docker镜像部署到服务器上。 # 执行Maven打包mvn clean install构建Docker镜像,镜像名称中不允许使用下划线docker build…
防止CSRF的核心是验证请求来源合法性,常用方法为表单令牌机制。1. 生成并存储CSRF令牌:用户访问表单页面时,PHP使用session_start()开启会话,通过bin2hex(random_bytes(32))生成安全令牌,存入$_SESSION[‘csrf_token̵…