Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
BigQuery中实现自定义排序:策略与实践_创想鸟

BigQuery中实现自定义排序:策略与实践

BigQuery中实现自定义排序:策略与实践

本文探讨了在BigQuery中实现自定义排序的两种主要策略。对于预定义且固定顺序的场景,推荐使用CASE语句构建排序键,以实现高效且可扩展的排序。对于需要复杂比较逻辑(如JavaScript localeCompare或自定义排名函数)的场景,可以利用JavaScript UDF,但需注意其在处理大规模数据集时的性能限制,因为它需要将数据聚合为数组进行处理。

引言

在数据分析和处理中,我们经常需要对数据进行排序。bigquery提供了标准的order by子句,支持按列的升序或降序排列。然而,有时我们需要更复杂的自定义排序逻辑,例如根据特定业务规则、字符串的自然语言顺序(忽略大小写和变音符号),或者基于非字母数字的自定义排名。本文将详细介绍在bigquery中实现这类自定义排序的两种主要方法:利用case语句构建排序键和使用javascript用户定义函数(udf)。

1. 使用CASE语句构建排序键(推荐)

当自定义排序规则是预先定义且相对固定时,使用CASE语句创建临时的排序键是 BigQuery 中最推荐且性能最佳的方法。这种方法将每个需要排序的值映射到一个数值或具有明确顺序的字符串,然后根据这个映射值进行排序。

工作原理:通过CASE表达式,您可以为每个特定的输入值指定一个对应的“排名”或“权重”。BigQuery会根据这些生成的排名值进行标准的数字或字符串排序,从而实现自定义的逻辑顺序。

示例场景:假设我们有一个包含字符串值”date”, “time”, “number”的表,我们希望它们按照”number” -> “time” -> “date”的顺序进行排序。

WITH tbl AS (  SELECT "date" AS val UNION ALL  SELECT "time" UNION ALL  SELECT "number")SELECT  tbl.val,  -- 使用CASE语句为每个值分配一个排序优先级  CASE tbl.val    WHEN 'number' THEN 1    WHEN 'time' THEN 2    WHEN 'date' THEN 3    ELSE 99 -- 处理未匹配的值,给予一个默认优先级  END AS sort_rankFROM tblORDER BY sort_rank;

输出:

val sort_rank

number1time2date3

优点:

高性能和可扩展性: CASE语句是标准SQL的一部分,BigQuery对其进行了高度优化,可以在大规模数据集上高效运行。易于理解和维护: 逻辑清晰,可以直接在SQL查询中表达排序规则。并行处理: BigQuery能够并行处理CASE表达式,充分利用其分布式计算能力。

注意事项:

此方法适用于排序规则相对固定且可以清晰映射到某个顺序值的场景。如果排序规则非常动态或复杂到难以用CASE语句表达,可能需要考虑其他方法。

2. 使用JavaScript UDF实现复杂排序逻辑(适用于小规模数据)

对于需要更复杂比较逻辑的场景,例如字符串的自然语言比较(如JavaScript的localeCompare)或基于动态规则的自定义排名函数,JavaScript UDF提供了一种解决方案。然而,由于其工作机制,此方法在处理大规模数据集时存在显著的性能限制。

工作原理:BigQuery的JavaScript UDF允许您在SQL查询中执行JavaScript代码。但是,与传统编程语言中直接传递比较函数给sort方法不同,BigQuery UDF不能直接接收两个元素进行比较。相反,它需要接收一个完整的数组,在UDF内部对这个数组进行排序,然后返回排序后的数组。之后,我们需要将原始数据与这个排序结果进行关联,以确定每个元素的最终排序位置。

示例场景:沿用上面的例子,我们希望实现”number” -> “time” -> “date”的自定义排序,但这次通过一个JavaScript函数来定义排名映射。

-- 定义一个JavaScript UDF,用于对字符串数组进行自定义排序CREATE TEMP FUNCTION sortme(MyValues ARRAY)RETURNS ARRAYLANGUAGE js AS"""// 定义自定义的排名映射const RANK_MAP = {"number": 1, "time": 2, "date": 3};// 自定义比较函数function customCompare(val1, val2) {    // 如果值不在RANK_MAP中,可以给予一个默认排名,例如Infinity    const rank1 = RANK_MAP[val1] !== undefined ? RANK_MAP[val1] : Infinity;    const rank2 = RANK_MAP[val2] !== undefined ? RANK_MAP[val2] : Infinity;    return rank1 - rank2;}// 使用自定义比较函数对数组进行排序MyValues.sort(customCompare);return MyValues;""";-- 示例数据WITH tbl AS (  SELECT "date" AS val UNION ALL  SELECT "time" UNION ALL  SELECT "number" UNION ALL  SELECT "apple" -- 添加一个不在RANK_MAP中的值),-- 步骤1: 聚合所有不重复的val值到一个数组中helper AS (  SELECT sortme(ARRAY_AGG(DISTINCT val)) AS sorted_values FROM tbl)-- 步骤2: 将排序后的数组展开,并与原始表连接SELECT  t.val,  -- 通过连接获取排序后的索引,作为最终的排序键  s.sort_byFROM tbl AS tLEFT JOIN (  SELECT    sorted_val,    sort_by -- sort_by是unnest生成的偏移量,即排序后的索引  FROM helper,  UNNEST(helper.sorted_values) AS sorted_val WITH OFFSET AS sort_by) AS sON t.val = s.sorted_valORDER BY s.sort_by;

输出:

val sort_by

number0time1date2apple3

解释:

CREATE TEMP FUNCTION sortme(…): 定义了一个临时UDF,它接受一个字符串数组并返回一个字符串数组。UDF内部逻辑: RANK_MAP定义了自定义的排名。customCompare函数使用这个映射来比较两个值。MyValues.sort(customCompare)对传入的数组进行原地排序。helper CTE: 使用ARRAY_AGG(DISTINCT val)将tbl表中所有不重复的val值收集到一个数组中,然后将这个数组传递给sortme UDF进行排序。最终查询:UNNEST(helper.sorted_values) AS sorted_val WITH OFFSET AS sort_by:将UDF返回的已排序数组展开,sort_by列会生成每个元素在排序后数组中的索引(从0开始)。LEFT JOIN:通过val列将原始表tbl与展开后的排序结果进行连接。ORDER BY s.sort_by:最终根据sort_by(即排序后的索引)对原始数据进行排序。

优点:

极高的灵活性: 可以在JavaScript中实现任何复杂的比较逻辑,包括使用localeCompare进行语言敏感排序。代码复用: 复杂的排序逻辑可以封装在UDF中。

注意事项:

性能瓶颈: 这是最主要的限制。将所有需要排序的唯一值聚合到一个数组中,并在UDF中进行处理,意味着:数据需要从BigQuery传递到JavaScript执行环境。JavaScript引擎对大型数组的排序效率可能不如BigQuery的原生排序。ARRAY_AGG操作本身在处理非常大的基数(distinct values)时可能会消耗大量内存和计算资源。官方建议此方法适用于数据集不超过数百行的情况,因为数据量过大可能导致查询失败或执行时间过长。复杂性增加: 查询结构变得更复杂,需要聚合、UDF调用、展开和连接多个步骤。

总结

在BigQuery中实现自定义排序时,应优先考虑以下策略:

首选CASE语句: 对于预定义且可映射的自定义排序规则,CASE语句是最高效、最可扩展且最易于维护的方法。它直接利用BigQuery的优化能力,适用于绝大多数场景。谨慎使用JavaScript UDF: 当排序逻辑极其复杂,无法通过CASE语句表达,且数据集规模较小(例如,只有数百个不同的值需要排序)时,可以考虑使用JavaScript UDF。但请务必意识到其性能限制,并避免在处理大规模数据时采用此方法。

通过选择合适的策略,您可以在BigQuery中有效地管理和实现各种自定义排序需求。

以上就是BigQuery中实现自定义排序:策略与实践的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/1519252.html

赞 (0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
BigQuery中实现复杂自定义排序:JavaScript UDF与性能考量
上一篇 2025年12月20日 12:16:31
Node.js 对象合并的内存优化策略:深度解析Object.assign()
下一篇 2025年12月20日 12:16:45

相关推荐

  • 解决 Conda 环境中 Java 版本冲突的策略

    本文旨在解决 Conda 环境中 Java 版本激活不正确的问题。当用户尝试在 Conda 环境中指定特定 Java 版本(如 OpenJDK 8)时,系统可能仍激活旧的或错误的 Java 版本。教程将详细分析问题根源,并提供一种通过精确指定 Java 包名来确保 Conda 环境正确管理 Java…

    2026年9月23日
    000
  • 淘宝支付方式无法选择怎么办

    支付方式无法选择通常因账户设置、系统版本或商家限制;2. 关闭“优先使用支付宝”开关可恢复其他支付选项;3. 微信支付需绑定“零钱”而非“零钱通”;4. 预售、大额订单、跨境商品等可能仅支持特定支付方式;5. 更新App、重启设备或切换网络可解决加载失败问题。 淘宝支付方式无法选择,通常和账户设置、…

    2026年9月23日
    1000
  • 谷歌为 Gemini CLI 带来扩展功能

    谷歌旗下的 AI 编程助手 Gemini CLI 最近推出了名为“扩展”的全新功能。官方表示,这一更新让用户能够“接入常用工具,并定制属于自己的 AI 命令行体验”。现在,任何开发者都可以发布扩展程序,无需经过谷歌的审核批准即可上线使用。 目前扩展库中已提供超过 50 款扩展,涵盖多种实用场景。例如…

    2026年9月23日
    000
  • 如何恢复未保存的WPS格式文档_WPS未保存文档恢复操作技巧

    首先尝试WPS自动恢复功能,重新打开软件后查看“文档恢复”面板;若无效,可手动查找C:Users当前用户名AppDataLocalKingsoftWPS Officecache目录下的临时文件;若启用云端同步,可通过“备份与恢复”中的历史版本找回;还可使用系统搜索*.asd文件定位自动保存的副本。 …

    2026年9月23日
    100
  • 递归方法中静态变量状态管理与重置策略

    本教程探讨了在递归方法中使用静态(全局)变量时,如何正确管理和重置其状态,以避免多次调用时出现累积错误。核心问题在于静态变量在方法调用之间保留其值,导致后续调用基于旧状态进行计算。解决方案是在递归的基准情况(base case)中,在完成当前调用的计算后,立即将静态变量重置为初始值,从而确保每次独立…

    2026年9月23日
    200
  • 图片库空间不足怎么办_图片库空间不足如何压缩图片详细步骤

    压缩图片可有效节省空间,推荐使用TinyPNG等在线工具批量处理,或用Photoshop、XnConvert进行精准控制,手机用户可通过专用App或快捷指令一键压缩,配合云存储与格式转换更高效。 图片库空间不足时,压缩图片是节省空间最直接有效的方法。不需要删除照片,通过合理压缩,既能保留视觉质量,又…

    2026年9月23日
    100
  • 苹果手机官网查询门户 苹果查询官网手机入口

    苹果查询官网手机入口是https://www.apple.com.cn,用户可通过该网站查询设备信息、技术支持及配件服务,包括序列号验证、保修状态、维修预约和原厂配件真伪核验等功能。 苹果手机官网查询门户在哪里?这是不少网友都关注的,接下来由PHP小编为大家带来苹果查询官网手机入口,感兴趣的网友一起…

    2026年9月23日
    100
  • Java中用户输入验证:正确使用equals()或转换为整数进行比较

    本教程详细阐述了Java中用户输入字符串(如菜单选项)验证的正确方法。针对==运算符在字符串比较中的局限性,文章介绍了两种解决方案:一是使用String.equals()方法进行内容比较,二是将字符串输入解析为整数后进行数值比较。通过代码示例,帮助开发者避免常见的字符串比较错误,确保程序逻辑的健壮性…

    2026年9月23日
    000
  • 微软免费文件恢复工具介绍

    微软免费文件恢复工具介绍微软免费文件恢复工具介绍微软免费文件恢复工具介绍微软免费文件恢复工具介绍

    现在好了,最近微软在 windows 10 应用商店中上架了一款免费的数据删除恢复工具 windows file recovery,猿妹再也不用担心误删文件了。 Windows File Recovery基于命令行程序设计,大小仅有8.26MB,所有Windows 10用户均可免费下载使用。 无论是…

    2026年9月23日 • 用户投稿
    100
  • 淘宝评价显示延迟怎么办 淘宝评价刷新与修复技巧

    先检查网络与应用状态,确认手机网络稳定并清理淘宝App缓存,避免因本地问题导致评价加载延迟。 淘宝评价显示延迟,通常不会持续太久,但确实会影响购物决策。核心是先判断是局部问题还是普遍现象,然后针对性地处理。 检查网络与应用状态 评价加载不出来,大概率是本地环境的问题。先确认你的手机网络是否稳定,可以…

    2026年9月23日
    000
  • 如何在Java中安装Eclipse开发环境

    先安装JDK并配置环境变量,再下载安装Eclipse IDE。1. 安装JDK:从Oracle或Eclipse Adoptium下载JDK 17/21,按提示安装,设置JAVA_HOME和PATH,用java -version验证。2. 安装Eclipse:官网下载“Eclipse IDE for …

    2026年9月23日
    000
  • 2025 旗舰手机选购指南:四款机型精准匹配你的需求

    2025 旗舰手机选购指南:四款机型精准匹配你的需求2025 旗舰手机选购指南:四款机型精准匹配你的需求2025 旗舰手机选购指南:四款机型精准匹配你的需求2025 旗舰手机选购指南:四款机型精准匹配你的需求

    在智能手机市场持续繁荣的今天,面对琳琅满目的旗舰%ignore_a_1%,用户往往难以抉择。本文精选四款当前热门的高端手机,帮你高效锁定心仪之选。 1 五款旗舰机型推荐 1. OPPO Find X9 系列 大容量电池、护眼显示屏、双 2 亿像素影像系统——适合对续航敏感、热爱摄影以及重视视觉健康的…

    2026年9月23日 • 用户投稿
    200
  • 番茄小说怎么清除浏览记录_番茄小说浏览记录清除操作教程

    可通过应用内设置一键清空浏览记录,或左滑删除特定书籍历史;也可通过手机设置清除缓存或数据来彻底移除阅读痕迹。 如果您在使用番茄小说时希望保护个人隐私,避免他人查看您的阅读历史,可以通过以下方法清除浏览记录。以下是具体的操作步骤: 一、通过应用内设置清除浏览记录 番茄小说提供了内置的清除功能,用户可以…

    2026年9月23日
    800
  • 为什么Java中构造方法重要 如何正确编写构造方法

    构造方法确保对象正确初始化:通过强制赋初值、校验数据、支持封装和重载提升灵活性;编写时需遵循命名一致、无返回类型、合理用参、注意访问修饰符、避免复杂逻辑及善用this()调用;常见误区包括忽略无参构造、过度初始化和异常处理不当。 构造方法在Java中扮演着初始化对象的关键角色。创建对象时,构造方法会…

    2026年9月23日
    000
  • VS Code团队协作:共享配置与规范

    通过共享VS Code配置实现团队协作标准化,1. 使用.settings.json统一编辑器行为;2. 集成Prettier与ESLint确保代码风格一致;3. 通过extensions.json推荐必备插件;4. 忽略私有配置文件避免冲突,提升开发效率。 在团队开发中,保持代码风格一致和开发环境…

    2026年9月23日
    000
  • Prestashop分类描述在分页时的显示行为解析与SEO考量

    Prestashop商店中,分类描述通常仅在首个分页页面显示,而在后续分页页面上消失,甚至从第二页返回第一页时也可能不显示。这并非一个技术故障,而是Prestashop的默认行为,且从SEO角度看,只要描述在直接访问的第一页可见,就已满足核心要求,无需在所有分页页面重复显示,以避免潜在的重复内容问题…

    2026年9月23日
    100
  • Infinispan中实现并发安全计数器:解决分布式应用中的用户登录统计挑战

    本文探讨了在Infinispan缓存中实现并发安全的用户登录计数问题,当多个用户同时登录时,传统计数方式可能导致数据不一致。文章详细介绍了利用Infinispan提供的分布式计数器、事务机制和版本化操作这三种核心策略,以确保在高并发环境下数据更新的原子性和一致性,为构建健壮的分布式应用提供解决方案。…

    2026年9月23日
    200
  • 微信支付功能被限制怎么办 微信支付账户解封与操作方法

    先看通知内容,区分临时风控与长期限制。若提示24-72小时自动解除则无需操作;若需申诉,准备身份证、交易凭证、实名信息三类材料,通过“腾讯客服”小程序或95017官方渠道提交,1-3日审核,全程免费且无需联系私人账号。 微信支付被限制,别急着找人花钱解封。绝大多数情况是系统触发的安全保护,自己按官方…

    2026年9月23日
    000
  • Hibernate实体间非映射关联ID的引用与查询策略

    本文探讨了在Hibernate应用中,如何在不建立显式实体映射关系(如@ManyToOne)的情况下,实现实体间基于ID的引用和数据查询。核心方法是利用HQL/JPQL的JOIN…ON语法,通过共享的ID字段进行动态关联查询,从而简化实体模型设计,避免不必要的复杂映射,同时满足数据追踪和…

    2026年9月23日
    400
  • Java对象与引用的区别是什么 引用传递对方法调用的影响

    对象是类的实例,存储在堆中;引用是保存对象地址的变量,存储在栈或堆中。例如Person p = new Person();中,new Person()创建对象在堆中,p是引用,指向该对象。Java只有值传递:基本类型传值,引用类型传地址副本。方法参数接收引用副本,仍指向同一对象,因此可通过它修改对象…

    2026年9月23日
    800

发表回复

登录后才能评论
关注微信