Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $YECBGYFECGEAFWHA as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2

Deprecated: imwpcache\f884414bce24ee67f\f73723ec7b1919fa5::__construct(): Implicitly marking parameter $BBWFDDBHHYHDXXAB as nullable is deprecated, the explicit nullable type must be used instead in /www/wwwroot/www.chuangxiangniao.com/wp-content/plugins/imwpcache-dist/build/f884414bce24ee67ff73723ec7b1919fa5.php on line 2
Flink CDC数据同步后的数据完整性校验:PySpark实践指南_创想鸟

Flink CDC数据同步后的数据完整性校验:PySpark实践指南

Flink CDC数据同步后的数据完整性校验:PySpark实践指南

在通过flink cdc将大量数据从数据库流式传输至数据湖(如iceberg on s3)后,确保数据完整性至关重要。本文将深入探讨使用pyspark进行数据丢失和数据不匹配校验的几种高效策略,包括基于行哈希值的比较、dataframe的`subtract()`操作以及更严格的`exceptall()`方法。我们将分析这些方法的优缺点、适用场景及性能考量,旨在帮助读者根据具体需求选择最合适的校验方案,以有效维护数据湖中的数据质量。

1. 数据完整性校验的重要性

随着数据量和数据源的不断增长,通过Flink CDC等工具将数据从事务型数据库同步到数据湖已成为常见实践。然而,在这一过程中,由于网络波动、系统故障、配置错误或数据转换逻辑问题,可能导致数据丢失或数据值不匹配。因此,建立一套可靠的数据校验机制,能够及时发现并定位这些问题,对于保障数据湖中数据的准确性和可用性至关重要。

2. PySpark数据校验方法

本文将介绍三种基于PySpark的数据校验方法,并对比它们的特点。假设我们已经通过PySpark读取了源数据库(MySQL)和目标数据湖(Iceberg)中的数据,并分别存储为df_mysql_table和df_iceberg_table两个DataFrame。

from pyspark.sql import SparkSessionfrom pyspark.sql.functions import col, concat_ws, md5# 初始化SparkSessionspark = SparkSession.builder.appName("DataValidation").getOrCreate()# 假设的读取函数,实际中需要根据您的环境实现def read_iceberg_table_using_spark(table_name):    # 示例:读取Iceberg表    return spark.read.format("iceberg").load(f"s3://your-bucket/{table_name}")def read_mysql_table_using_spark(table_name):    # 示例:读取MySQL表    # 注意:需要JDBC驱动,并配置好连接信息    return spark.read.format("jdbc")         .option("url", "jdbc:mysql://localhost:3306/your_database")         .option("dbtable", table_name)         .option("user", "your_user")         .option("password", "your_password")         .load()def get_table_columns(table_name):    # 示例:获取表的所有列名,不包括主键'id'    # 实际中可能需要从数据库元数据或DataFrame schema中获取    if table_name == 'target_table':        return ['col1', 'col2', 'col3'] # 假设的列名    return []table_name = 'target_table'df_iceberg_table = read_iceberg_table_using_spark(table_name)df_mysql_table = read_mysql_table_using_spark(table_name)table_columns = get_table_columns(table_name) # 用于哈希计算的列

2.1 方法一:基于行哈希值的比较

这种方法通过计算每行的哈希值来判断两行数据是否完全一致。如果两行的哈希值不同,则说明数据存在不匹配。这种方法对于检测行内数据值的细微变化非常有效。

实现步骤:

为源表和目标表的每一行(通常排除主键,或将主键也包含在哈希计算中,取决于需求)生成一个哈希值。以主键为依据,将两个DataFrame的哈希值进行外连接。筛选出主键不匹配(即一方存在而另一方缺失)或哈希值不一致的行。

# 计算MySQL表的行哈希值df_mysql_table_hash = (    df_mysql_table    .select(        col('id'), # 假设'id'是主键        md5(concat_ws('|', *table_columns)).alias('hash') # 对所有非主键列进行哈希    ))# 计算Iceberg表的行哈希值df_iceberg_table_hash = (    df_iceberg_table    .select(        col('id'),        md5(concat_ws('|', *table_columns)).alias('hash')    ))# 创建临时视图以便使用SQL进行比较df_mysql_table_hash.createOrReplaceTempView('mysql_table_hash')df_iceberg_table_hash.createOrReplaceTempView('iceberg_table_hash')# 使用SQL查询找出差异df_diff_hash = spark.sql('''    SELECT         d1.id AS mysql_id,         d2.id AS iceberg_id,         d1.hash AS mysql_hash,         d2.hash AS iceberg_hash    FROM mysql_table_hash d1    FULL OUTER JOIN iceberg_table_hash d2 ON d1.id = d2.id    WHERE         d1.id IS NULL OR d2.id IS NULL OR d1.hash  d2.hash''')# 显示差异结果df_diff_hash.show()# df_diff_hash.write.format(...).save(...) # 保存差异数据

优点:

精确检测行内差异: 能够发现即使主键相同但其他列值发生变化的行。灵活性: 可以选择性地包含或排除某些列进行哈希计算。

缺点:

Spacely AI Spacely AI

为您的房间提供AI室内设计解决方案,寻找无限的创意

Spacely AI 67 查看详情 Spacely AI 计算开销大: 对于包含大量列和海量数据的表,计算每行的哈希值可能非常耗时且消耗资源。不直观: 差异结果只显示哈希值不同,需要进一步查询原始数据才能知道具体哪些列发生了变化。

2.2 方法二:DataFrame的subtract()操作

subtract()方法用于找出在一个DataFrame中存在但在另一个DataFrame中不存在的行。它基于所有列的值进行比较,且不考虑行顺序。

# 找出MySQL中有但在Iceberg中没有的行(潜在的数据丢失)df_missing_in_iceberg = df_mysql_table.subtract(df_iceberg_table)# 找出Iceberg中有但在MySQL中没有的行(潜在的脏数据或额外数据)df_extra_in_iceberg = df_iceberg_table.subtract(df_mysql_table)print("MySQL中有但在Iceberg中没有的行 (数据丢失):")df_missing_in_iceberg.show()print("Iceberg中有但在MySQL中没有的行 (额外数据):")df_extra_in_iceberg.show()# 如果需要合并差异,可以对两者进行union# df_diff_subtract = df_missing_in_iceberg.unionAll(df_extra_in_iceberg)# df_diff_subtract.show()

优点:

简单直观: 代码简洁,易于理解。性能较好: 对于大规模数据集,通常比哈希比较更快,因为它利用了Spark的优化。忽略行顺序: 对于大多数数据同步场景,行顺序并不重要。

缺点:

无法检测行内差异: 如果一行数据的主键相同,但其他列的值发生了变化,subtract()无法直接检测到,因为它只比较完整的行。不检测重复行: 如果源表和目标表都有重复行,subtract()不会将这些重复行视为差异,因为它在内部会去重。

2.3 方法三:DataFrame的exceptAll()操作

exceptAll()方法与subtract()类似,但它会考虑重复行和行顺序。它返回一个DataFrame,其中包含第一个DataFrame中有但在第二个DataFrame中没有的所有行,包括重复行。如果exceptAll()的结果为空,则表示两个DataFrame完全相同(包括行顺序和重复行)。

# 找出df_mysql_table中有但在df_iceberg_table中没有的行,包括重复行diff_mysql_to_iceberg = df_mysql_table.exceptAll(df_iceberg_table)# 找出df_iceberg_table中有但在df_mysql_table中没有的行,包括重复行diff_iceberg_to_mysql = df_iceberg_table.exceptAll(df_mysql_table)print("MySQL中有但在Iceberg中没有的行 (包括重复行):")diff_mysql_to_iceberg.show()print("Iceberg中有但在MySQL中没有的行 (包括重复行):")diff_iceberg_to_mysql.show()# 检查是否存在差异if diff_mysql_to_iceberg.count() == 0 and diff_iceberg_to_mysql.count() == 0:    print("两个DataFrames完全相同 (包括行顺序和重复行)。")else:    print("两个DataFrames存在差异。")

优点:

最严格的比较: 能够检测所有类型的差异,包括行内值变化、行缺失、行新增以及重复行的差异。适用于单元测试: 在需要精确验证两个DataFrame是否完全一致的场景(如单元测试)中非常有用。

缺点:

性能开销可能最大: 由于需要考虑重复行和行顺序,其计算复杂度可能高于subtract()。对行顺序敏感: 如果数据同步过程中行顺序发生变化,即使数据内容相同,exceptAll()也会将其视为差异,这在某些场景下可能不是期望的行为。

3. 方法选择与性能考量

在选择合适的校验方法时,需要综合考虑数据规模、对差异检测的严格程度以及性能要求。

数据规模(例如10TB数据): 对于10TB级别的数据,性能是首要考虑因素。

哈希比较: 对每一行计算哈希值并进行全连接,计算量和网络传输量都非常大,可能成为性能瓶颈。subtract(): 通常比哈希比较高效,因为它利用了Spark的分布式去重和集合操作优化。exceptAll(): 性能可能略低于subtract(),因为它需要更严格地处理重复行和行顺序。

差异检测需求:

仅关注行是否存在: 如果只关心源数据是否全部同步到目标,以及目标中是否有不属于源数据的额外行,subtract()是高效且足够的。关注行内值变化: 如果需要精确到列级别的差异,例如某个字段的值在同步后发生了改变,那么哈希比较是更合适的选择。关注所有差异(包括重复行和顺序): 如果需要最严格的校验,例如在进行精确的单元测试时,exceptAll()是最佳选择。

总结性建议:

对于生产环境中的大规模数据同步校验,如果主要目标是检测数据丢失或额外数据,且不关心行内值的细微变化(即只要主键相同,就认为行是匹配的),subtract()方法通常是效率和效果的良好平衡。如果需要检测行内任意列的值变化,哈希比较是必要的,但需要注意其性能开销。可以考虑只对关键业务列进行哈希,或者结合subtract()先找出缺失/额外行,再对匹配行进行哈希比较。exceptAll()在需要极致精确度(如单元测试)的场景下表现出色,但在大规模生产数据校验中,其性能开销可能需要权衡。

4. 优化与注意事项

增量校验: 对于持续同步的数据,全量校验成本很高。可以考虑实现增量校验,例如只校验最近一段时间内同步的数据批次或分区。分区表利用: 如果数据湖表是分区表,可以利用分区信息进行更细粒度的校验,减少每次校验的数据量。主键索引: 确保源表和目标表都具有有效的主键或唯一标识符,这对于进行高效的连接和比较至关重要。数据类型一致性: 在进行比较之前,确保源和目标DataFrame的数据类型一致,否则可能导致不准确的比较结果。列顺序: 使用select方法显式指定列顺序,以确保DataFrame的列顺序一致,这对于subtract()和exceptAll()非常重要。抽样校验: 对于非关键数据或快速检查,可以对数据进行抽样,以降低校验成本。

5. 结论

在Flink CDC将数据从数据库流式传输到数据湖后,数据完整性校验是不可或缺的一环。PySpark提供了多种强大的工具来完成这项任务。通过理解哈希比较、subtract()和exceptAll()这三种方法的特点、优缺点和性能考量,开发者可以根据具体的业务需求和数据规模,选择最合适的校验策略,从而有效地保障数据湖中数据的质量和可靠性。在实际应用中,往往需要结合多种方法,甚至构建更复杂的自动化数据质量监控体系,以应对不断变化的数据挑战。

以上就是Flink CDC数据同步后的数据完整性校验:PySpark实践指南的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/847368.html

赞 (0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
电脑任务栏看不到打开的图标怎么办(教你解决电脑任务栏无法显示图标的问题)
上一篇 2025年11月27日 16:02:30
Python 3 学习笔记:环境搭建
下一篇 2025年11月27日 16:02:31

相关推荐

  • JavaScript中的模块联邦如何实现微前端的代码共享?

    模块联邦通过运行时动态加载实现微前端代码共享,无需打包公共依赖。使用 ModuleFederationPlugin 配置 name、remotes、exposes 和 shared,使应用可暴露或引入远程模块,支持组件、工具函数及状态管理共享,提升复用性并减少冗余。 模块联邦通过在构建时让不同应用直…

    2026年9月21日
    100
  • 如何系统学习蝴蝶号无人直播运营的核心知识

    如何系统学习蝴蝶号无人直播运营的核心知识如何系统学习蝴蝶号无人直播运营的核心知识如何系统学习蝴蝶号无人直播运营的核心知识如何系统学习蝴蝶号无人直播运营的核心知识

    要系统学习蝴蝶号无人直播运营的核心知识,首先要理解平台逻辑、制定精细化内容策略、掌握自动化技术并持续进行数据分析与风险控制。具体包括:一是深入研究平台算法和规则边界,确保操作合规;二是构建高质量、多样化且合规的内容素材库,并进行标签化管理;三是选择安全可靠的自动化工具,避免使用违规软件;四是模拟真人…

    2026年9月21日 • 用户投稿
    200
  • 天眼查app怎么看一个公司的法院判决书_天眼查公司法院判决书查询

    通过天眼查App可查询公司法律纠纷详情。首先登录并搜索企业名称进入主页,再点击“法律诉讼”板块查看案件列表,最后筛选已结案案件并点击查看裁判文书获取判决书全文,部分敏感信息可能不予展示。 如果您想了解一家公司涉及的法律纠纷详情,查阅其法院判决书是重要的途径之一。天眼查App整合了公开的司法信息,可以…

    2026年9月21日
    000
  • MySQL执行计划中的Extra字段代表什么_怎么看优化空间?

    MySQL执行计划中的Extra字段代表什么_怎么看优化空间?MySQL执行计划中的Extra字段代表什么_怎么看优化空间?MySQL执行计划中的Extra字段代表什么_怎么看优化空间?MySQL执行计划中的Extra字段代表什么_怎么看优化空间?

    在 mysql 查询优化中,执行计划的 extra 字段用于说明查询执行时的额外操作,常见的值包括:1. using filesort 表示需要额外排序,应尽量通过建立索引避免;2. using temporary 表示使用了临时表,常见于 group by 或复杂 join,需优化减少其使用;3.…

    2026年9月21日 • 用户投稿
    000
  • OPPO官宣哈苏专业影像套装:为Find X9系列打造“口袋中的完全体哈苏”

    OPPO官宣哈苏专业影像套装:为Find X9系列打造“口袋中的完全体哈苏”OPPO官宣哈苏专业影像套装:为Find X9系列打造“口袋中的完全体哈苏”OPPO官宣哈苏专业影像套装:为Find X9系列打造“口袋中的完全体哈苏”OPPO官宣哈苏专业影像套装:为Find X9系列打造“口袋中的完全体哈苏”

    10月13日,oppo正式宣布将发布哈苏专业影像套装,涵盖哈苏专业增距镜、全新磁吸手柄、磁吸保护壳以及专业手机肩带等配件。该套装被官方誉为“口袋里的完整版哈苏”,主打“追星无需携带相机”的理念,将于10月16日随find x9系列一同亮相,并专为find x9 pro机型优化适配。 图片来源@OPP…

    2026年9月21日 • 用户投稿
    000
  • 如何通过tracert命令追踪数据包从本地到目标服务器的完整路径?

    打开命令提示符,输入cmd并回车;2. 执行tracert 目标地址命令追踪路径;3. 查看每跳响应时间与IP,分析延迟变化定位网络瓶颈;4. 注意部分节点可能因防火墙不响应导致超时。 使用 tracert(Windows 系统)命令可以追踪数据包从你的计算机到目标服务器所经过的每一跳网络节点,帮助…

    2026年9月21日
    900
  • iPhone声音小如何解决

    确认音量是否被调低 第一步,检查iPhone的音量是否被误调至最低。可以通过按压手机左侧的音量加减键,观察屏幕上的音量条是否处于合理范围。同时留意是否启用了静音模式——手机左侧的静音开关若拨到静音位置(显示橙色),声音会明显变小甚至无声,将其拨回非静音状态即可恢复正常。 清洁扬声器孔 扬声器出声孔被…

    2026年9月21日
    000
  • UC浏览器网页上的文字无法选中复制怎么办 UC浏览器解决网页文字禁止复制问题

    答案:可通过开发者工具、阅读模式、打印预览、OCR识别或自定义脚本解除UC浏览器网页复制限制。具体操作依次为:开启开发者工具并执行JavaScript代码解除限制;启用阅读模式净化页面内容;使用打印预览重新渲染页面以选中文字;对截图应用OCR技术提取文本;添加书签脚本自动移除禁用选择的代码,从而实现…

    2026年9月21日
    000
  • MySQL数据分库分表如何设计_避免性能瓶颈的方法?

    MySQL数据分库分表如何设计_避免性能瓶颈的方法?MySQL数据分库分表如何设计_避免性能瓶颈的方法?MySQL数据分库分表如何设计_避免性能瓶颈的方法?MySQL数据分库分表如何设计_避免性能瓶颈的方法?

    分库分表设计需注意分片键选择、分片数量控制、避免跨库查询及完善运维体系。一,优先选择高频查询字段作为分片键,如用户id,避免使用时间戳以防写热点;二,初期合理分片(如4~8库,每库4~8表),预留扩容空间并根据数据总量反推分片数;三,尽量避免跨库查询,可通过冗余数据、异步汇总或强制路由优化;四,配套…

    2026年9月21日 • 用户投稿
    000
  • 抖音蝴蝶号无人直播带货操作流程及注意事项

    抖音蝴蝶号无人直播带货操作流程及注意事项抖音蝴蝶号无人直播带货操作流程及注意事项抖音蝴蝶号无人直播带货操作流程及注意事项抖音蝴蝶号无人直播带货操作流程及注意事项

    “抖音蝴蝶号无人直播带货”是一种通过自动化或半自动化技术实现的直播销售模式。①其核心在于摆脱真人主播限制,实现24小时不间断直播,提升效率与流量利用率;②关键步骤包括明确账号定位与商品选择、准备高质量且丰富的内容素材、利用虚拟人或预录内容实现直播推流、结合智能客服模拟评论区互动;③优势在于降低人力成…

    2026年9月21日 • 用户投稿
    500
  • VSCode侧边栏怎么去掉_VSCode侧边栏隐藏教程

    隐藏VSCode侧边栏可通过Ctrl + B(Windows/Linux)或Cmd + B(macOS)快捷键快速切换,也可通过菜单栏“视图 > 外观 > 切换侧边栏可见性”或命令面板执行“View: Toggle Sidebar Visibility”实现。推荐使用快捷键操作,效率最高…

    2026年9月21日
    000
  • win10连接打印机错误0x00000709怎么办_win10打印机连接错误修复方法

    错误代码0x00000709通常因权限不足、系统更新冲突或服务异常导致共享打印机连接失败。可使用专业工具一键修复,或通过修改注册表权限、卸载KB5005569等特定更新、重启Print Spooler及相关服务,以及添加Windows凭据(如IP地址和guest账户)解决该问题。 当您在Window…

    2026年9月21日
    100
  • MobileCLIP2— 苹果开源的端侧多模态模型

    MobileCLIP2— 苹果开源的端侧多模态模型MobileCLIP2— 苹果开源的端侧多模态模型MobileCLIP2— 苹果开源的端侧多模态模型MobileCLIP2— 苹果开源的端侧多模态模型

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 可图大模型 可图大模型(Kolors)是快手大模型团队自研打造的文生图AI大模型 32 查看详情 MobileCLIP2是什么 mobileclip2是由苹果研究团队开发的新一代高效多模态模型,…

    2026年9月21日 • 用户投稿
    100
  • 如何利用蝴蝶号自动直播间打造被动收入系统

    如何利用蝴蝶号自动直播间打造被动收入系统如何利用蝴蝶号自动直播间打造被动收入系统如何利用蝴蝶号自动直播间打造被动收入系统如何利用蝴蝶号自动直播间打造被动收入系统

    要打造蝴蝶号自动直播间实现被动收入,核心在于用预设内容和智能系统替代真人出镜,构建低干预、可持续的流量转化模式。1.内容策略上选择“长寿型”内容,如软件教程、助眠音频、产品演示,并设计循环播放逻辑;2.技术搭建时优化互动设置,嵌入商品链接与自动弹幕,提升直播间活性;3.多渠道引流,结合短视频与社交媒…

    2026年9月21日 • 用户投稿
    000
  • MySQL用户权限体系配置思路_Sublime中编辑多用户分权管理脚本

    MySQL用户权限体系配置思路_Sublime中编辑多用户分权管理脚本MySQL用户权限体系配置思路_Sublime中编辑多用户分权管理脚本MySQL用户权限体系配置思路_Sublime中编辑多用户分权管理脚本MySQL用户权限体系配置思路_Sublime中编辑多用户分权管理脚本

    最小权限原则是mysql用户权限配置的核心,确保每个用户仅拥有必要权限以提升安全性与可维护性。1.明确需求:根据用户角色分配如只读、增删改查或结构修改权限;2.创建用户并编写sql脚本进行权限管理,替代手动输入命令,提高效率与一致性;3.使用sublime text等编辑器提升脚本编写效率,利用语法…

    2026年9月21日 • 用户投稿
    000
  • mac怎么在菜单栏显示日期_Mac菜单栏显示日期方法

    首先启用菜单栏时钟显示,进入系统设置→控制中心→日期与时间→开启“在菜单栏中显示”;接着在“桌面与程序坞”→“时钟”中勾选“显示日期”以显示星期和具体日期,可选开启24小时制或秒数;若设置未生效,可通过终端执行killall SystemUIServer命令强制刷新菜单栏。 如果您发现Mac的菜单栏…

    2026年9月21日
    200
  • 音乐文件占用空间太多怎么办_音乐文件占用空间太多如何整理详细指南

    解决音乐文件占空间问题的关键是压缩与整理:先用软件或在线工具降低比特率压缩体积,再按场景分类、利用元数据自动归集,并通过听歌片段和BPM判断保留内容,避免重复与误删。 音乐文件占空间太多,核心解决办法就两条:一是压缩单个文件体积,二是通过有效分类管理提升使用效率。直接删歌不是长久之计,学会整理和优化…

    2026年9月21日
    000
  • Via浏览器在鸿蒙系统上运行会闪退怎么办_Via浏览器鸿蒙系统闪退的解决方法

    Via浏览器闪退可依次尝试清除缓存数据、更新或重装应用、检查系统更新与存储空间、禁用硬件加速功能,必要时通过开发者模式启用USB调试并使用DevEco Studio捕获日志定位问题。 如果您在使用Via浏览器访问网页时,应用突然关闭或无法正常启动,则可能是由于软件兼容性或系统资源问题导致。以下是解决…

    2026年9月21日
    300
  • VSCode的便携模式(Portable Mode)如何工作,它适合哪些使用场景?

    VSCode便携模式通过将编辑器与data文件夹置于同一目录,实现配置、扩展和数据的集中存储,无需安装即可运行。1. 下载ZIP版解压至目标路径;2. 创建data文件夹;3. 运行Code.exe,所有数据自动存入data目录。适用于公共电脑、跨设备开发、教学演示、测试配置及受限环境。需注意手动更…

    2026年9月21日
    100
  • 升级X86架构性能大提升!极空间Z2 Ultra图赏

    升级X86架构性能大提升!极空间Z2 Ultra图赏升级X86架构性能大提升!极空间Z2 Ultra图赏升级X86架构性能大提升!极空间Z2 Ultra图赏升级X86架构性能大提升!极空间Z2 Ultra图赏

    10月23日,极空间正式推出全新双盘位nas产品——极空间z2 ultra,官方售价为1899元,参与国家补贴后仅需1457元,性价比进一步提升。 此次发布的Z2 Ultra最大的亮点在于采用X86架构处理器,相较以往使用的ARM平台,性能实现飞跃式提升,运行速度显著加快。更重要的是,新架构对Doc…

    2026年9月21日 • 用户投稿
    200

发表回复

登录后才能评论
关注微信