spark

  • 「Spark从精通到重新入门(二)」Spark中不可不知的动态资源分配

    「Spark从精通到重新入门(二)」Spark中不可不知的动态资源分配「Spark从精通到重新入门(二)」Spark中不可不知的动态资源分配「Spark从精通到重新入门(二)」Spark中不可不知的动态资源分配「Spark从精通到重新入门(二)」Spark中不可不知的动态资源分配

    前言 资源是影响 Spark 应用执行效率的一个关键因素。Spark 应用中执行任务的组件是 Executor,通过 spark.executor.instances 参数可以设定 Spark 应用的 Executor 数量。在运行过程中,无论 Executor 上是否有任务在执行,它都会被持续占用…

    2025年11月8日 用户投稿
    200
  • Spark 内部原理(上) – 计算引擎与调度管理

    Spark 内部原理(上) – 计算引擎与调度管理Spark 内部原理(上) – 计算引擎与调度管理Spark 内部原理(上) – 计算引擎与调度管理Spark 内部原理(上) – 计算引擎与调度管理

    本文主要探讨spark计算引擎与调度管理的实现方式,包括spark计算引擎原理、spark调度管理原理、spark存储管理原理以及spark监控管理。 一:Spark计算引擎原理 Spark计算引擎的核心流程是从RDD创建DAG图,通过DAG图生成逻辑计划,划分Stage并生成Task,最后调度并执…

    2025年11月8日 用户投稿
    000
  • 初识Structured Streaming

    初识Structured Streaming初识Structured Streaming初识Structured Streaming初识Structured Streaming

    设想我们要设计一个交易数据展示系统,实时呈现比特币最近1s钟的成交均价。 我们可以通过交易数据接口以非常低的延迟获得全球各个比特币交易市场的每一笔比特币的成交价,成交额,交易时间。 由于比特币交易事件一直在发生,所以交易事件触发的交易数据会像流水一样源源不断地通过交易接口传给我们。 如何对这种流式数…

    2025年11月7日 用户投稿
    700
  • MySql和Spark比较分析:如何根据大数据处理需求选择合适的工具

    随着互联网和物联网的快速发展,大数据的处理需求也越来越高,越来越多的企业开始关注和利用大数据来进行业务决策和优化。而在处理大数据时,选择合适的工具显得尤为重要。本文将就mysql和spark这两大数据处理工具进行比较分析,从而帮助企业选择合适的工具来处理大数据。 数据处理方式 MySql是一种关系型…

    2025年11月4日
    000
  • 使用宝塔面板搭建Hadoop、Spark等大数据平台

    近年来,大数据技术在各个领域都得到越来越广泛的应用。相比于传统的数据库和数据分析工具,hadoop、spark等大数据平台具有更强的扩展性、易用性、容错性、实时性和效率。虽然搭建大数据平台需要具备一定的技术水平,但是通过使用宝塔面板,可以大大降低搭建大数据平台的难度和复杂度。 一、宝塔面板简介 宝塔…

    2025年11月4日
    400
关注微信