Spark内核分析之Shuffle操作流程（非常重要）

作者：超级-郁闷中 | 来源：互联网 | 2023-09-14 08:14

如题，我们来分析一下spark的shuffle操作原理；为什么说其非常重要，是因为shuffle操作是我们在Spark调优中非常重要的一环，对shuffle进行了优

如题，我们来分析一下spark的shuffle操作原理；为什么说其非常重要，是因为shuffle操作是我们在Spark调优中非常重要的一环，对shuffle进行了优化，往往可以使得我们的spark程序运行效率有极大的提升。依照惯例，我们先来看一张图；

《Spark内核分析之Shuffle操作流程（非常重要）》普通shuffle流程图

上图是一个普通的Shuffle操作流程原理图，一个shuffle操作由三个RDD算子构成，分别是mapPartitionsRDD，ShuffleRDD，mapPartitionsRDD；如上图所示，

1.每个ShuffleMapTask都会为每个ResultTask创建一个Bucket缓存和一个对应的ShuffleBlockFile磁盘文件；2.每个ShuffleMapTask的输出相关信息封装成一个MapStatus发送到DAGScheduler的MapOutputTracker中去；
3.ResultTask开始拉取该任务所需要的数据，ResultTask通过向DAGScheduler的MapOutputTracker获取MapStatus的信息，从而知道自己需要的数据所在的位置，然后去相应的位置拉去数据到该任务所在节点的内存中，如果内存不够，会将部分数据写入磁盘，完成这系列的操作是由ShufflerRDD算子完成的；
4.然后ResultTask对拉取到的数据进行聚合操作，最后生成mapPartitionsRDD算子；

想想上面的这个Shuffler流程会有什么问题？

我们来做一个假设，如果有100个ShuffleMapTask，2个CPU Core，100个ResultTask，那么这个shuffler操作将产生10000个文件，如此多的文件对于Spark作业的性能就是一个灾难；针对这个问题当然有对应的优化策略，接着我们来看另外一张图；

《Spark内核分析之Shuffle操作流程（非常重要）》优化的Shuffler流程图

通过优化的Shuffler操作如上图所示，假设有100个ShufflerMapTask，2CPU core，100个Resulttask，优化后产生的中间文件是200个，是优化之前的1/50；那么这是如何做到的，通过阅读源码可以知道，只要引入consolidation机制就可以实现了，其配置是通过在SparkConf中配置对应的参数即可实现；

来简单分析一下：一个ShuffleMapTask将数据写入本地不变，但是当这一批ShuffleMapTask运行完成以后，下一批ShuffleMapTask开始运行（一批ShuffleMapTask是指，同一时间有两个Task并行执行，因为有两个CPU Core），它们产生的数据会直接写入上一批ShuffleMapTask产生的本地文件中；上图中左边的一组可以称为一组ShuffleGroup，每个文件中都存储了多个ShuffleMapTask的数据，每个ShuffleMapTask所产生的数据是一个segment，每个File中通过索引，偏移量来标记每部分数据来自不同的ShuffleMapTask。

下面我们来看看源码是如何实现的；

《Spark内核分析之Shuffle操作流程（非常重要）》 ShuffleMapTask的runTask

1.首先通过Spark全局变量得到shuffleManager对象，并通过shuffleManager对象获得Write对象；

2.接着，通过rdd.iterator方法对属于自己的partition进行计算，最后会调用我们自己编写的RDD算子来计算partition；

3.接着Writer调用自己的write方法将RDD算子计算的结果写入缓存；

《Spark内核分析之Shuffle操作流程（非常重要）》 HashShuffleWriter的write

1.判断aggregator为true，并且是否设置了map端的combine操作；若成立，则进行map端的数据合并（这里是一个spark优化点，在我之前关于spark优化系列文章中有写过）；

2.对所有经过合并操作之后的数据遍历，根据每个元素获得对应的bucketId，然后将改元素写入对应的bucket缓存中；

这里我们来看看这个shuffle对象做了什么？

《Spark内核分析之Shuffle操作流程（非常重要）》 FileShuffleBlockManager的forMapTask

1.首先创建出一个ShuffleWriterGroup对象；

2.接着判断Spark作业是否设置了consolidateShuffleFiles；如果设置其为true，首先得到一个fileGroup对象，然后使用shuffleId，mapId，BucketId来得到一个blockId，接着根据这个blockId写数据到磁盘的对象；相反，如果没有设置consolidateShuffleFiles为true，则直接为每个shuffleMapTask创建一个blockFile，然后得到一个写数据到磁盘的对象；

3.执行完这里后，接着调用write方法将数据写入内存缓冲bucket，然后再将数据写入磁盘；

写数据到这里就完成了，然后会将产生的数据位置等信息封装成一个MapStatus对象发送给DAGSchedule的MapOutputTracker中；接下来ResultTask开始读取数据；

《Spark内核分析之Shuffle操作流程（非常重要）》 ShuffleRDD的compute
HashShuffleReader的read

《Spark内核分析之Shuffle操作流程（非常重要）》 BlockStoreShuffleFetcher的fetch
BlockStoreShuffleFetcher的fetch

总结：到此shuffle的整个操作流程就分析完了，接下来会分析底层数据存储的核心组件BlockManager的工作原理，，欢迎关注。

如需转载，请注明：

本篇：Spark内核分析之Shuffle操作流程（非常重要）

推荐阅读

char
Scala学习指南：从零开始掌握基础

本指南从零开始介绍Scala编程语言的基础知识，重点讲解了Scala解释器REPL（读取-求值-打印-循环）的使用方法。REPL是Scala开发中的重要工具，能够帮助初学者快速理解和实践Scala的基本语法和特性。通过详细的示例和练习，读者将能够熟练掌握Scala的基础概念和编程技巧。 ... [详细]

蜡笔小新 2024-11-07 18:07:59
char
深入解析NoSQL数据库：键值对、文档、列式存储与图数据库的应用与特点

本文深入探讨了NoSQL数据库的四大主要类型：键值对存储、文档存储、列式存储和图数据库。NoSQL（Not Only SQL）是指一系列非关系型数据库系统，它们不依赖于固定模式的数据存储方式，能够灵活处理大规模、高并发的数据需求。键值对存储适用于简单的数据结构；文档存储支持复杂的数据对象；列式存储优化了大数据量的读写性能；而图数据库则擅长处理复杂的关系网络。每种类型的NoSQL数据库都有其独特的优势和应用场景，本文将详细分析它们的特点及应用实例。 ... [详细]

蜡笔小新 2024-11-09 14:47:28
char
初探性能优化：入门指南与实践技巧

在编程领域，常有“尚未精通编码便急于优化”的声音。为了从性能优化的角度提升代码质量，本文将带领读者初步探索性能优化的基本概念与实践技巧。即使程序看似运行良好，数据处理效率仍有待提高，通过系统学习性能优化，能够帮助开发者编写更加高效、稳定的代码。文章不仅介绍了性能优化的基础知识，还提供了实用的调优方法和工具，帮助读者在实际项目中应用这些技术。 ... [详细]

蜡笔小新 2024-11-07 14:15:35
char
第二章：Kafka基础入门与核心概念解析

本章节主要介绍了Kafka的基本概念及其核心特性。Kafka是一种分布式消息发布和订阅系统，以其卓越的性能和高吞吐量而著称。最初，Kafka被设计用于LinkedIn的活动流和运营数据处理，旨在高效地管理和传输大规模的数据流。这些数据主要包括用户活动记录、系统日志和其他实时信息。通过深入解析Kafka的设计原理和应用场景，读者将能够更好地理解其在现代大数据架构中的重要地位。 ... [详细]

蜡笔小新 2024-11-06 11:10:03
function
深入理解 React 项目中的 Redux 中间件及其应用

在深入研究 React 项目的过程中，特别是在探索 react-router 源码时，我发现了其中蕴含的中间件概念。这激发了我对中间件的进一步思考与整理。本文将详细探讨 Redux 中间件的原理及其在实际项目中的应用，帮助读者更好地理解和使用这一强大工具。通过具体示例和代码解析，我们将揭示中间件如何提升应用的状态管理和异步操作处理能力。 ... [详细]

蜡笔小新 2024-11-05 18:41:01
future
投融资周报 | Circle 达成 4 亿美元融资协议，唯一艺术平台 A 轮融资超千万美元

投融资周报 | Circle 达成 4 亿美元融资协议，唯一艺术平台 A 轮融资超千万美元 ... [详细]

蜡笔小新 2024-11-05 04:56:42
future
使用OpenSSL自建CA证书（实测有效）

本文详细介绍了如何使用OpenSSL自建CA证书的步骤，包括准备工作、生成CA证书、生成服务器待签证书以及证书签名等过程。 ... [详细]

蜡笔小新 2024-11-13 09:55:03
future
Spark与HBase结合处理大规模流量数据结构设计

本文将详细介绍如何利用Spark和HBase进行大规模流量数据的分析与处理，包括数据结构的设计和优化方法。 ... [详细]

蜡笔小新 2024-11-12 19:49:05
char
网站访问全流程解析

本文详细介绍了从用户在浏览器中输入一个域名（如www.yy.com）到页面完全展示的整个过程，包括DNS解析、TCP连接、请求响应等多个步骤。 ... [详细]

蜡笔小新 2024-11-12 18:13:16
install
基于Linux开源VOIP系统LinPhone[四]

****************************************************************************************** ... [详细]

蜡笔小新 2024-11-12 11:00:11
bit
《Linux高性能服务器编程》深入解析：3.2 TCP报头结构与功能

在《Linux高性能服务器编程》一书中，第3.2节深入探讨了TCP报头的结构与功能。TCP报头是每个TCP数据段中不可或缺的部分，它不仅包含了源端口和目的端口的信息，还负责管理TCP连接的状态和控制。本节内容详尽地解析了TCP报头的各项字段及其作用，为读者提供了深入理解TCP协议的基础。 ... [详细]

蜡笔小新 2024-11-10 14:18:44
main
Java Socket 关键参数详解与优化建议

Java Socket 的 API 虽然被广泛使用，但其关键参数的用途却鲜为人知。本文详细解析了 Java Socket 中的重要参数，如 backlog 参数，它用于控制服务器等待连接请求的队列长度。此外，还探讨了其他参数如 SO_TIMEOUT、SO_REUSEADDR 等的配置方法及其对性能的影响，并提供了优化建议，帮助开发者提升网络通信的稳定性和效率。 ... [详细]

蜡笔小新 2024-11-09 21:38:05
text
Bootstrap 学习指南：全面掌握前端框架的核心知识点与实战技巧

### 优化后的摘要本学习指南旨在帮助读者全面掌握 Bootstrap 前端框架的核心知识点与实战技巧。内容涵盖基础入门、核心功能和高级应用。第一章通过一个简单的“Hello World”示例，介绍 Bootstrap 的基本用法和快速上手方法。第二章深入探讨 Bootstrap 与 JSP 集成的细节，揭示两者结合的优势和应用场景。第三章则进一步讲解 Bootstrap 的高级特性，如响应式设计和组件定制，为开发者提供全方位的技术支持。 ... [详细]

蜡笔小新 2024-11-09 16:58:21
text
Web开发框架概览：Java与JavaScript技术及框架综述

Web开发涉及服务器端和客户端的协同工作。在服务器端，Java是一种优秀的编程语言，适用于构建各种功能模块，如通过Servlet实现特定服务。客户端则主要依赖HTML进行内容展示，同时借助JavaScript增强交互性和动态效果。此外，现代Web开发还广泛使用各种框架和库，如Spring Boot、React和Vue.js，以提高开发效率和应用性能。 ... [详细]

蜡笔小新 2024-11-09 11:59:38
main
如何利用Java 5 Executor框架高效构建和管理线程池

Java 5 引入了 Executor 框架，为开发人员提供了一种高效管理和构建线程池的方法。该框架通过将任务提交与任务执行分离，简化了多线程编程的复杂性。利用 Executor 框架，开发人员可以更灵活地控制线程的创建、分配和管理，从而提高服务器端应用的性能和响应能力。此外，该框架还提供了多种线程池实现，如固定线程池、缓存线程池和单线程池，以适应不同的应用场景和需求。 ... [详细]

蜡笔小新 2024-11-07 17:05:32

超级-郁闷中

这个家伙很懒，什么也没留下！

Tags | 热门标签

RankList | 热门文章