当前位置: 开发笔记 > 编程语言 > 正文

Hadoop快速入门系列(7)|Hadoop集群HA简介

作者：manassatromble | 来源：互联网 | 2023-10-10 14:05

HA概述1）所谓HA（highavailable），即高可用（7*24小时不中断服务）。2&

HA概述

1&＃xff09;所谓HA&＃xff08;high available&＃xff09;&＃xff0c;即高可用&＃xff08;7*24小时不中断服务&＃xff09;。

2&＃xff09;实现高可用最关键的策略是消除单点故障。HA严格来说应该分成各个组件的HA机制&＃xff1a;HDFS的HA和YARN的HA。

3&＃xff09;Hadoop2.0之前&＃xff0c;在HDFS集群中NameNode存在单点故障&＃xff08;SPOF&＃xff09;。

4&＃xff09;NameNode主要在以下两个方面影响HDFS集群

NameNode机器发生意外&＃xff0c;如宕机&＃xff0c;集群将无法使用&＃xff0c;直到管理员重启

NameNode机器需要升级&＃xff0c;包括软件、硬件升级&＃xff0c;此时集群也将无法使用

HDFS HA功能通过配置Active/Standby两个nameNodes实现在集群中对NameNode的热备来解决上述问题。如果出现故障&＃xff0c;如机器崩溃或机器需要升级维护&＃xff0c;这时可通过此种方式将NameNode很快的切换到另外一台机器。

HDFS-HA工作机制

1&＃xff09;通过双namenode消除单点故障

HDFS-HA工作要点

1&＃xff09;元数据管理方式需要改变&＃xff1a;

内存中各自保存一份元数据&＃xff1b;

Edits日志只有Active状态的namenode节点可以做写操作&＃xff1b;

两个namenode都可以读取edits&＃xff1b;

共享的edits放在一个共享存储中管理&＃xff08;qjournal和NFS两个主流实现&＃xff09;&＃xff1b;

2&＃xff09;需要一个状态管理功能模块

实现了一个zkfailover&＃xff0c;常驻在每一个namenode所在的节点&＃xff0c;每一个zkfailover负责监控自己所在namenode节点&＃xff0c;利用zk进行状态标识&＃xff0c;当需要进行状态切换时&＃xff0c;由zkfailover来负责切换&＃xff0c;切换时需要防止brain split现象的发生。

3&＃xff09;必须保证两个NameNode之间能够ssh无密码登录。

4&＃xff09;隔离&＃xff08;Fence&＃xff09;&＃xff0c;即同一时刻仅仅有一个NameNode对外提供服务

HDFS-HA自动故障转移工作机制

前面学习了使用命令hdfs haadmin -failover手动进行故障转移&＃xff0c;在该模式下&＃xff0c;即使现役NameNode已经失效&＃xff0c;系统也不会自动从现役NameNode转移到待机NameNode&＃xff0c;下面学习如何配置部署HA自动进行故障转移。自动故障转移为HDFS部署增加了两个新组件&＃xff1a;ZooKeeper和ZKFailoverController&＃xff08;ZKFC&＃xff09;进程。ZooKeeper是维护少量协调数据&＃xff0c;通知客户端这些数据的改变和监视客户端故障的高可用服务。HA的自动故障转移依赖于ZooKeeper的以下功能&＃xff1a;

1&＃xff09;故障检测&＃xff1a;集群中的每个NameNode在ZooKeeper中维护了一个持久会话&＃xff0c;如果机器崩溃&＃xff0c;ZooKeeper中的会话将终止&＃xff0c;ZooKeeper通知另一个NameNode需要触发故障转移。

2&＃xff09;现役NameNode选择&＃xff1a;ZooKeeper提供了一个简单的机制用于唯一的选择一个节点为active状态。如果目前现役NameNode崩溃&＃xff0c;另一个节点可能从ZooKeeper获得特殊的排外锁以表明它应该成为现役NameNode。

ZKFC是自动故障转移中的另一个新组件&＃xff0c;是ZooKeeper的客户端&＃xff0c;也监视和管理NameNode的状态。每个运行NameNode的主机也运行了一个ZKFC进程&＃xff0c;ZKFC负责&＃xff1a;

1&＃xff09;健康监测&＃xff1a;ZKFC使用一个健康检查命令定期地ping与之在相同主机的NameNode&＃xff0c;只要该NameNode及时地回复健康状态&＃xff0c;ZKFC认为该节点是健康的。如果该节点崩溃&＃xff0c;冻结或进入不健康状态&＃xff0c;健康监测器标识该节点为非健康的。

2&＃xff09;ZooKeeper会话管理&＃xff1a;当本地NameNode是健康的&＃xff0c;ZKFC保持一个在ZooKeeper中打开的会话。如果本地NameNode处于active状态&＃xff0c;ZKFC也保持一个特殊的znode锁&＃xff0c;该锁使用了ZooKeeper对短暂节点的支持&＃xff0c;如果会话终止&＃xff0c;锁节点将自动删除。

3&＃xff09;基于ZooKeeper的选择&＃xff1a;如果本地NameNode是健康的&＃xff0c;且ZKFC发现没有其它的节点当前持有znode锁&＃xff0c;它将为自己获取该锁。如果成功&＃xff0c;则它已经赢得了选择&＃xff0c;并负责运行故障转移进程以使它的本地NameNode为active。故障转移进程与前面描述的手动故障转移相似&＃xff0c;首先如果必要保护之前的现役NameNode&＃xff0c;然后本地NameNode转换为active状态。

推荐阅读

export
构建高可用性Spark分布式集群：大数据环境下的最佳实践

在构建高可用性的Spark分布式集群过程中，确保所有节点之间的无密码登录是至关重要的一步。通过在每个节点上生成SSH密钥对（使用 `ssh-keygen -t rsa` 命令并保持默认设置），可以实现这一目标。此外，还需将生成的公钥分发到所有节点的 `~/.ssh/authorized_keys` 文件中，以确保节点间的无缝通信。为了进一步提升集群的稳定性和性能，建议采用负载均衡和故障恢复机制，并定期进行系统监控和维护。 ... [详细]

蜡笔小新 2024-11-02 14:18:50
controller
05Hadoop的HA搭建

前期Linux环境准备1.修改Linux主机名2.修改IP3.修改主机名和IP的映射关系4.关闭防火墙5.ssh免登陆6.安装JDK，配置环境变量等集群规划主机 IP安装软件运行进 ... [详细]

蜡笔小新 2024-10-16 18:20:36
controller
大数据领域的职业路径与角色解析

本文将深入探讨大数据领域的各种职业和工作角色，帮助读者全面了解大数据行业的需求、市场趋势，以及从入门到高级专业人士的职业发展路径。文章还将详细介绍不同公司对大数据人才的需求，并解析各岗位的具体职责、所需技能和经验。 ... [详细]

蜡笔小新 2024-11-16 08:54:03
io
Hadoop 2.6 日志文件解析与MapReduce日志管理深入探讨

Hadoop 2.6 主要由 HDFS 和 YARN 两大部分组成，其中 YARN 包含了运行在 ResourceManager 的 JVM 中的组件以及在 NodeManager 中运行的部分。本文深入探讨了 Hadoop 2.6 日志文件的解析方法，并详细介绍了 MapReduce 日志管理的最佳实践，旨在帮助用户更好地理解和优化日志处理流程，提高系统运维效率。 ... [详细]

蜡笔小新 2024-11-03 16:23:38
select
技术日志：深入探讨Spark Streaming与Spark SQL的融合应用

技术日志：深入探讨Spark Streaming与Spark SQL的融合应用 ... [详细]

蜡笔小新 2024-10-30 14:20:53
controller
【原创】七、Hadoop 2.5.2+zookeeper高可用部署

一、原理（四大要点）（1）保证元数据一致（edits）namenode（fsimage edits）a、NFSb、journalnodec、zk（2）只有一台namenode对外提 ... [详细]

蜡笔小新 2024-10-15 12:25:58
io
Zookeeper在Hadoop生态系统中的关键作用与应用分析

Zookeeper作为Apache Hadoop生态系统中的一个重要组件，主要致力于解决分布式应用中的常见数据管理难题。它提供了统一的命名服务、状态同步服务以及集群管理功能，有效提升了分布式系统的可靠性和可维护性。此外，Zookeeper还支持配置管理和临时节点管理，进一步增强了其在复杂分布式环境中的应用价值。 ... [详细]

蜡笔小新 2024-11-04 15:48:51
io
Hadoop集群搭建常见问题与解决方案（一）：避免配置过程中的常见陷阱

在搭建Hadoop集群以处理大规模数据存储和频繁读取需求的过程中，经常会遇到各种配置难题。本文总结了作者在实际部署中遇到的典型问题，并提供了详细的解决方案，帮助读者避免常见的配置陷阱。通过这些经验分享，希望读者能够更加顺利地完成Hadoop集群的搭建和配置。 ... [详细]

蜡笔小新 2024-11-03 19:59:23
io
Hadoop + Spark安装(三) —— 调hadoop

***************************测试hadoop及问题跟进***************************执行以下语句报错datahadoop-2.9. ... [详细]

蜡笔小新 2024-10-17 11:56:27
io
构建用户画像环境：Hive与SparkSQL的高效整合

本文介绍如何通过整合SparkSQL与Hive来构建高效的用户画像环境，提高数据处理速度和查询效率。 ... [详细]

蜡笔小新 2024-11-19 09:44:24
io
Kafka 集群的高效部署与优化策略

本文探讨了 Kafka 集群的高效部署与优化策略。首先介绍了 Kafka 的下载与安装步骤，包括从官方网站获取最新版本的压缩包并进行解压。随后详细讨论了集群配置的最佳实践，涵盖节点选择、网络优化和性能调优等方面，旨在提升系统的稳定性和处理能力。此外，还提供了常见的故障排查方法和监控方案，帮助运维人员更好地管理和维护 Kafka 集群。 ... [详细]

蜡笔小新 2024-11-06 20:37:50
io
第二章：Kafka基础入门与核心概念解析

本章节主要介绍了Kafka的基本概念及其核心特性。Kafka是一种分布式消息发布和订阅系统，以其卓越的性能和高吞吐量而著称。最初，Kafka被设计用于LinkedIn的活动流和运营数据处理，旨在高效地管理和传输大规模的数据流。这些数据主要包括用户活动记录、系统日志和其他实时信息。通过深入解析Kafka的设计原理和应用场景，读者将能够更好地理解其在现代大数据架构中的重要地位。 ... [详细]

蜡笔小新 2024-11-06 11:10:03
io
Hadoop中NameNode与SecondaryNameNode的运行机制解析

在Hadoop架构中，NameNode中的元数据存储位置是一个关键问题。通常，元数据会存储在内存中以提高访问效率，因为频繁的磁盘随机访问会导致性能下降。此外，NameNode还会定期将元数据的快照保存到磁盘上，以确保数据的持久性和恢复能力。SecondaryNameNode则负责定期合并这些快照和编辑日志，进一步增强系统的稳定性和可靠性。 ... [详细]

蜡笔小新 2024-11-04 11:41:43
io
HBase在金融大数据迁移中的应用与挑战

随着最后一台设备的下线，标志着超过10PB的HBase数据迁移项目顺利完成。目前，新的集群已在新机房稳定运行超过两个月，监控数据显示，新集群的查询响应时间显著降低，系统稳定性大幅提升。此外，数据消费的波动也变得更加平滑，整体性能得到了显著优化。 ... [详细]

蜡笔小新 2024-10-31 14:06:06
io
HDFS基础知识与数据读写机制详解

本文详细介绍了HDFS的基础知识及其数据读写机制。首先，文章阐述了HDFS的架构，包括其核心组件及其角色和功能。特别地，对NameNode进行了深入解析，指出其主要负责在内存中存储元数据、目录结构以及文件块的映射关系，并通过持久化方案确保数据的可靠性和高可用性。此外，还探讨了DataNode的角色及其在数据存储和读取过程中的关键作用。 ... [详细]

蜡笔小新 2024-10-30 11:58:25

manassatromble

这个家伙很懒，什么也没留下！

Tags | 热门标签

RankList | 热门文章