当前位置: 开发笔记 > 后端 > 正文

hive和hadoop的浅显理解

作者：love四叶草health | 来源：互联网 | 2023-09-04 09:37

hadoop是一个分布式存储系统，他可以将我们的日志、数据等存储到不同的节点上（当数据十分大的时候），有时候一份数据会被存储

hadoop是一个分布式存储系统&＃xff0c;他可以将我们的日志、数据等存储到不同的节点上&＃xff08;当数据十分大的时候&＃xff09;&＃xff0c;有时候一份数据会被存储到不同机器的不同磁盘上面。

那么问题来了&＃xff1a;
我们想取出这么一整份数据并做对应计算怎么办呢&＃xff1f;
这个时候&＃xff0c;mapreduce就应运而生。它是一个依托于hadoop上的计算引擎&＃xff0c;主要就是对数据进行合并汇总等操作&＃xff0c;本身并不存储数据。
那hive是什么呢&＃xff1f;
hive是基于hadoop的一个数据仓库工具。由于mapreduce程序比较复杂&＃xff0c;故而hive对他做了一层封装。它可以将我们写的hql翻译成mapreduce去计算数据。说白了&＃xff0c;它就是一个搞翻译的。

但是由于mapreduce每次都是对磁盘进行操作&＃xff0c;每次中间job操作的输出结果&＃xff0c;都是先存到磁盘里面的&＃xff0c;这样再去读取中间job的数据再进行操作的时候&＃xff0c;速度就很慢。
这个时候 spark计算引擎就可以解决这个问题&＃xff0c;spark每次中间job的操作结果&＃xff0c;都是存入内存&＃xff0c;之后的读取也是直接从内存读出&＃xff0c;大大的提高了数据计算的速度&＃xff0c;也因为如此 spark的计算成本要比mapreduce贵&＃xff08;一个用内存过渡&＃xff0c;一个用磁盘过渡&＃xff09;。当然spark并不止依托于分布式存储系统上面。

mapreduce和spark的共同点之一&＃xff1a;他们均不存储数据&＃xff0c;只对数据进行操作&＃xff08;计算&＃xff09;
浅显理解&＃xff0c;本文完毕。在这里插入图片描述

推荐阅读

spark
Hadoop入门与核心组件详解

本文详细介绍了Hadoop的基础知识及其核心组件，包括HDFS、MapReduce和YARN。通过本文，读者可以全面了解Hadoop的生态系统及应用场景。 ... [详细]

蜡笔小新 2024-12-26 13:12:48
token
Hadoop发行版本选择指南：技术解析与应用实践

本文详细介绍了Hadoop的不同发行版本及其特点，帮助读者根据实际需求选择最合适的Hadoop版本。内容涵盖Apache Hadoop、Cloudera CDH等主流版本的特性及应用场景。 ... [详细]

蜡笔小新 2024-12-22 20:38:12
队列
深入解析Hadoop的核心组件与工作原理

本文详细介绍了Hadoop的三大核心组件：分布式文件系统HDFS、资源管理器YARN和分布式计算框架MapReduce。通过分析这些组件的工作机制，帮助读者更好地理解Hadoop的架构及其在大数据处理中的应用。 ... [详细]

蜡笔小新 2024-12-19 17:17:51
队列
全面解析运维监控：白盒与黑盒监控及四大黄金指标

本文深入探讨了白盒和黑盒监控的概念，以及它们在系统监控中的应用。通过详细分析基础监控和业务监控的不同采集方法，结合四个黄金指标的解读，帮助读者更好地理解和实施有效的监控策略。 ... [详细]

蜡笔小新 2024-12-22 14:02:29
队列
Hive中Map任务数量的确定方法

本文探讨了Hive作业中Map任务数量的确定方式，主要涉及HiveInputFormat和CombineHiveInputFormat两种InputFormat的分片计算逻辑。通过调整相关参数，可以有效控制Map任务的数量，进而优化Hive作业的性能。 ... [详细]

蜡笔小新 2024-12-19 11:36:41
队列
深入解析BookKeeper的设计与应用场景

本文介绍了由Yahoo在2009年开发并于2011年开源的BookKeeper技术。BookKeeper是一种高效且可靠的日志流存储解决方案，广泛应用于需要高性能和强数据持久性的场景。 ... [详细]

蜡笔小新 2024-12-19 11:08:57
log4j
解决Hive启动时权限被拒问题

本文详细分析了Hive在启动过程中遇到的权限拒绝错误，并提供了多种解决方案，包括调整文件权限、用户组设置以及环境变量配置等。 ... [详细]

蜡笔小新 2024-12-26 19:14:29
log4j
深入解析 Apache Flink 的保存点机制

在本周的白板演练中，Apache Flink 的 PMC 成员及数据工匠首席技术官 Stephan Ewen 深入探讨了如何利用保存点功能进行流处理中的数据重新处理、错误修复、系统升级和 A/B 测试。本文将详细解释保存点的工作原理及其应用场景。 ... [详细]

蜡笔小新 2024-12-24 16:57:24
缓存
技术变现之道：从日常工作中挖掘潜力

本文探讨了如何在日常工作中通过优化效率和深入研究核心技术，将技术和知识转化为实际收益。文章结合个人经验，分享了提高工作效率、掌握高价值技能以及选择合适工作环境的方法，帮助读者更好地实现技术变现。 ... [详细]

蜡笔小新 2024-12-24 15:21:23
缓存
深入解析 org.apache.hadoop.registry.client.impl.zk.ZKPathDumper 类及其应用

本文详细介绍了 Java 中的 org.apache.hadoop.registry.client.impl.zk.ZKPathDumper 类，提供了丰富的代码示例和使用指南。通过这些示例，读者可以更好地理解如何在实际项目中利用 ZKPathDumper 类进行注册表树的转储操作。 ... [详细]

蜡笔小新 2024-12-23 14:15:06
缓存
从码农到创业者：我的职业转型之路

在观察了众多同行的职业发展后，我决定分享自己的故事。本文探讨了为什么大多数程序员难以成为架构师，并阐述了我从一家外企离职后投身创业的心路历程。 ... [详细]

蜡笔小新 2024-12-21 15:55:02
port
使用正则表达式去除字符串中单词间的空格

本文探讨了如何在Hive（基于Hadoop）环境中编写类似SQL的语句，以去除字段中的空格。特别是在处理邮政编码等数据时，去除特定位置的空格是常见的需求。 ... [详细]

蜡笔小新 2024-12-20 19:08:43
yii
备战BAT面试：掌握这些MySQL核心问题

本文深入探讨了MySQL中常见的面试问题，包括事务隔离级别、存储引擎选择、索引结构及优化等关键知识点。通过详细解析，帮助读者在面对BAT等大厂面试时更加从容。 ... [详细]

蜡笔小新 2024-12-20 18:58:01
yii
Apache Spark 基础操作指南

本文详细介绍如何使用 Apache Spark 执行基本任务，包括启动 Spark Shell、运行示例程序以及编写简单的 WordCount 程序。同时提供了参数配置的注意事项和优化建议。 ... [详细]

蜡笔小新 2024-12-20 18:01:20
token
Linux 文件权限与用户配置管理

本文详细介绍了 Linux 系统中用户、组和文件权限的设置方法，包括基本权限（读、写、执行）、特殊权限（SUID、SGID、Sticky Bit）以及相关配置文件的使用。 ... [详细]

蜡笔小新 2024-12-20 09:27:23

love四叶草health

这个家伙很懒，什么也没留下！

Tags | 热门标签

RankList | 热门文章