使用KyBot优化ApacheKylin存储

作者：瓜妞妹妹 | 来源：互联网 | 2023-08-01 11:45

使用KyBot优化ApacheKylin存储更多干货分布式实战（干货）springcloud实战（干货）mybatis实

使用KyBot优化Apache Kylin存储

一、概述

众所周知&＃xff0c;Apache Kylin基于预计算的思想&＃xff0c;实现了在Hadoop上对PB规模数据集进行高速OLAP分析的需求&＃xff0c;查询性能可以达到秒级甚至亚秒级。既然是预计算&＃xff0c;势必需要占用一定的集群存储资源&＃xff1b;如果使用不当&＃xff0c;可能造成大量的资源浪费。如何优化存储资源占用&＃xff0c;就是本文讨论的话题。

二、关于存储资源

Apache Kylin使用“空间换时间”极大提高了查询效率。但“空间”也并非无限&＃xff0c;不能无节制使用&＃xff1b;而且需要的存储越多&＃xff0c;生成数据消耗的预计算时间和计算资源就越多&＃xff0c;维护成本也越大。因此&＃xff0c;在保持查询效率不变的前提下&＃xff0c;减少存储占用显得尤为重要。

Apache Kylin对于存储资源的占用主要包括以下几个方面&＃xff1a;

元数据&＃xff1a;包含Cube、Model等的定义信息&＃xff0c;以及构建任务、字典、维表镜像等&＃xff1b;默认保存在HBase当中
Cube数据&＃xff1a;即预计算的结果&＃xff1b;默认保存在HBase当中
HDFS文件&＃xff1a;Cube构建任务生成的中间文件&＃xff0c;主要用于Segment合并等操作&＃xff1b;默认保存在Apache Kylin的HDFS工作目录当中
Hive表&＃xff1a;Cube构建时为了从数据源拉取数据生成的临时外表&＃xff0c;数据默认保存在Apache Kylin的HDFS工作目录当中&＃xff0c;一般会在任务完成时自动删除

想要优化存储&＃xff0c;首先需要了解整体及各项资源的存储分布&＃xff0c;进而找到资源瓶颈和优化方案。但是Apache Kylin中没有存储监控和汇总统计的功能&＃xff0c;想要快速洞悉存储占用并不是那么容易——而KyBot擅长解决这一问题。

三、使用KyBot优化存储

KyBot (https://kybot.io) 是为Apache Kylin及其商业版KAP提供在线诊断、优化及服务的平台。通过分析Apache Kylin的日志等信息&＃xff0c;为用户提供可视化仪表盘、系统优化、故障排查、知识库等自助式服务。

登录进入KyBot后&＃xff0c;通过左侧菜单进入“存储”仪表盘&＃xff0c;即可看到整个系统的存储统计指标&＃xff0c;如图1所示。

在图1中&＃xff0c;A区域代表整个HBase存储的统计&＃xff0c;在这个例子中总共使用了1.3 TB的空间&＃xff0c;其中48.5 GB是元数据&＃xff0c;共计35个HTable。通过这些统计&＃xff0c;管理员可以直观掌握Kylin的存储用量&＃xff0c;也能为集群扩容、运维计划提供数据支撑。

B区域代表HBase存储用量的变化趋势&＃xff0c;帮助用户快速定位用量突变等异常情况。这里的采样时间是用户每次生成KyBot诊断包的时间&＃xff0c;因此&＃xff0c;用户只需要定期生成并上传诊断包&＃xff08;如每日一次&＃xff09;&＃xff0c;就可以在此处观测到完整的存储变化曲线。

C区域代表检测出的可清理项统计&＃xff0c;帮助管理员明确存储健康程度&＃xff0c;并合理安排运维任务。在这个例子中&＃xff0c;通过数据清理可以回收291.3 GB空间。

通过这些仪表盘&＃xff0c;管理员可以一目了然地了解存储占用情况&＃xff0c;但是如果发现用量过高&＃xff0c;该如何优化呢&＃xff1f;

四、数据清理

在Apache Kylin的运行过程当中&＃xff0c;会产生一定的中间数据&＃xff0c;这些数据有的会在使用后自动删除&＃xff0c;有的会保留下来作为数据备份。随着使用越来越久&＃xff0c;这些数据的价值也越来越低&＃xff0c;管理员可以通过数据清理回收这些数据的空间。

可清理的数据包括元数据、Cube数据。可清理的元数据主要包括很久之前的构建任务描述、无用的字典和维表镜像等&＃xff0c;数据过多可能导致页面加载过慢、内存占用过多等问题。如果A区域表示的元数据表过大&＃xff0c;则需要进行元数据清理

当用户清空一个Cube时&＃xff0c;系统并不会把Cube数据立即删除&＃xff0c;而只是更新了Cube元数据。这是为了当用户操作失误时&＃xff0c;还可以通过恢复元数据快速回滚&＃xff1b;当用户不再需要回滚&＃xff0c;这些数据就可以被清理&＃xff1b;同样的还有任务中断留下的Hive中间表等等。C区域表示的“可清理项”统计过大&＃xff0c;则表示需要进行存储清理

五、降低Cube膨胀率

存储中最具重量级的就是Cube数据&＃xff0c;如果发现总体存储用量异常之大&＃xff0c;那么极有可能是有个别Cube极度膨胀导致。

切换至KyBot的Cube仪表盘查看“Cube膨胀倍数统计”图表&＃xff0c;如图2所示&＃xff0c;可以快速根据膨胀倍数找到最为异常的Cube&＃xff0c;并进入Cube调优页面&＃xff0c;观察“Cuboid重合率”图表&＃xff1a;

如图3所示&＃xff0c;每根柱子代表一个Cuboid和父级Cuboid的重合率&＃xff0c;重合率100%则代表当前Cuboid是冗余的&＃xff0c;可以被删除。图3中的Cube有很多冗余Cuboid&＃xff0c;说明该Cube有很大优化空间&＃xff0c;即可以通过调整Cube设计减小冗余Cuboid&＃xff0c;从而降低膨胀率&＃xff0c;进而有效减小系统的存储资源用量&＃xff0c;同时不影响查询性能。有关Cuboid重合率和Cube优化方案&＃xff0c;请参考文章[4]&＃xff0c;本文不再赘述。

六、总结

空间换时间”是Apache Kylin在大数据分析领域的杀手锏&＃xff0c;为了让它永久锋利&＃xff0c;就需要通过不断优化进行“保养”&＃xff0c;如存储优化、模型优化等等。KyBot是专业、智能的“保养顾问”&＃xff0c;可以达到事半功倍的效果。如果你也有存储方面的困扰

七、参考文章

元数据清理 http://kylin.apache.org/docs21/howto/howto_backup_metadata.html

存储清理 http://kylin.apache.org/docs21/howto/howto_cleanup_storage.html

推荐阅读

io
探索阿里巴巴的开源世界

从理想主义者的内心深处萌发的技术信仰，推动了云原生技术在全球范围内的快速发展。本文将带你深入了解阿里巴巴在开源领域的贡献与成就。 ... [详细]

蜡笔小新 2024-11-21 09:06:54
io
Java虚拟机及其发展历程

Java虚拟机（JVM）是每个Java开发者日常工作中不可或缺的一部分，但其背后的运作机制却往往显得神秘莫测。本文将探讨Java及其虚拟机的发展历程，帮助读者深入了解这一关键技术。 ... [详细]

蜡笔小新 2024-11-23 08:59:58
io
七大策略降低云上MySQL成本

在全球经济放缓和通胀压力下，降低云环境中MySQL数据库的运行成本成为企业关注的重点。本文提供了一系列实用技巧，旨在帮助企业有效控制成本，同时保持高效运作。 ... [详细]

蜡笔小新 2024-11-22 10:13:40
io
为何Compose与Swarm之后仍有Kubernetes的诞生？

探讨在已有Compose和Swarm的情况下，Kubernetes是如何以其独特的设计理念和技术优势脱颖而出，成为容器编排领域的领航者。 ... [详细]

蜡笔小新 2024-11-22 09:26:11
bash
Docker安全策略与管理

本文探讨了Docker的安全挑战、核心安全特性及其管理策略，旨在帮助读者深入理解Docker安全机制，并提供实用的安全管理建议。 ... [详细]

蜡笔小新 2024-11-21 20:03:03
io
龙蜥社区开发者访谈：技术生涯的三次蜕变 | 第3期

龙蜥社区的开发者们通过自己的实践和经验，推动着开源技术的发展。本期「龙蜥开发者说」聚焦于一位资深开发者的三次技术转型，分享他在龙蜥社区的成长故事。 ... [详细]

蜡笔小新 2024-11-21 11:12:28
string
深入解析SpringMVC中的HandlerMapping机制

本文将从基础概念入手，详细探讨SpringMVC框架中DispatcherServlet如何通过HandlerMapping进行请求分发，以及其背后的源码实现细节。 ... [详细]

蜡笔小新 2024-11-20 19:24:42
string
大厂Java研发岗位面试总结与资料分享

本文总结了一次针对大厂Java研发岗位的面试经历，探讨了面试中常见的问题及其背后的原因，并分享了一些实用的面试准备资料。 ... [详细]

蜡笔小新 2024-11-20 19:00:01
io
GLiHT数据介绍

GLiHT数据介绍 ... [详细]

蜡笔小新 2024-11-19 18:34:08
get
Centos7 Tomcat9 安装笔记

centos7,tom ... [详细]

蜡笔小新 2024-11-17 18:15:16
string
Spring Boot与Graylog集成实现微服务日志聚合与分析

本文介绍了如何在Graylog中配置输入源，并详细说明了Spring Boot项目中集成Graylog的日志聚合和分析方法，包括logback.xml的多环境配置。 ... [详细]

蜡笔小新 2024-11-17 11:47:30
string
整合Spring属性占位符与Jersey @Path和@ApplicationPath

本文介绍了如何将Spring属性占位符与Jersey的@Path和@ApplicationPath注解结合使用，以便在资源路径中动态解析属性值。 ... [详细]

蜡笔小新 2024-11-16 18:58:28
post
ABP框架概览及其前后端开发系列（一）

ABP框架是ASP.NET Boilerplate的简称，它不仅是一个开源且文档丰富的应用程序框架，还提供了一套基于领域驱动设计（DDD）的最佳实践架构模型。本文将详细介绍ABP框架的特点、项目结构及其在Web API优先架构中的应用。 ... [详细]

蜡笔小新 2024-11-16 18:09:51
io
黑客松获奖名单出炉、NFT艺术周圆满落幕 |Oasis周报

黑客松获奖名单出炉、NFT艺术周圆满落幕 |Oasis周报 ... [详细]

蜡笔小新 2024-11-22 18:23:40
command
ADO.NET核心组件解析

本文介绍了ADO.NET框架中的五个关键组件：Connection、Command、DataAdapter、DataSet和DataReader。每个组件都在数据访问和处理过程中扮演着不可或缺的角色。 ... [详细]

蜡笔小新 2024-11-20 19:31:07

瓜妞妹妹

这个家伙很懒，什么也没留下！

Tags | 热门标签

RankList | 热门文章