热门标签 | HotTags
当前位置:  开发笔记 > 编程语言 > 正文

Spark与HBase结合处理大规模流量数据结构设计

本文将详细介绍如何利用Spark和HBase进行大规模流量数据的分析与处理,包括数据结构的设计和优化方法。

对于依赖内容创作和分享的大型平台如简书小红书CSDN等,对高质量内容进行大数据分析是不可或缺的一环。本系列文章将从多个角度深入探讨如何利用Spark和HBase进行高效的数据处理和分析,适合初学者入门大数据开发,同时也为资深从业者提供有价值的参考。

Spark与HBase结合处理大规模流量数据结构设计

作者简介

网名:大猪佩琪 姓名:不详 年龄:未知 身高:未知 性别:男

日志结构设计

日志存储结构采用JSON格式,虽然占用更多空间,但具有更好的可读性和便于排查问题的特点。

{
    "time": 1553269361115,
    "data": {
        "type": "read",
        "aid": "10000",
        "uid": "4229d691b07b13341da53f17ab9f2416",
        "tid": "49f68a5c8493ec2c0bf489821c21fc3b",
        "ip": "22.22.22.22"
    }
}

参数说明

名称 说明
time 精确到毫秒 时间戳
type login:登录/register:注册/read:阅读/like:喜欢/comment:评论/share:分享/reward:赞赏/publish:发布文章/update:发布更新/private:设置私密/delete:删除 操作类型
aid 数字 文章编号
uid UUID 用户编号
tid UUID 用户临时缓存编号
ip IP地址 用户IP地址

HBase表结构设计

日志表

create 'LOG_TABLE',{NAME => 'info',TTL => '30 DAYS',
COnFIGURATION=> {'SPLIT_POLICY' => 'org.apache.hadoop.hbase.regionserver.KeyPrefixRegionSplitPolicy','KeyPrefixRegionSplitPolicy.prefix_length'=>'2'},
COMPRESSION=>'SNAPPY'},
SPLITS => ['20', '40', '60', '80', 'a0', 'c0', 'e0']
  1. rowkey -----> 49|20190101000000000|f68a5c (时间+用户ID) **设计原则:**支持按时间维度查询,并分散数据。
  2. 过期时间 30天 -----> 足够长,因为日志源文件仍然保留 **设计原则:**减少存储资源占用。
  3. 预分区 -----> 使用rowkey前两位,00~ff=256个region **设计原则:**尽量将数据分散到各台Region Server

用户表

create 'USER_TABLE',{NAME => 'info',
COnFIGURATION=> {'SPLIT_POLICY' => 'org.apache.hadoop.hbase.regionserver.KeyPrefixRegionSplitPolicy','KeyPrefixRegionSplitPolicy.prefix_length'=>'2'},
COMPRESSION=>'SNAPPY'},
SPLITS => ['20', '40', '60', '80', 'a0', 'c0', 'e0']
  1. rowkey -----> 49f68a5c8493ec2c0bf489821c21fc3b (用户ID,前8位) **设计原则:**唯一性,通过ID能直接找到用户信息。

目前尚未涉及具体的程序设计与实现,后续将在“百亿级流量实时分析统计”系列文章中逐一实现。

Spark与HBase结合处理大规模流量数据结构设计
Spark与HBase结合处理大规模流量数据结构设计

以上所述就是小编给大家介绍的《Spark与HBase结合处理大规模流量数据结构设计》,希望对大家有所帮助,如果大家有任何疑问请给我留言,小编会及时回复大家的。在此也非常感谢大家对我们的支持!


推荐阅读
author-avatar
shyaiqq
这个家伙很懒,什么也没留下!
PHP1.CN | 中国最专业的PHP中文社区 | DevBox开发工具箱 | json解析格式化 |PHP资讯 | PHP教程 | 数据库技术 | 服务器技术 | 前端开发技术 | PHP框架 | 开发工具 | 在线工具
Copyright © 1998 - 2020 PHP1.CN. All Rights Reserved | 京公网安备 11010802041100号 | 京ICP备19059560号-4 | PHP1.CN 第一PHP社区 版权所有