当前位置: 开发笔记 > 运维 > 正文

hadoop集群SystemCpu消耗过高问题分析by杂货店店长

作者：书友42218068 | 来源：互联网 | 2018-06-11 04:11

Hadoop集群服务器升级为rhel6内核后，SystemCpu占用非常高，有任务运行的时候经常到50%以上。对其中一台机器一天的运行状态采样的数据：idle:76%??sys:14%?user:9%从采样数据中，可以发现SystemCpu比UserCpu还要高，这在Hadoop集群环境中很不寻常。

Hadoop集群服务器升级为rhel6内核后，System Cpu占用非常高，有任务运行的时候经常到50%以上。对其中一台机器一天的运行状态采样的数据： idle: 76%?? sys:14%? user: 9% 从采样数据中，可以发现System Cpu比User Cpu还要高，这在Hadoop集群环境中很不寻常。

Hadoop集群服务器升级为rhel6内核后，System Cpu占用非常高，有任务运行的时候经常到50%以上。对其中一台机器一天的运行状态采样的数据：

idle: 76%?? sys:14%? user: 9%

从采样数据中，可以发现System Cpu比User Cpu还要高，这在Hadoop集群环境中很不寻常。

先简单地用strace看了一下占用cpu高的java程序经常去调哪些系统调用，发现sched_yield调用频率非常之高，莫非是锁的问题？分析了下内核中的文档和代码，发现CFS调度下sched_yield的行为与以前的O(1)算法略有出入——CFS下sched_yield返回非常快，对于一些借助sched_yield实现锁的应用来说，开销会很大。内核提供了一个proc参数sched_compat_yield，设置该参数为1，就可以解决这个问题。于是设置了该参数，仍然没有效果，分析代码后，竟然发现sched_compat_yield在rhel6内核中并没有实现，只是留下了一个接口兼容而已。于是乎将upstream中的相关部分的代码port到rhel6的内核中，sched_compact_yield终于能干活了，但出乎意料的是，系统态cpu仍然非常高。

没办法了，上个大招：oprofile，结果如下：

samples???????? %???????? ?symbol name

2822865? ?71.2192?? ?compact_zone

160729??? ?4.0551?????? clear_page_c

156913?? ?? 3.9588???? ?compaction_alloc

47691?????? ?1.2032????? ?copy_user_generic_string

一看到结果，一头雾水。compact_zone为何物？为何cpu占用如此之高？不懂了就看代码。

__alloc_pages_slowpath

__alloc_pages_direct_compact

try_to_compact_pages

compact_zone_order

compact_order

有点头绪了，内核要分配一块高阶物理内存，buddy system中又没有满足条件的，似乎内核要在compact_zone中做些什么事，来满足对高阶物理内存的分配。

下一步，快速验证下是不是compact_zone的问题，修改config文件，去掉CONFIG_COMPACTION，重新编译，换内核，竟然真的OK了。那基本断定是compact_zone的问题了，后面就得分析下代码，研究下其中的原理了。

经过几天的艰苦奋战，终于把compaction的基本原理搞明白了。

linux物理内存的管理采用的是经典的伙伴系统，当然也就存在伙伴系统的问题——内存碎片。当然，此处的内存碎片问题并不算大，因为伙伴系统是以页为单位为管理内存的，碎片也是以“页”为单位，4k的物理内存还算不上是“碎片”。对于用户态的程序，几乎不需要超过4k的连续空间。但是对内核来说，碎片永远都不是好东西。某些硬件相关的操作会需要连续的物理内存，如果无法满足，内核就只能panic。

clip_image002

另外，引入compaction的另一个重要因素就是使用THP（Transparent hugepages）。4k的页面大小已经出现了很多年了，就像文件系统上1k-4k的block_size一样，都是适应二十年前硬件的容量与速度而出现的，对于现在的硬件来说它们都显得太小了。使用更大的物理页，可以带来两个好处：TLB缓存命中率的提高和page_fault的次数降低。compaction正是为了支持THP而出现的。

在以前版本的内核中，要获得连续的物理内存只有一个办法：释放掉一部分内存，一般是释放page cache、脏页，或者进行页面swap。

而compaction提出了另外一个思路：重新组织内存。为此，提出了“可移动”页面的概念。在内核中的物理内存，有一部分是“可移动”的，内核使用的反碎片技术的基本原理，就是根据页的“可移动性”将页面分组。

clip_image004

那哪些页面是可以移动的呢？非空闲的物理内存，当然要么是用户态进程在用，要么内核本身在用。对于前者，进程在访问物理内存的时候，实际上要通过页表的映射来访问。页表是一个可以做文章的地方：如果把一个页移动到另一个地方，如果可以同时修改页表，那么对应用程序就不会有影响。而对于内核访问物理内存时，是通过简单的常量偏移来做的。因此内核使用的物理页面无法移动。

定义了“可移动”的页面，具体到某一个页面，内核怎样知道它是否是可移动的？分配内存的函数，kmalloc,alloc_pages等在任何地方都可能被调用。内核又是怎样知道在这些地方分配的页面属于哪种类型呢？看这几个函数的原型

void *kmalloc(size_t size, gfp_t flags)

struct page * alloc_pages(gfp_t gfp_mask, unsigned int order)

内核自然不知道kmalloc分配的内存是作什么用途的，但是kernel 开发者知道，一个页面是否可移动，自然也是开发者们告诉内核的。gft_t中有个标志位：GFP_MOVABLE，开发者需要根据相应的内存是否要移动来设置该位。

了解了如何识别“可移动”页面，下面看看页面移动的流程：

1.???????? 锁定页，以避免在移动页的过程中有进程修改页面。页面记为oldpage

2.???????? 确保“writeback”已经完成

3.???????? 删除当前页面的全部映射，并将指向该页的页表项标记MIGRATION

4.???????? 查找新页，记为newpage

5.???????? 获取radix tree的锁，以阻塞所有试图通过radix tree来访问页面的进程。将radix tree中oldpage的指针指向newpage。释放radix tree的锁。

6.???????? 旧页的内容被拷到新页面中，设置新页面的各项标志

7.???????? 将所有页表项指向新页面

了解了compaction的目标和原理，那么该怎样查看系统中当前的碎片情况呢？/proc/pagetypeinfo文件提供了“可移动”和“不可移动”页面的分布数据，一方面方便开发者调试，另一方面可以让系统管理员了解当前的系统运行状态。

Compaction在hadoop上所带来的性能问题，目前还不知道是在这种特定场景下才出现还是compaction本身就影响了性能。不过现在看来，在其它机器上还没有发现这种情况。

Compaction的目的是减少内存碎片，主要和THP搭配使用，适合需要大量连续内存的应用，比如KVM，能提升TLB效率和减少page fault次数，从而提高应用程序的执行效率。因此，去掉Compaction的支持，会对此类应用的性能所有影响。

参考：http://lwn.net/Articles/359158/你也许会喜欢：

Mem Cgroup目录无法清理问题分析
深入剖析 linux GCC 4.4 的 STL string
利用 Flash 漏洞的木马程序分析报告 by 师兄
一个淘宝客劫持木马的分析
从Dump到POC系列一:Win32k内核提权漏洞分析

原文地址：hadoop集群System Cpu消耗过高问题分析 by 杂货店店长, 感谢原作者分享。

推荐阅读

服务器
Python 开发环境最佳实践：Anaconda + Jupyter Notebook 快速上手指南

对于初学者而言，搭建一个高效稳定的 Python 开发环境是入门的关键一步。本文将详细介绍如何利用 Anaconda 和 Jupyter Notebook 来构建一个既易于管理又功能强大的开发环境。 ... [详细]

蜡笔小新 2024-11-21 18:30:23
服务器
软件测试行业深度解析：迈向高薪的必经之路

本文深入探讨了软件测试行业的发展现状及未来趋势，旨在帮助有志于在该领域取得高薪的技术人员明确职业方向和发展路径。 ... [详细]

蜡笔小新 2024-11-21 17:32:44
centos
龙蜥社区开发者访谈：技术生涯的三次蜕变 | 第3期

龙蜥社区的开发者们通过自己的实践和经验，推动着开源技术的发展。本期「龙蜥开发者说」聚焦于一位资深开发者的三次技术转型，分享他在龙蜥社区的成长故事。 ... [详细]

蜡笔小新 2024-11-21 11:12:28
port
MongoDB 高可用集群搭建指南：分片、读写分离与负载均衡

本文详细介绍了如何搭建一个高可用的MongoDB集群，包括环境准备、用户配置、目录创建、MongoDB安装、配置文件设置、集群组件部署等步骤。特别关注分片、读写分离及负载均衡的实现。 ... [详细]

蜡笔小新 2024-11-20 18:28:16
port
ARM平台下构建SSH服务端并实现远程访问

本文详细介绍了如何在ARM架构的目标设备上部署SSH服务端，包括必要的软件包下载、交叉编译过程以及最终的服务配置与测试。适合嵌入式开发人员和系统集成工程师参考。 ... [详细]

蜡笔小新 2024-11-20 14:13:38
service
如何在U8系统中连接服务器并获取数据

本文介绍了如何在U8系统中通过不同的方法连接服务器并获取数据，包括使用MySQL客户端连接实例的方法，如非SSL连接和SSL连接，并提供了详细的步骤和注意事项。 ... [详细]

蜡笔小新 2024-11-19 12:08:19
服务器
深入解析：存储技术的演变与发展

本文探讨了从单机文件系统到分布式文件系统的存储技术发展过程，详细解释了各种存储模型及其特点。 ... [详细]

蜡笔小新 2024-11-19 11:25:40
tomcat
H5技术实现经典游戏《贪吃蛇》

本文将分享一个使用HTML5技术实现的经典小游戏——《贪吃蛇》。通过H5技术，我们将探讨如何构建这款游戏的两种主要玩法：积分闯关和无尽模式。 ... [详细]

蜡笔小新 2024-11-21 20:16:59
服务器
Node.js在服务器上的多种部署策略

本文探讨了Node.js应用程序在服务器上部署的几种有效方法，包括使用Screen、PM2以及通过宝塔面板进行简易管理。 ... [详细]

蜡笔小新 2024-11-21 18:58:31
tomcat
我的读书清单（持续更新）

我的读书清单（持续更新）201705311.《一千零一夜》2006（四五年级）2.《中华上下五千年》2008（初一）3.《鲁滨孙漂流记》2008（初二）4.《钢铁是怎样炼成的》20 ... [详细]

蜡笔小新 2024-11-21 13:01:23
port
调试利器SSH隧道

在开发微信公众号或小程序的时候，由于微信平台规则的限制，部分接口需要通过线上域名才能正常访问。但我们一般都会在本地开发，因为这能快速的看到 ... [详细]

蜡笔小新 2024-11-21 11:15:53
centos
CentOS下ProFTPD的安装与配置指南

本文详细介绍在CentOS操作系统上安装和配置ProFTPD服务的方法，包括基本配置、安全设置及高级功能的启用。 ... [详细]

蜡笔小新 2024-11-21 09:45:56
服务器
精选10款Python框架助力并行与分布式机器学习

随着神经网络模型的不断深化和复杂化，训练这些模型变得愈发具有挑战性，不仅需要处理大量的权重，还必须克服内存限制等问题。本文将介绍10款优秀的Python框架，帮助开发者高效地实现分布式和并行化的深度学习模型训练。 ... [详细]

蜡笔小新 2024-11-20 19:44:05
service
大厂Java研发岗位面试总结与资料分享

本文总结了一次针对大厂Java研发岗位的面试经历，探讨了面试中常见的问题及其背后的原因，并分享了一些实用的面试准备资料。 ... [详细]

蜡笔小新 2024-11-20 19:00:01
service
日志处理流程：Flume+MapReduce+Hive+Sqoop+MySQL

本文介绍了如何使用Flume从Linux文件系统收集日志并存储到HDFS，然后通过MapReduce清洗数据，使用Hive进行数据分析，并最终通过Sqoop将结果导出到MySQL数据库。 ... [详细]

蜡笔小新 2024-11-13 18:47:34

书友42218068

这个家伙很懒，什么也没留下！

Tags | 热门标签

RankList | 热门文章