zoukankan      html  css  js  c++  java
  • linux分析工具之vmstat详解

    一、概述

    vmstat命令是最常见的Linux/Unix监控工具,可以展现给定时间间隔的服务器的状态值,包括服务器的CPU使用率,内存使用,虚拟内存交换情况,IO读写情况。首先我们查看下帮助。如下图所示:

    使用语法: vmstat [-V] [-n] [delay [count]]

    -V:显示vmstat版本信息。
    -n:只在开始时显示一次各字段名称。
    -a:显示活跃和非活跃内存
    -d:显示磁盘相关统计信息。
    -p:显示指定磁盘分区统计信息
    -s:显示内存相关统计信息及多种系统活动数量。
    -m:显示slabinfo
    -S:使用指定单位显示。参数有 k 、K 、m 、M ,分别代表1000、10241000000、1048576字节(byte)。默认单位为K(1024 bytes)
    -f:显示从系统启动至今的fork数量 。
    
    delay:刷新时间间隔。
    count:刷新次数。如果不指定刷新次数,但指定了刷新时间间隔,这时刷新次数为无穷。

    1.1、虚拟内存原理

        在系统中运行的每个进程都需要使用到内存,但不是每个进程都需要每时每刻使用系统分配的内存空间。当系统运行所需内存超过实际的物理内存,内核会释放某些进程所占用但未使用的部分或所有物理内存,将这部分资料存储在磁盘上直到进程下一次调用,并将释放出的内存提供给有需要的进程使用。

        在Linux内存管理中,主要是通过“调页Paging”和“交换Swapping”来完成上述的内存调度。调页算法是将内存中最近不常使用的页面换到磁盘上,把活动页面保留在内存中供进程使用。交换技术是将整个进程,而不是部分页面,全部交换到磁盘上。

        分页(Page)写入磁盘的过程被称作Page-Out,分页(Page)从磁盘重新回到内存的过程被称作Page-In。当内核需要一个分页时,但发现此分页不在物理内存中(因为已经被Page-Out了),此时就发生了分页错误(Page Fault)。

       当系统内核发现可运行内存变少时,就会通过Page-Out来释放一部分物理内存。经管Page-Out不是经常发生,但是如果Page-out频繁不断的发生,直到当内核管理分页的时间超过运行程式的时间时,系统性能会急剧下降。这时的系统已经运行非常慢或进入暂停状态,这种状态亦被称作thrashing(颠簸)

    二、参数详解

    首先看一个vmstat 2 命令,表示每隔两秒钟采集一次

    [root@mwpl003 ~]# vmstat 2
    procs -----------memory---------------- ---swap-- -----io---- --system-- -----cpu-----
     r  b      swpd  free   buff   cache      si   so    bi    bo   in cs   us sy id wa st
     0  0      0 233481328 758304 20795516    0    0     0     1    0    0  0  0 100  0  0
     0  0      0 233480800 758304 20795520    0    0     0     0  951 1519  0  0 100  0  0
     0  0      0 233481056 758304 20795520    0    0     0     0  867 1460  0  0 100  0  0
     0  0      0 233481408 758304 20795520    0    0     0    20  910 1520  0  0 100  0  0
     0  0      0 233481680 758304 20795520    0    0     0     0  911 1491  0  0 100  0  0
     0  0      0 233481920 758304 20795520    0    0     0     0  889 1530  0  0 100  0  0

    2.1、procs

    r    #表示运行队列(就是说多少个进程真的分配到CPU),当这个值超过了CPU数目,就会出现CPU瓶颈了。这个也和top的负载有关系,一般负载超过了3就比较高,超过了5就高,超过了10就不正常了,服务器的状态很危险。top的负载类似每秒的运行队列。如果运行队列过大,表示你的CPU很繁忙,一般会造成CPU使用率很高。

    b   #表示阻塞的进程,在等待资源的进程,这个不多说,进程阻塞,大家懂的。

    2.2、memory

    swpd  #虚拟内存已使用的大小,如果大于0,表示你的机器物理内存不足了,如果不是程序内存泄露的原因,那么你该升级内存了或者把耗内存的任务迁移到其他机器。

    free    # 空闲的物理内存的大小

    buff    #Linux/Unix系统是用来存储,目录里面有什么内容,权限等的缓存

    cache #cache直接用来记忆我们打开的文件,给文件做缓冲,把空闲的物理内存的一部分拿来做文件和目录的缓存,是为了提高 程序执行的性能,当程序使用内存时,buffer/cached会很快地被使用。

    2.3、swap

    si   #每秒从磁盘读入虚拟内存的大小,如果这个值大于0,表示物理内存不够用或者内存泄露了,要查找耗内存进程解决掉。我的机器内存充裕,一切正常。

    so  #每秒虚拟内存写入磁盘的大小,如果这个值大于0,同上。

    2.4、io

    bi   #块设备每秒接收的块数量,这里的块设备是指系统上所有的磁盘和其他块设备,默认块大小是1024byte

    bo  #块设备每秒发送的块数量,例如我们读取文件,bo就要大于0。bi和bo一般都要接近0,不然就是IO过于频繁,需要调整。

    2.5、system

    in   #每秒CPU的中断次数,包括时间中断

    cs   #每秒上下文切换次数,例如我们调用系统函数,就要进行上下文切换,线程的切换,也要进程上下文切换,这个值要越小越好,太大了,要考虑调低线程或者进程的数目

    2.6、cpu

    us   #用户CPU时间,我曾经在一个做加密解密很频繁的服务器上,可以看到us接近100,r运行队列达到80(机器在做压力测试,性能表现不佳)。

    sy   #系统CPU时间,如果太高,表示系统调用时间长,例如是IO操作频繁。

    id    #空闲 CPU时间,一般来说,id + us + sy = 100,一般我认为id是空闲CPU使用率,us是用户CPU使用率,sy是系统CPU使用率。

    wt   #等待IO CPU时间。

    三、实践

    vmstat 1 3 #表示每个一秒采集3次
    [root@lgh3 ~]# vmstat 1 3
    procs -----------memory---------------- ---swap-- -----io---- --system-- -----cpu-----
     r  b    swpd   free   buff  cache       si   so    bi    bo   in   cs us sy id  wa st
     0  0      0 233483840 758304 20795596    0    0     0     1    0    0  0  0 100  0  0
     0  0      0 233483936 758304 20795596    0    0     0     0 1052 1569  0  0 100  0  0
     0  0      0 233483920 758304 20795596    0    0     0     0  966 1558  0  0 100  0  0
    vmstat 2 #表示每隔两秒打印一次
    [root@mwpl003 ~]# vmstat 2
    procs --------------memory------------ ---swap-- ------io---- --system-- -----cpu-----
     r  b    swpd   free    buff  cache      si   so    bi    bo   in   cs us  sy id  wa st
     0  0      0 233481872 758304 20795716    0    0     0     1    0    0  0  0 100  0  0
     0  0      0 233481536 758304 20795720    0    0     0    16 1091 1625  0  0 100  0  0
     0  0      0 233481840 758304 20795720    0    0     0     0  976 1582  0  0 100  0  0

    注意:

    procs r: 运行的进程比较多,系统很繁忙
    bi/bo: 磁盘写的数据量稍大,如果是大文件的写,10M以内基本不用担心,如果是小文件写2M以内基本正常
    cpu us: 持续大于50%,服务高峰期可以接受, 如果长期大于50 ,可以考虑优化
    cpu sy: 现实内核进程所占的百分比,这里us + sy的参考值为80%,如果us+sy 大于 80%说明可能存在CPU不足。
    cpu wa: 列显示了IO等待所占用的CPU时间的百分比。这里wa的参考值为30%,如果wa超过30%,说明IO等待严重,这可能是磁盘大量随机访问造成的, 也可能磁盘或者磁盘访问控制器的带宽瓶颈造成的(主要是块操作)

    更多linux文章请见:linux&shell学习系列

    参考:

    https://www.jianshu.com/p/6d9e5ad2751c

    https://blog.csdn.net/zhuying_linux/article/details/7336869

    https://blog.csdn.net/wzyzzu/article/details/50395502

  • 相关阅读:
    痞子衡嵌入式:利用i.MXRT1060,1010上新增的FlexSPI地址重映射(Remap)功能可安全OTA
    “既生 ExecutorService, 何生 CompletionService?”
    55
    .map() is not a function【js报错】
    内网穿透之流量代理转发
    JDK8 String类知识总结
    Java并发编程(07):Fork/Join框架机制详解
    数据源管理 | 分布式NoSQL系统,Cassandra集群管理
    Solon详解(三)- Solon的web开发
    Solon详解(二)- Solon的核心
  • 原文地址:https://www.cnblogs.com/zsql/p/11643750.html
Copyright © 2011-2022 走看看