Arthas 学习笔记-监控

Posted by AceKei on October 1, 2018

官方文档:https://alibaba.github.io/arthas/index.html

官方文档

1. Arthas(阿尔萨斯) 能为你做什么?

Arthas 是Alibaba开源的Java诊断工具,深受开发者喜爱。

当你遇到以下类似问题而束手无策时,Arthas可以帮助你解决:

  1. 这个类从哪个 jar 包加载的?为什么会报各种类相关的 Exception?
  2. 我改的代码为什么没有执行到?难道是我没 commit?分支搞错了?
  3. 遇到问题无法在线上 debug,难道只能通过加日志再重新发布吗?
  4. 线上遇到某个用户的数据处理有问题,但线上同样无法 debug,线下无法重现!
  5. 是否有一个全局视角来查看系统的运行状况?
  6. 有什么办法可以监控到JVM的实时运行状态?

Arthas采用命令行交互模式,同时提供丰富的 Tab 自动补全功能,进一步方便进行问题的定位和诊断。

2.安装

Linux/Unix/Mac

Arthas 支持在 Linux/Unix/Mac 等平台上一键安装,请复制以下内容,并粘贴到命令行中,敲 回车 执行即可:

1
curl -L https://alibaba.github.io/arthas/install.sh | sh

上述命令会下载启动脚本文件 as.sh 到当前目录,你可以放在任何地方或将其加入到 $PATH 中。

直接在shell下面执行./as.sh,就会进入交互界面。

也可以执行./as.sh -h来获取更多参数信息。

Windows

最新版本:Arthas

在Download栏下载最新的 bin.zip 包,解压后在bin目录有 as.bat。此脚本暂时只接受一个参数 pid,即只能诊断本机上的 Java 进程。(欢迎精通bat脚本的开发者改进)

1
as.bat <pid>

如果需要更好的体验,可以在本地使用 as.bat 启动 Arthas Server 后,然后在另外的 Linux/Mac 上使用 as.sh pid@ip:port 来远程诊断。

Windows用户如果在cmd里不能正常显示颜色,可以使用conemu。

手动拼接命令行启动

如果启动遇到问题,可以尝试手动拼接出命令行参数来启动。

  1. 查找目录jvm的java文件路径。
在linux/mac上执行**ps aux grep java,在windows上可以通过进程管理器来查看。假设是 **/opt/jdk1.8/bin/java
  1. 拼接出命令行
1
2
3
4
5
6
/opt/jdk1.8/bin/java -Xbootclasspath/a:/opt/jdk1.8/lib/tools.jar \
 -jar /tmp/arthas-packaging/arthas-core.jar \
 -pid 15146 \
 -target-ip 127.0.0.1 -telnet-port 3658 -http-port 8563 \
 -core /tmp/arthas-packaging/arthas-core.jar \
 -agent /tmp/arthas-packaging/arthas/arthas-agent.jar

命令行分几部分组成:

  • -Xbootclasspath 增加tools.jar
  • -jar /tmp/arthas-packaging/arthas-core.jar 指定main函数入口
  • -pid 15146 指定目标java进程ID
  • -target-ip 127.0.0.1 指定IP
  • -telnet-port 3658 -http-port 8563 指定telnet和http端口
  • -core /tmp/arthas-packaging/arthas-core.jar -agent /tmp/arthas-packaging/arthas/arthas-agent.jar 指定core/agent jar包

如果是jdk > 9,即9/10/11以上的版本,不需要指定tools.jar,直接去掉-Xbootclasspath 的配置即可。

启动目志输出在 ~/logs/arthas/arthas.log里。

  1. attach成功之后,使用telnet连接
1
telnet localhost 3658
卸载
  • 在 Linux/Unix/Mac 平台

删除下面文件:

1
rm -rf ~/.arthas/ ~/.arthas_history
  • Windows平台直接删除zip包和解压的文件

操作

基础命令
  • help——查看命令帮助信息
  • cls——清空当前屏幕区域
  • session——查看当前会话的信息
  • reset——重置增强类,将被 Arthas 增强过的类全部还原,Arthas 服务端关闭时会重置所有增强过的类
  • version——输出当前目标 Java 进程所加载的 Arthas 版本号
  • quit——退出当前 Arthas 客户端,其他 Arthas 客户端不受影响
  • shutdown——关闭 Arthas 服务端,所有 Arthas 客户端全部退出
  • keymap——Arthas快捷键列表及自定义快捷键
jvm相关
  • dashboard——当前系统的实时数据面板
  • thread——查看当前 JVM 的线程堆栈信息
  • jvm——查看当前 JVM 的信息
  • sysprop——查看和修改JVM的系统属性
  • getstatic——查看类的静态属性
class/classloader相关
  • sc——查看JVM已加载的类信息
  • sm——查看已加载类的方法信息
  • dump——dump 已加载类的 byte code 到特定目录
  • redefine——加载外部的.class文件,redefine到JVM里
  • jad——反编译指定已加载类的源码
  • classloader——查看classloader的继承树,urls,类加载信息,使用classloader去getResource
monitor/watch/trace相关

注意,这些命令,都通过字节码增强技术来实现的,会在指定类的方法中插入一些切面来实现数据统计和观测,因此在线上、预发使用时,请尽量明确需要观测的类、方法以及条件,诊断结束要执行 shutdown 或将增强过的类执行 reset 命令。

  • monitor——方法执行监控
  • watch——方法执行数据观测
  • trace——方法内部调用路径,并输出方法路径上的每个节点上耗时
  • stack——输出当前方法被调用的调用路径
  • tt——方法执行数据的时空隧道,记录下指定方法每次调用的入参和返回信息,并能对这些不同的时间下调用进行观测
options
  • options——查看或设置Arthas全局开关
管道

Arthas支持使用管道对上述命令的结果进行进一步的处理,如

1
sm org.apache.log4j.Logger | grep <init>
  • grep——搜索满足条件的结果
  • plaintext——将命令的结果去除颜色
  • wc——按行统计输出结果
后台异步任务

当线上出现偶发的问题,比如需要watch某个条件,而这个条件一天可能才会出现一次时,异步后台任务就派上用场了,详情请参考这里

  • 使用 > 将结果重写向到日志文件,使用 & 指定命令是后台运行,session断开不影响任务执行(生命周期默认为1天)
  • jobs——列出所有job
  • kill——强制终止任务
  • fg——将暂停的任务拉到前台执行
  • bg——将暂停的任务放到后台执行
Web Console

通过websocket连接Arthas。

Web Console

其他特性

异步命令支持 执行结果存日志 批处理的支持 ognl表达式的用法说明

具体命令列表

dashboard

当前系统的实时数据面板,按 ctrl+c 退出。 当运行在Ali-tomcat时,会显示当前tomcat的实时信息,如HTTP请求的qps, rt, 错误数, 线程池信息等等。

运行截图

image

数据说明
  • ID: Java级别的线程ID,注意这个ID不能跟jstack中的nativeID一一对应
  • NAME: 线程名
  • GROUP: 线程组名
  • PRIORITY: 线程优先级, 1~10之间的数字,越大表示优先级越高
  • STATE: 线程的状态
  • CPU%: 线程消耗的cpu占比,采样100ms,将所有线程在这100ms内的cpu使用量求和,再算出每个线程的cpu使用占比。
  • TIME: 线程运行总时间,数据格式为分:秒
  • INTERRUPTED: 线程当前的中断位状态
  • DAEMON: 是否是daemon线程

    thread

    查看当前线程信息,查看线程的堆栈

    参数说明
参数名称 参数说明
id 线程id
[n:] 指定最忙的前N个线程并打印堆栈
[b] 找出当前阻塞其他线程的线程
[i ] 指定cpu占比统计的采样间隔,单位为毫秒

cpu占比是如何统计出来的?

这里的cpu统计的是,一段采样间隔内,当前JVM里各个线程所占用的cpu时间占总cpu时间的百分比。其计算方法为: 首先进行一次采样,获得所有线程的cpu的使用时间(调用的是java.lang.management.ThreadMXBean#getThreadCpuTime这个接口),然后睡眠一段时间,默认100ms,可以通过-i参数指定,然后再采样一次,最后得出这段时间内各个线程消耗的cpu时间情况,最后算出百分比。 注意: 这个统计也会产生一定的开销(JDK这个接口本身开销比较大),因此会看到as的线程占用一定的百分比,为了降低统计自身的开销带来的影响,可以把采样间隔拉长一些,比如5000毫秒。 如果想看从Java进程启动开始到现在的cpu占比情况:可以使用show-busy-java-threads这个脚本

使用参考

支持一键展示当前最忙的前N个线程并打印堆栈: image 当没有参数时,显示所有线程的信息。 image thread id, 显示指定线程的运行堆栈

1
2
3
4
5
6
7
8
$ thread 42
"Timer-0" Id=42 TIMED_WAITING on java.util.TaskQueue@2ad86867
    at java.lang.Object.wait(Native Method)
    -  waiting on java.util.TaskQueue@2ad86867
    at java.util.TimerThread.mainLoop(Timer.java:552)
    at java.util.TimerThread.run(Timer.java:505)

Affect(row-cnt:0) cost in 44 ms.

thread -b, 找出当前阻塞其他线程的线程

1
2
3
$ thread -b
No most blocking thread found!
Affect(row-cnt:0) cost in 54 ms.

thread -i, 指定采样时间间隔

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
"New I/O client worker #1-2" Id=21 cpuUsage=2% RUNNABLE
    at sun.nio.ch.EPollArrayWrapper.epollWait(Native Method)
    at sun.nio.ch.EPollArrayWrapper.poll(EPollArrayWrapper.java:269)
    at sun.nio.ch.EPollSelectorImpl.doSelect(EPollSelectorImpl.java:79)
    at sun.nio.ch.SelectorImpl.lockAndDoSelect(SelectorImpl.java:87)
    -  locked sun.nio.ch.Util$2@181a64e9
    -  locked java.util.Collections$UnmodifiableSet@19a76d30
    -  locked sun.nio.ch.EPollSelectorImpl@5eda8790
    at sun.nio.ch.SelectorImpl.select(SelectorImpl.java:98)
    at org.jboss.netty.channel.socket.nio.SelectorUtil.select(SelectorUtil.java:38)
    at org.jboss.netty.channel.socket.nio.NioWorker.run(NioWorker.java:163)
    at org.jboss.netty.util.ThreadRenamingRunnable.run(ThreadRenamingRunnable.java:108)
    at org.jboss.netty.util.internal.DeadLockProofWorker$1.run(DeadLockProofWorker.java:44)
    at java.util.concurrent.ThreadPoolExecutor.runWorker(ThreadPoolExecutor.java:1152)
    at java.util.concurrent.ThreadPoolExecutor$Worker.run(ThreadPoolExecutor.java:622)
    at java.lang.Thread.run(Thread.java:748)

    Number of locked synchronizers = 1
    - java.util.concurrent.ThreadPoolExecutor$Worker@6bf3edec