前言:
最近一段sso单点登录系统经常收到服务不可用自动重启的报警邮件,因为有做集群,影响较小,所以拖了几个月才开始着手解决这个问题。下面记录一下本次问题解决的过程(有走一些弯路),以做总结,也希望能给正在排查像试问题的同学一些启发:
先看看我的监控脚本
通过crontab 来监听重启
#!/bin/sh
_status=`curl -I -m 40 -o /dev/null -s -w %{http_code} 127.0.0.1`
echo status $_status
if [ $_status -ne 200 ] && [ $_status -ne 302 ]
then
echo start engine......
aws sns publish --message " sso2 检测到web不可用,自动重启" --topic arn:aws-cn:sns:cn-north-1:XXXX:aws-warning
#sleep 180
/usr/bin/sudo /usr/share/tomcat/bin/shutdown.sh
sleep 5
/usr/bin/sudo ps -ef | grep 'tomcat'|grep '-server' | grep -v grep| awk '{print $2}' | xargs sudo kill -9
sleep 2
/usr/bin/sudo /usr/share/tomcat/bin/startup.sh
fi
这边是通过监听本机127.0.0.1 http状态是否正常来判断服务是否可用的,不等于200或者302时发送报警通知,并且自动重启tomcat;
1,怀疑连接数过高,服务器负载压力 服务器为 t2.medium(2cpu,4GB)
当我收到报警邮件的时候,我先连接上服务器,查看tomcat进程确实还在,查看服务器连接情况
ne

本文记录了一次SSO单点登录系统频繁重启问题的排查过程,包括监控脚本、CPU及内存分析,最终定位到GC引起的高负载问题并修复。

624

被折叠的 条评论
为什么被折叠?



