要求:咱们的机器角色多种多样,可是全部机器上都要部署一样的监控系统,也就说全部机器无论什么角色,整个程序框架都是一致的,不一样的地方在于根据不一样的角色,定制不一样的配置文件。
程序架构:
bin下是主程序
conf下是配置文件
shares下是各个监控脚本
mail下是邮件引擎
log下是日志。php
首先咱们能够建立主目录和下面全部的脚本目录,python
[root@lijie-01 ~]# cd /usr/local/sbin [root@lijie-01 sbin]# mkdir mon [root@lijie-01 sbin]# cd mon [root@lijie-01 mon]# ls [root@lijie-01 mon]# mkdir bin conf shares log mail [root@lijie-01 mon]# ls bin conf log mail shares [root@lijie-01 mon]# cd bin [root@lijie-01 bin]# vim main.sh [root@lijie-01 bin]#
而后咱们来写主脚本内容以下:mysql
#!/bin/bash # 是否发送邮件的开关,当send=1时,表示给下面全部的监控项目都会发送邮件,若是维护时,能够选择将发送邮件的这个总开关设置为0 export send=1 # 过滤ip地址,表示上报告警的ip地址,因每台机器独立上报,须要单独过滤 export addr=`/sbin/ifconfig |grep -A1 "ens33: "|awk '/inet/ {print $2}'` # 获取当前所在目录路径 dir=`pwd` # 只须要最后一级目录名 last_dir=`echo $dir|awk -F'/' '{print $NF}'` # 下面的判断目的是,保证执行脚本的时候,咱们在bin目录里,否则监控脚本、邮件和日志颇有可能找不到,这也意味着当执行main.sh这个脚本以前咱们先要切换到这个目录里面来 if [ $last_dir == "bin" ] || [ $last_dir == "bin/" ]; then conf_file="../conf/mon.conf" else echo "you shoud cd bin dir" exit fi #输出正确的日志和错误日志 exec 1>>../log/mon.log 2>>../log/err.log #将系统负载标记上时间, echo "`date +"%F %T"` load average" # 执行子脚本 /bin/bash ../shares/load.sh #先检查配置文件中是否须要监控502 if grep -q 'to_mon_502=1' $conf_file; then export log=`grep 'logfile=' $conf_file |awk -F '=' '{print $2}' |sed 's/ //g'` /bin/bash ../shares/502.sh fi
配置文件主要定义一些开关,和一些日志的路径,配置文件须要放在../conf/mon.conf这个路径,咱们在主脚本中已经定义好了的 mon.conf内容sql
## to config the options if to monitor ## 定义mysql的服务器地址、端口以及user、password to_mon_cdb=0 ##是否监控cdb数据库,0 or 1, default 0,0 not monitor, 1 monitor db_ip=10.20.3.13 db_port=3315 db_user=username db_pass=passwd ## httpd 若是是1则监控,为0不监控 to_mon_httpd=0 ## php 若是是1则监控,为0不监控 to_mon_php_socket=0 ## http_code_502 须要定义访问日志的路径 to_mon_502=1 logfile=/data/log/xxx.xxx.com/access.log ##状态码来源于这个日志 ## request_count 定义日志路径以及域名 to_mon_request_count=0 #是否监控请求数 req_log=/data/log/www.discuz.net/access.log domainname=www.discuz.net ##若是机器数量很少,子脚本须要用到的资源是能够在子脚本中定义的,但若是机器数量不少,再到子脚本中定义通用性不强
load.sh内容shell
#! /bin/bash #将当前负载值赋值给load load=`uptime |awk -F 'average:' '{print $2}'|cut -d',' -f1|sed 's/ //g' |cut -d. -f1` #若是负载大于10而且容许发送邮件,则调用邮件发送脚本 if [ $load -gt 10 ] && [ $send -eq "1" ] then echo "$addr `date +%T` load is $load" >../log/load.tmp /bin/bash ../mail/mail.sh aming_test@163.com "$addr\_load:$load" `cat ../log/load.tmp` fi #不然记录一条负载值到日志中 echo "`date +%T` load is $load"
502.sh内容数据库
#! /bin/bash #时间设置为1分钟之前,由于监控是1分钟执行一次,因此这里咱们查看到的日志是一分钟之前的 d=`date -d "-1 min" +%H:%M` c_502=`grep :$d: $log |grep ' 502 '|wc -l` if [ $c_502 -gt 10 ] && [ $send == 1 ]; then echo "$addr $d 502 count is $c_502">../log/502.tmp /bin/bash ../mail/mail.sh $addr\_502 $c_502 ../log/502.tmp fi echo "`date +%T` 502 $c_502"
disk.sh内容vim
mail.sh内容 ``` #这个脚本用于作告警收敛 #这里的$1指的是在监控子脚本中发送告警邮件的代码后面跟的第一个参数 log=$1 #定义了一个时间戳 t_s=date +%s
#定义两个小时之前的时间戳,用于第一次执行脚本时第一次发生异常必须要报警 t_s2=date -d "2 hours ago" +%s
#若是日志不存在,就将两个小时之前的时间戳写入日志中 if [ ! -f /tmp/$log ] then echo $t_s2 > /tmp/$log fi t_s2=tail -1 /tmp/$log|awk '{print $1}'
echo $t_s>>/tmp/$log #比较两个时间戳 v=$[$t_s-$t_s2] echo $v #若是两次时间戳间隔大于1小时,就报警 if [ $v -gt 3600 ] then ./mail.py $1 $2 $3 #$log.txt用于计数,从这时开始新的计数 echo "0" > /tmp/$log.txt else if [ ! -f /tmp/$log.txt ] then echo "0" > /tmp/$log.txt fi nu=cat /tmp/$log.txt
nu2=$[$nu+1] echo $nu2>/tmp/$log.txt if [ $nu2 -gt 10 ] then ./mail.py $1 "trouble continue 10 min $2" "$3" echo "0" > /tmp/$log.txt fi fi bash
五 运行监控项目 =========== 首先编辑计划任务
任务计划以下:每分钟执行一次,首先进入/usr/local/sbin/mon/bin目录下,而后执行主脚本。必需要进入bin目录下,否则脚本没办法正常执行