一般咱们会使用Nginx的ngx_http_upstream_module模块来配置服务器组,示例以下html
upstream springboot { server 10.3.73.223:8080 max_fails=2 fail_timeout=30s; server 10.3.73.223:8090 max_fails=2 fail_timeout=30s; } server { listen 80; server_name localhost; location /test { proxy_pass http://springboot; } }
在30s内(fail_timeout,默认值为10s),与服务端通信失败2次(max_fails,默认值为1,设置为0则认为服务端一直可用),则认为服务器不可用mysql
不可用服务器在30s内与服务端通信成功2次,则认为服务器恢复nginx
特别须要注意的是,何为与服务端通信失败是由upstream的使用方定义的(ngx_http_proxy_module、proxy_next_upstream、fastcgi_next_upstream和memcached_next_upstream)git
以proxy_next_upstream为例:github
与服务端创建链接、向服务端发送请求或者解析服务端响应头时,发生异常或超时将被认为是通信失败web
服务端返回的响应为空或不合法将被认为是通信失败spring
若是配置了http_500,http_502,http_503,http_504和http_429,服务端返回这些状态码将被认为是通信失败sql
服务端返回http_403和http_404永远不会被认为通信失败json
当upstream中的一台服务器响应失败时, Nginx会将请求转发给下一台服务器,直到全部的服务器都发送过该请求,若是此时依然没法得到成功的响应,客户端将收到最后一台服务器返回的响应结果ubuntu
使用上面的配置进行测试:
package com.sean.test; import org.springframework.http.HttpStatus; import org.springframework.web.bind.annotation.RequestMapping; import org.springframework.web.bind.annotation.ResponseBody; import org.springframework.web.bind.annotation.ResponseStatus; /** * Created by seanzou on 2018/8/20. */ @org.springframework.stereotype.Controller public class Controller { @RequestMapping("/test") @ResponseBody // @ResponseStatus(code= HttpStatus.NOT_FOUND) @ResponseStatus(code= HttpStatus.INTERNAL_SERVER_ERROR) public String test(){ System.out.println("test"); // throw new RuntimeException(); return "test"; } }
即使服务端响应40四、500状态码,Nginx依然认为通信成功,除非停掉当前服务
upstream存在以下一些问题:
1 没法主动感知服务器状态
2 配置不灵活,没法自定义通信失败判断条件(仅提供少数定义好的状态码可供使用)
1,ngx_http_upstream_hc_module
ngx_http_upstream_hc_module容许周期性的对服务器组中的服务器进行健康检查,前提条件是服务器组中的服务器必须使用共享内存模式(共享内存用来保存服务器组的配置信息以及运行时状态,Nginx的woker进程将共享该配置和状态),示例以下:
功能十分强大,遗憾的是只有Nginx商业版才包含该模块
2,nginx_upstream_check_module
这个模块是由淘宝团队开发的,而且是彻底开源的:nginx_upstream_check_module
淘宝Tengine自带该模块,若是咱们没有使用Tengine,能够经过打补丁的方式把该模块加到咱们本身的Nginx中
修改Nginx配置,官方文档参考:ngx_http_upstream_check_module document
后端服务器健康检查状态都存于共享内存中,该指令能够设置共享内存的大小,若是服务器数量较大,须要注意该设置是否够用
语法:check_shm_size size
默认值:1M
上下文:http
健康检查规则配置
语法:check interval=milliseconds [fall=count] [rise=count] [timeout=milliseconds] [default_down=true | false]
[type=tcp | http | ssl_hello | mysql | ajp] [port=check_port]
默认值:check interval=30000 fall=5 rise=2 timeout=1000 default_down=true type=tcp
上下文:upstream
interval:向后端发送的健康检查的间隔时间
fall(fall_count): 连续失败次数达到fall_count,服务器被认为是down状态
rise(rise_count): 连续成功次数达到rise_count,服务器被认为是up状态
timeout: 健康检查请求超时时间
default_down: 设定初始时服务器的状态,若是是true,服务器默认是down状态,若是是false,服务器默认是up状态,默认值是true,也就是一开始服务器被认为不可用,要等健康检查请求达到必定成功次数之后才会被认为是健康的
type:健康检查请求协议类型,支持tcp,http,ssl_hello,mysql和ajp
port:健康检查请求发送端口,能够与后端服务器服务端口不一样
一个链接可发送的请求数,默认值为1,表示完成1次请求后即关闭链接
语法:check_keepalive_requests request_num
默认值:1
上下文:upstream
HTTP接口健康检查发送的请求内容,为了减小传输数据量,推荐采用HEAD方法
语法:check_http_send http_packet
默认值:"GET / HTTP/1.0\r\n\r\n"
上下文:upstream
HTTP接口健康检查成功状态码
语法:check_http_expect_alive [http_2xx | http_3xx | http_4xx | http_5xx]
默认值:http_2xx | http_3xx
上下文:upstream
后端服务器状态查询页面,提供三种展现方式
语法:check_status [html | csv | json]
默认值:check_status html
上下文:location
------------2018-11-29------------
线上环境检测的worker机使用tomcat做为容器,check_http_send须要配置Host(仅需配置便可,值是否正确不重要),不然会一直发送心跳检测,可是一直断定检测失败,示例以下: