config/prometheus/additional_metrics.yml


1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
159

- group: Response metrics (NGINX Ingress)
  priority: 10
  metrics:
  - title: "Throughput"
    y_label: "Requests / Sec"
    required_metrics:
      - nginx_upstream_responses_total
    weight: 1
    queries:
    - query_range: 'sum(rate(nginx_upstream_responses_total{upstream=~"%{kube_namespace}-%{ci_environment_slug}-.*"}[2m])) by (status_code)'
      unit: req / sec
      label: Status Code
      series:
        - label: status_code
          when:
            - value: 2xx
              color: green
            - value: 4xx
              color: orange
            - value: 5xx
              color: red
  - title: "Latency"
    y_label: "Latency (ms)"
    required_metrics:
      - nginx_upstream_response_msecs_avg
    weight: 1
    queries:
    - query_range: 'avg(nginx_upstream_response_msecs_avg{upstream=~"%{kube_namespace}-%{ci_environment_slug}-.*"})'
      label: Average
      unit: ms
  - title: "HTTP Error Rate"
    y_label: "HTTP 500 Errors / Sec"
    required_metrics:
      - nginx_upstream_responses_total
    weight: 1
    queries:
    - query_range: 'sum(rate(nginx_upstream_responses_total{status_code="5xx", upstream=~"%{kube_namespace}-%{ci_environment_slug}-.*"}[2m]))'
      label: HTTP Errors
      unit: "errors / sec"
- group: Response metrics (HA Proxy)
  priority: 10
  metrics:
  - title: "Throughput"
    y_label: "Requests / Sec"
    required_metrics:
      - haproxy_frontend_http_requests_total
    weight: 1
    queries:
    - query_range: 'sum(rate(haproxy_frontend_http_requests_total{%{environment_filter}}[2m])) by (code)'
      unit: req / sec
      series:
        - label: code
          when:
            - value: 2xx
              color: green
            - value: 4xx
              color: yellow
            - value: 5xx
              color: red
  - title: "HTTP Error Rate"
    y_label: "Error Rate (%)"
    required_metrics:
      - haproxy_frontend_http_responses_total
    weight: 1
    queries:
    - query_range: 'sum(rate(haproxy_frontend_http_responses_total{code="5xx",%{environment_filter}}[2m])) / sum(rate(haproxy_frontend_http_responses_total{%{environment_filter}}[2m]))'
      label: HTTP Errors
      unit: "%"
- group: Response metrics (AWS ELB)
  priority: 10
  metrics:
  - title: "Throughput"
    y_label: "Requests / Sec"
    required_metrics:
      - aws_elb_request_count_sum
    weight: 1
    queries:
    - query_range: 'sum(aws_elb_request_count_sum{%{environment_filter}}) / 60'
      label: Total
      unit: req / sec
  - title: "Latency"
    y_label: "Latency (ms)"
    required_metrics:
      - aws_elb_latency_average
    weight: 1
    queries:
    - query_range: 'avg(aws_elb_latency_average{%{environment_filter}}) * 1000'
      label: Average
      unit: ms
  - title: "HTTP Error Rate"
    y_label: "Error Rate (%)"
    required_metrics:
      - aws_elb_request_count_sum
      - aws_elb_httpcode_backend_5_xx_sum
    weight: 1
    queries:
    - query_range: 'sum(aws_elb_httpcode_backend_5_xx_sum{%{environment_filter}}) / sum(aws_elb_request_count_sum{%{environment_filter}})'
      label: HTTP Errors
      unit: "%"
- group: Response metrics (NGINX)
  priority: 10
  metrics:
  - title: "Throughput"
    y_label: "Requests / Sec"
    required_metrics:
      - nginx_responses_total
    weight: 1
    queries:
    - query_range: 'sum(rate(nginx_responses_total{server_zone!="*", server_zone!="_", %{environment_filter}}[2m])) by (status_code)'
      unit: req / sec
      label: Status Code
      series:
        - label: status_code
          when:
            - value: 2xx
              color: green
            - value: 4xx
              color: orange
            - value: 5xx
              color: red
  - title: "Latency"
    y_label: "Latency (ms)"
    required_metrics:
      - nginx_upstream_response_msecs_avg
    weight: 1
    queries:
    - query_range: 'avg(nginx_upstream_response_msecs_avg{%{environment_filter}})'
      label: Upstream
      unit: ms
  - title: "HTTP Error Rate"
    y_label: "HTTP 500 Errors / Sec"
    required_metrics:
      - nginx_responses_total
    weight: 1
    queries:
    - query_range: 'sum(rate(nginx_responses_total{status_code="5xx", %{environment_filter}}[2m]))'
      label: HTTP Errors
      unit: "errors / sec"
- group: System metrics (Kubernetes)
  priority: 5
  metrics:
  - title: "Memory Usage"
    y_label: "Memory Usage (MB)"
    required_metrics:
      - container_memory_usage_bytes
    weight: 1
    queries:
    - query_range: '(sum(container_memory_usage_bytes{container_name!="POD",%{environment_filter}}) / count(container_memory_usage_bytes{container_name!="POD",%{environment_filter}})) /1024/1024'
      label: Average
      unit: MB
  - title: "CPU Utilization"
    y_label: "CPU Utilization (Cores)"
    required_metrics:
     - container_cpu_usage_seconds_total
    weight: 1
    queries:
    - query_range: 'sum(rate(container_cpu_usage_seconds_total{container_name!="POD",%{environment_filter}}[2m]))'
      label: CPU
      unit: "cores"