fix(monitoring): node-exporter отдавал сетевые метрики контейнера вместо хоста
`node_network_*` показывал трафик собственного `eth0` экспортера (56 МБ) вместо хостового `enp3s0` (39.8 ГБ). При разборе нагрузочного теста 28.07 сетевых метрик хоста не оказалось вовсе — весь анализ трафика пришлось вести по метрикам контейнеров. Причина не в конфигурации экспортера, а в устройстве procfs: bind-mount `/proc` хоста достаточен для CPU, памяти и диска, но `/proc/net` — это симлинк на `self/net`, который резолвится в сетевом namespace читающего процесса. Никакое монтирование это не обходит, нужен host network namespace. Прежний комментарий в compose утверждал обратное — исправлен. Порт 9100 теперь слушается на хосте, наружу не торчит: ufw пропускает только 22/80/443/3478/7881/51820 и UDP-диапазон LiveKit. Prometheus обращается к экспортеру через `host.docker.internal` (`extra_hosts: host-gateway`), потому что по имени сервиса в docker-сети он больше не резолвится. Дашборд `host.json` правок не требует: сетевые панели фильтруют интерфейсы по исключению (`device!~"lo|veth.*|docker.*|br-.*"`), под которое `enp3s0` не подпадает. Алерты на имя instance не завязаны.
This commit is contained in:
@@ -662,6 +662,12 @@ services:
|
|||||||
- ./monitoring/prometheus.yml:/etc/prometheus/prometheus.yml:ro
|
- ./monitoring/prometheus.yml:/etc/prometheus/prometheus.yml:ro
|
||||||
- ./monitoring/alerts.yml:/etc/prometheus/alerts.yml:ro
|
- ./monitoring/alerts.yml:/etc/prometheus/alerts.yml:ro
|
||||||
- prometheus_data:/prometheus
|
- prometheus_data:/prometheus
|
||||||
|
# node-exporter живёт в host-сети (см. комментарий у него) и по имени
|
||||||
|
# сервиса в docker-сети больше не резолвится. `host-gateway` — штатный
|
||||||
|
# способ дать контейнеру адрес хоста, не завязываясь на конкретный IP
|
||||||
|
# docker-моста.
|
||||||
|
extra_hosts:
|
||||||
|
- "host.docker.internal:host-gateway"
|
||||||
# Loopback-only: админ-доступ по ssh-туннелю, наружу не публикуется.
|
# Loopback-only: админ-доступ по ssh-туннелю, наружу не публикуется.
|
||||||
ports:
|
ports:
|
||||||
- "127.0.0.1:9090:9090"
|
- "127.0.0.1:9090:9090"
|
||||||
@@ -711,13 +717,27 @@ services:
|
|||||||
|
|
||||||
node-exporter:
|
node-exporter:
|
||||||
# Метрики железа хоста (CPU, память, диск, сеть, load average) — то,
|
# Метрики железа хоста (CPU, память, диск, сеть, load average) — то,
|
||||||
# чего нет ни в одном из приложенческих экспортеров выше. Без
|
# чего нет ни в одном из приложенческих экспортеров выше.
|
||||||
# `network_mode: host` (не нужен: читаем /proc,/sys,/ хоста через
|
#
|
||||||
# bind-mount, а Prometheus достаёт их по имени сервиса во внутренней
|
# `network_mode: host` ОБЯЗАТЕЛЕН, и вот почему (проверено 2026-07-28,
|
||||||
# сети compose — так безопаснее, не расширяет сетевой доступ контейнера).
|
# до этого экспортер работал в bridge-сети и отдавал неверные данные).
|
||||||
|
# Bind-mount'а `/proc` достаточно для CPU, памяти и диска, но НЕ для сети:
|
||||||
|
# `/proc/net` — это симлинк на `self/net`, который резолвится в сетевом
|
||||||
|
# namespace ЧИТАЮЩЕГО процесса. В bridge-сети экспортер видел собственные
|
||||||
|
# `lo` и `eth0` (56 МБ трафика) вместо хостового `enp3s0` (39.8 ГБ), то
|
||||||
|
# есть `node_network_*` показывал трафик контейнера, а не сервера. При
|
||||||
|
# разборе нагрузочного теста 28.07 сетевых метрик хоста не оказалось
|
||||||
|
# вовсе — см. .forcc/LOAD-FINDINGS.md.
|
||||||
|
#
|
||||||
|
# Порт 9100 при этом слушается на хосте. Наружу он не торчит: ufw
|
||||||
|
# пропускает только 22/80/443/3478/7881/51820 и UDP-диапазон LiveKit
|
||||||
|
# (проверено `ufw status`). Prometheus обращается к нему через
|
||||||
|
# `host.docker.internal` (см. `extra_hosts` у сервиса prometheus и
|
||||||
|
# таргет `node` в deploy/monitoring/prometheus.yml).
|
||||||
image: prom/node-exporter:v1.8.2
|
image: prom/node-exporter:v1.8.2
|
||||||
restart: unless-stopped
|
restart: unless-stopped
|
||||||
pid: host
|
pid: host
|
||||||
|
network_mode: host
|
||||||
volumes:
|
volumes:
|
||||||
- /proc:/host/proc:ro
|
- /proc:/host/proc:ro
|
||||||
- /sys:/host/sys:ro
|
- /sys:/host/sys:ro
|
||||||
@@ -727,9 +747,8 @@ services:
|
|||||||
- '--path.sysfs=/host/sys'
|
- '--path.sysfs=/host/sys'
|
||||||
- '--path.rootfs=/rootfs'
|
- '--path.rootfs=/rootfs'
|
||||||
- '--collector.filesystem.mount-points-exclude=^/(sys|proc|dev|host|etc)($$|/)'
|
- '--collector.filesystem.mount-points-exclude=^/(sys|proc|dev|host|etc)($$|/)'
|
||||||
# Не публикуем порт наружу вообще (не 127.0.0.1:9100, а совсем без
|
# Секции `ports` нет и с host-сетью быть не может: контейнер слушает
|
||||||
# ports) — Prometheus ходит к нему по внутренней сети compose
|
# прямо на интерфейсах хоста. От внешнего мира порт закрывает ufw.
|
||||||
# (`node-exporter:9100`), публикация на хост для этого не нужна.
|
|
||||||
healthcheck:
|
healthcheck:
|
||||||
test: ["CMD-SHELL", "wget -q -O- http://127.0.0.1:9100/metrics >/dev/null || exit 1"]
|
test: ["CMD-SHELL", "wget -q -O- http://127.0.0.1:9100/metrics >/dev/null || exit 1"]
|
||||||
interval: 10s
|
interval: 10s
|
||||||
|
|||||||
@@ -38,9 +38,16 @@ scrape_configs:
|
|||||||
# — сервис node-exporter). Единственный источник, который покажет
|
# — сервис node-exporter). Единственный источник, который покажет
|
||||||
# нехватку памяти/CPU на сервере, если она не проявится как рост
|
# нехватку памяти/CPU на сервере, если она не проявится как рост
|
||||||
# латентности API (см. дашборд host.json).
|
# латентности API (см. дашборд host.json).
|
||||||
|
#
|
||||||
|
# Адрес `host.docker.internal`, а не `node-exporter:9100`: с 2026-07-28
|
||||||
|
# экспортер работает в host-сети и по имени сервиса в docker-сети не
|
||||||
|
# резолвится. Причина перевода — сетевые метрики: `/proc/net` это симлинк
|
||||||
|
# на `self/net`, поэтому в bridge-сети экспортер отдавал трафик
|
||||||
|
# собственного `eth0` вместо хостового `enp3s0`. Имя резолвится через
|
||||||
|
# `extra_hosts: host-gateway` у сервиса prometheus (deploy/docker-compose.yml).
|
||||||
- job_name: node
|
- job_name: node
|
||||||
static_configs:
|
static_configs:
|
||||||
- targets: ["node-exporter:9100"]
|
- targets: ["host.docker.internal:9100"]
|
||||||
|
|
||||||
# Метрики по каждому контейнеру (CPU/память/сеть отдельно у backend,
|
# Метрики по каждому контейнеру (CPU/память/сеть отдельно у backend,
|
||||||
# worker, postgres и т.д. — профиль monitoring, сервис
|
# worker, postgres и т.д. — профиль monitoring, сервис
|
||||||
|
|||||||
Reference in New Issue
Block a user