fix(monitoring): node-exporter отдавал сетевые метрики контейнера вместо хоста
`node_network_*` показывал трафик собственного `eth0` экспортера (56 МБ) вместо хостового `enp3s0` (39.8 ГБ). При разборе нагрузочного теста 28.07 сетевых метрик хоста не оказалось вовсе — весь анализ трафика пришлось вести по метрикам контейнеров. Причина не в конфигурации экспортера, а в устройстве procfs: bind-mount `/proc` хоста достаточен для CPU, памяти и диска, но `/proc/net` — это симлинк на `self/net`, который резолвится в сетевом namespace читающего процесса. Никакое монтирование это не обходит, нужен host network namespace. Прежний комментарий в compose утверждал обратное — исправлен. Порт 9100 теперь слушается на хосте, наружу не торчит: ufw пропускает только 22/80/443/3478/7881/51820 и UDP-диапазон LiveKit. Prometheus обращается к экспортеру через `host.docker.internal` (`extra_hosts: host-gateway`), потому что по имени сервиса в docker-сети он больше не резолвится. Дашборд `host.json` правок не требует: сетевые панели фильтруют интерфейсы по исключению (`device!~"lo|veth.*|docker.*|br-.*"`), под которое `enp3s0` не подпадает. Алерты на имя instance не завязаны.
This commit is contained in:
@@ -38,9 +38,16 @@ scrape_configs:
|
||||
# — сервис node-exporter). Единственный источник, который покажет
|
||||
# нехватку памяти/CPU на сервере, если она не проявится как рост
|
||||
# латентности API (см. дашборд host.json).
|
||||
#
|
||||
# Адрес `host.docker.internal`, а не `node-exporter:9100`: с 2026-07-28
|
||||
# экспортер работает в host-сети и по имени сервиса в docker-сети не
|
||||
# резолвится. Причина перевода — сетевые метрики: `/proc/net` это симлинк
|
||||
# на `self/net`, поэтому в bridge-сети экспортер отдавал трафик
|
||||
# собственного `eth0` вместо хостового `enp3s0`. Имя резолвится через
|
||||
# `extra_hosts: host-gateway` у сервиса prometheus (deploy/docker-compose.yml).
|
||||
- job_name: node
|
||||
static_configs:
|
||||
- targets: ["node-exporter:9100"]
|
||||
- targets: ["host.docker.internal:9100"]
|
||||
|
||||
# Метрики по каждому контейнеру (CPU/память/сеть отдельно у backend,
|
||||
# worker, postgres и т.д. — профиль monitoring, сервис
|
||||
|
||||
Reference in New Issue
Block a user