3 Commits

Author SHA1 Message Date
b528785249 docs(deploy): правило ufw для скрейпа node-exporter из docker-сети
Some checks failed
CI / backend (push) Has been cancelled
CI / frontend (push) Has been cancelled
node-exporter переведён в host-сеть (иначе отдавал сетевые метрики
контейнера вместо серверных), и порт 9100 теперь слушается на хосте —
а значит Prometheus из docker-сети упирается в политику ufw по умолчанию.
Без этого правила таргет `node` остаётся down с `context deadline exceeded`.

Правило узкое: только из внутренних docker-подсетей (172.16.0.0/12 не
маршрутизируется в интернете) и только на 9100. Снаружи порт закрыт.

Инсталлятор firewall не настраивает — это ручной шаг документации,
поэтому строка добавлена именно сюда, иначе на новой инсталляции
мониторинг хоста молча останется без сетевых метрик.
2026-07-28 19:25:33 +03:00
a53ba7c827 fix(monitoring): node-exporter отдавал сетевые метрики контейнера вместо хоста
Some checks failed
CI / backend (push) Has been cancelled
CI / frontend (push) Has been cancelled
`node_network_*` показывал трафик собственного `eth0` экспортера (56 МБ)
вместо хостового `enp3s0` (39.8 ГБ). При разборе нагрузочного теста 28.07
сетевых метрик хоста не оказалось вовсе — весь анализ трафика пришлось
вести по метрикам контейнеров.

Причина не в конфигурации экспортера, а в устройстве procfs: bind-mount
`/proc` хоста достаточен для CPU, памяти и диска, но `/proc/net` — это
симлинк на `self/net`, который резолвится в сетевом namespace читающего
процесса. Никакое монтирование это не обходит, нужен host network
namespace. Прежний комментарий в compose утверждал обратное — исправлен.

Порт 9100 теперь слушается на хосте, наружу не торчит: ufw пропускает
только 22/80/443/3478/7881/51820 и UDP-диапазон LiveKit. Prometheus
обращается к экспортеру через `host.docker.internal` (`extra_hosts:
host-gateway`), потому что по имени сервиса в docker-сети он больше не
резолвится.

Дашборд `host.json` правок не требует: сетевые панели фильтруют
интерфейсы по исключению (`device!~"lo|veth.*|docker.*|br-.*"`), под
которое `enp3s0` не подпадает. Алерты на имя instance не завязаны.
2026-07-28 19:22:36 +03:00
71f150d1b6 feat(monitoring): собирать метрики LiveKit в Prometheus
Some checks failed
CI / backend (push) Has been cancelled
CI / frontend (push) Has been cancelled
В `livekit.yaml` порт метрик (6789) объявлен с самого начала, но job'а в
Prometheus не было — метрики SFU просто не собирались. Из-за этого разбор
нагрузочного теста 28.07.2026 пришлось вести по логам: `container-exporter`
показывает CPU, память и суммарный трафик контейнера, но не знает, что
внутри этого трафика.

Теперь доступны, в частности:
- `livekit_track_subscribed_total` / `livekit_track_published_total` —
  подписки против публикаций, то есть прямой эффект adaptiveStream;
- `livekit_participant_total`, `livekit_room_total` — нагрузка в участниках;
- `livekit_quality_score`, `livekit_packet_loss_percent`, `livekit_rtt_ms`,
  `livekit_jitter_us`, `livekit_nack_total`, `livekit_pli_total` — качество
  связи у клиентов вместо догадок по событиям congestion в логах;
- `livekit_webhook_queue_length` — очередь доставки вебхуков в backend.

Job включён, а не закомментирован, как `llm`: профиль `media` входит в
дефолтный набор COMPOSE_PROFILES. Конфиг проверен `promtool check config`.
2026-07-28 19:15:38 +03:00
3 changed files with 71 additions and 8 deletions

View File

@@ -662,6 +662,12 @@ services:
- ./monitoring/prometheus.yml:/etc/prometheus/prometheus.yml:ro - ./monitoring/prometheus.yml:/etc/prometheus/prometheus.yml:ro
- ./monitoring/alerts.yml:/etc/prometheus/alerts.yml:ro - ./monitoring/alerts.yml:/etc/prometheus/alerts.yml:ro
- prometheus_data:/prometheus - prometheus_data:/prometheus
# node-exporter живёт в host-сети (см. комментарий у него) и по имени
# сервиса в docker-сети больше не резолвится. `host-gateway` — штатный
# способ дать контейнеру адрес хоста, не завязываясь на конкретный IP
# docker-моста.
extra_hosts:
- "host.docker.internal:host-gateway"
# Loopback-only: админ-доступ по ssh-туннелю, наружу не публикуется. # Loopback-only: админ-доступ по ssh-туннелю, наружу не публикуется.
ports: ports:
- "127.0.0.1:9090:9090" - "127.0.0.1:9090:9090"
@@ -711,13 +717,27 @@ services:
node-exporter: node-exporter:
# Метрики железа хоста (CPU, память, диск, сеть, load average) — то, # Метрики железа хоста (CPU, память, диск, сеть, load average) — то,
# чего нет ни в одном из приложенческих экспортеров выше. Без # чего нет ни в одном из приложенческих экспортеров выше.
# `network_mode: host` (не нужен: читаем /proc,/sys,/ хоста через #
# bind-mount, а Prometheus достаёт их по имени сервиса во внутренней # `network_mode: host` ОБЯЗАТЕЛЕН, и вот почему (проверено 2026-07-28,
# сети compose — так безопаснее, не расширяет сетевой доступ контейнера). # до этого экспортер работал в bridge-сети и отдавал неверные данные).
# Bind-mount'а `/proc` достаточно для CPU, памяти и диска, но НЕ для сети:
# `/proc/net` — это симлинк на `self/net`, который резолвится в сетевом
# namespace ЧИТАЮЩЕГО процесса. В bridge-сети экспортер видел собственные
# `lo` и `eth0` (56 МБ трафика) вместо хостового `enp3s0` (39.8 ГБ), то
# есть `node_network_*` показывал трафик контейнера, а не сервера. При
# разборе нагрузочного теста 28.07 сетевых метрик хоста не оказалось
# вовсе — см. .forcc/LOAD-FINDINGS.md.
#
# Порт 9100 при этом слушается на хосте. Наружу он не торчит: ufw
# пропускает только 22/80/443/3478/7881/51820 и UDP-диапазон LiveKit
# (проверено `ufw status`). Prometheus обращается к нему через
# `host.docker.internal` (см. `extra_hosts` у сервиса prometheus и
# таргет `node` в deploy/monitoring/prometheus.yml).
image: prom/node-exporter:v1.8.2 image: prom/node-exporter:v1.8.2
restart: unless-stopped restart: unless-stopped
pid: host pid: host
network_mode: host
volumes: volumes:
- /proc:/host/proc:ro - /proc:/host/proc:ro
- /sys:/host/sys:ro - /sys:/host/sys:ro
@@ -727,9 +747,8 @@ services:
- '--path.sysfs=/host/sys' - '--path.sysfs=/host/sys'
- '--path.rootfs=/rootfs' - '--path.rootfs=/rootfs'
- '--collector.filesystem.mount-points-exclude=^/(sys|proc|dev|host|etc)($$|/)' - '--collector.filesystem.mount-points-exclude=^/(sys|proc|dev|host|etc)($$|/)'
# Не публикуем порт наружу вообще (не 127.0.0.1:9100, а совсем без # Секции `ports` нет и с host-сетью быть не может: контейнер слушает
# ports) — Prometheus ходит к нему по внутренней сети compose # прямо на интерфейсах хоста. От внешнего мира порт закрывает ufw.
# (`node-exporter:9100`), публикация на хост для этого не нужна.
healthcheck: healthcheck:
test: ["CMD-SHELL", "wget -q -O- http://127.0.0.1:9100/metrics >/dev/null || exit 1"] test: ["CMD-SHELL", "wget -q -O- http://127.0.0.1:9100/metrics >/dev/null || exit 1"]
interval: 10s interval: 10s

View File

@@ -38,9 +38,16 @@ scrape_configs:
# — сервис node-exporter). Единственный источник, который покажет # — сервис node-exporter). Единственный источник, который покажет
# нехватку памяти/CPU на сервере, если она не проявится как рост # нехватку памяти/CPU на сервере, если она не проявится как рост
# латентности API (см. дашборд host.json). # латентности API (см. дашборд host.json).
#
# Адрес `host.docker.internal`, а не `node-exporter:9100`: с 2026-07-28
# экспортер работает в host-сети и по имени сервиса в docker-сети не
# резолвится. Причина перевода — сетевые метрики: `/proc/net` это симлинк
# на `self/net`, поэтому в bridge-сети экспортер отдавал трафик
# собственного `eth0` вместо хостового `enp3s0`. Имя резолвится через
# `extra_hosts: host-gateway` у сервиса prometheus (deploy/docker-compose.yml).
- job_name: node - job_name: node
static_configs: static_configs:
- targets: ["node-exporter:9100"] - targets: ["host.docker.internal:9100"]
# Метрики по каждому контейнеру (CPU/память/сеть отдельно у backend, # Метрики по каждому контейнеру (CPU/память/сеть отдельно у backend,
# worker, postgres и т.д. — профиль monitoring, сервис # worker, postgres и т.д. — профиль monitoring, сервис
@@ -53,6 +60,32 @@ scrape_configs:
static_configs: static_configs:
- targets: ["container-exporter:9419"] - targets: ["container-exporter:9419"]
# LiveKit SFU (профиль `media`). Порт объявлен в самом LiveKit —
# `deploy/livekit/livekit.yaml.template`, секция `prometheus: port: 6789`;
# наружу он не публикуется, скрейп идёт по имени сервиса внутри docker-сети.
#
# Почему это важно отдельно от `container-exporter`: тот показывает CPU,
# память и суммарный трафик контейнера, но ничего не знает о том, ЧТО внутри
# этого трафика. Разбор нагрузочного теста 28.07.2026 пришлось делать по
# логам именно потому, что job'а здесь не было (см. .forcc/LOAD-FINDINGS.md).
#
# Ключевое, что отсюда появляется:
# livekit_track_subscribed_total / livekit_track_published_total —
# подписки против публикаций, то есть прямой эффект adaptiveStream;
# livekit_participant_total, livekit_room_total — нагрузка в участниках;
# livekit_quality_score, livekit_packet_loss_percent, livekit_rtt_ms,
# livekit_jitter_us, livekit_nack_total, livekit_pli_total — качество
# связи у клиентов, а не догадки по событиям congestion в логах;
# livekit_webhook_queue_length, livekit_webhook_dispatch_total — очередь
# доставки вебхуков в backend (на тесте она росла до 56 секунд).
#
# Профиль `media` входит в дефолтный набор COMPOSE_PROFILES (см. .env.example),
# поэтому job включён, а не закомментирован, как `llm`. На инсталляции без
# профиля `media` таргет не резолвится — закомментируйте секцию.
- job_name: livekit
static_configs:
- targets: ["livekit:6789"]
# Локальный LLM-сервер (llama.cpp, LLAMA_ARG_ENDPOINT_METRICS=1). Адрес # Локальный LLM-сервер (llama.cpp, LLAMA_ARG_ENDPOINT_METRICS=1). Адрес
# `llm:8080` разрешается ОДНИМ из двух compose-сервисов в зависимости от # `llm:8080` разрешается ОДНИМ из двух compose-сервисов в зависимости от
# выбранного при установке пресета — `llm` (CPU, профиль `llm`, уровни # выбранного при установке пресета — `llm` (CPU, профиль `llm`, уровни

View File

@@ -85,6 +85,17 @@ ufw allow 54000:54100/udp # LiveKit WebRTC media (ICE), см. docker-compose.y
# TURN (coturn) — только если включаете раздел 8: # TURN (coturn) — только если включаете раздел 8:
# ufw allow 3478/tcp # ufw allow 3478/tcp
# ufw allow 3478/udp # ufw allow 3478/udp
# Мониторинг (профиль `monitoring`): node-exporter работает в host-сети —
# иначе он отдаёт сетевые метрики собственного контейнера вместо метрик
# сервера (`/proc/net` — симлинк на `self/net`, bind-mount `/proc` этого не
# обходит; см. комментарий у сервиса в deploy/docker-compose.yml). Порт
# слушается на хосте, поэтому Prometheus в docker-сети упирается в
# политику ufw по умолчанию. Правило разрешает скрейп ТОЛЬКО из внутренних
# docker-подсетей — снаружи 9100 остаётся закрыт (172.16.0.0/12 не
# маршрутизируется в интернете):
ufw allow from 172.16.0.0/12 to any port 9100 proto tcp comment 'node-exporter: скрейп Prometheus из docker-сети'
ufw enable ufw enable
``` ```