fix(monitoring): убрать cAdvisor — несовместим с containerd-снапшоттером
На сервере 1gb Docker Engine использует containerd-снапшоттер (driver-type: io.containerd.snapshotter.v1), а не классический overlay2. cAdvisor (проверено на v0.49.2 и свежей v0.52.1, с --docker_only и через --containerd/--containerd-namespace=moby) не может определить read-write layer контейнеров — падает с «failed to identify the read-write layer ID», метрики только по корневому cgroup, без разбивки по контейнерам. Открытая проблема совместимости, флагами не решается. Убран сервис cadvisor, job в prometheus.yml, панели «топ контейнеров» в host.json (Prometheus иначе резолвит cadvisor:8080 в никуда — Grafana показывала бы «No data» вечно). node-exporter метрики хоста (CPU/RAM/ диск/сеть) при этом покрывает полностью, без изменений. Правка конфигурации мониторинга, без изменения пользовательского поведения — версия не бампается.
This commit is contained in:
@@ -734,42 +734,17 @@ services:
|
||||
profiles: ["monitoring"]
|
||||
logging: *default-logging
|
||||
|
||||
cadvisor:
|
||||
# Метрики по контейнерам (CPU/память каждого) — отвечает на вопрос
|
||||
# «какой из контейнеров ест ресурсы», в отличие от node-exporter
|
||||
# (только хост целиком). Дороже node-exporter по CPU/RAM (собственные
|
||||
# ~60-120 МБ RSS + периодический обход cgroups) — на сервере 8 ГБ/4 CPU
|
||||
# с ~13 контейнерами это приемлемо, но не бесплатно; `--docker_only`
|
||||
# и `--disable_metrics` ниже отключают часть коллекторов сверх дефолта
|
||||
# cAdvisor (который уже отключает cpu_topology/hugetlb/memory_numa/
|
||||
# process/sched/tcp/udp и т.п.) — здесь дополнительно per-core CPU,
|
||||
# perf_event и дисковые метрики (диск и так покрыт node-exporter'ом,
|
||||
# дублировать через cAdvisor незачем). Список допустимых значений —
|
||||
# `cadvisor -help` (в версии образа меняется, не все имена стабильны
|
||||
# между релизами — при апгрейде образа сверяться с `-help`).
|
||||
image: gcr.io/cadvisor/cadvisor:v0.49.2
|
||||
restart: unless-stopped
|
||||
volumes:
|
||||
- /:/rootfs:ro
|
||||
- /var/run:/var/run:ro
|
||||
- /sys:/sys:ro
|
||||
- /var/lib/docker/:/var/lib/docker:ro
|
||||
# Только чтение — cAdvisor не должен иметь возможность управлять
|
||||
# контейнерами, ему нужен только список и статистика.
|
||||
- /var/run/docker.sock:/var/run/docker.sock:ro
|
||||
command:
|
||||
- '--docker_only=true'
|
||||
- '--disable_metrics=percpu,perf_event,diskIO,disk,app'
|
||||
# Без ports вообще — тот же принцип, что и у node-exporter: Prometheus
|
||||
# достаёт метрики по имени сервиса (`cadvisor:8080`) внутри сети compose.
|
||||
healthcheck:
|
||||
test: ["CMD-SHELL", "wget -q -O- http://127.0.0.1:8080/healthz >/dev/null || exit 1"]
|
||||
interval: 10s
|
||||
timeout: 5s
|
||||
retries: 10
|
||||
start_period: 15s
|
||||
profiles: ["monitoring"]
|
||||
logging: *default-logging
|
||||
# cAdvisor сознательно НЕ используется: несовместим с Docker Engine на
|
||||
# сервере `1gb` (containerd-снапшоттер вместо классического overlay2 —
|
||||
# `docker info` показывает `driver-type: io.containerd.snapshotter.v1`).
|
||||
# cAdvisor (проверено на v0.49.2 и v0.52.1) не может определить
|
||||
# read-write layer контейнеров через ни docker.sock, ни напрямую через
|
||||
# `--containerd`/`--containerd-namespace=moby` — падает с
|
||||
# «failed to identify the read-write layer ID», отдаёт метрики только по
|
||||
# корневому cgroup, без разбивки по контейнерам. Открытая проблема
|
||||
# совместимости cAdvisor с containerd image store, не чинится флагами —
|
||||
# см. `.forcc/JOURNAL.md` за детали и альтернативы. node-exporter
|
||||
# (сервис выше) метрики хоста при этом покрывает полностью.
|
||||
|
||||
grafana:
|
||||
image: grafana/grafana:13.1.0
|
||||
|
||||
Reference in New Issue
Block a user