chore(monitoring): глубина логов и срок хранения метрик под наблюдение неделями
Some checks failed
CI / backend (push) Has been cancelled
CI / frontend (push) Has been cancelled

Готовим стенд к сбору статистики по реальным конференциям вместо разового
нагрузочного теста. В прежней конфигурации данные не дожили бы до разбора.

Логи: 10 МБ × 3 → 50 МБ × 5 на контейнер. При полусотне участников логи
LiveKit перезаписывались за часы, а по ним восстанавливается то, чего нет
в метриках: сколько камер работало одновременно, кого и почему отключило,
как шли события congestion. Именно так был уточнён профиль теста 28.07
(оказалось 17 камер, а не 8).

Prometheus: retention 15 суток (дефолт) → 30. Первые два флага в `command`
дублируют дефолт образа намеренно — `command` перекрывает CMD целиком, без
них Prometheus не найдёт конфиг.

Расход: 250 МБ логов на контейнер и рост TSDB со 100 МБ; на сервере
свободно 15 ГБ.
This commit is contained in:
2026-07-29 13:32:18 +03:00
parent 270926cc96
commit 5e6c4f8bfd

View File

@@ -1,10 +1,17 @@
name: vidconf
# Глубина логов рассчитана на РАЗБОР ИНЦИДЕНТОВ, а не только на просмотр
# последних сообщений. При 10 МБ × 3 (прежнее значение) логи LiveKit на
# конференции в полсотни человек перезаписывались за часы — а именно по ним
# восстанавливаются вещи, которых нет в метриках: сколько камер было включено
# одновременно, кого и почему отключило, какие события congestion шли.
# 50 МБ × 5 = 250 МБ на контейнер; на сервере с 15 ГБ свободного места это
# незаметно, зато ретроспектива живёт неделями.
x-logging: &default-logging
driver: json-file
options:
max-size: "10m"
max-file: "3"
max-size: "50m"
max-file: "5"
services:
postgres:
@@ -664,6 +671,16 @@ services:
# Тег закреплён по версии (не `:latest`) — та же причина, что и у llm-образов.
image: prom/prometheus:v3.13.1
restart: unless-stopped
# Первые два флага — дефолт образа; повторяем их явно, потому что
# `command` перекрывает CMD целиком. Третий — срок хранения: дефолтных
# 15 суток мало, когда нагрузку набирают неделями (наблюдение за
# реальными конференциями вместо разового теста), и разбирать её потом
# приходится задним числом. 30 суток при нынешних 100 МБ TSDB стоят
# копеек — база растёт медленнее, чем кажется.
command:
- '--config.file=/etc/prometheus/prometheus.yml'
- '--storage.tsdb.path=/prometheus'
- '--storage.tsdb.retention.time=30d'
volumes:
- ./monitoring/prometheus.yml:/etc/prometheus/prometheus.yml:ro
- ./monitoring/alerts.yml:/etc/prometheus/alerts.yml:ro