monitoring: decouple default profile from optional llm/llm-gpu

Целевой набор профилей compose по умолчанию (media,monitoring) не включает
llm/llm-gpu — job `llm` в prometheus.yml и алерт LlmDown в alerts.yml
закомментированы, иначе Prometheus постоянно логировал бы неудачный скрейп
несуществующего таргета, а LlmDown вечно оставался бы firing. Раскомментировать
оба вместе — на инсталляциях с профилем llm/llm-gpu (пресеты 3-5 install.sh).

Дашборд «Пайплайны пост-обработки» и docs/deploy/monitoring.md обновлены с
пояснением, что большинство панелей показывают «No data» без
transcribe/llm — это ожидаемо, не баг.
This commit is contained in:
2026-07-25 21:58:20 +03:00
parent 93e98f445b
commit ca54fe84d1
4 changed files with 50 additions and 29 deletions

View File

@@ -41,19 +41,22 @@ groups:
# LLM-сервер (llama.cpp, job `llm` — см. комментарий в prometheus.yml
# про сетевой алиас `llm`/`llm-gpu`) недоступен. Актуально ТОЛЬКО на
# инсталляциях с включённым профилем `llm`/`llm-gpu` (пресеты 35,
# `install.sh`) — на пресетах 1/2 (без AI) таргет `llm:8080` в принципе
# не резолвится, и этот алерт будет постоянно активен, если профиль
# `monitoring` включён без AI-профиля; для таких инсталляций правило
# можно отключить (закомментировать) в локальной копии alerts.yml.
- alert: LlmDown
expr: up{job="llm"} == 0
for: 2m
labels:
severity: critical
annotations:
summary: "LLM-сервер (llama.cpp) недоступен"
description: >-
Prometheus не может достучаться до llm:8080 дольше 2 минут —
суммаризация встанет (задачи будут копиться в очереди summarize,
см. также алерт QueueGrowing). Проверить
`docker compose ps llm` / `llm-gpu` и `docker compose logs llm`.
# `install.sh`) — целевой набор профилей по умолчанию (`media,monitoring`,
# см. .env.example) их не включает, поэтому правило закомментировано
# вместе с job `llm` в prometheus.yml (иначе `up{job="llm"}` не находит
# ни одной серии — сам по себе закомментированный job уже не даёт этому
# алерту сработать, но держать активное правило на несуществующую
# метрику вводит в заблуждение). Раскомментируйте оба вместе на
# инсталляциях с профилем `llm`/`llm-gpu`.
# - alert: LlmDown
# expr: up{job="llm"} == 0
# for: 2m
# labels:
# severity: critical
# annotations:
# summary: "LLM-сервер (llama.cpp) недоступен"
# description: >-
# Prometheus не может достучаться до llm:8080 дольше 2 минут —
# суммаризация встанет (задачи будут копиться в очереди summarize,
# см. также алерт QueueGrowing). Проверить
# `docker compose ps llm` / `llm-gpu` и `docker compose logs llm`.