monitoring: decouple default profile from optional llm/llm-gpu
Целевой набор профилей compose по умолчанию (media,monitoring) не включает llm/llm-gpu — job `llm` в prometheus.yml и алерт LlmDown в alerts.yml закомментированы, иначе Prometheus постоянно логировал бы неудачный скрейп несуществующего таргета, а LlmDown вечно оставался бы firing. Раскомментировать оба вместе — на инсталляциях с профилем llm/llm-gpu (пресеты 3-5 install.sh). Дашборд «Пайплайны пост-обработки» и docs/deploy/monitoring.md обновлены с пояснением, что большинство панелей показывают «No data» без transcribe/llm — это ожидаемо, не баг.
This commit is contained in:
@@ -41,19 +41,22 @@ groups:
|
||||
# LLM-сервер (llama.cpp, job `llm` — см. комментарий в prometheus.yml
|
||||
# про сетевой алиас `llm`/`llm-gpu`) недоступен. Актуально ТОЛЬКО на
|
||||
# инсталляциях с включённым профилем `llm`/`llm-gpu` (пресеты 3–5,
|
||||
# `install.sh`) — на пресетах 1/2 (без AI) таргет `llm:8080` в принципе
|
||||
# не резолвится, и этот алерт будет постоянно активен, если профиль
|
||||
# `monitoring` включён без AI-профиля; для таких инсталляций правило
|
||||
# можно отключить (закомментировать) в локальной копии alerts.yml.
|
||||
- alert: LlmDown
|
||||
expr: up{job="llm"} == 0
|
||||
for: 2m
|
||||
labels:
|
||||
severity: critical
|
||||
annotations:
|
||||
summary: "LLM-сервер (llama.cpp) недоступен"
|
||||
description: >-
|
||||
Prometheus не может достучаться до llm:8080 дольше 2 минут —
|
||||
суммаризация встанет (задачи будут копиться в очереди summarize,
|
||||
см. также алерт QueueGrowing). Проверить
|
||||
`docker compose ps llm` / `llm-gpu` и `docker compose logs llm`.
|
||||
# `install.sh`) — целевой набор профилей по умолчанию (`media,monitoring`,
|
||||
# см. .env.example) их не включает, поэтому правило закомментировано
|
||||
# вместе с job `llm` в prometheus.yml (иначе `up{job="llm"}` не находит
|
||||
# ни одной серии — сам по себе закомментированный job уже не даёт этому
|
||||
# алерту сработать, но держать активное правило на несуществующую
|
||||
# метрику вводит в заблуждение). Раскомментируйте оба вместе на
|
||||
# инсталляциях с профилем `llm`/`llm-gpu`.
|
||||
# - alert: LlmDown
|
||||
# expr: up{job="llm"} == 0
|
||||
# for: 2m
|
||||
# labels:
|
||||
# severity: critical
|
||||
# annotations:
|
||||
# summary: "LLM-сервер (llama.cpp) недоступен"
|
||||
# description: >-
|
||||
# Prometheus не может достучаться до llm:8080 дольше 2 минут —
|
||||
# суммаризация встанет (задачи будут копиться в очереди summarize,
|
||||
# см. также алерт QueueGrowing). Проверить
|
||||
# `docker compose ps llm` / `llm-gpu` и `docker compose logs llm`.
|
||||
|
||||
Reference in New Issue
Block a user