NOVECTRA / БАЗА ЗНАНИЙ

Zabbix для небольшой компании: что мониторить в первую очередь

Обновлено: октябрь 2026

Установка Zabbix — самый описанный в интернете шаг этой истории, а вот вопрос «что, собственно, мониторить, когда система поднята» обычно остаётся за кадром. В этой статье — первый рабочий контур для небольшой компании: доступность, диски, сервисы, копии — с примерами порогов и порядком, который не превращает мониторинг в источник шума. Примеры выражений написаны в синтаксисе Zabbix 5.4+, действительном для линеек 6.0 и 7.0 LTS.

НОВЫЙ УРОВЕНЬ
ВАШЕЙ ИНФРАСТРУКТУРЫ
01 / ГРАНИЦА

Установку мы сознательно не пересказываем

Порядок установки Zabbix — сервера, базы, веб-интерфейса, агентов — зависит от версии, ОС и того, какая у вас база данных, и отлично описан в официальной документации: любой пересказ устареет раньше оригинала. Скажем о другом: для небольшой компании разворачивать имеет смысл именно LTS-линейку Zabbix — версии с длительной поддержкой получают исправления годами, а не месяцами, и не заставляют передумевать обновление посреди рабочего года.

И второе, что стоит решить до первого узла: мониторинг — это не установка, а налаженная петля «проблема обнаружена — человек узнал — проблема исправлена». Дальше в статье ровно об этой петле.

02 / КОНТУР

Первый контур: доступность, диски, ресурсы, сервисы

Порядок в этом списке не случаен: сначала то, что ловит полную остановку, затем то, что ловит приближение аварии, и только потом — тонкие индикаторы.

Доступность узлов. Каждый сервер и сетевое устройство отвечают на ping, а агенты — на свой ping:

# сервер не отвечает на ping (простая проверка с сервера Zabbix)
last(/srv-1c/icmpping)=0

# агент не выходит на связь три минуты (item: agent.ping)
nodata(/srv-1c/agent.ping,3m)=1

Второй триггер — самый недооценённый: он срабатывает и тогда, когда сервер жив, но агент остановлен, — типовая ситуация после «лёгкого обновления».

Диски. Заполнение диска — причина номер один внезапных остановок: база и логи растут незаметно.

# предупреждение при 90%, критично при 95% (item: vfs.fs.size[/,pused])
last(/srv-1c/vfs.fs.size[/,pused])>90

Процессор и память. Здесь пороги мягче: постоянная высокая загрузка — не авария, а приглашение разобраться.

# средняя загрузка CPU за 5 минут (item: system.cpu.util)
avg(/srv-1c/system.cpu.util,5m)>90

# доступной памяти меньше 10% (item: vm.memory.size[pavailable])
last(/srv-1c/vm.memory.size[pavailable])<10

Сервисы, а не серверы. Сервер может быть жив, а компания — стоять: учётная система, файловая шара, туннель. Проверка TCP-порта службы ловит это напрямую:

# файловая шара не принимает подключения (item: net.tcp.service[tcp,,445])
last(/srv-file/net.tcp.service[tcp,,445])=0

Для туннелей удобен ping изнутри сети: если Zabbix перестаёт получать ответ от туннельного адреса VPN-сервера, удалённые сотрудники уже это почувствовали. Порты конкретных систем — учётной базы, почты, телефонии — перечисляются по своему списку: у каждой компании он свой, и составить его проще всего вопросом «что именно мы открываем по утрам».

Состав самого списка узлов для небольшой компании предсказуем: сервер с учётной базой, файловый сервер или NAS, роутер, сервер виртуализации, если он есть. Правило включения простое: если остановка узла заметит вся компания, он в первом контуре; если остановку заметит один человек, это задача второго эшелона.

Отдельная строка — сетевое оборудование: агенты на роутеры и управляемые коммутаторы не ставятся, их доступность закрывает обычный ping, а при желании глубже — SNMP, который включается в настройках самого устройства. Для первого контура этого достаточно.

03 / КОПИИ

Мониторинг бэкапов

Раз копии — защита от худшего, их свежесть заслуживает места в первом контуре, а не надежды, что «задача зелёная». Универсальный приём — следить не за программой копирования, а за следом, который остаёт успешная копия: файл отметки или самый свежий файл в каталоге назначения. Время его изменения отвечает на главный вопрос:

# отметке о последней копии больше двух суток
# (item: vfs.file.time[/mnt/backup/last.txt,modify])
now()-last(/srv-nas/vfs.file.time[/mnt/backup/last.txt,modify])>172800

Порог подстраивается под расписание: для ежедневных копий две суток означают «пропущено уже две ночи». Содержимое журнала задачи мониторится отдельно, если программе копирования есть что сказать, — но свежесть следа не зависит от того, сменилась ли программа копирования, и потому надёжнее.

Важно понимать границу: мониторинг подтверждает, что копия появилась вовремя. То, что из неё можно восстановиться, подтверждает только тестовое восстановление — об этом наш чек-лист проверки резервных копий.

Тот же приём со следом работает и для данных, живущих в облачных сервисах: регулярный экспорт оставляет файл — его свежесть мониторится точно так же, свежесть локальной копии.

04 / УВЕДОМЛЕНИЯ

Кому и как присылать уведомления

Мониторинг без доведения до человека — графики для аффединков. Правильная петля собирается из трёх решений.

Кому. У каждой группы триггеров есть ответственный — человек, который при сообщении знает, что делать. В небольшой компании это часто один и тот же сотрудник или подрядчик, но дублёр нужен и здесь: сообщение, улетевшее в отпуск единственного администратора, равно отсутствию мониторинга.

Куда. Zabbix умеет отправку почты и вызовы вебхуков — через них сообщение попадает в мессенджер, где его реально читают. Канал стоит выбрать тот, которым компания пользуется днём: «сообщения на служебную почту, которую открывают по пятницам» — это имитация петли.

Как. Разделение по важности важнее выбора канала. Критичные события — «сервер молчит», «копия не появилась» — доходят до человека сразу, в любое время. Предупреждающие («диск подбирается к 90%») спокойно ждут утра. Zabbix различает важность триггеров и поддерживает эскалацию — если проблема не закрыта, сообщение повторяется. Первое время уместен самый простой вариант: две важности, два сценария доставки.

Эскалацию достаточно настроить в одном месте: критичное событие, на которое никто не отреагировал, через полчаса повторяется, а через час уходит дублёру. Zabbix поддерживает такие сценарии штатными средствами; главное — чтобы у каждого критичного триггера существовал тот, кому он придёт.

05 / ПОРОГИ

Пороги без фанатизма: что шумит и что важно

Практический критерий здоровья первого контура: ложных срабатываний — реже пары в месяц. Каждое пустое сообщение расходует доверие, и после десятка «пустышек» человек начинает читать уведомления по диагонали — именно в этот момент пропадает настоящее.

Шум почти всегда рождается из двух решений. Первое — слишком чувствительные пороги: загрузка процессора 80% на сервере, который раз в неделю пересчитывает отчёт, — не проблема, а его нормальный день. Порог ставится по наблюдению за нормальной неделей, а не по красивому числу из чужой статьи. Второе — мгновенные срабатывания на краткие всплески: условия вида «среднее за пять минут» вместо «последнее значение» гасят односекундные пики, о которых никто не должен узнавать.

Обратная сторона — пороги, поставленные настолько мягко, что проблемы проходят под ними. Диск, растущий на процент в неделю, напомнит о себе триггером за несколько дней до аварии — но только если предупреждение настроено на 90%, а не на 99%. Пороги — не разовое решение: через месяц работы стоит пройтись по истории и подвинуть те, что не сработали ни разу, хотя должны были, и те, что сработали зря.

И важная привычка из той же серии: сам мониторинг нужно проверять. Раз в несколько месяцев условие триггера воспроизводится намеренно — на тестовой машине останавливается агент или заполняется раздел, — и убедиться, что сообщение действительно пришло тому, кому должно. Мониторинг, который никто не проверял с момента установки, — та же копия, из которой ни разу ничего не восстанавливали.

06 / ЧЕСТНЫЕ ГРАНИЦЫ

Чего не стоит мониторить в маленькой инфраструктуре

  • Всё подряд из шаблонов. Полный шаблон ОС приносит сотни метрик: загрузка каждого ядра, каждый раздел, каждая сеть. В небольшой компании это шум без владельца — включайте то, что входит в первый контур, остальное добавляйте по мере потребности.
  • Каждый принтер и каждую точку Wi-Fi. Оборудование, простой которого никого не будит ночью, не заслуживает триггеров; при желании — доступность, но без уведомлений.
  • Десятки дашбордов без триггеров. Красивые графики, на которые не смотрит никто, — наблюдение без действия. Сначала петля «обнаружили — узнали — исправили», дашборд потом.
  • Второй мониторинг для страховки. Две системы мониторинга друг за другом удваивают сопровождение, а не надёжность. Лучше одна, но с работающими уведомлениями и дублёром на канале.
  • Метрики, на которые нет реакции. Правило простое: для каждой включённой значимой проверки должен существовать ответ на вопрос «что я сделаю, если это сработает». Нет ответа — проверка пока ранняя.
07 / ВОПРОСЫ И ОТВЕТЫ

Частые вопросы

Zabbix — не слишком ли тяжёлая система для маленькой компании?+

Для контура из пяти–двадцати узлов достаточно скромной виртуальной машины: нагрузка такая, что о ней не думаешь. Зато система умеет всё из этой статьи и не потребует замены при росте.

Обязательно ли ставить агенты на серверы?+

Нет: доступность и TCP-сервисы собираются простыми проверками с сервера Zabbix. Но диски, память и логи без агента не увидеть, а это половина первого контура — агенты на серверах оправданы почти всегда.

Сколько это стоит?+

Сам Zabbix бесплатен. Цена складывается из времени настройки и последующего сопровождения — пороги не настраиваются раз и навсегда, о чём выше. Это и есть та часть работы, которую часто недооценивают.

Сколько времени занимает настройка первого контура?+

Сам контур из пяти–семи узлов — вечер-два работы. Настоящая настройка идёт дальше: месяц наблюдений, за который пороги обкатываются на реальной неделе компании, а не на красивых числах.

А рабочие станции сотрудников мониторить?+

В первый контур — нет: их остановка заметна без мониторинга, а ресурсов и вариаций на них десятки. Исключение — машины, выполняющие важные фоновые задачи; для них включаются конкретные проверки этих задач.

Ночные уведомления — их правда нужно включать?+

Только для событий, при которых промедление до утра ухудшает положение: сервер недоступен, копия не создалась. Всё остальное спокойно ждёт утра — важность триггеров для того и различается.

08 / ЧТО ДАЛЬШЕ

Связанные материалы

Постановка мониторинга — от первого контура до уведомлений и пересмотра порогов — направление мониторинга и наблюдаемости.