NOVECTRA / КЕЙСЫ

После сбоя: не просто восстановили работу, а устранили причину повторения

Утром сотрудники обнаружили, что сетевые папки и внутренняя программа недоступны. Первой задачей было не модернизировать инфраструктуру, а вернуть доступ к рабочим данным.

НОВЫЙ УРОВЕНЬ
ВАШЕЙ ИНФРАСТРУКТУРЫ
01 / ПАРАМЕТРЫ ПРОЕКТА

Кейс коротко

Отрасль

Небольшая производственная компания

Масштаб

Около тридцати пяти пользователей

Формат

Аварийное восстановление → модернизация → сопровождение

Начало

Отказ физического сервера, часть операций остановлена

02 / ИНЦИДЕНТ

Инцидент

Физический сервер включался, но операционная система работала нестабильно. Компания фактически остановила часть операций.

03 / ВОССТАНОВЛЕНИЕ

Восстановление

Было проверено состояние дисков и доступность последних резервных копий. Критичные данные удалось восстановить на временную систему. Это позволило вернуть ключевые процессы, пока велась диагностика основного оборудования.

04 / РАЗБОР

Что показал разбор

Инцидент оказался следствием не одной ошибки: сервер был старым; мониторинг отсутствовал; предупреждения накопителей никто не отслеживал; backup существовал, но контроль его состояния не был частью регулярного обслуживания.

Таким образом, сам отказ оборудования был только финальной стадией проблемы.

05 / ИЗМЕНЕНИЯ

Что изменили

После восстановления текущей работы была построена новая схема. Сервисы перенесли на виртуальную платформу. Резервное копирование вынесли на отдельное устройство. Критичные компоненты подключили к мониторингу. Для оборудования определили график профилактической проверки.

06 / ВЫВОД

Основной вывод проекта

Невозможно гарантировать, что оборудование никогда не выйдет из строя. Поэтому задача инфраструктуры другая: сбой не должен превращаться в неизвестную ситуацию. Должно быть заранее понятно:

  • что отказало;
  • какие сервисы затронуты;
  • где находится резервная копия;
  • как выполнить восстановление;
  • какие действия требуются дальше.
07 / РЕЗУЛЬТАТ

Результат

Именно это компания получила после проекта: известный состав инфраструктуры, отдельное резервирование, наблюдаемые критичные компоненты и порядок действий при отказе.

08 / ТЕХНОЛОГИИ И СВЯЗАННЫЕ СТРАНИЦЫ

Технологии

PROXMOX WINDOWS SERVER / LINUX BACKUP NAS SMART-МОНИТОРИНГ ZABBIX MIKROTIK

Подробности о технологиях из этого кейса: резервное копирование и восстановление и мониторинг инфраструктуры. С чего начать наблюдение за инфраструктурой — в статье «Zabbix: что мониторить в первую очередь» нашей Базы знаний.

09 / ОБСУЖДЕНИЕ

Обсудим вашу инфраструктуру?

Расскажите, что нужно восстановить, модернизировать или взять на сопровождение. Предложим подходящий вариант реализации.