Про аварийный план восстановления

(взято на HABR.RU)

Ключевые пункты

  1. Если фигня может случиться, она не просто случится, но и сделает это по максимально катастрофичному сценарию.
  2. Убедитесь, что у вас есть ресурсы для аварийного переброса нагрузки.
  3. Убедитесь, что у вас есть бэкапы, они автоматически создаются и регулярно проверяются на консистентность.
  4. Продумайте типовые сценарии угроз.
  5. Дайте возможность инженерам придумать нетиповые варианты положить сервис.
  6. DRP должен быть простой и тупой инструкцией. Вся сложная диагностика только после того, как у клиентов восстановился сервис. Пусть даже на резервных мощностях.
  7. Укажите ключевые телефоны и контакты в DRP.
  8. Регулярно тестируйте сотрудников на понимание DRP.
  9. Устраивайте плановые аварии на продуктиве. Стенды не могут заменить все.

Читать полный текст статьи в источнике: https://habr.com/ru/company/ruvds/blog/523570/

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *