(взято на HABR.RU)
Ключевые пункты
- Если фигня может случиться, она не просто случится, но и сделает это по максимально катастрофичному сценарию.
- Убедитесь, что у вас есть ресурсы для аварийного переброса нагрузки.
- Убедитесь, что у вас есть бэкапы, они автоматически создаются и регулярно проверяются на консистентность.
- Продумайте типовые сценарии угроз.
- Дайте возможность инженерам придумать нетиповые варианты положить сервис.
- DRP должен быть простой и тупой инструкцией. Вся сложная диагностика только после того, как у клиентов восстановился сервис. Пусть даже на резервных мощностях.
- Укажите ключевые телефоны и контакты в DRP.
- Регулярно тестируйте сотрудников на понимание DRP.
- Устраивайте плановые аварии на продуктиве. Стенды не могут заменить все.
Читать полный текст статьи в источнике: https://habr.com/ru/company/ruvds/blog/523570/