Ключевые группы рисков
| Группа | Содержание |
|---|---|
| Непрерывность сети | Аварии на магистралях, отказ узлов, обрывы, перегрузки, отключения электроснабжения |
| Оборудование и поставки | Доступность оборудования и запчастей, длительные циклы поставки, поддержка вендора |
| Программное обеспечение | Поддержка платформ, обновления, зависимость от внешних решений, миграции |
| Регуляторные | Требования к хранению данных, лицензионные условия, требования к качеству услуг, тарифное регулирование |
| Информационная безопасность | Атаки на инфраструктуру, утечки абонентских данных, мошенничество в сетях |
| Коммерческие | Отток абонентов, ценовая конкуренция, изменение структуры потребления услуг |
| Инфраструктурные | Права на размещение оборудования, доступ в здания, аренда опор и каналов |
| Проектные | Строительство сети, сроки ввода объектов, подключение крупных клиентов |
Специфика подхода
В телекоме управление рисками тесно смыкается с управлением непрерывностью и с эксплуатационной надежностью. Отраслевая практика оперирует показателями доступности услуги, целевым временем восстановления и допустимым уровнем деградации, и эти же величины естественным образом становятся индикаторами риска.
Вторая особенность в скорости. Инцидент в сети развивается за минуты, и решение принимается дежурной сменой, а не комитетом. Поэтому основная работа по управлению рисками смещена в подготовку, схемы резервирования, планы восстановления, регулярные учения и заранее переданные полномочия.
Что стоит проверить
- Есть ли актуальная карта критичных элементов сети и понимание последствий отказа каждого
- Проверены ли схемы резервирования фактически, а не по документации
- Есть ли планы восстановления по основным сценариям и когда они последний раз проверялись учением
- Учтены ли риски зависимости от единственного поставщика оборудования или платформы
- Как организовано управление изменениями, значительная часть аварий возникает при плановых работах
- Отражены ли регуляторные обязательства в реестре с конкретными сроками и владельцами
Наблюдение
Самая недооцененная группа рисков в отрасли это риски плановых изменений. Существенная часть крупных сбоев происходит не из-за внешних событий, а во время обновлений, миграций и работ по расширению.
Отсюда практический приоритет. Управление изменениями с обязательной оценкой риска изменения, планом отката и окном, в котором последствия минимальны, дает больший эффект на надежность, чем дополнительное резервирование оборудования. И обходится существенно дешевле.
Для сети и ИТ-систем оператора ключевой документ это план аварийного восстановления с целевыми RTO и RPO. Как он устроен и чем отличается от плана непрерывности, разобрано на странице «План аварийного восстановления».
Частые вопросы
Через общие сценарии и общие целевые показатели восстановления. Реестр рисков дает перечень угроз, планы непрерывности дают ответ на их реализацию.
Обязательно. План, который не проверялся учением, при реальном инциденте работает примерно наполовину.
Через потерянную выручку, компенсации абонентам, регуляторные последствия и отток. Последний обычно оценивают ниже реального.
Проверьте зрелость своей системы управления рисками
Тринадцать вопросов по пяти уровням ГОСТ Р 70350, результат сразу: уровень, три главных пробела и следующий шаг.