Сетевая инфраструктура генерирует значительное количество показателей: состояние интерфейсов, объемы трафика, загрузку каналов, ошибки, параметры оборудования, события протоколов маршрутизации, данные инженерных систем. Задача мониторинга заключается не только в том, чтобы собрать эти значения, но и в том, чтобы связать их между собой и дать эксплуатационной службе понятную картину состояния инфраструктуры.
Российские системы инфраструктурного мониторинга показывают устойчивый базовый набор показателей. Практически во всех решениях присутствуют доступность оборудования, сетевой трафик, состояние интерфейсов, загрузка процессоров, памяти и дисковой подсистемы. При этом более глубокий сетевой мониторинг дополняет этот уровень ошибками и отбрасываниями пакетов, потоковой статистикой, параметрами протоколов, QoS и другими специализированными показателями. В статье мы рассмотрим, как числовые метрики и счетчики, так и состояния объектов, события и расчетные эксплуатационные KPI.
Будем говорить не о едином списке «главных метрик», а о нескольких уровнях наблюдения за сетью: от ответа на вопрос «работает ли устройство?» до оценки качества каналов, состояния сетевой логики и эксплуатационных показателей всей инфраструктуры.