• /
Мониторинг инфраструктуры
ЦИСУСС

Метрики мониторинга сетевой инфраструктуры: как собрать показатели в единую картину

Сетевая инфраструктура генерирует значительное количество показателей: состояние интерфейсов, объемы трафика, загрузку каналов, ошибки, параметры оборудования, события протоколов маршрутизации, данные инженерных систем. Задача мониторинга заключается не только в том, чтобы собрать эти значения, но и в том, чтобы связать их между собой и дать эксплуатационной службе понятную картину состояния инфраструктуры.

Российские системы инфраструктурного мониторинга показывают устойчивый базовый набор показателей. Практически во всех решениях присутствуют доступность оборудования, сетевой трафик, состояние интерфейсов, загрузка процессоров, памяти и дисковой подсистемы. При этом более глубокий сетевой мониторинг дополняет этот уровень ошибками и отбрасываниями пакетов, потоковой статистикой, параметрами протоколов, QoS и другими специализированными показателями. В статье мы рассмотрим, как числовые метрики и счетчики, так и состояния объектов, события и расчетные эксплуатационные KPI.

Будем говорить не о едином списке «главных метрик», а о нескольких уровнях наблюдения за сетью: от ответа на вопрос «работает ли устройство?» до оценки качества каналов, состояния сетевой логики и эксплуатационных показателей всей инфраструктуры.
Доступность: первый уровень контроля сети
Базовый уровень мониторинга отвечает на самый очевидный вопрос: доступен ли контролируемый объект.

Для этого могут использоваться состояние узла, ICMP-проверки, время отклика, доступность TCP- или UDP-портов и другие проверки связи. Однако сама доступность — только исходная точка анализа. Устройство может отвечать на запросы, но один из его интерфейсов будет находиться в аварийном состоянии, канал — приближаться к пределу загрузки, а количество ошибок — быстро увеличиваться. Именно поэтому мониторинг доступности должен рассматриваться вместе с другими техническими характеристиками.

В ЦИСУСС «NB XT EM» для проверки связи используются агенты, которые позволяют контролировать ICMP-доступность и время отклика, а также TCP/UDP-порты. Доступность узлов и сервисов может затем использоваться и при расчете эксплуатационных показателей.

Для распределенной инфраструктуры этот уровень особенно важен: оператор получает базовую картину работоспособности объектов, после чего может переходить от фиксации самого факта проблемы к ее диагностике.
Интерфейсы: трафик, скорость и состояние портов
Следующий слой — сетевые интерфейсы. Здесь важно одновременно видеть состояние порта и параметры проходящего через него трафика. Для эксплуатационной службы важны как минимум несколько групп данных:
  • входящие и исходящие октеты и пакеты;
  • скорость передачи данных;
  • загрузка интерфейса;
  • административное и операционное состояние;
  • текущая и номинальная скорость интерфейса.

Здесь необходимо различать первичные и расчетные показатели. Счетчик переданных октетов показывает накопленное значение, но для оперативного мониторинга обычно интереснее производная от него — например, фактический битрейт за определенный интервал. Аналогично утилизация канала является расчетным показателем, который характеризует отношение фактического битрейта к пропускной способности интерфейса, принятой за базу расчета.

Типовые агенты сетевых устройств ЦИСУСС «NB XT EM» поддерживают сбор входящих и исходящих октетов, в том числе 64-битных счетчиков, статистику пакетов, состояние портов и данные о скорости. Битрейт и утилизация интерфейса могут формироваться как расчетные показатели. Это позволяет использовать одни и те же первичные данные и для оперативного наблюдения, и для последующей аналитики.
Errors и discards: одной загрузки канала недостаточно
Загруженность интерфейса показывает, насколько интенсивно используется канал, но сама по себе ничего не говорит о корректности передачи. Поэтому отдельная группа мониторинга — ошибки и отбрасывания.

Для сетевых интерфейсов в ЦИСУСС «NB XT EM» учитываются входящие и исходящие ошибки, включая CRC, а также входящие и исходящие discards.
Эти показатели важно анализировать отдельно. Ошибка означает проблему при обработке или передаче данных, тогда как отброшенный пакет не обязательно был поврежден. Например, рост отбрасываний может быть связан с перегрузкой или ограничениями ресурсов.

Для диагностики полезна именно комбинация параметров. Высокая утилизация без роста ошибок — одна ситуация. Умеренная нагрузка при быстром увеличении CRC — другая. Рост discards при нормальном физическом состоянии интерфейса — третья. Поэтому зрелая система мониторинга должна давать возможность сопоставлять показатели, а не заставлять инженера анализировать их изолированно.

В ЦИСУСС «NB XT EM» это реализовано на уровне подсистемы мониторинга производительности: система собирает и хранит параметры оборудования, позволяет группировать показатели независимо от устройства и выводить несколько метрик на одной панели для анализа их взаимосвязи. Также предусмотрена настройка пороговых значений, связанных с формированием аварийных сообщений.
Порог — начало анализа
Пороговые значения остаются одним из основных механизмов инфраструктурного мониторинга. Оператору важно получать предупреждение не тогда, когда он случайно открыл нужный график, а когда показатель выходит за допустимые границы.

Но значение порогов проявляется только в контексте исторических данных. Например, высокая загрузка процессора может быть нормальной для определенного режима работы оборудования. Кратковременный всплеск трафика также не обязательно является инцидентом. Поэтому мониторинг должен учитывать не только единичное значение, но и историю показателя, длительность состояния, его связь с другими метриками и событиями.

В ЦИСУСС «NB XT EM» для свойств агентов могут настраиваться пороги срабатывания и восстановления, также предусматривается отображение на графиках границ и цветовых областей, которые позволяют визуально сопоставлять текущее значение с заданными диапазонами.

При этом платформа не ограничивается текущим состоянием. Подсистема мониторинга производительности предусматривает долгосрочное хранение агрегированной информации, вывод данных за выбранные периоды, а также их экспорт для дальнейшей обработки.
В результате инженер может работать не только по модели «порог превышен — возникла тревога», но и анализировать динамику показателя.
Метрики оборудования: сеть зависит не только от каналов
Причина сетевой проблемы не всегда находится непосредственно в сетевом интерфейсе.
Маршрутизатор или сервер может продолжать отвечать на запросы, но испытывать нехватку памяти или высокую нагрузку на процессор. Проблемы с дисковой подсистемой, отдельными процессами или системными службами также могут влиять на работу связанных сервисов. CPU, память и диски входят в базовый слой практически всех систем инфраструктурного мониторинга наряду с сетевой активностью.

Для самомониторинга и мониторинга вычислительной инфраструктуры в ЦИСУСС «NB XT EM» предусмотрены показатели загрузки CPU, включая ядра и среднюю нагрузку, объем и использование памяти, параметры дисков, сетевые интерфейсы, состояние процессов и служб. Также могут контролироваться активные сессии и другие системные ресурсы.

Такой подход расширяет диагностику, оператор может видеть не только следствие на сетевом уровне, но и параметры самого оборудования, которые могут быть связаны с инцидентом.
Инженерная инфраструктура и оптика — часть общей картины
В реальной эксплуатации сетевое оборудование зависит от электропитания, температуры, состояния вентиляторов и других физических условий. Поэтому для крупных объектов мониторинг только IP-параметров оставляет существенную часть инфраструктуры за пределами единого контура.

ЦИСУСС «NB XT EM» предназначена для предприятий с большим парком разнородного оборудования. Система предусматривает работу не только с сетевыми объектами, но и с инженерным оборудованием, в том числе устройствами без сетевых интерфейсов через контроллеры узлов связи. Архитектура платформы включает работу с оборудованием по SNMP, через системы управления производителей, а также с устройствами через сухие контакты и последовательные интерфейсы.

Для инженерного оборудования в ЦИСУСС «NB XT EM» могут контролироваться параметры ИБП, включая заряд батареи, ток, напряжение и температуру, а также датчики влажности, мощности и других физических величин.
Для оптических модулей отслеживаются ток смещения, мощность приема и передачи, температура и напряжение питания.

Для эксплуатации это принципиальный момент. Сетевой сбой можно рассматривать вместе с данными об оптическом модуле, питании или температуре оборудования, не разделяя диагностику на несколько независимых систем.
Состояние сетевой логики: BGP, OSPF, STP и VPN
По мере усложнения сети интерфейсных метрик становится недостаточно. Физические соединения могут быть доступны, но нарушения возникнут на уровне маршрутизации или логической топологии.

ЦИСУСС «NB XT EM» поддерживает контроль ряда параметров сетевых протоколов и логических объектов. Для BGP доступны состояние пиров, данные о префиксах и автономных системах; для OSPF — состояние соседей; для STP — события и состояние топологии. Поддерживается информация о VLAN и транках, соседстве LLDP/CDP, состоянии IKE/IPsec-туннелей и L2VPN. Этот уровень мониторинга помогает перейти от наблюдения за набором физических устройств к контролю логики взаимодействия между ними.

Например, доступность двух маршрутизаторов еще не означает, что между ними корректно работает динамическая маршрутизация. Аналогично исправные интерфейсы не гарантируют, что VPN-туннель находится в рабочем состоянии.

В системах класса NMS подобная детализация является важным отличием от базового серверного мониторинга. Российские платформы показывают, что классические NMS заметно глубже раскрывают состояние портов, каналов связи, SNMP и потоковую телеметрию.
Временная синхронизация как специализированный слой мониторинга
Для отдельных технологических сетей требуется контролировать не только передачу данных, но и параметры синхронизации времени. Показатели мониторинга PTP/NTP: jitter синхронизации, MTIE, смещение часов, задержка PPS/NTP и стабильность времени поддерживаются в ЦИСУСС «NB XT EM».

Важно отделять эти показатели от сетевого jitter, характеризующего вариацию задержки передачи пакетов. В функционале ЦИСУСС «NB XT EM» перечисленные показатели относятся именно к контролю систем синхронизации. Это хороший пример того, когда набор метрик определяется задачами конкретной инфраструктуры. Для обычной офисной сети такой слой может быть вторичным, а для технологических систем точное время становится самостоятельным объектом контроля.
От отдельных метрик к эксплуатационным показателям
Низкоуровневые показатели необходимы инженеру для диагностики, но для управления инфраструктурой требуется следующий уровень — агрегированные эксплуатационные показатели.

В ЦИСУСС «NB XT EM» входят расчет доступности, MTTD, MTTR, MTBF и SLA на основе событий и метрик. При этом состояние устройств и сервисов отслеживается совместно с уровнями критичности.

Это уже другой взгляд на данные. Инженера во время аварии интересуют конкретный порт, ошибка или состояние процесса. Руководителю эксплуатации важнее понимать доступность сервиса, частоту и продолжительность нарушений, а также динамику восстановления. Именно наличие общего слоя данных позволяет использовать первичные метрики не только для оперативного контроля, но и для последующей отчетности.

В архитектуре ЦИСУСС «NB XT EM» для этого предусмотрена подсистема анализа технического состояния сети и формирования показателей. Она используется для подготовки отчетов о произошедших сбоях, включая фиксацию их частоты и причин, а также для автоматизированного формирования отчетов по заданным параметрам и расписанию.
Важно связать все виды оборудования в одну систему
Большой каталог показателей сам по себе не делает мониторинг эффективным. Если инженер вынужден открывать отдельный интерфейс для каждого устройства и вручную сопоставлять десятки графиков, объем телеметрии начинает усложнять эксплуатацию вместо того, чтобы помогать ей. Одна из ключевых задач зонтичного мониторинга — привести разнородные данные к общей эксплуатационной модели.

ЦИСУСС «NB XT EM» предназначена для мониторинга сетей предприятий с большим парком разнородного оборудования и интеграции смежных систем. В функциональных возможностях предусмотрены унифицированные критерии оценки состояния, хранение и обработка больших объемов информации, а объекты мониторинга могут формироваться в иерархическую структуру по подразделениям, филиалам и группам.

Для сбора данных ЦИСУСС «NB XT EM» может взаимодействовать с оборудованием напрямую, через системы управления производителей и через контроллеры для устройств без сетевых интерфейсов. При прямом подключении поддерживается работа с распространенными протоколами, включая SNMP, SYSLOG, SSH и Telnet, а также с агентами сопряжения.

Это формирует одно из практических преимуществ платформенного подхода: объектом мониторинга становится не отдельный тип оборудования, а инфраструктура — как совокупность взаимосвязанных элементов.
Уровень выше — аналитика событий
Метрика становится особенно полезной, когда система умеет связать ее изменение с событием.

В платформе ЦИСУСС «NB XT EM» пороговые значения могут использоваться для формирования аварийных сообщений. Подсистема мониторинга нештатных ситуаций выполняет регистрацию, локализацию и классификацию событий и доводит информацию о них до обслуживающего персонала. События могут быть связаны с иерархией вероятных причин, а на ее основе реализуются корреляция и определение первопричины. Также в составе аналитики NMS доступны baseline и выявление аномалий.

Это важный переход от традиционного мониторинга к эксплуатационной модели, в которой данные помогают выделять значимые изменения и работать с причинами событий.
ЦИСУСС «NB XT EM»: мониторинг как единый эксплуатационный контур
Именно в этом контексте раскрываются преимущества ЦИСУСС «NB XT EM» — зонтичная система мониторинга и управления сетями связи и ИТ-инфраструктурой промышленного класса. Единый веб-интерфейс, поддержка сетевых протоколов, возможность подключения несетевого оборудования и поэтапного внедрения платформы. Для задач мониторинга это означает возможность работать на одной платформе с несколькими слоями данных — от состояния сетевых интерфейсов и параметров оборудования до аварийных сообщений и эксплуатационной отчетности.

Главная задача при этом состоит не в максимизации числа собираемых показателей, а в выборе комплекса метрик, которые действительно характеризуют работу конкретной инфраструктуры, установление связи между ними и в предоставление специалистам данных в том контексте, в котором принимаются решения.

В этом отношении ЦИСУСС «NB XT EM» не ограничивает проект только фиксированным пакетом показателей. Набор контролируемых параметров может адаптироваться под задачи и особенности инфраструктуры заказчика. Если для проекта необходимы дополнительные метрики, которых нет в текущей конфигурации, специалисты компании «Теком» могут доработать соответствующий функционал. Это позволяет выстраивать мониторинг с учетом конкретного оборудования, технологических процессов и требований эксплуатации, а не подстраивать инфраструктуру под заранее заданные метрики.

Для сложной распределенной инфраструктуры это и становится основой зрелого мониторинга: от отдельных счетчиков — к единой картине состояния сети.
Эльнара
Контент-маркетолог
Хотите получать интересный контент
на почту?
Подписаться
Заполните форму и будьте в курсе всех новостей

Больше статей блога