Мониторинг парка окупается не экономией на зарплате, а сокращением простоя: сотрудник, который полдня не работает из-за забитого диска, стоит компании больше, чем месяц подписки. Считать нужно на своих числах — соотношение сильно зависит от того, сколько людей зависит от каждой машины.
Посчитайте на своих числах
Возьмите последние три месяца и разметьте инциденты, из-за которых кто-то не работал. По каждому запишите: сколько времени человек простаивал, сколько времени потратил администратор и можно ли было это предупредить заранее.
- Забитый диск, переполненный профиль, кончившееся место под базой — предупреждаются почти всегда.
- Машина не вернулась после обновления — обнаруживается сразу, если следить за выходом на связь.
- Отказ диска — часто предупреждается по симптомам, если их кто-то видит.
- Пролитый кофе и сгоревший блок питания — не предупреждаются, и в расчёт их брать не надо.
Сложите простой по предотвратимой части и сравните со стоимостью подписки. У большинства компаний до полусотни машин ответ получается очевидным уже на этом этапе — и без всяких средних цифр по рынку.
Не измеряйте всё сразу
Главная ошибка старта — включить все доступные метрики и получить поток оповещений, который через неделю начинают игнорировать. Начните с трёх правил, которые почти не дают ложных срабатываний:
- Свободное место на системном диске меньше 10–15%.
- Загрузка процессора выше 90% дольше пятнадцати минут.
- Машина не выходила на связь дольше суток.
Пороги по памяти добавляйте позже — они сильнее зависят от того, что на машине работает. Как подбирать значения под свой парк, разобрано в статье о порогах мониторинга.
Простой процесс вокруг мониторинга
Оповещение без адресата бесполезно. Минимальная схема для небольшой компании: у каждой машины есть владелец, у каждого оповещения — тот, кто его разбирает, и срок. Всё это может жить в обычном списке задач, отдельная система не нужна.
Раз в месяц просматривайте, какие правила срабатывали и что из этого потребовало действий. Правило, которое сработало десять раз и ни разу не привело к работе, нужно менять или выключать — оно приучает игнорировать остальные.
По чему видно, что работает
- Доля инцидентов, о которых вы узнали от системы, а не от сотрудника. Это главный показатель, и он растёт первым.
- Время от появления проблемы до её обнаружения.
- Количество машин, которых нет в списке. В норме оно должно быть нулём.
- Число повторяющихся ручных действий, которые вы перевели в массовые задачи.
Что вообще входит в мониторинг парка и чем он отличается от удалённого доступа — в статье о том, что такое RMM, а состав раздела в кабинете — на странице мониторинга и управления парком.
С какой метрики начать, если внедрять постепенно?
Со свободного места на диске: это самая предсказуемая проблема из всех — она развивается медленно, предупреждает о себе заранее и останавливает работу целиком, когда доходит до конца. Одна эта метрика окупает настройку быстрее остальных.
Сколько времени занимает настройка мониторинга на десяток машин?
Установка агентов — быстро, а вот на пороги и правила уходит основное время, и торопиться с ними не стоит. Пока вы не знаете, какие значения на ваших машинах нормальны, любой порог будет либо молчать, либо звенеть постоянно.