Ответ
Я занимался построением системы мониторинга на базе Zabbix для гибридной инфраструктуры (on-premise серверы, облачные VM, сетевые устройства).
Основные направления работы:
- Архитектура и развертывание: Установка Zabbix Server 6+ с высокой доступностью (активный-пассивный режим), настройка Zabbix Proxy для удаленных сегментов сети, развертывание агентов (Zabbix Agent 2) через Ansible.
- Конфигурация мониторинга:
- Создание кастомных шаблонов для мониторинга специфичных приложений (например, Kafka, PostgreSQL).
- Написание сложных триггеров с функциями
trendavg(),timeleft()для прогнозирования проблем (закончится место на диске через N дней). - Использование Low-level discovery для автоматического мониторинга динамических объектов (диски, сетевые интерфейсы, Docker-контейнеры).
- Автоматизация: Массовое добавление хостов, обновление шаблонов через Zabbix API с помощью Python-скриптов.
Пример триггера для обнаружения аномального роста логов:
{My Host:log[/var/log/app/error.log].lograte(5m)} > 100 and {My Host:log[/var/log/app/error.log].lograte(1h)} > 50
Интеграции: Настраивал оповещения в Telegram и Slack с использованием AlertScripts и webhooks, форматируя сообщения для удобства (включая ссылки на графики, теги проблем). Также интегрировал Zabbix с Grafana через плагин для визуализации данных в дашбордах.