Ответ
На моем предыдущем месте работы основной проблемой была «снежинка»-инфраструктура — каждый стенд настраивался вручную, что приводило к дрейфу конфигураций и долгому восстановлению после сбоев. Я инициировал и внедрил Terraform для управления облачными ресурсами (AWS) и Ansible для конфигурации виртуальных машин. Это позволило воспроизводить окружения за минуты, а не дни.
Другой болью было отсутствие CI/CD. Разработчики делали ручные сборки и выкатывали артефакты по SSH. Я построил пайплайн на GitLab CI/CD, который автоматически запускал линтеры, unit-тесты, собирал Docker-образы и деплоил их в Kubernetes-кластер по git-тегам. Это сократило время на релиз с нескольких часов до 20 минут и минимизировало человеческий фактор.
Также не было централизованного мониторинга и логирования. Я развернул стек Prometheus + Grafana для метрик и Loki + Grafana для логов, что дало командам возможность самостоятельно диагностировать проблемы, а не ждать админов.