Привели CI/CD и K8s в состояние «можно трогать в пятницу»
PropTech · vacation rental SaaSGuestyИнфра2024

Привели CI/CD и K8s в состояние «можно трогать в пятницу»

деплой 45м → 8м

Тот же Guesty: платформа на сотни тысяч листингов и ежедневные релизы. Пайплайн был хрупким, проды — ручными. Наладили GitOps, healthchecks и откат одной кнопкой — чтобы деплой в пятницу не был лотереей.

45м → 8мДеплой
ручной → 1 кликОткат
3 неделиСрок

// проблема

Что ломалось

Деплой занимал 40–50 минут, откат — «по звонку». Часть сервисов без readiness, алерты шумели и их игнорировали. При объёме channel sync и guest ops любой «тихий» релиз в конце недели стоил нервов.

// решения

Что сделали

  1. Единый пайплайн: build → test → canary → promote, без ручных SSH в кластер.
  2. Readiness/liveness + PodDisruptionBudgets на критичных сервисах (calendar, channel sync, messaging).
  3. Алерты по SLO, а не по каждой 5xx вспышке — pager снова читают.

// результат

Чем закончилось

Среднее время деплоя ~8 минут. Откат через предыдущий ревиз манифеста. Ложных алертов стало заметно меньше — команда снова смотрит в pager, а не глушит его.

KubernetesGitLab CIHelmTerraformPrometheus