// проблема
Что ломалось
Деплой занимал 40–50 минут, откат — «по звонку». Часть сервисов без readiness, алерты шумели и их игнорировали. При объёме channel sync и guest ops любой «тихий» релиз в конце недели стоил нервов.
// решения
Что сделали
- Единый пайплайн: build → test → canary → promote, без ручных SSH в кластер.
- Readiness/liveness + PodDisruptionBudgets на критичных сервисах (calendar, channel sync, messaging).
- Алерты по SLO, а не по каждой 5xx вспышке — pager снова читают.


