История изменений¶
23 июля 2026 (обновление 2)¶
Новые главы¶
- OpenTelemetry: один стандарт вместо десятка SDK
- Wide Events и Observability 2.0
- eBPF: программы внутри ядра Linux
- SLO для AI/ML-систем
- Kubernetes-native reliability
- Disaster Recovery: как не остаться без данных
- Testing in Production
- Supply Chain Security
Переработано¶
- Телеметрия — добавлены ссылки на OpenTelemetry и Wide Events
- chaosctl — добавлен дисклеймер о deprecation (уже был)
- sloth — добавлен дисклеймер о проверке актуальности (уже был)
Другое¶
- Убраны штампы LLM: «в современном мире», «по сути», «бесценный», «давайте посмотрим», «как известно» (10 правок)
- Унифицирована терминология: «латентность» с расшифровкой в SLI.md, обновлён глоссарий
23 июля 2026¶
Новые главы¶
Другое¶
- Уточнена информация о версиях OpenSLO (v1 — стабильная, v1alpha — deprecated, v2 — экспериментальная)
- Добавлены labels в примеры YAML во всех главах, использующих OpenSLO
- История изменений вынесена на отдельную страницу
29 мая 2026¶
Новые главы¶
- SLA vs SLO vs SLI: разница и связь
- Стратегия автоматизации: что автоматизировать в первую очередь?
- Runbooks и документация
- On-call: дежурство без выгорания
- Database Reliability Engineering (DBRE)
- Service Mesh: невидимая инфраструктура надёжности
- Feature Flags: рубильники безопасности для продакшена
- Canary и Progressive Delivery: безопасная раскатка изменений
- Chaos Engineering: разрушаем, чтобы построить
- SRE для legacy-систем
Переработано¶
- Модель здоровья продукта — полная переработка, добавлены 4 слоя, 3 уровня здоровья, протокол принятия решений
- Шаблоны и чек-листы — новый раздел с шаблонами runbook, postmortem, PRR, on-call
- Постепенное снижение риска — удалены технические подробности (canary, blue-green, feature flags), оставлена только философия
Другое¶
- Добавлены перекрёстные ссылки между главами
- Исправлены опечатки и стилистические ошибки
- Актуализирована информация в слабоактуальных главах
27 февраля 2026¶
Первая публикация книги в открытом доступе.