Forge
markdowne8ad0934
1# Playbook: Инциденты и тикеты (v1)
2
3> **Scope:** общие практики реагирования на инциденты и работы с тикетами. Без привязки к конкретным системам учёта.
4
5---
6
7## Ключевые понятия
8
9- **Жизненный цикл инцидента:** обнаружение → триаж → реагирование → коммуникация → смягчение → решение → постмортем → действия по результатам.
10- **Severity (критичность):** уровни для приоритизации и SLA (например SEV-1 — полный простой, ответ за 5 мин; SEV-2 — серьёзная деградация, 15 мин; SEV-3 — частичная деградация, 1 ч; SEV-4 — минимальное влияние, следующий рабочий день).
11- **Постмортем:** структурированный разбор после инцидента: что произошло, влияние, хронология, причина, способ устранения, действия по недопущению повторения.
12
13---
14
15## Практики
16
17- **Обнаружение:** комбинация алертов мониторинга, синтетических проверок, обращений пользователей и аномалий.
18- **Роли при реагировании:** инцидент-командир, связь с пользователями, операционное руководство, фиксация событий, привлечённые эксперты.
19- **Постмортем — содержание:** краткое описание и влияние на бизнес/пользователей; хронология; корневая причина; способствующие факторы; действия с владельцами и сроками. Проводить пока детали свежие; привязывать действия к тикетам (Jira, Linear и т.д.) для контроля.
20
21---
22
23## Анти-паттерны
24
25- Игнорировать постмортемы или делать их «для галочки» без реальных действий.
26- Не определять severity и SLA — хаотичная приоритизация.
27- Не фиксировать хронологию во время инцидента — потом восстанавливать по памяти.
28
29---
30
31## Диагностика
32
33Сводка: [`troubleshooting/playbook-ops-reliability-troubleshooting-v1.md`](troubleshooting/playbook-ops-reliability-troubleshooting-v1.md) § Инциденты.
34
35---
36
37*Источники: SRE-практики, гайды по постмортемам (PagerDuty, Atlassian). Конкретные тикет-системы и каналы — в локальном контексте.*
38
39
View only · write via MCP/CIDE