Цель первого этапа инцидента — восстановить сервис безопасным способом, а не сразу найти идеальную первопричину. Любое действие должно оставлять возможность отката.

Уровни

Первые десять минут

1

Зафиксируйте симптом

Время, affected endpoint, пользовательский эффект и последнее изменение.
2

Назначьте owner

Один человек координирует, остальные проверяют конкретные слои.
3

Определите слой

DNS/TLS → edge → application → dependency → guest → PVE.
4

Остановите ухудшение

Откат релиза, maintenance или остановка проблемной job.
5

Соберите минимальные данные

Health, последние logs, metrics и активные alarms.

Диагностическое дерево

Launcher-server недоступен

  1. С сайта проверьте TCP 10.10.10.40:50051.
  2. На VM 104 проверьте systemd status и journal.
  3. Проверьте local live/ready endpoint.
  4. Проверьте S3 credentials file и доступ к control-plane prefix.
  5. Сверьте admin token на сайте и launcher-server по hash, не выводя token.
  6. Проверьте firewall route между 10.10.20.7 и 10.10.10.40.
  7. Не публикуйте admin gRPC в internet как временный обход.

Minecraft недоступен

  1. Проверьте public DNS и 82.202.161.121.
  2. Проверьте VM 100 и QEMU Guest Agent.
  3. Проверьте listener игрового порта внутри VM.
  4. Для Docker недостаточно состояния Up: дождитесь готовности сервера в log и проверьте 0.0.0.0:25565 LISTEN.
  5. Проверьте routed /32 через vmbr0 и guest route/gateway.
  6. Проверьте Authlib/site только после подтверждения доступности игрового порта.

Proxmox или VPN недоступны

  • Public UDP 51820 должен DNAT на 10.10.10.2:51820.
  • VPN VM должна иметь 10.10.10.2 и WG 10.10.20.1.
  • PVE должен иметь маршрут 10.10.20.0/24 via 10.10.10.2.
  • Public TCP 22/8006 PVE намеренно заблокирован — это не основание открывать management в internet.
  • Если VM 101 не работает, используйте out-of-band console, а не ослабление public firewall.

Диск или storage

  1. Остановите тяжёлые publish/log jobs при критическом заполнении.
  2. Проверьте zpool status, ZFS usage и крупнейшие datasets.
  3. Не удаляйте VM disks, release objects или backups по предположению.
  4. Очистка logs/cache выполняется только по известной retention policy.
  5. После восстановления добавьте threshold и capacity action в Beszel/Kuma.

После восстановления

Отчёт должен содержать:
Не записывайте в отчёт passwords, tokens, cookies и приватные ключи. Если secret мог попасть в лог или чат инцидента, он ротируется.