IT

インシデントの受付とエスカレーション

テクノロジー インシデントはさまざまなチャネルを通じて侵入し、対応中に重大度、所有権、エスカレーションの規律が失われます。

ビジネス上の問題

テクノロジー インシデントはさまざまなチャネルを通じて侵入し、対応中に重大度、所有権、エスカレーションの規律が失われます。

チームが見ているもの

  • インシデントを受信してから影響を受けるサービスを検証するまでの間、作業が待機します。
  • 所有者は、汎用 Webhook と Jira からステータスを再構築します。

なぜそれが起こるのか

  • 汎用 Webhook、Jira、Slack にまたがる共有状態はありません。
  • 決定ルールと例外ルールが一貫して適用されません。

なぜ高価になるのか

  • 調整と再作業によって容量が消費されます。
  • 例外が遅れると、可視性が低下し、サービスの品質が低下します。

ビジネスの成果

  • インシデント後のタスク作成サイクルの短縮
  • ハンドオフと欠落情報の例外が減少
  • インシデント受信から所有権をクリアしてインシデント後のタスクを作成する
  • 検査可能な決定と回復

測定可能なKPI

  • 所要時間: インシデントを受信してからインシデント後のタスクを作成するまでの経過時間。
  • 手動介入率: 定義されたレビュー条件外の人員を必要とするアイテムのシェア。
  • 例外年齢: アクションが完了しないまま、未解決の例外が残ります。
  • 成功率: 有効なワークフロー項目の共有が端末障害なしで完了します。

ワークフローの仕組み

  1. インシデントを受信する — インシデントの取り込みとエスカレーションのトリガーを受け入れて特定します。 汎用 Webhook
  2. 影響を受けるサービスを検証する — 検証済みのサンプル データと監査可能な結果を使用して、影響を受けるサービスを検証します。 汎用 Webhook
  3. 重大度ルールを適用する — 検証済みのサンプル データと監査可能な結果を使用して重大度ルールの適用を実行します。 ジラ
  4. インシデント所有者の割り当て — 検証済みのサンプル データと監査可能な結果を使用して、インシデント所有者の割り当てを実行します。 たるみ
  5. 応答者に通知する — 検証済みのサンプル データと監査可能な結果を使用して通知レスポンダーを実行します。 汎用 Webhook
  6. 時間ごとにエスカレーション — 検証されたサンプルデータと監査可能な結果を使用して、時間ごとにエスカレーションを実行します。 ジラ
  7. レコード解像度 — 検証されたサンプルデータと監査可能な結果を使用してレコード解決を実行します。 たるみ
  8. インシデント後のタスクを作成する — 検証済みのサンプル データと監査可能な結果を使用して、インシデント後のタスクの作成を実行します。 汎用 Webhook
  9. 監査とKPIの更新 — 実行結果、監査事実、ワークフロー測定イベントを保持します。 SEIDO実行ストア

統合と所有権

  • 汎用 Webhook: ワークフロー入力を提供する
  • ジラ: コンテキストの検索と更新
  • たるみ: 制御された結果を受け取る

人間の責任: ITサービスオーナー

失敗と回復

汎用 Webhook は一時的に利用できなくなります。

上限付きの指数バックオフを使用して再試行します。実行を保存し、制限を超えた後に検査可能な障害キューに移動します。

影響を受けるサービスを検証するために必要なデータが不正であるか欠落している。

下流のアクションを停止し、指定されたレビュー担当者に不足しているフィールド、ソース証拠、および修正アクションを示します。

トリガーまたはプロバイダー イベントが複数回配信されます。

冪等性キーによって識別された既存の実行を返し、下流のビジネス アクションを繰り返しません。

人間の決定は完了する前に期限切れになります。

設定された代理人にエスカレーションし、元のリクエストを保持し、有効期限と再割り当ての両方を記録します。

これを構築しない場合

  • 月間ボリュームが少なすぎるため、汎用 Webhook、Jira、Slack を統合することは正当化できません。
  • 既存の構成済みプラットフォームは、適切な所有権とレポートを使用して、インシデントの取り込みとエスカレーションをすでに処理しています。
  • 信頼できるソース データまたはサポートされている API アクセスが利用できません。
  • ビジネスオーナーには、決定ルールと例外ルールを定義する権限はありません。

関連するワークフロー