IT

Prise en charge et escalade des incidents

Les incidents technologiques entrent par différents canaux et perdent en gravité, en appropriation et en discipline d'escalade au cours de la réponse.

Problème commercial

Les incidents technologiques entrent par différents canaux et perdent en gravité, en appropriation et en discipline d'escalade au cours de la réponse.

Ce que voient les équipes

  • Le travail attend entre la réception de l'incident et la validation du service concerné.
  • Les propriétaires reconstruisent le statut à partir du webhook générique et de Jira.

Pourquoi ça arrive

  • Aucun état partagé ne s’étend sur le webhook générique, Jira, Slack.
  • Les règles de décision et d’exception sont appliquées de manière incohérente.

Pourquoi ça devient cher

  • La capacité est consommée par la coordination et le remaniement.
  • Les exceptions tardives affaiblissent la visibilité et la qualité du service.

Résultats commerciaux

  • Cycle de création de tâches post-incident plus court
  • Moins d’exceptions de transfert et d’informations manquantes
  • Effacer la propriété de la réception d'un incident pour créer une tâche post-incident
  • Décisions inspectables et récupération

KPI mesurables

  • Délai d'exécution: Temps écoulé entre la réception de l'incident et la création d'une tâche post-incident.
  • Tarif d'intervention manuelle: Part des éléments nécessitant une personne en dehors des conditions d’examen définies.
  • Âge exceptionnel: Les exceptions non résolues restent sans action terminée.
  • Taux de réussite: Part des éléments de flux de travail valides se terminant sans défaillance du terminal.

Comment fonctionne le flux de travail

  1. Recevoir l'incident — Acceptez et identifiez le déclencheur d’admission et d’escalade de l’incident. Webhook générique
  2. Valider le service concerné — Exécutez et validez le service concerné avec des exemples de données validés et un résultat vérifiable. Webhook générique
  3. Appliquer des règles de gravité — Exécutez et appliquez des règles de gravité avec des exemples de données validés et un résultat vérifiable. Jira
  4. Attribuer un propriétaire d'incident — Exécutez l'affectation du propriétaire de l'incident avec des exemples de données validés et un résultat vérifiable. Mou
  5. Avertir les intervenants — Exécutez et informez les intervenants avec des échantillons de données validés et un résultat vérifiable. Webhook générique
  6. Escalader par le temps — Exécutez une escalade dans le temps avec des exemples de données validés et un résultat vérifiable. Jira
  7. Résolution d'enregistrement — Exécutez la résolution d’enregistrements avec des échantillons de données validés et un résultat vérifiable. Mou
  8. Créer une tâche post-incident — Exécutez une tâche de création post-incident avec des exemples de données validés et un résultat vérifiable. Webhook générique
  9. Audit et mise à jour des KPI — Conservez le résultat de l’exécution, les faits d’audit et les événements de mesure du flux de travail. Magasin d'exécution SEIDO

Intégrations et propriété

  • Webhook générique: Fournir une entrée sur le flux de travail
  • Jira: Contexte de recherche et de mise à jour
  • Mou: Recevez un résultat contrôlé

Responsabilité humaine: Propriétaire de service informatique

Échec et récupération

Le webhook générique est temporairement indisponible.

Réessayez avec un recul exponentiel plafonné ; conserver l'exécution et la déplacer vers la file d'attente des échecs inspectables après la limite.

Les données requises pour valider le service concerné sont mal formées ou manquantes.

Arrêtez les actions en aval et affichez les champs manquants, les preuves sources et les actions de correction au réviseur nommé.

L'événement déclencheur ou fournisseur est transmis plusieurs fois.

Renvoyez l’exécution existante identifiée par la clé d’idempotence et ne répétez pas les actions commerciales en aval.

La décision humaine expire avant son achèvement.

Transférez la demande au remplaçant configuré, conservez la demande d'origine et enregistrez l'expiration et la réaffectation.

Quand ne pas construire ça

  • Le volume mensuel est trop faible pour justifier l'intégration de webhook générique, Jira, Slack.
  • Une plate-forme configurée existante gère déjà la réception et la remontée des incidents avec une appropriation et un reporting adéquats.
  • Les données sources fiables ou l'accès API pris en charge ne sont pas disponibles.
  • Aucun propriétaire d'entreprise n'a le pouvoir de définir les règles de décision et d'exception.

Flux de travail associés