IT

Ingreso y escalada de incidentes

Los incidentes tecnológicos ingresan por diferentes canales y pierden gravedad, propiedad y disciplina de escalada durante la respuesta.

Problema empresarial

Los incidentes tecnológicos ingresan por diferentes canales y pierden gravedad, propiedad y disciplina de escalada durante la respuesta.

que ven los equipos

  • El trabajo espera entre la recepción del incidente y la validación del servicio afectado.
  • Los propietarios reconstruyen el estado a partir del webhook genérico y Jira.

Por que sucede

  • Ningún estado compartido abarca el webhook genérico, Jira y Slack.
  • Las reglas de decisión y excepción se aplican de manera inconsistente.

¿Por qué se vuelve caro?

  • La capacidad se consume mediante la coordinación y el retrabajo.
  • Las excepciones tardías debilitan la visibilidad y la calidad del servicio.

Resultados comerciales

  • Ciclo de creación de tareas posterior al incidente más corto
  • Menos excepciones de transferencia y falta de información
  • Borrar la propiedad al recibir el incidente para crear una tarea posterior al incidente
  • Decisiones inspeccionables y recuperación.

KPI medibles

  • tiempo de respuesta: Tiempo transcurrido desde la recepción del incidente hasta la creación de la tarea posterior al incidente.
  • Tasa de intervención manual: Proporción de artículos que necesitan una persona fuera de las condiciones de revisión definidas.
  • Edad de excepción: Tiempo en el que las excepciones no resueltas permanecen sin que se haya completado una acción.
  • Tasa de finalización exitosa: Proporción de elementos válidos del flujo de trabajo que se completan sin fallas en el terminal.

Cómo funciona el flujo de trabajo

  1. Recibir incidente — Aceptar e identificar el desencadenante de entrada y escalada del incidente. Webhook genérico
  2. Validar servicio afectado — Ejecute la validación del servicio afectado con datos de muestra validados y un resultado auditable. Webhook genérico
  3. Aplicar reglas de gravedad — Ejecute, aplique reglas de gravedad con datos de muestra validados y un resultado auditable. Jira
  4. Asignar propietario del incidente — Ejecute la asignación del propietario del incidente con datos de muestra validados y un resultado auditable. flojo
  5. Notificar a los respondedores — Ejecute la notificación a los respondedores con datos de muestra validados y un resultado auditable. Webhook genérico
  6. Escalar por tiempo — Ejecute escalado por tiempo con datos de muestra validados y un resultado auditable. Jira
  7. Resolución de registro — Ejecute la resolución de registros con datos de muestra validados y un resultado auditable. flojo
  8. Crear tarea posterior al incidente — Ejecute la tarea de creación posterior al incidente con datos de muestra validados y un resultado auditable. Webhook genérico
  9. Auditoría y actualización de KPI — Conserve el resultado de la ejecución, los hechos de auditoría y los eventos de medición del flujo de trabajo. Tienda de ejecución SEIDO

Integraciones y propiedad

  • Webhook genérico: Proporcionar entrada de flujo de trabajo
  • Jira: Contexto de búsqueda y actualización
  • flojo: Reciba un resultado controlado

Responsabilidad humana: propietario del servicio de TI

Fracaso y recuperación

El webhook genérico no está disponible temporalmente.

Reintentar con retroceso exponencial limitado; preservar la ejecución y moverla a la cola de fallas inspeccionable después del límite.

Los datos requeridos para validar el servicio afectado están mal formados o faltan.

Detenga las acciones posteriores y muestre los campos faltantes, la evidencia fuente y la acción correctiva al revisor designado.

El evento desencadenante o proveedor se entrega más de una vez.

Devuelva la ejecución existente identificada por la clave de idempotencia y no repita acciones comerciales posteriores.

La decisión humana expira antes de completarse.

Escale al sustituto configurado, conserve la solicitud original y registre tanto el vencimiento como la reasignación.

Cuando no construir esto

  • El volumen mensual es demasiado bajo para justificar la integración del webhook genérico, Jira y Slack.
  • Una plataforma configurada existente ya maneja la admisión y escalada de incidentes con propiedad e informes adecuados.
  • Los datos de origen confiables o el acceso API compatible no están disponibles.
  • Ningún propietario de empresa tiene autoridad para definir las reglas de decisión y excepción.

Flujos de trabajo relacionados