IT

事件接收和升级

技术事件通过不同的渠道进入,并在响应过程中失去严重性、所有权和升级纪律。

业务问题

技术事件通过不同的渠道进入,并在响应过程中失去严重性、所有权和升级纪律。

团队看到什么

  • 工作在接收事件和验证受影响的服务之间等待。
  • 所有者从 Generic webhook 和 Jira 重建状态。

为什么会发生这种情况

  • 没有共享状态跨越通用 webhook、Jira、Slack。
  • 决策和例外规则的应用不一致。

为什么它变得昂贵

  • 能力因协调和返工而消耗。
  • 迟到的例外会削弱可见性和服务质量。

业务成果

  • 更短的创建事件后任务周期
  • 更少的交接和信息缺失异常
  • 清除接收事件的所有权以创建事件后任务
  • 可检查的决策和恢复

可衡量的关键绩效指标

  • 周转时间: 从接收事件到创建事件后任务所用的时间。
  • 人工干预率: 在规定的审查条件之外需要人员的项目份额。
  • 异常年龄: 未完成的操作仍存在时间未解决的异常。
  • 成功完成率: 共享在没有终端故障的情况下完成的有效工作流程项目。

工作流程如何运作

  1. 接收事件 — 接受并识别事件接收和升级触发因素。 通用网络钩子
  2. 验证受影响的服务 — 使用经过验证的示例数据和可审核的结果来执行验证受影响的服务。 通用网络钩子
  3. 应用严重性规则 — 使用经过验证的示例数据和可审核的结果执行应用严重性规则。 吉拉
  4. 指定事件所有者 — 使用经过验证的样本数据和可审核的结果执行分配事件所有者。 松弛
  5. 通知响应者 — 使用经过验证的样本数据和可审核的结果执行通知响应者。 通用网络钩子
  6. 按时间逐步升级 — 使用经过验证的样本数据和可审核的结果按时间执行升级。 吉拉
  7. 记录分辨率 — 使用经过验证的样本数据和可审核的结果执行记录解析。 松弛
  8. 创建事件后任务 — 使用经过验证的样本数据和可审核的结果执行创建事件后任务。 通用网络钩子
  9. 审计和 KPI 更新 — 保留执行结果、审计事实和工作流程测量事件。 SEIDO执行商店

整合和所有权

  • 通用网络钩子: 提供工作流程输入
  • 吉拉: 查找和更新上下文
  • 松弛: 收到受控结果

人类责任: IT服务所有者

失败与恢复

通用 Webhook 暂时不可用。

使用有上限的指数退避重试;保留运行并将其移至限制后的可检查故障队列。

验证受影响服务所需的数据格式错误或丢失。

停止下游操作并向指定审阅者显示缺失字段、源证据和更正操作。

触发器或提供者事件被传递多次。

返回由幂等键标识的现有执行,并且不重复下游业务操作。

人类的决定在完成之前就失效了。

升级到配置的替代者,保留原始请求并记录到期和重新分配。

什么时候不构建这个

  • 每月的交易量太低,无法证明集成 Generic webhook、Jira、Slack 的合理性。
  • 现有的配置平台已经可以通过足够的所有权和报告来处理事件的接收和升级。
  • 可靠的源数据或支持的 API 访问不可用。
  • 任何企业主都无权定义决策和例外规则。

相关工作流程