运维与故障排查

运维与故障排查

健康检查

  • /health/simple:进程级存活响应。
  • /health:同时检查数据库与 Redis,任一异常即报告不健康。

系统只声明上述健康检查端点;不要把未注册的性能或指标路径加入监控。可用结构化日志、健康检查、管理后台统计和 Redis/数据库自身监控建立告警。

常见问题

现象 检查顺序
无法启动 数据库驱动/地址 → Redis → goose 迁移错误 → Secret 长度
后台无法登录 账号状态 → bcrypt 密码 → JWT_SECRET → OIDC discovery/回调
API 鉴权失败 四个请求头 → Unix 秒 → nonce → 规范 JSON → 代理路径
通道阻塞 系统模板 → 绑定 → 账号/供应商模板 → 参数映射 → 签名共同别名
任务长期 pending Redis Stream、consumer group、Worker 日志和调度时间
sent 无回执 回调 URL、账号 ID、供应商签名校验和 callback_logs
Webhook 失败 应用配置、订阅事件、目标 TLS、超时与重试日志

备份与恢复

备份数据库、部署配置和 Secret 元数据;Redis Stream 需要按业务恢复目标决定是否持久化。恢复后先阻断外部发送,核对迁移版本、应用密钥解密、通道准备状态,再逐步放量。

升级

发布前备份数据库并阅读新增迁移;升级后检查 /health、后台登录、准备台、只使用受控测试通道完成验证。迁移由服务启动自动完成,不要依赖独立迁移命令。

相关页面:发送记录 · Docker 与 Compose