运维与故障排查
运维与故障排查
健康检查
/health/simple:进程级存活响应。/health:同时检查数据库与 Redis,任一异常即报告不健康。
系统只声明上述健康检查端点;不要把未注册的性能或指标路径加入监控。可用结构化日志、健康检查、管理后台统计和 Redis/数据库自身监控建立告警。
常见问题
| 现象 | 检查顺序 |
|---|---|
| 无法启动 | 数据库驱动/地址 → Redis → goose 迁移错误 → Secret 长度 |
| 后台无法登录 | 账号状态 → bcrypt 密码 → JWT_SECRET → OIDC discovery/回调 |
| API 鉴权失败 | 四个请求头 → Unix 秒 → nonce → 规范 JSON → 代理路径 |
| 通道阻塞 | 系统模板 → 绑定 → 账号/供应商模板 → 参数映射 → 签名共同别名 |
| 任务长期 pending | Redis Stream、consumer group、Worker 日志和调度时间 |
| sent 无回执 | 回调 URL、账号 ID、供应商签名校验和 callback_logs |
| Webhook 失败 | 应用配置、订阅事件、目标 TLS、超时与重试日志 |
备份与恢复
备份数据库、部署配置和 Secret 元数据;Redis Stream 需要按业务恢复目标决定是否持久化。恢复后先阻断外部发送,核对迁移版本、应用密钥解密、通道准备状态,再逐步放量。
升级
发布前备份数据库并阅读新增迁移;升级后检查 /health、后台登录、准备台、只使用受控测试通道完成验证。迁移由服务启动自动完成,不要依赖独立迁移命令。
相关页面:发送记录 · Docker 与 Compose