← 返回技巧手册协作工作流 / UPDATED 2026.08
生产故障与服务器发布
故障
先冻结扩大风险的动作,记录时间线和用户影响;只读收集指标、日志、变更和依赖;优先恢复服务,再进行根因修复;每一步设停止与回滚条件。
发布
精确目标 → 备份/恢复点 → 预发布验证 → 小步部署 → 健康检查 → 核心用户旅程 → 指标观察 → 扩大发布 → 发布记录。
服务器密码、Token和私钥不得写入提示词或文件。发现历史泄漏要轮换,不是只删除文本。
故障响应顺序
- 声明影响范围、开始时间和当前负责人。
- 冻结可能扩大影响的发布和数据操作。
- 保存现场:版本、配置哈希、指标、日志、追踪和最近变更。
- 优先选择可逆恢复:回滚、切流、降级、限流或关闭非核心功能。
- 每个动作写预期、观察窗口、停止条件和恢复方法。
- 服务恢复后再做根因修复;不要在事故中顺便大重构。
发布前清单
- 目标主机/集群、服务、版本和配置精确无歧义。
- 数据库迁移已在近似数据量环境演练。
- 备份或恢复点存在且恢复步骤可执行。
- 密钥通过安全渠道注入,没有进入命令历史和日志。
- 健康、日志、指标、告警和核心用户旅程都有验证入口。
- 回滚版本、命令、触发条件和负责人明确。
发布后观察
不要只运行 ps 或看容器为 healthy。还要从公网/真实客户端完成核心流程,检查错误率、P95/P99、队列、数据库连接、磁盘、证书和最终业务数据。