← 返回技巧手册协作工作流 / UPDATED 2026.08

生产故障与服务器发布

故障

先冻结扩大风险的动作,记录时间线和用户影响;只读收集指标、日志、变更和依赖;优先恢复服务,再进行根因修复;每一步设停止与回滚条件。

发布

精确目标 → 备份/恢复点 → 预发布验证 → 小步部署 → 健康检查 → 核心用户旅程 → 指标观察 → 扩大发布 → 发布记录。

服务器密码、Token和私钥不得写入提示词或文件。发现历史泄漏要轮换,不是只删除文本。

故障响应顺序

  1. 声明影响范围、开始时间和当前负责人。
  2. 冻结可能扩大影响的发布和数据操作。
  3. 保存现场:版本、配置哈希、指标、日志、追踪和最近变更。
  4. 优先选择可逆恢复:回滚、切流、降级、限流或关闭非核心功能。
  5. 每个动作写预期、观察窗口、停止条件和恢复方法。
  6. 服务恢复后再做根因修复;不要在事故中顺便大重构。

发布前清单

  • 目标主机/集群、服务、版本和配置精确无歧义。
  • 数据库迁移已在近似数据量环境演练。
  • 备份或恢复点存在且恢复步骤可执行。
  • 密钥通过安全渠道注入,没有进入命令历史和日志。
  • 健康、日志、指标、告警和核心用户旅程都有验证入口。
  • 回滚版本、命令、触发条件和负责人明确。

发布后观察

不要只运行 ps 或看容器为 healthy。还要从公网/真实客户端完成核心流程,检查错误率、P95/P99、队列、数据库连接、磁盘、证书和最终业务数据。