← 返回技巧手册基础设施与质量 / UPDATED 2026.08
SRE与可观测性工程师
开篇速查:推荐模型与工具
推荐模型:
DeepSeek V4 Pro、GPT-5.6 Sol或Claude Opus 5。
理由:适合跨日志、Trace、指标的复杂故障归因;常规聚类和告警摘要用 V4 Flash/Luna,自动恢复必须有阈值、次数上限和回滚。
推荐产品:Codex、Claude Code、Cursor(本岗位涉及复杂开发、仓库或运行环境)。 常用工具:Prometheus、Grafana、OpenTelemetry、日志平台、Trace、告警和值班系统。 核对日期:2026-08-04;上线前再查厂商官方模型列表并用内部评测集验证。
历史依据:从 8,276 条用户消息中命中 149 条,精确去重后 79 条。以下工作方式优先针对这些历史任务和返工问题。
1. 历史记录暴露的问题
- 明确验收标准:16/79(20%)。
- 明确要求验证:43/79(54%)。
- 提供失败/复现证据:38/79(48%)。
- 出现“功能不可用/报错”类返工:16 条。
- 出现“再检查/再测试”类返工:6 条。
- 出现“继续/不要停”但退出条件不清:9 条。
因此本岗位的模板会把验证、证据和退出条件写进首轮提示,而不是等失败后补充。
2. 什么时候使用
- 建立监控、告警、追踪和运行手册
- 处理排队、部分成功和长尾延迟
- 制定SLI/SLO和错误预算
- 组织故障响应和复盘
3. 责任边界
- 关注用户结果而非只有机器指标
- 告警必须可行动并有负责人
- 不通过提高阈值掩盖持续问题
- 不在故障中做无回滚的大范围重构
4. 开始前必须提供
- 关键用户旅程和业务影响
- 服务依赖和任务状态
- 历史故障、延迟和容量
- 日志、指标、追踪现状
- 可用性目标和支持时间
缺少信息时,先从仓库、配置、运行状态和现有资料中查证。只有会改变业务方向、造成生产影响或无法安全推断的内容才询问。
5. 完整可复制提示词
PROMPT
你是 SRE。为【服务/用户流程】建立端到端可靠性和故障处理。
关键旅程:【请求→排队→执行→持久化→用户可见】
业务影响:【失败/延迟会怎样】
依赖与历史故障:【内容】
定义成功率、完整率、P95/P99延迟、新鲜度等 SLI;设定SLO、窗口和错误预算。统一关联ID贯穿入口、插件、队列、执行器和数据库。
输出仪表盘、分级告警、负责人、抑制规则、Top故障运行手册、容量模型和故障演练。告警必须说明触发条件、用户影响、第一检查、恢复步骤、升级和验证。
最后模拟一次【依赖超时/队列积压/磁盘满/部分持久化】并形成复盘与行动项。6. 推荐执行流程
- 定义用户看到的成功和失败
- 为入口、队列、执行、持久化建同一关联ID
- 测量端到端而非单服务耗时
- 按影响设计告警和升级
- 为常见故障写可执行恢复步骤
- 演练依赖超时、队列积压和磁盘满
- 复盘行动项进入负责人和截止时间
每一步都要留下可复核产物:文件、命令、截图、请求、任务ID、数据库记录、指标或决策记录。
7. 标准交付物
- SLI/SLO/错误预算
- 业务+技术仪表盘
- 分级告警和抑制规则
- 任务端到端追踪
- Top故障运行手册
- 容量与故障演练
- 无责复盘与行动项
8. 历史中常见失败写法
- 接口接受任务就计为成功
- 只监控CPU/内存,不监控任务完整性
- 部分失败没有状态和原因
- 告警很多但没人知道怎么处理
- 没有端到端任务ID,插件、队列、数据库对不上
- 故障后只写总结,没有可验证改进
修正提示词
PROMPT
当前结果未满足验收。不要整体重做,先按证据定位差距。
原目标:【目标】
原验收:【可观察标准】
实际结果:【截图/日志/请求/任务ID/数据库记录】
差距:【逐条列出】
必须保持:【已正确部分和接口不变量】
请先复现并说明根因,再实施最小修正。修正后重复原验证,并给出修改前后证据。未通过的项继续保留为失败,不要用“基本完成”代替。9. 完成检查清单
- 目标、范围和不做项没有漂移。
- 关键假设已用代码、运行或数据验证。
- 成功、失败、空、重复、超时和权限路径已处理。
- 交付物可由另一人独立打开或运行。
- 验收命令/路径已实际执行并保留证据。
- 未完成项、风险和数据限制被明确列出。
- 下游岗位得到接口、不变量、文件和验证入口。
10. 交接模板
PROMPT
岗位:SRE与可观测性工程师
已完成:【内容】
证据:【文件、命令、截图、日志、任务ID、数据库记录或指标】
接口与不变量:【下游必须遵守】
配置/迁移影响:【内容】
未完成与风险:【内容、严重度、负责人】
下一岗位:【岗位】
下一步输入:【精确文件、环境、账号或任务】
禁止假设:【仍未知内容】11. 实用组合技巧
- 任务链自动拼接:统一关联 ID 后,让诊断 Agent 自动汇总插件、API、队列、执行器和数据库时间线,快速找到卡点。
- 告警自动附运行手册:每条告警同时带用户影响、第一检查、恢复步骤、升级负责人和验证方式,避免只收到一个红点。
- 日志聚类发现新故障:让分析 Agent 定期聚类未知错误和慢请求,识别尚未设置告警的重复模式。
- 故障复盘自动变行动项:从时间线生成根因、促成因素和可验证行动项,并自动跟踪负责人和截止时间。
- 容量预测联动业务:把任务量、SKU数、视频生成量等业务指标与CPU、队列、数据库和第三方配额一起建容量模型。