← 返回技巧手册数据与智能 / UPDATED 2026.08
AI与机器学习工程师
开篇速查:推荐模型与工具
推荐模型:
GPT-5.6 Terra、Claude Sonnet 5与DeepSeek V4 Pro交叉评测。
理由:不要只让被测模型评价自己;固定评测集同时比较质量、延迟和成本,高风险样本由人工复核。
推荐产品:Codex、Claude Code、Cursor(本岗位涉及复杂开发、仓库或运行环境)。 常用工具:模型 API、评测集、Prompt 版本库、Tracing、向量库与成本/延迟监控。 核对日期:2026-08-04;上线前再查厂商官方模型列表并用内部评测集验证。
历史依据:从 8,276 条用户消息中命中 309 条,精确去重后 172 条。以下工作方式优先针对这些历史任务和返工问题。
1. 历史记录暴露的问题
- 明确验收标准:10/172(6%)。
- 明确要求验证:49/172(28%)。
- 提供失败/复现证据:32/172(19%)。
- 出现“功能不可用/报错”类返工:21 条。
- 出现“再检查/再测试”类返工:4 条。
- 出现“继续/不要停”但退出条件不清:12 条。
因此本岗位的模板会把验证、证据和退出条件写进首轮提示,而不是等失败后补充。
2. 什么时候使用
- 训练分类、排序、预测和推荐模型
- 构建RAG、知识问答和智能体
- 优化提示词与模型路由
- 验证AI功能是否真实优于规则基线
3. 责任边界
- 负责可评测、可复现的AI能力
- 不使用未来信息训练历史决策
- 不以合成数据证明真实业务效果
- 不把一次好回答当稳定质量
4. 开始前必须提供
- 业务决策和失败成本
- 数据来源、标签和成熟窗口
- 规则/人工/旧模型基线
- 延迟、成本、隐私和解释约束
- 失败案例与真实评测集
缺少信息时,先从仓库、配置、运行状态和现有资料中查证。只有会改变业务方向、造成生产影响或无法安全推断的内容才询问。
5. 完整可复制提示词
PROMPT
你是 AI/机器学习工程师。实现或评估【模型/RAG/Agent】。
业务决策:【输出将影响什么】
成功与失败成本:【内容】
数据与标签:【来源、时间、成熟窗口】
现有基线:【规则/人工/旧模型】
约束:【延迟、成本、隐私、可解释性】
请先审计数据:时间泄漏、幸存者偏差、重复实体、标签可靠性和缺失。建立按时间/实体隔离的训练、验证、测试集。
先实现简单基线,再证明复杂方案的增益。评测包含总体、类目/店铺/时间分层、关键错误成本和真实失败案例。RAG必须验证检索相关性、来源、新鲜度、引用和无答案处理。提示词使用固定评测集按“分析→测量→定向修改”迭代。
交付数据版本、代码/模型/提示词版本、指标、失败案例、成本延迟、上线门、监控和回滚。6. 推荐执行流程
- 先定义决策与可测指标
- 检查标签、时间泄漏和样本偏差
- 建立简单规则基线
- 按时间/店铺/实体隔离切分
- 对关键分层和失败案例评测
- 记录数据/代码/模型/提示词版本
- 小流量上线并监控漂移、成本和人工反馈
每一步都要留下可复核产物:文件、命令、截图、请求、任务ID、数据库记录、指标或决策记录。
7. 标准交付物
- 问题定义、基线和数据切分
- 训练/检索/提示词实现
- 离线与线上评测
- 失败案例分类和改进记录
- 版本、成本、延迟和质量监控
- 人工兜底与回滚
8. 历史中常见失败写法
- 声称百万SKU训练但没有数据清单和标签
- 用出一单直接定义成功,忽略退款和利润
- 只看整体准确率,不看类目/店铺/时间分层
- RAG引用了不相关或过期资料
- 提示词不断加长却没有固定评测集
- AI失败后没有人工门和安全退出
修正提示词
PROMPT
当前结果未满足验收。不要整体重做,先按证据定位差距。
原目标:【目标】
原验收:【可观察标准】
实际结果:【截图/日志/请求/任务ID/数据库记录】
差距:【逐条列出】
必须保持:【已正确部分和接口不变量】
请先复现并说明根因,再实施最小修正。修正后重复原验证,并给出修改前后证据。未通过的项继续保留为失败,不要用“基本完成”代替。9. 完成检查清单
- 目标、范围和不做项没有漂移。
- 关键假设已用代码、运行或数据验证。
- 成功、失败、空、重复、超时和权限路径已处理。
- 交付物可由另一人独立打开或运行。
- 验收命令/路径已实际执行并保留证据。
- 未完成项、风险和数据限制被明确列出。
- 下游岗位得到接口、不变量、文件和验证入口。
10. 交接模板
PROMPT
岗位:AI与机器学习工程师
已完成:【内容】
证据:【文件、命令、截图、日志、任务ID、数据库记录或指标】
接口与不变量:【下游必须遵守】
配置/迁移影响:【内容】
未完成与风险:【内容、严重度、负责人】
下一岗位:【岗位】
下一步输入:【精确文件、环境、账号或任务】
禁止假设:【仍未知内容】11. 实用组合技巧
- 历史失败自动变评测集:把错误回答、错误推荐和人工修改按失败类型整理为固定评测集,每次换模型或提示词都自动回归。
- 提示词版本自动竞赛:同一评测集并行测试多个提示词/模型组合,按质量、延迟和成本综合打分,只发布有可测增益的版本。
- RAG检索与回答分开评测:先判断证据是否检索正确,再判断回答是否忠于证据,避免只优化语言风格。
- 规则基线守门:先建立规则或简单统计模型,复杂模型必须在时间/实体隔离测试集上证明增益才能上线。
- 低置信度自动转人工:对缺证据、冲突数据、高风险决策或低置信度输出自动创建人工审批,而不是强行给答案。
- 线上反馈回流训练:把接受、拒绝、修改、后续经营结果和数据版本回流,形成可追溯的模型改进闭环。