← 返回技巧手册数据与智能 / UPDATED 2026.08
数据工程师
开篇速查:推荐模型与工具
推荐模型:批量清洗用
DeepSeek V4 Flash或GPT-5.6 Luna;复杂口径用GPT-5.6 Sol。
理由:字段分类和结构化抽取适合低成本高吞吐模型;多源冲突、指标口径和因果判断应升级模型并保留来源证据。
推荐产品:Codex、Claude Code、Cursor(本岗位涉及复杂开发、仓库或运行环境)。 常用工具:SQL、dbt、Airflow/Dagster、数据质量检查、Notebook 与 BI 工具。 核对日期:2026-08-04;上线前再查厂商官方模型列表并用内部评测集验证。
历史依据:从 8,276 条用户消息中命中 379 条,精确去重后 107 条。以下工作方式优先针对这些历史任务和返工问题。
1. 历史记录暴露的问题
- 明确验收标准:11/107(10%)。
- 明确要求验证:49/107(46%)。
- 提供失败/复现证据:24/107(22%)。
- 出现“功能不可用/报错”类返工:15 条。
- 出现“再检查/再测试”类返工:5 条。
- 出现“继续/不要停”但退出条件不清:8 条。
因此本岗位的模板会把验证、证据和退出条件写进首轮提示,而不是等失败后补充。
2. 什么时候使用
- 建立采集、清洗、快照和数据闭环
- 统一多平台商品、店铺、任务和订单身份
- 为分析或模型构建可靠数据集
- 诊断数据缺失、冲突和时效性
3. 责任边界
- 负责数据来源、口径、质量和血缘
- 不把合成数据冒充真实业务效果
- 不只保存成功样本
- 不覆盖原始证据和历史版本
4. 开始前必须提供
- 数据源、授权和采集方式
- 业务实体与稳定ID
- 事件时间、采集时间和处理时间
- 质量规则和允许延迟
- 下游报表/模型/业务需求
缺少信息时,先从仓库、配置、运行状态和现有资料中查证。只有会改变业务方向、造成生产影响或无法安全推断的内容才询问。
5. 完整可复制提示词
PROMPT
你是数据工程师。为【业务】建立可追溯数据管道和数据集。
数据源:【平台、数据库、插件、文件】
业务身份链:【组织→用户→设备→店铺→商品→货源→任务→订单等】
下游用途:【报表、规则、模型、运营】
新鲜度与规模:【内容】
要求:
1. 定义稳定主键、外部ID映射、事件时间/采集时间/处理时间。
2. 保留原始证据、规范层、历史快照和版本。
3. 同时保存成功、失败、未选择、未出单、亏损和未知样本。
4. 区分缺失、未采集、不适用、冲突和已确认未知。
5. 管道幂等、可断点续跑、可补采、可重放。
6. 建立覆盖率、新鲜度、重复率、冲突率和可信度质量门。
交付数据字典、血缘、管道、质量报告、补采机制和下游使用限制。6. 推荐执行流程
- 先建立数据源清单和权限
- 定义业务键、去重和时间语义
- 保留原始层再构建规范层
- 分别编码缺失、未知、不适用和冲突
- 记录采集器和规则版本
- 构建质量门和补采队列
- 验证下游能够追溯每个结论
每一步都要留下可复核产物:文件、命令、截图、请求、任务ID、数据库记录、指标或决策记录。
7. 标准交付物
- 源到目标映射和数据字典
- 增量/全量管道与幂等
- 快照、版本、血缘和质量状态
- 成功/失败/未选/未知数据集
- 质量监控、补采和重放机制
8. 历史中常见失败写法
- 只保存最终汇总值,无法回看历史
- 只保留被选中/成功商品,产生幸存者偏差
- 把采集失败当成业务上不存在
- 未来订单数据泄漏到历史特征
- 多平台ID错配造成货源/商品关系错误
- 管道部分成功却没有质量状态
修正提示词
PROMPT
当前结果未满足验收。不要整体重做,先按证据定位差距。
原目标:【目标】
原验收:【可观察标准】
实际结果:【截图/日志/请求/任务ID/数据库记录】
差距:【逐条列出】
必须保持:【已正确部分和接口不变量】
请先复现并说明根因,再实施最小修正。修正后重复原验证,并给出修改前后证据。未通过的项继续保留为失败,不要用“基本完成”代替。9. 完成检查清单
- 目标、范围和不做项没有漂移。
- 关键假设已用代码、运行或数据验证。
- 成功、失败、空、重复、超时和权限路径已处理。
- 交付物可由另一人独立打开或运行。
- 验收命令/路径已实际执行并保留证据。
- 未完成项、风险和数据限制被明确列出。
- 下游岗位得到接口、不变量、文件和验证入口。
10. 交接模板
PROMPT
岗位:数据工程师
已完成:【内容】
证据:【文件、命令、截图、日志、任务ID、数据库记录或指标】
接口与不变量:【下游必须遵守】
配置/迁移影响:【内容】
未完成与风险:【内容、严重度、负责人】
下一岗位:【岗位】
下一步输入:【精确文件、环境、账号或任务】
禁止假设:【仍未知内容】11. 实用组合技巧
- 字段自动建字典:让数据 Agent 从表、接口和插件响应生成数据字典,再由业务方补充含义、口径和质量门。
- 数据链自动追溯:给每条数据保存来源、外部ID、业务时间、采集时间、处理版本和质量状态,让任何报表结论都能回到原始证据。
- 缺失字段自动补采:质量 Agent 检测必需字段缺失后生成精确补采任务,而不是重新采集整个商品或批次。
- 正负样本同时沉淀:自动保存选中、淘汰、未选择、上架失败、未出单、退款和盈利样本,避免模型只看到成功案例。
- 多源冲突自动仲裁:规则 Agent 根据来源可信度、新鲜度和人工确认状态标记冲突,不直接用最后写入值覆盖。