← 返回技巧手册数据与智能 / UPDATED 2026.08

数据工程师

开篇速查:推荐模型与工具

推荐模型:批量清洗用 DeepSeek V4 FlashGPT-5.6 Luna;复杂口径用 GPT-5.6 Sol
理由:字段分类和结构化抽取适合低成本高吞吐模型;多源冲突、指标口径和因果判断应升级模型并保留来源证据。
推荐产品CodexClaude CodeCursor(本岗位涉及复杂开发、仓库或运行环境)。 常用工具:SQL、dbt、Airflow/Dagster、数据质量检查、Notebook 与 BI 工具。 核对日期:2026-08-04;上线前再查厂商官方模型列表并用内部评测集验证。

历史依据:从 8,276 条用户消息中命中 379 条,精确去重后 107 条。以下工作方式优先针对这些历史任务和返工问题。

1. 历史记录暴露的问题

  • 明确验收标准:11/107(10%)。
  • 明确要求验证:49/107(46%)。
  • 提供失败/复现证据:24/107(22%)。
  • 出现“功能不可用/报错”类返工:15 条。
  • 出现“再检查/再测试”类返工:5 条。
  • 出现“继续/不要停”但退出条件不清:8 条。

因此本岗位的模板会把验证、证据和退出条件写进首轮提示,而不是等失败后补充。

2. 什么时候使用

  • 建立采集、清洗、快照和数据闭环
  • 统一多平台商品、店铺、任务和订单身份
  • 为分析或模型构建可靠数据集
  • 诊断数据缺失、冲突和时效性

3. 责任边界

  • 负责数据来源、口径、质量和血缘
  • 不把合成数据冒充真实业务效果
  • 不只保存成功样本
  • 不覆盖原始证据和历史版本

4. 开始前必须提供

  • 数据源、授权和采集方式
  • 业务实体与稳定ID
  • 事件时间、采集时间和处理时间
  • 质量规则和允许延迟
  • 下游报表/模型/业务需求

缺少信息时,先从仓库、配置、运行状态和现有资料中查证。只有会改变业务方向、造成生产影响或无法安全推断的内容才询问。

5. 完整可复制提示词

PROMPT
你是数据工程师。为【业务】建立可追溯数据管道和数据集。

数据源:【平台、数据库、插件、文件】
业务身份链:【组织→用户→设备→店铺→商品→货源→任务→订单等】
下游用途:【报表、规则、模型、运营】
新鲜度与规模:【内容】

要求:
1. 定义稳定主键、外部ID映射、事件时间/采集时间/处理时间。
2. 保留原始证据、规范层、历史快照和版本。
3. 同时保存成功、失败、未选择、未出单、亏损和未知样本。
4. 区分缺失、未采集、不适用、冲突和已确认未知。
5. 管道幂等、可断点续跑、可补采、可重放。
6. 建立覆盖率、新鲜度、重复率、冲突率和可信度质量门。

交付数据字典、血缘、管道、质量报告、补采机制和下游使用限制。

6. 推荐执行流程

  1. 先建立数据源清单和权限
  2. 定义业务键、去重和时间语义
  3. 保留原始层再构建规范层
  4. 分别编码缺失、未知、不适用和冲突
  5. 记录采集器和规则版本
  6. 构建质量门和补采队列
  7. 验证下游能够追溯每个结论

每一步都要留下可复核产物:文件、命令、截图、请求、任务ID、数据库记录、指标或决策记录。

7. 标准交付物

  • 源到目标映射和数据字典
  • 增量/全量管道与幂等
  • 快照、版本、血缘和质量状态
  • 成功/失败/未选/未知数据集
  • 质量监控、补采和重放机制

8. 历史中常见失败写法

  • 只保存最终汇总值,无法回看历史
  • 只保留被选中/成功商品,产生幸存者偏差
  • 把采集失败当成业务上不存在
  • 未来订单数据泄漏到历史特征
  • 多平台ID错配造成货源/商品关系错误
  • 管道部分成功却没有质量状态

修正提示词

PROMPT
当前结果未满足验收。不要整体重做,先按证据定位差距。

原目标:【目标】
原验收:【可观察标准】
实际结果:【截图/日志/请求/任务ID/数据库记录】
差距:【逐条列出】
必须保持:【已正确部分和接口不变量】

请先复现并说明根因,再实施最小修正。修正后重复原验证,并给出修改前后证据。未通过的项继续保留为失败,不要用“基本完成”代替。

9. 完成检查清单

  • 目标、范围和不做项没有漂移。
  • 关键假设已用代码、运行或数据验证。
  • 成功、失败、空、重复、超时和权限路径已处理。
  • 交付物可由另一人独立打开或运行。
  • 验收命令/路径已实际执行并保留证据。
  • 未完成项、风险和数据限制被明确列出。
  • 下游岗位得到接口、不变量、文件和验证入口。

10. 交接模板

PROMPT
岗位:数据工程师
已完成:【内容】
证据:【文件、命令、截图、日志、任务ID、数据库记录或指标】
接口与不变量:【下游必须遵守】
配置/迁移影响:【内容】
未完成与风险:【内容、严重度、负责人】
下一岗位:【岗位】
下一步输入:【精确文件、环境、账号或任务】
禁止假设:【仍未知内容】

11. 实用组合技巧

  • 字段自动建字典:让数据 Agent 从表、接口和插件响应生成数据字典,再由业务方补充含义、口径和质量门。
  • 数据链自动追溯:给每条数据保存来源、外部ID、业务时间、采集时间、处理版本和质量状态,让任何报表结论都能回到原始证据。
  • 缺失字段自动补采:质量 Agent 检测必需字段缺失后生成精确补采任务,而不是重新采集整个商品或批次。
  • 正负样本同时沉淀:自动保存选中、淘汰、未选择、上架失败、未出单、退款和盈利样本,避免模型只看到成功案例。
  • 多源冲突自动仲裁:规则 Agent 根据来源可信度、新鲜度和人工确认状态标记冲突,不直接用最后写入值覆盖。