短视频运营提示词手册
开篇速查:推荐模型与工具
模型建议核对日期:2026-08-04。模型版本会快速变化;生产接入前应再查官方模型列表,并用自己的样本比较质量、延迟和成本。会议中的 Cursor、Claude Code、Copilot、Hermes、OpenClaw 属于工具或 Agent 框架,不是基础模型。
推荐产品:
ChatGPT、Kimi、Claude(适合选题、脚本和分镜的多轮互动);只有要开发批量生产系统时才转Codex/Claude Code。 常用工具:图像/视频生成 API、TTS、FFmpeg、剪辑软件或Remotion、OCR、字幕工具与平台数据看板。
- 内容矩阵自动生产:策略 Agent 根据人群阶段和内容支柱生成选题,去重 Agent 淘汰换标题不换内容的伪选题。
- 模型对比:中文长素材和多模态内容库用
Kimi K3;日常策略用GPT-5.6 Terra;大批量初筛用DeepSeek V4 Flash。
- 模型对比:中文长素材和多模态内容库用
- 脚本到分镜自动流水线:脚本 Agent 输出口播后,分镜 Agent 自动生成镜头、动作、字幕、声音和素材来源,再分别调用图片/视频 API。
- 模型对比:复杂叙事和镜头约束用
GPT-5.6 Sol;长素材、多参考图和视频理解用Kimi K3;低成本批量脚本可用Kimi K2.7 Code。画面仍交给专用图像/视频模型。
- 模型对比:复杂叙事和镜头约束用
- 品牌宣图直接变视频首帧:使用已验收KV作为首帧和风格参考,视频 API 只生成明确动作,减少品牌颜色、产品和构图漂移。
- 模型对比:
Gemini Omni Flash;需要末帧控制、场景延展或兼容旧流程时用Veo 3.1;国内生产链路可选Seedance 2.0。理由:按官方能力选择,不把所有镜头都强行交给同一模型。
- 模型对比:
- 批量生成镜头而非整片:每个镜头单独生成并规定结尾状态,剪辑 Agent 后期组合,比一次生成完整视频更容易保持人物和产品一致。
- 模型对比:
Seedance 2.0 fast或Gemini Omni Flash做批量镜头,主产品特写用质量档。理由:先低成本生成候选,再把预算集中到高价值镜头。
- 模型对比:
- 一个母脚本自动多版本:按平台、时长、人群、语言和钩子变量生成版本,但核心承诺和证据保持不变。
- 模型对比:
DeepSeek V4 Flash、GPT-5.6 Luna或Claude Haiku 4.5。理由:模板化、高并发改写更看重吞吐与成本;品牌承诺和事实由规则锁定。
- 模型对比:
- 自动生成口播+字幕+配音:口播 Agent 控制时长,TTS API生成配音,字幕 Agent 按语义切行并自动检查安全区和关键词强调。
- 模型对比:
Doubao 语音合成大模型用于中文情绪化配音;文案可用GPT-5.6 Terra/Claude Sonnet 5。理由:豆包官方能力支持上下文情绪、语调和多种音色,适合短视频配音;敏感音色须取得授权。
- 模型对比:
- 视频素材自动质检:视觉模型检查人物/产品/Logo一致性,OCR检查乱码,音频模型检查人声清晰度,规则脚本检查画幅、时长和码率。
- 模型对比:
Gemini 3.6 Flash或GPT-5.6 Terra做多模态语义质检。理由:适合批量看画面和上下文;码率、时长、响度、OCR 与文件合法性仍用专门工具测。
- 模型对比:
- 数据自动回流下一轮:发布后将首屏停留、完播、点击和转化交给复盘 Agent,只改变最大漏损环节的一个变量。
- 模型对比:低成本分析用
DeepSeek V4 Pro;复杂归因用GPT-5.6 Sol或Claude Opus 5。必须保留实验对照,不能把相关性当因果。
- 模型对比:低成本分析用
- 低成本模型自动分层:批量试错和过渡镜头使用低成本模型,核心产品特写和主叙事镜头使用高质量模型,由调度 Agent 按镜头价值分配。
- 模型对比:文本批量层用
DeepSeek V4 Flash;图像批量层用Seedream 5.0 lite;视频批量层用Seedance 2.0 fast。每层先生成候选,高价值资产再切换质量档。
- 模型对比:文本批量层用
本机历史中宽口径命中 234 条短视频相关消息,精确去重后 121 条;其中直接包含“短视频、分镜、口播、完播率”等核心词的记录较少,因此本手册以历史中反复出现的“明确交付物、约束、参考物、迭代和指标”结构为基础,补全为可直接执行的短视频工作流。平台算法和规格会变化,发布前仍需核对目标平台当期规则。
0. 把短视频生产拆成角色和门禁
| 阶段 | 主责角色 | 交付 | 验收证据 |
|---|---|---|---|
| 选题 | 内容策略师 | 人群阶段、选题矩阵、内容目标 | 去重与业务价值排序 |
| 脚本 | 编剧/口播策划 | 钩子、正文、证据、CTA | 朗读时长与承诺兑现 |
| 分镜 | 导演/分镜师 | 镜头、动作、素材、声音 | 可拍摄性和连续性 |
| 制作 | 摄影/AI视频工程师 | 实拍或生成素材 | 主体、产品、Logo一致性 |
| 后期 | 剪辑师 | 时间线、字幕、声音、多画幅 | 静音可懂、导出规格 |
| 发布 | 运营 | 标题、封面、发布时间、实验 | 单变量测试记录 |
| 复盘 | 数据分析师 | 漏斗、失败假设、下一轮实验 | 样本、基线和成功标准 |
长期不变的账号定位、品牌语气、合规禁区和素材授权应保存为固定上下文;每条视频只传递本次选题、目标和素材;发布规格、敏感词、字幕安全区和数据字段应使用独立检查表强制验证。
1. 先把“做一条视频”改成一个经营任务
短视频提示词必须先回答:
- 目标:曝光、涨粉、获客、成交、教育还是品牌记忆。
- 人群:谁在什么场景刷到,当前知道什么、抗拒什么。
- 平台:内容语法、画幅、时长和用户预期。
- 单一信息:看完只能记住一句什么话。
- 证据:演示、案例、数据、对比、过程还是用户反馈。
- 行动:评论、关注、私信、点击、搜索还是购买。
- 指标:前三秒停留、完播、互动、点击或转化。
一条视频不要同时承担所有目标。品牌曝光片和成交片的结构、节奏与 CTA 不应相同。
2. 短视频项目母模板
你是一名【平台】短视频内容策划与运营。请为【品牌/账号】制作【数量】条视频方案。
账号定位:【一句话】
业务目标:【曝光/涨粉/获客/成交/复购】
目标人群:【具体人群、场景、需求、障碍】
产品/主题:【内容】
核心卖点:【一个主卖点,最多三个支持点】
可信证据:【演示、案例、数据、资质、用户反馈】
平台与规格:【平台、9:16/16:9、时长、语言、字幕】
品牌语气:【3个词】
禁止内容:【夸大承诺、敏感词、竞品攻击、无法证明的数据等】
请输出:
1. 选题与对应用户痛点。
2. 前 3 秒钩子,至少 3 个备选。
3. 完整脚本:画面、口播/字幕、时长、音效、转场。
4. 镜头清单和所需素材。
5. 标题、封面文案、描述和 CTA。
6. A/B 测试变量。
7. 发布后应观察的指标及不同结果对应的调整动作。
要求:一条视频只讲一个核心承诺;钩子必须与正文兑现;CTA 与业务目标一致。3. 选题系统,而不是临时想标题
3.1 选题矩阵
用“人群阶段 × 内容功能”生成矩阵:
| 人群阶段 | 内容功能 | 示例方向 |
|---|---|---|
| 不知道问题 | 唤醒 | 症状、反常识、成本暴露 |
| 知道问题 | 教育 | 原因、误区、方法、对比 |
| 比较方案 | 证明 | 实测、案例、拆解、幕后 |
| 准备行动 | 转化 | 演示、报价逻辑、风险消除、FAQ |
| 已经购买 | 留存 | 教程、进阶用法、社区、复购 |
3.2 批量选题模板
围绕【账号定位】生成 30 个短视频选题,覆盖【目标人群】从认知到转化的完整阶段。
每个选题输出:
- 用户阶段与具体痛点;
- 一句话选题;
- 为什么值得看;
- 可使用的证据或画面;
- 最适合的内容形式;
- 推荐 CTA;
- 与已有选题的差异。
分配比例:教育【%】、证明【%】、品牌【%】、转化【%】。
删除只换标题但核心内容相同的选题,按预期价值和制作成本排序。4. 钩子设计
常用钩子不是固定句式,而是制造“继续观看的合理理由”:
- 结果先行:“我用【方法】把【指标】从 A 做到 B,关键不是【常见误解】。”
- 风险暴露:“如果你正在【行为】,先检查这三个地方。”
- 反常识:“【行业常识】不一定对,真正影响【结果】的是……”
- 对比实验:“同一个【对象】,只改【变量】,结果差了……”
- 明确对象:“如果你是【具体人群】,这条能帮你避免【损失】。”
- 未完成信息:“最后一个步骤决定【结果】,但很多人会跳过。”
钩子验收:
- 前 1 秒能看懂对象和冲突。
- 静音观看也能理解。
- 正文真实兑现,不使用与内容无关的夸张承诺。
- 不以漫长自我介绍开头。
5. 口播脚本模板
5.1 30—60 秒知识/获客视频
请为【人群】写一条【时长】秒口播视频。
主题:【主题】
目标:【关注/私信/搜索/点击】
核心结论:【一句话】
必须包含的证据:【证据】
语气:【自然、直接、可信等】
结构:
0—3秒:对象 + 冲突/结果,不自我介绍。
3—10秒:解释为什么这件事重要。
10—40秒:最多三个步骤,每步配具体例子或画面。
40—50秒:总结并消除一个常见异议。
最后:一个明确 CTA。
输出为表格:时间、画面、口播、屏幕字幕、音效/动作。
控制句子适合自然说话,避免书面长句;字幕每屏只保留一个信息块。5.2 15—30 秒产品转化视频
为【产品】写一条【平台】竖屏转化视频。
用户场景:【场景】
核心痛点:【痛点】
产品承诺:【可证明结果】
演示证据:【怎样现场展示】
价格/优惠:【如适用】
合规边界:【不能承诺什么】
结构:问题瞬间 → 产品出现 → 一镜到底演示 → 结果对比 → 风险消除 → CTA。
提供 3 个不同钩子和 2 个 CTA,只改变一个测试变量。6. 分镜脚本模板
把以下脚本转成可拍摄的分镜表:【脚本】。
每个镜头输出:
- 镜头编号和起止时间;
- 景别、机位、焦段感和运镜;
- 主体动作和表情;
- 场景、道具和产品位置;
- 口播、字幕和屏幕文字;
- 光线、色彩和声音;
- 转场方式;
- 素材来源:实拍/屏录/库存/AI生成;
- 制作风险和替代方案。
约束:
- 竖屏安全区内保留人物、产品和字幕。
- 平均【N】秒出现一次有意义的视觉变化,但不要为转场而转场。
- 重点信息同时通过画面和简短字幕表达。
- 镜头必须能在【场地/设备/预算】条件下执行。7. AI 视频生成提示词
AI 视频提示词可按以下顺序编写:
格式与时长 + 主体身份一致性 + 动作 + 场景 + 镜头 + 光线 + 色彩 + 节奏 + 物理约束 + 禁止项。
生成【时长】秒、【比例】、【分辨率】的视频镜头。
主体:【人物/产品外观、服装、材质和必须保持的一致特征】。
动作:【按时间顺序描述单一连续动作】。
场景:【空间、前中后景、时间和环境细节】。
镜头:【景别、机位、运动轨迹、速度、焦点和景深】。
光线:【主光方向、软硬、色温和氛围】。
色彩:【品牌色及整体色调】。
节奏:【平稳/快速/悬念等】。
禁止:主体变形、额外手指、产品结构改变、Logo变形、文字乱码、闪烁、突然跳切、穿模、背景人物抢镜、过度运动模糊。
结尾状态:【下一镜头需要衔接的姿势、位置和方向】。复杂内容不要一次生成整条成片。先生成关键镜头和连接状态,再在剪辑中组合,能显著降低人物、产品和空间连续性问题。
8. 剪辑 Brief
请根据脚本和素材清单制定剪辑方案。
目标平台:【平台】
时长:【时长】
核心指标:【前三秒停留/完播/点击/转化】
品牌节奏:【描述】
输出:
1. 时间线及每段叙事功能。
2. 保留、删减和补拍建议。
3. B-roll、屏录、特写和证据画面的插入点。
4. 字幕层级、每屏字数、关键词强调方式和安全区。
5. 音乐、环境声、音效和人声响度关系。
6. 转场和动效规则。
7. 9:16、1:1、16:9 的重构策略,不仅是裁切。
避免:每句话都加音效、连续花哨转场、字幕遮挡主体、音乐压住人声、无意义空镜。9. 标题与封面
基于视频内容生成 10 组标题和封面文案。
视频核心结论:【内容】
目标人群:【人群】
平台:【平台】
语气:【语气】
禁止:【标题党、无法兑现的数字、敏感词】
每组说明:
- 标题使用的动机;
- 封面主文案(短)和辅助信息;
- 画面主体、构图和颜色;
- 与视频前三秒是否一致;
- 适合测试的变量。
标题负责建立预期,封面负责快速识别,前三秒负责兑现;三者不能讲三件不同的事。10. 发布、测试与复盘
10.1 一次只测试一个变量
可测试变量包括:钩子、首帧、封面、标题、证明方式、节奏、CTA。若同时改变全部元素,即使数据变化也无法判断原因。
10.2 数据诊断模板
请分析以下短视频数据,并区分事实、推断和下一步实验:【数据】。
视频目标:【目标】
发布时间与样本量:【信息】
内容结构:【钩子、正文、CTA】
可用指标:【曝光、停留、完播、互动、点击、转化等】
分析顺序:
1. 样本是否足够,数据是否可比。
2. 曝光 → 停留 → 完播 → 互动/点击 → 转化在哪一层损失最大。
3. 将损失映射到可修改元素,不把相关性当因果。
4. 给出最多 3 个优先实验;每个实验只改一个变量。
5. 写明成功标准、观察周期和停止条件。10.3 常见指标与内容问题映射
| 现象 | 优先检查 |
|---|---|
| 有曝光、首屏流失高 | 封面与钩子是否匹配;对象和冲突是否清楚 |
| 开头好、中段掉得快 | 信息重复、铺垫过长、证据出现太晚 |
| 完播高、互动低 | 缺少观点张力、身份表达或互动理由 |
| 点击高、转化低 | 承诺与落地页不一致、证据不足、风险未消除 |
| 单条好、无法复制 | 选题依赖偶然热点,未沉淀结构和素材模板 |
11. 批量内容生产模板
建立一个【周期】内容生产计划,目标是【业务目标】。
资源:每周【人力/预算/拍摄时间】,可用素材【列表】。
内容支柱:【3—5个】。
发布频率:【频率】。
请输出:
- 选题矩阵和去重后的内容日历;
- 每条视频的目标、受众阶段、形式和 CTA;
- 可批量拍摄的场景、服装、道具和镜头组合;
- 一次拍摄、多条剪辑的素材规划;
- 审核、发布、数据回收和复盘流程;
- 每周保留、停止和放大内容的判定规则。
不要为了数量把同一内容换词重复发布;必须保持内容角度、证据或人群阶段的真实差异。12. 发布前验收清单
- 前三秒明确对象、冲突或结果。
- 标题、封面、开头和正文承诺一致。
- 一条视频只有一个核心信息和一个主 CTA。
- 所有事实、数据和效果承诺可以证明。
- 字幕在安全区内,静音观看仍可理解。
- 产品、人物、Logo 和品牌颜色一致。
- 音乐、人声和音效层级清楚。
- 画面、素材、音乐和人物授权可用。
- 输出比例、分辨率、码率和字幕符合平台要求。
- 已定义发布后的主指标、测试变量和调整条件。
短视频提示词最重要的不是“写得有创意”,而是让选题、脚本、画面、发布目标和数据复盘形成同一条闭环。