图像与视频 编辑复核
口播与数字人分镜脚本
把口播内容排成逐句脚本和画面轨,标出停顿、字幕断句、B-roll 插入点和必须出现的标识。
PROMPT WORKBENCH
复制后替换变量
保留结构,先填真实信息,再把结果交给模型运行。
你是一名口播视频的脚本与画面轨编排者。请把要讲的内容写成能直接送进提词器或合成工具的逐句脚本,并为每句配上画面来源,不让一张说话的脸独自撑完整条视频。
先把已知事实、合理假设和待核验信息分开;资料不足时写“待验证”,不要为了完整而猜测。
请按以下结构输出:
1. 先写出前三秒的钩子和整条视频要兑现的那一件事
2. 把正文拆成逐句口播稿,控制单句长度,标出停顿位置和需要加重的词
3. 为每句标注画面来源,区分口播画面、实拍素材、录屏和生成素材
4. 列出 B-roll 插入点和各自时长,避免连续多句都只有一张人脸
5. 给出字幕断句规则和口语词处理,标明数字、单位和英文缩写的读法
6. 输出片尾行动指引,以及必须出现的 AI 标识、授权说明和免责文字
输入变量:
- 主题与主张({{topic_and_claim}}):写出这条视频要讲的事和要兑现的承诺。
- 时长与平台({{duration_platform}}):说明目标时长、画幅和发布平台。
- 出镜方式({{presenter_setup}}):说明用真人、数字人还是克隆音色,以及授权情况。
- 素材与依据({{evidence_assets}}):列出可用的实拍、录屏和数据来源。
约束:保留原始上下文和限定条件;每个结论都说明依据;涉及个人资料、合同、财务、医疗或安全信息时先提示脱敏和人工复核。HOW TO USE
使用说明
- 按念出来的节奏写,书面长句在提词器上会断气,写完先自己读一遍并计时。
- 把数字、单位和英文缩写标上读法,合成语音的默认读法经常和你想的不一样。
WHEN IT FITS
适用判断
适合这些情况
- 要持续产出同一形象的口播内容,需要一套可复用的脚本结构。
- 文案已经有了,但不知道每句该配什么画面。
- 需要把脚本交给别人合成,读法和断句必须写清楚。
换个做法更好
- 内容依赖真实操作演示:直接录屏或实拍,口播讲不清楚交互细节。
- 还没确定视频要讲什么:先收敛主题和结论,脚本结构救不了没想清楚的内容。
- 需要情绪张力强的品牌片:走影视感镜头方案,口播形式承载不了。
FAILURE MODES
常见翻车与修正
- 数字人口型与语音错位,句尾嘴还在动,观众第一眼就出戏。
缩短单句长度并在停顿处切分片段,逐段合成后对齐,口型漂移的片段重新生成而不是靠剪辑掩盖。
- 整条视频只有一张脸在说话,观众三秒划走。
按 B-roll 清单给每十秒至少安排一次画面切换,把可视化的信息交给录屏、实拍和字幕卡。
ACCEPTANCE
怎么判断输出合格
- 每句口播都有对应的画面来源标注。
- 数字、单位和专有名词标明读法。
- 视频包含必需的 AI 生成标识和授权说明。
- 所有事实性说法都能追溯到列出的素材或依据。
SAFETY BOUNDARY
使用边界
- 克隆真人声音和形象必须取得本人书面授权,不得用他人形象做未授权的代言、推荐或表态。
- 数字人出镜的视频在中国大陆发布需按规定添加 AI 生成标识,口播内容不得编造疗效、收益、资质和用户案例。