AI 视频分镜教程:先用低成本验证镜头,再生成成片
从30秒脚本拆分镜头,明确景别、动作、时长、转场和连续性,用低成本预演和逐镜验收减少视频生成返工。
为什么不要直接把整段脚本丢给视频模型
一个 30 秒视频通常包含多个景别、动作和信息点。让模型一次生成整段,人物、产品、空间和镜头方向容易漂移,失败后也不知道该重做哪一部分。更可靠的方法是先拆成 4—7 个可独立验收的镜头。
第一步:把脚本压缩成一个目标
先写清视频给谁看、希望观众记住什么、最后要做什么。30 秒内容通常只能承载一个核心信息。把所有卖点都塞进去,会造成字幕过多、节奏混乱和镜头没有重点。
第二步:建立分镜表
每个镜头至少记录:
| 字段 | 要回答的问题 |
|---|---|
| 时长 | 这个镜头持续几秒? |
| 画面目标 | 观众这一刻必须看到什么? |
| 景别与机位 | 全景、中景、近景还是特写? |
| 主体动作 | 谁从哪里移动到哪里? |
| 运镜 | 固定、推进、横移还是跟随? |
| 旁白与字幕 | 声音传递什么,画面还需不需要文字? |
| 连续性 | 人物、服装、产品、光线哪些不能变? |
一个镜头只安排一个主要动作,例如“人物拿起杯子并看向窗外”,不要同时要求转身、奔跑、换装和环境变化。
第三步:先做静态关键帧
先生成每个镜头的起始画面,确认角色、产品、场景、构图和色彩。把所有关键帧排在一起看,能很快发现服装变色、产品比例变化和镜头方向冲突。静态图不稳定时,直接生成视频只会更贵。
第四步:写视频提示词
视频提示词重点描述可见动作和摄影机运动:主体是什么、从什么状态开始、完成什么动作、镜头怎样移动、环境哪些元素保持稳定。少用“震撼、电影感、顶级”这类无法验收的词,多写速度、方向、景别和结束状态。
示例:“中景,固定机位。白色桌面上的黑色耳机保持居中,人物右手从画面右侧缓慢进入,将耳机拿起并移出画面;背景与光线不变,动作自然,4 秒。”
第五步:低成本预演
先用较低分辨率、短时长或低成本模式检查动作和构图。只有镜头内容确认后,再生成高质量版本。失败镜头单独重做,不要因为一个手部动作错误而重算整条视频。
第六步:声音与字幕后置
旁白先确定节奏,再根据实际镜头微调;字幕通常在剪辑工具中添加,比让视频模型直接生成准确文字稳定。音乐、音效和转场应服务信息,不要用大量效果掩盖镜头不连贯。
常见失败原因
- 每个镜头包含太多动作;
- 没有固定角色和产品特征;
- 相邻镜头的视线与运动方向相反;
- 先追求高分辨率,后发现脚本本身不成立;
- 把准确文字、Logo 和复杂手部动作完全交给模型;
- 忽略生成素材、音乐、肖像和品牌的商用权利。
最终验收
逐镜头检查主体一致性、动作是否完整、产品是否变形、方向是否连续、字幕是否可读、声音是否盖住旁白。最后关掉声音看一遍,再只听声音走一遍;两种情况下核心信息都清楚,成片才算稳。