AI 视频创作最近确实被讨论得很多,尤其是 AI 短剧这种形态,从剧本、分镜、画面生成到剪辑,基本上一个人就能走完整条制作链路。这次我们不空谈概念,直接拆一套完整的 AI 短剧制作流程:提示词怎么写、AI 绘画怎么出分镜图、图生视频怎么让画面动起来、最后怎么剪辑成片。整个过程面向零基础新手,也适合想批量产出短剧内容的运营人员。
这套流程用到的工具,本地部署和在线平台都能覆盖。文本提示词、图像生成、视频生成、剪辑成片,每个环节都有对应的落地方法。相比动辄上万的付费课程,核心操作其实就那几步,真正拉开差距的是提示词设计、分镜节奏和后期剪辑,而不是工具本身。
这篇文章会分为几个部分:核心能力速览、工作流全景、提示词设计、AI 绘画出图、图生视频、剪辑成片、批量任务、API 接入、性能观察和问题排查。每一步都给出模板、命令和验证方法,你可以直接照着跑。
1. 核心能力速览
先给一张速览表,方便判断这套流程适不适合你现在的情况。
| 能力项 | 说明 |
|---|---|
| 覆盖流程 | 剧本拆解、分镜设计、AI 绘画出图、图生视频、剪辑成片 |
| 主要模型形态 | 文生图模型、图生视频模型、文生视频模型,可根据实际效果选择 |
| 提示词工程 | 正向提示词、负面提示词、镜头语言描述、风格统一词 |
| 角色一致性 | 通过固定角色提示词、垫图、同一底图重绘等方式保持 |
| 批量能力 | 分镜批量出图、多镜头批量图生视频、后期批量导入剪辑 |
| API 接口 | 不同平台差异较大,通常支持 HTTP 接口调用,需按实际项目查看 |
| 硬件门槛 | 本地部署建议重点关注显存占用;在线平台对本地硬件要求较低 |
| 适合人群 | 零基础新手、短视频运营、短剧作者、想接触 AI 视频的开发者 |
| 主要瓶颈 | 角色一致性、动作幅度控制、长镜头稳定性、素材版权合规 |
接着明确一下:这套流程不是某个单一软件,而是一条“组合管线”。它的价值在于,把原来需要一个团队完成的工作拆成单人可以执行的步骤。你不用等编剧、不用等演员、不用等摄影,所有画面素材都可以通过工具生成,再进剪辑软件合成。
2. 适用场景与使用边界
AI 短剧不是万能的。它有非常值得做的场景,也有明显不适合的领域。
适合的场景包括:概念短剧,用于快速验证剧情、测试平台数据;小说推文视频,把文案内容视觉化,生产节奏快;账号批量运营,不同剧情方向并行测试,先跑通再优化;短视频广告和背景片段,作为素材补充,节省实拍成本。
不太适合的场景包括:一致性要求极高的长剧情剧集,纯 AI 生成很难保证主角每一帧都长一样,出片后需要大量修正;需要精准表演的镜头,AI 生成的动作往往是概率采样,无法像真人演员那样精确走位;商业级品牌广告,涉及产品外观、人物肖像、场景还原等,容错率很低。
使用边界要重点说,因为 AI 绘画和图生视频涉及素材生成。创作短剧时,如果使用了现实人物的照片做垫图、使用了他人版权作品做风格参考、或者使用了未经授权的音色和音乐,都可能引发法律风险。平台审核同样敏感,人物肖像、暴力、低俗、侵权内容都会导致限流甚至封号。正确的做法是:使用自己拍摄的素材、可商用素材库、或完全由 AI 生成且不模仿特定真人面部特征的内容,并保留创作记录。
3. 完整工作流全景
整个 AI 短剧流程可以拆成六个步骤。每一步的输出都会作为下一步的输入,任何一个环节做不好,都会影响最终成片。
3.1 剧本拆解
剧本不能直接丢给视频生成工具。你需要把每一段剧情拆成“镜头”,也就是分镜。分镜表里应该包含:镜头号、景别、画面内容、人物动作、台词、预计时长。建议第一版分镜不要追求文学性,用最直白的“谁在哪里做什么”来描述,越具体越好。
示例分镜表结构:
| 镜头号 | 景别 | 画面内容 | 人物动作 | 台词 | 预计时长 |
|---|---|---|---|---|---|
| 01 | 中景 | 现代都市办公室 | 女主坐在工位,抬头看向门口 | “你怎么来了?” | 3 秒 |
| 02 | 近景 | 办公室门口 | 男主走进来,手里拿着一束花 | “来给你送早餐” | 3 秒 |
分镜拆到这一步,后面所有提示词都有了依据。
3.2 分镜设计
分镜设计阶段要确定画面描述。你需要把每个镜头翻译成 AI 绘画能理解的视觉语言,包括场景环境、人物外貌、服装、光影、镜头角度。同一角色在不同镜头中的外貌描述必须保持一致,否则人物会“变脸”。
3.3 AI 绘画出图
把分镜文字转换成图像。这一步是所有动态画面的基础,图像质量直接决定视频质量。建议先批量生成所有镜头的关键帧,检查人物一致性和画面风格,有问题在这一步就重画,不要拖到视频生成阶段。
3.4 图生视频
把静态图变成动态视频。上传关键帧图片、输入动作描述提示词,让模型生成合理的动态效果。图生视频通常比直接文生视频更容易控制构图,因为画面主体和背景已经被确定下来了。
3.5 剪辑成片
把所有动态镜头导入剪辑软件,按分镜顺序排列,添加配音、背景音乐、字幕、转场和音效。这是最终品质把关环节,AI 生成镜头的抖动、抽帧、跳变都可以在这里做二次修正或重新生成。
3.6 审核与发布
成片导出前,检查素材版权、平台审核规则、音频授权和画面比例。短剧内容通常以 9:16 竖屏格式呈现,导出分辨率建议不低于 1080x1920。
4. AI 视频提示词设计
提示词是整个流程里投资回报率最高的技能。模型能力在短时间内不会有质变,但提示词写得好不好,效果差距非常明显。
4.1 提示词的基本结构
一个稳定输出的 AI 视频/图像提示词,通常包含几个模块:主体、动作、环境、景别与镜头、光影与氛围、风格词、画质词。这几个模块可以按固定顺序排列,方便批量修改和复用。
正向提示词模板示例:
一位年轻女性,黑色长直发,穿着白色衬衫,坐在现代风格办公室工位前 动作:抬头看向门口,表情从惊讶转为微笑 景别与镜头:中景,缓慢推近,浅景深 环境:明亮的办公室,落地窗外可见城市天际线,午后自然光 风格:写实电影质感,柔和色调,细节丰富 画质:4k,高清,高质量,电影级光影负面提示词模板示例:
模糊,低分辨率,变形,多余手指,面部扭曲,肢体不自然,画面闪烁,文字水印,logo,过度锐化负面提示词在 AI 绘画和视频生成里非常重要。如果不写负面提示词,模型很容易在手指、眼睛、边缘轮廓这些位置产生明显瑕疵。
4.2 镜头语言在提示词中的表达
短剧需要镜头感。提示词里可以通过景别词和镜头运动词来控制画面观感:特写适合情绪表达,近景适合对话,中景适合动作,全景适合交代环境。镜头运动方面,可以使用“缓慢推近”“镜头环绕”“手持轻微晃动”“俯拍视角”等描述。不是所有模型都能精确执行这些指令,但写上去比不写强,生成的随机性会往可控方向偏移。
4.3 不同题材短剧提示词参考
以古风短剧为例:
古装年轻男子,束发,身穿深蓝色长袍,站在落满雪的庭院中 动作:缓缓转身,望向镜头,眼神哀伤 环境:冬夜古庭院,飞雪,屋檐积雪,暖色宫灯 镜头:中景到近景,缓慢推进,镜头略带微光 风格:中国风写实,国风海报质感,高细节 画质:超清,电影感以都市情感短剧为例:
年轻男女在深夜便利店门口相对而立,男生拿着伞,女生背对镜头 动作:男生伸出手,女生侧头,边缘霓虹灯闪烁 环境:雨夜,街道湿润,便利店灯光透出,霓虹反射 镜头:远景到近景,慢速推近,电影感 画质:4k,高分辨率,细节清晰提示词并不是越长越好,更重要的是信息密度。场景、动作、光影这些核心描述要具体,形容词要服务于画面,而不是堆砌。
4.4 提示词的批量复用思路
写提示词时要考虑复用性。一个分镜表可能有几十个镜头,每个镜头逐字手写会消耗大量时间。建议维护三个清单:角色清单(固定的人物外貌描述)、场景清单(固定的环境描述)、镜头模板清单(可替换的镜头语言描述)。每次生成新镜头时,从清单里拼出提示词,而不是从零写起。
5. AI 绘画出图环节
提示词设计完成之后,进入 AI 绘画环节。这一步的目标是生成高质量的关键帧,而不是直接出最终画面。关键帧的质量越高,后续图生视频阶段的可控性越好。
5.1 文生图与图生图的选择
在生成第一批分镜时,通常优先使用文生图:输入完整的提示词,生成单张或多张候选图。如果某些镜头已经有一张不错的图,但构图、角度、色调需要微调,就使用图生图,把原图作为输入,配合局部重绘或重绘幅度调整。
图生图的优势在于稳定。人物姿势、场景结构、色彩基调已经固定,模型只负责在已有基础上做变化,生成结果不容易跑偏。
5.2 角色一致性方案
角色一致性是 AI 短剧制作中最大的痛点。同一角色在不同镜头里出现,理论上应该长得一样,但因为每次生成都是独立采样,很容易出现“千人千面”。常见的处理方案有三种:
第一种是固定角色描述词。把角色的外貌描述写成一个固定字符串,在全部镜头中复用:
短发年轻女性,丹凤眼,肤色偏白,穿着红色风衣这种方法实现成本最低,但一致性有限,适合角色特征足够鲜明的情况。
第二种是垫图方案。每次生成新镜头时,把一张确定好的角色正面图作为参考图一起输入,让模型参考人物长相。许多支持图生图的工具都支持参考图功能,本质上是用“图生图+提示词”的方式完成角色迁移。
第三种是同一底图重绘方案。对一个固定的角色全身图反复局部重绘,保持整体构图和人物结构不变,只修改局部动作、表情和环境。这种方式一致性最好,但灵活性最低。
对于零基础新手,建议先用固定角色描述词跑通全流程,后续再逐步加入垫图和局部重绘优化。
5.3 分辨率与输出格式
短剧通常以竖屏为主。生成关键帧时,建议分辨率接近 9:16 比例,比如常见的高宽比 1080x1920 或 720x1280。不建议直接生成超过模型能力范围的高分辨率,容易导致构图崩坏。更稳妥的方式是先生成较低分辨率,再通过超分工具放大。
输出格式建议使用 PNG 无损压缩格式,保留更多细节用于后续图生视频。生成批次建议每次至少出 2 到 4 张候选图,从中挑选构图和人物表情最自然的一张。
5.4 批量出图与目录管理
当镜头数量很多时,手动一张张生成会非常低效。建议搭建一个分镜目录结构,按“场景-镜头号-版本”组织图像文件。比如:
./project/dajiangtang/scene01/shot01_v1.png ./project/dajiangtang/scene01/shot01_v2.png目录名和文件名的命名规则要统一,后面做批量图生视频和剪辑导入时能省大量时间。如果使用的是支持批处理功能的工具,可以直接指定输入目录和输出目录,一次性处理多个分镜。
6. 图生视频环节
图生视频是整条流程中从静态转向动态的关键步骤。核心思路是:上传一张关键帧图片,再输入动作提示词,让模型补全画面中的运动过程。
6.1 图生视频的输入要素
一次典型的图生视频生成,通常需要四个输入:起始图片、动作描述提示词、运动强度、生成时长。起始图片就是 AI 绘画阶段生成的关键帧;动作描述要写清楚“谁在做什么动作”,比如“女主角低头看手机,然后抬头微笑”;运动强度控制画面变化的剧烈程度,值太高会导致人物形变,值太低会导致画面几乎不动;生成时长通常以秒为单位,单次生成时长越长约容易崩。
6.2 动作幅度与稳定性
图生视频最常遇到的问题是“一动不动”和“乱动”两个极端。如果你发现画面基本静止,优先检查动作提示词是否过于简略,或者运动强度参数设置过低。如果你发现人物肢体变形严重、背景扭曲,说明模型在有限步数内塞入了太多变化,此时应该减小动作跨度,把一个大动作拆成几个小动作,通过多个镜头拼接完成。
6.3 多镜头批量处理
短剧不可能只生成一个镜头。当分镜数量在二十个以上时,建议按“一个镜头一个任务”的方式批量提交。因为单次生成的时长有限,几乎每个镜头都要单独处理。先把所有分镜的关键帧准备好,统一命名,再逐个提交图生视频任务。此时命名的规范性直接影响效率。
6.4 首尾帧与连续动作
除了单张图片输入,不少图生视频工具还支持首尾帧模式:输入起始帧和结束帧,模型自动补全两帧之间的过渡动作。这在处理“进门走向座位”这类连续动作时很好用。首尾帧模式需要注意两点:一是起始帧和结束帧的画面结构不能差异过大,否则中间过渡会非常生硬;二是中间过程无法精确控制,接受范围内的自然运动即可,不必追求每一帧都完美。
6.5 图生视频与文生视频的取舍
文生视频适合没有明确画面基础、想从文字直接生成动态视觉的场景;图生视频适合已经有确定关键帧、需要让画面动起来的场景。在短剧制作中,图生视频的优先级更高,因为短剧首先要求角色和场景统一,直接用文生视频容易每段镜头都长得不一样,后期拼接很痛苦。更稳妥的做法是以 AI 绘画确定静态画面,再以图生视频补全运动。
7. 剪辑成片与视听语言
AI 工具负责生成素材,最终成片还是要进剪辑软件。这一步拼的是基础剪辑能力和视听语言素养。
7.1 剪辑软件选择
对零基础新手,推荐从剪映入手。它有自动字幕、背景音乐、转场模板和语音合成,学习和产出成本最低。需要更精细控制时,可以使用 Adobe Premiere 或 DaVinci Resolve。关键点不在于软件本身,而在于你是否把分镜表的顺序、时长、台词对齐到时间线上。
7.2 镜头组接原则
AI 生成的单镜头通常很短,多则几秒、少则一两秒。剪辑时要按“景别变化”的思路来组接,不要连续几个镜头都是同一个景别,否则视觉上会非常单调。可以按“全景交代环境、中景展示动作、近景表达情绪”的顺序编排,形成节奏感。镜头与镜头之间的切换可以加少量转场,但不要过度使用,AI 视频本身已经有较强的画面连续性,硬切往往比花哨转场更自然。
7.3 配音、字幕与音效
AI 短剧通常使用 AI 配音。配音文本要和台词严格对应,语速建议偏慢,给观众留出阅读字幕的时间。字幕建议使用剪映自动识别或手动输入,统一字体、颜色和位置,避免每段字幕风格不一致。背景音乐优先选择可商用曲库,音量不要超过人声。音效方面,脚步声、门声、环境声这类细节能明显提升成片质感,值得花时间加上。
7.4 画面比例与导出参数
竖屏短剧导出时,分辨率设置为 1080x1920、帧率 30fps、码率选择中等以上即可。如果工具支持“智能防抖”或“画面稳定”,可以对 AI 生成的轻微抖动镜头做一次处理。导出前完整播放一遍,重点检查字幕错别字、画面跳变、音画不同步和角色形象突变。
8. 接口 API 与批量任务
如果你的目标不只是手工做几条视频,而是想批量产出,或者把 AI 短剧流程接入到自己的内容生产工具中,就需要考虑接口调用和批量任务设计。
8.1 API 服务的通用接入思路
不同工具和模型平台提供的 API 差异较大,但基本结构类似:新建任务、提交参数、轮询任务状态、获取结果。建议先阅读目标平台的官方 API 文档,确认鉴权方式、请求地址、参数格式和回调机制。
下面给出一个通用版 Python 调用示例,实际使用时需要按项目 API 文档调整端点地址、请求头和字段名:
import requests import time API_URL = "https://your-api-endpoint.com/api/generate" API_KEY = "your-api-key" headers = { "Authorization": f"Bearer {API_KEY}", "Content-Type": "application/json" } payload = { "prompt": "年轻女性,黑色直发,白色衬衫,现代办公室,中景,电影感", "image_path": "./scene01_shot01.png", "negative_prompt": "模糊,变形,多余手指,水印", "duration": 4, "motion_strength": 0.6 } response = requests.post(API_URL, json=payload, headers=headers, timeout=120) task_id = response.json().get("task_id") print("任务ID:", task_id)提交任务后,用轮询方式查询状态:
status_url = f"{API_URL}/{task_id}" for _ in range(60): resp = requests.get(status_url, headers=headers, timeout=30) data = resp.json() state = data.get("status") if state == "SUCCESS": print("生成结果:", data.get("video_url")) break elif state == "FAILED": print("任务失败:", data.get("error")) break time.sleep(5)这个模板的价值在于演示了异步任务的基本交互模式:先创建任务拿到任务 ID,再轮询查询状态,最后在成功状态下获取产物地址。批量场景可以在这个基础上加一个任务队列。
8.2 批量任务队列设计
批量任务可以简单分为“串行处理”和“并发处理”。串行适合免费额度和限流较多的情况,一次只跑一个任务,不够高效但稳定。并发适合付费接口或本地部署资源充足的情况,可以同时跑多个任务,对程序稳定性要求更高。
一个稳妥的批量处理策略是:将全部分镜写入一个任务清单,程序逐个读取,先调用 API 判断输入文件是否存在、参数是否合法,再提交任务;任务状态变为失败时,自动记录错误信息并最多重试三次;全部完成后生成一个批次报告,列出每个镜头的状态、输出地址和失败原因。
{ "batch_name": "short_drama_ep01", "input_dir": "./frames", "output_dir": "./clips", "tasks": [ {"shot": "01", "image": "shot01.png", "action": "抬头看向门口"}, {"shot": "02", "image": "shot02.png", "action": "走进办公室"} ] }8.3 失败重试与稳定性
接口调用失败通常有三种原因:网络抖动、服务端限流、参数不合法。前两种可以通过重试缓解,第三种需要修改程序逻辑。建议每个任务记录提交时间和重试次数,连续失败超过设定阈值时,将任务标记为需人工检查,而不是死循环重试。
9. 资源占用与性能观察
本地部署 AI 绘画和视频生成模型时,资源占用是绕不开的话题。但这里要提醒一句:显存占用数值高度依赖模型版本、分辨率、步数、生成时长和采样器类型,不同设备差异很大。建议不要照搬任何网上的“固定显存数字”,而是学习如何自己观察和分析。
9.1 显存占用观察方法
在本地运行推理任务时,可以通过任务管理器(Windows)或nvidia-smi命令实时查看 GPU 显存占用:
watch -n 1 nvidia-smi启动服务后,先记录空闲显存占用,再提交一个最小测试任务,观察生成过程中显存峰值和生成结束后的回落情况。如果显存不够,优先降低分辨率、减少生成时长、降低运动强度参数,这是最有效的降显存手段。
9.2 CPU 推理与 GPU 推理
CPU 推理基本不需要显存,但速度会慢很多,只适合测试环节或极小规模任务。GPU 推理速度快,但显存不足时会直接报错或把任务卡死。如果使用的是在线平台,本地资源占用几乎可以忽略,主要关注网络请求效率和任务排队时间。
9.3 性能瓶颈观察建议
影响图生视频生成速度的关键因素通常包括:分辨率、单次生成时长、运动强度、模型复杂度。分辨率提高一倍,显存和计算量可能上升数倍;单次生成时长越长,越容易出现显存不足或生成失败。第一次使用时,建议使用最小参数组合跑通流程,再逐步加大参数,观察显存占用的变化。
10. 常见问题与排查方法
AI 短剧制作过程中会遇到大量问题。下面整理一份排查清单,按现象分类。
| 问题现象 | 可能原因 | 排查方式 | 解决方案 |
|---|---|---|---|
| 生成的人物每帧都不同 | 角色描述词不一致 | 检查提示词中人物外貌描述 | 固定角色描述词,加入垫图参考 |
| 画面几乎不动 | 动作提示词太弱或运动强度过低 | 查看生成参数 | 增强动作描述,提高运动强度 |
| 动作变形、肢体扭曲 | 单次生成变化幅度过大 | 查看输出帧序列 | 拆分动作,缩短生成时长 |
| 图像模糊 | 分辨率不足或放大过度 | 查看输入图像尺寸 | 使用原始高清图片,减少放大倍数 |
| 本地生成报显存不足 | 输入参数超过显存上限 | 查看显存峰值 | 调低分辨率、减少时长、关闭多余程序 |
| 生成任务长时间无响应 | 服务被限流或排队 | 查看任务日志 | 等待重试,或降低并发数量 |
| 提示词描述很详细但效果不行 | 模型对语法理解有限 | 简化表述并增加明确的动作词 | 使用短句和直观名词,少用抽象修辞 |
| 成片画面闪烁 | 多个镜头风格差异大 | 检查关键帧风格是否统一 | 统一光影、色调、风格词 |
更复杂的排查,比如模型版本不兼容、依赖安装失败,需要先看服务的启动日志。日志里没有明显报错,再检查模型文件是否放置正确、依赖版本是否对应、端口是否被占用。启动失败时,优先检查端口的占用情况:
# Linux / macOS lsof -i :7860 # Windows netstat -ano | findstr 7860如果端口被占用,可以换一个端口启动。服务启动成功但页面访问不了,通常是服务进程没有正常监听,要回到终端查看完整日志。
11. 最佳实践与使用建议
把整个流程跑通之后,可以按照下面的工程化思路持续优化。
11.1 建立最小可运行配置
第一次不要尝试制作完整短剧。先选一个镜头,从提示词设计、AI 绘画、图生视频到剪辑,完整走一遍。确认这条链路没有断点,再扩大到整段剧情。最小可运行配置是排错的基础,后续所有优化都基于它展开。
11.2 模型文件、输入素材与输出结果分目录管理
强烈建议把流程中的三类文件分开存放:模型与工具文件、输入素材(分镜表、提示词、参考图)、输出结果(关键帧、动态片段、成片)。目录命名使用日期和场景编号,例如20250120_ep01_scene01,避免后期找不到文件。
11.3 批量任务加日志和失败重试
批量生成时必须记录日志。日志里要包含任务 ID、输入文件名、状态、输出地址、失败原因和重试次数。没有日志的批量任务就是黑盒,失败后无法定位问题。建议复制原始输出目录后,再删除不需要的任务记录,避免操作失误。
11.4 涉及人脸、声音、版权素材必须确认授权
这个话题再强调一次也不为过。AI 绘画和视频生成中,使用真人照片做垫图、使用带商标的物品、使用受版权保护的台词和背景音乐,都可能构成侵权。商用短剧在发布前,要把所有素材的来源和授权情况过一遍。养成习惯:能自产就自产,能商用就商用,不明确的素材不采用。
11.5 发布和商用前要做效果复核
AI 生成的内容在导出前需要完整播放一遍,重点看字幕错别字、音画同步、角色一致性、镜头转场是否自然。平台审核规则也要考虑,发布前可以通过预览权限检查是否存在敏感画面。建议制作“同行评审”环节,找 2 到 3 个人提前看片,收集真实的观感反馈,再决定是否发布。
11.6 提示词库与分镜模板持续沉淀
完成几个短剧之后,你会积累一批常用的角色描述、场景描述、镜头语言模板。把这些内容整理成自己的提示词库,后续创作速度会明显提升。分镜模板也一样:冲突开场、反转结构、情感发展,都可以拆成可复用的模板,让批量生产短剧成为可能。
12. 总结与下一步
这套流程最值得尝试的点,是把短剧制作从“团队协作”压缩成“单人生产线”。你不需要会写复杂剧本,不需要有演员和场地,只要掌握提示词设计、AI 绘画、图生视频和剪辑四个核心环节,就能完成一条完整的 AI 视频短剧。
最先应该验证的功能是“单镜头全流程”:从一个分镜表条目出发,完成一张关键帧和一段视频片段。这一步跑通之后,再扩展到多镜头、批量任务和 API 接入。
最容易踩的坑有两个:一个是提示词写得太笼统,导致画面风格不可控;另一个是跳过了 AI 绘画直接依赖文生视频,导致角色一致性问题集中爆发。把这两个问题前置解决,后面的工作会顺利很多。后续可以继续扩展的方向很多:角色一致性工作流、视频超分与修复、自动化批量剪辑、多平台发布接口集成等。先用最小配置跑通,再逐步升级,才是零基础入门 AI 短剧的正确姿势。