如果你这一两年有关注微短剧市场,应该已经感觉到一个新变化:AI 生成的微短剧越来越多。2026 年第一季度,国内新增微短剧里有超过 95% 在制作链路中使用了 AI 生成能力,这个比例即使存在统计口径差异,也已经说明一个很直接的结论——AI 微短剧不是小众尝鲜,而是成了内容供给的主力。对于编剧、剪辑、MCN 运营和工具开发者来说,现在值得认真研究一整套可复现的 AI 微短剧制作流程。
我先把一个判断放在前面:AI 生成比例高,不等于全自动。所谓“超过 95%”,统计的通常是有 AI 参与主要环节,比如剧本初稿、人物设计、画面生成、配音或者后期剪辑;真能把项目长期跑起来的团队,反而会把 AI 流程设计得非常克制,只在合适的环节让 AI 接管。这篇文章不讲行业叙事,按生产者视角,从环境、流程、参数、验收、排查一路拆到常态化管线。
1. 先弄懂这波“AI 微短剧”到底在涨什么
1.1 这不是简单的工具升级,而是生产方式更换
传统微短剧剧组要解决人的问题:演员档期、服装化妆、场地租用、灯光摄影、后期剪辑。AI 微短剧把其中很大一部分变成了“提示词、参考图、生成模型和批量任务”。同样做一个三分钟单集,传统剧组最少要几天,AI 流水线可以压缩到以小时计,前提是人已经把流程摸熟。
它并不是让所有人都不需要创作能力,而是让创作能力的重心从“组织现场”转向“定义输入和判断输出”。你要能写清楚人物、场景、情绪、镜头,也要能判断生成结果能不能用。这个能力和传统编剧、剪辑经验相关,但又不完全一样。
从行业现象来看,AI 微短剧并不只是出现在低成本供给端。现在很多专业团队、短剧平台、MCN 机构,也在用 AI 做前期概念片、批量测试选题、多语言版本,甚至直接做完整剧集。市场节奏越来越快,一周内要测试十个题材方向,过去很难做到,AI 让“先快速生成再看数据”成为可能。
1.2 超过 95% 这个数字怎么读
如果你看到“95% 的新微短剧由 AI 生成”,先不要理解成“95% 的内容已经完全不需要人”。在行业统计里,这个数字一般包括“AI 参与生成”。例如剧本由大模型产出初稿、人物和场景图由 AI 生成、后期配音由 TTS 完成、字幕和素材辅助由 AI 做,只要某个关键环节用了 AI,都可能被归入这个比例。
现实中,全自动生成的短剧还很难做到。多数团队的做法是:AI 提供海量初稿和中间素材,人工负责选题、审核、修改、拼接和发布。比例高说明 AI 的渗透率已经足够高,不代表每个环节都无人值守。
这里我想提醒两点。第一,对外宣传时要分清“AI 参与”和“完全 AI 生成”,不要把口径当成能力承诺。第二,内容平台对 AI 生成内容的展示和审核要求正在收紧,实际投放前要把规则看明白,否则制作效率再高,也过不了发布这一关。
1.3 谁最应该现在开始研究
第一类是编导和编剧。需要高频产出内容创意,AI 能帮他们把“点子”快速拆成分场剧本。第二类是剪辑和后期。过去要等拍摄素材,现在可以直接参与生成式工作流,可以在素材还没有“拍”出来之前,就开始设计节奏和叙事。第三类是 MCN 和内容运营。短剧本质是内容产品,必须用数据快速试错,AI 让试错成本明显下降。第四类是工具开发者。由于需求快速增长,很多团队想要内部交付流水线,你可以把这套流程接口化、队列化、产品化。
2. 从“能出片”到“能稳定更新”,先确认你的运行条件
2.1 本地、云端和在线平台怎么选
先想清楚自己是“学习验证”还是“批量生产”。
- 如果是学习验证,优先用在线平台。不需要本地显卡,只要注册账号、准备提示词、上传参考图,就能生成。缺点是排队和价格,不适合大量重试。
- 如果是本地部署,用途偏向探索可控性和隐私。常见图像生成模型在 12GB 以上显存可以跑,但要留有性能余量;如果机器只有 8GB 甚至更低,可以跑但要把分辨率降下来,使用精简模型,速度会比较慢。视频生成模型对硬件要求更高,本地搭建前要确认显存、内存、磁盘和模型依赖,不要只看模型下载大小。
- 如果是批量生产,建议使用云端 GPU 或在线平台的批量接口。云端的好处是可以弹性开多卡,缺点是网络传输、任务监控和成本跟踪都要额外做。不要一上来就开八卡并发,先用一张卡跑通,再逐步加。
我自己的经验是,第一批测试用在线平台最省事。把剧本、分镜、参考图全部准备好,再考虑要不要投入本地基建。先解决“能不能出片”,再解决“能不能规模化”。
2.2 软件栈和模型组合
AI 微短剧不是某一个模型完成的,而是由一条模型链完成。
| 生产环节 | 输入 | 常见工具/模型类型 | 输出 |
|---|---|---|---|
| 剧本 | 题材、人物、剧情走向 | 大语言模型 | 分集剧本、台词、分场表 |
| 分镜 | 剧本片段 | 大语言模型 / 表格工具 | 镜头列表 |
| 角色与场景 | 人物设定卡、场景描述 | 文生图模型 | 角色参考图、场景参考图 |
| 视频片段 | 参考图 + 动作提示词 | 文生视频、图生视频模型 | 5-10 秒视频片段 |
| 配音 | 台词文本 | TTS 语音合成 | 对白音频 |
| 后期 | 视频、音频、字幕 | 剪辑软件 / 合成工具 | 成片 |
这里不固定推荐某个具体模型,因为演进非常快。常见实践是:用大语言模型处理文本,用图像模型设计角色和场景,用视频模型生成动态画面,再用传统剪辑工具合成。只要每个环节能输出标准文件,就可以替换内部组件。反过来,如果某个平台把文本、图画、视频、配音全部封闭在一个界面里,也更方便新手起步,只是批量化和定制化能力通常会弱一些。
2.3 数据和素材准备:先建好人物设定卡和场景设定卡
很多人生成出来的角色第一集和第三集长得不一样,原因是提示词根本没有做到“受控”。要解决这个问题,建议先建立结构化的设定卡。
人物设定卡至少要有这些字段:
角色名:林然 年龄:28 外貌:黑色长发,五官立体,眼神犀利 服装:灰色风衣,黑色内搭,金色耳环 习惯动作:说话时习惯双手交叉放在桌面 场景风格:现代都市,职场,办公室 统一参考词:林然_职场_灰衣场景设定卡也需要单独维护:
场景ID:林然办公室_白天 画面描述:现代简约办公室,落地窗,窗边有城市天际线 光线:自然光,偏冷色调 道具:黑色办公桌,笔记本电脑,蓝色文件夹 统一参考词:办公室_白天_城市远景这些设定卡是给人类看的,也是给 AI 用的。你在文生图和视频生成时,把对应的设定卡作为参考描述写进提示词,人物一致性会比随手写一段描述稳定得多。批量任务尤其需要结构化,否则几百集素材最后根本没法管理和复用。
3. 一套最小可复现的 AI 微短剧制作流程
3.1 用大语言模型搭剧本和分集结构
微短剧单集通常在 1-3 分钟,目标是快速抓住注意力。AI 写剧本能写很快,但你需要给它足够明确的约束,否则会得到一堆空泛对话。
我给大模型的提示词一般包含这些元素:题材类型、主角和目标、集数、单集时长、节奏要求、结尾钩子。下面是一个可用的示例:
请帮我写一部面向短视频平台的现代都市情感微短剧,共6集,每集约60秒,台词控制在300-500字。 主角是28岁女性林然,职场管理层,性格冷静但家庭关系复杂。配角包括她的助手小周和前同事陈默。 要求: 1. 每一集要有独立冲突。 2. 前10秒必须有悬念。 3. 每集结尾留一个钩子。 4. 输出格式为分场脚本,包含场景、角色、动作、对白、镜头提示。 先从第1集开始。模型输出后,不要直接进入素材生成。先做三件事:检查角色说话口吻是否一致;删除可能引发平台审核问题的内容;把较长的对白拆短,因为视频生成模型很难处理长台词。改完初稿后,再把每一场拆成镜头。
3.2 把剧本拆成分镜表
分镜表是素材生成的“施工图”。一个 60 秒的单集,建议拆成 8-12 个镜头,每个镜头用一句话描述画面和动作。例如:
镜头1:中景,林然坐在办公室桌前抬头,表情冷淡,交代办公环境。 镜头2:近景,林然拿起手机,看到一条消息,眼神变化。 镜头3:特写,手机屏幕上出现“项目终止”四个字。 镜头4:侧面镜头,林然站起来走往窗边,停顿,背影。镜头数量不是越多越好,太长会增加生成成本,太短会显得画面碎。我一般每个镜头控制在 4-8 秒,方便后续剪辑时重排。拆完分镜后,手动给每个镜头补充镜头运动、光线和情绪,例如“缓慢推近”“手持晃动”“逆光”“从平静到紧张”。
3.3 生成角色参考图和场景参考图
生成分镜前,先要有稳定的角色参考图。常见做法是用文生图模型生成一张“标准正面照”,再基于这张图生成不同角度的形象,最后把统一参考图固定在提示词里。
提示词模板可以先这样写:
正面:女性,28岁,黑色长发,灰色风衣,黑色内搭,金色耳环,现代职场,浅景深,电影感,4K。 负面:变形手指,多余肢体,模糊,水印,文字。生成后检查服装、发型、脸型是否稳定。如果差异大,不要继续往下跑视频,先调整参考图。很多视频模型支持“图生视频”,你可以把角色参考图作为第一帧,再描述镜头动作。这样能减少从零生成的随机性。
场景图也一样,同一场景只保留一张基座图,后续镜头都围绕它变化角度和光线。批量生成时,确保每张图都写上场景 ID,不然后期很混乱。
3.4 生成视频片段
视频生成是成本和失败率最高的环节,它的操作逻辑是:输入参考图 + 动作提示词,输出一段短视频。这里需要注意:
- 时长不要一次生成太长。通常 5-8 秒效果更稳,超过 10 秒后人物变形、画面闪烁的概率会明显增加。
- 动作描述要单一。一个镜头只做一件事,例如“林然从椅子上站起来,转身看向窗外”,而不是“林然站起来、抱怨、再拿电话”。
- 用固定 seed 做回放。如果你发现有某个镜头的画面构图不错,只是动作不自然,尽量在同一个参数附近重跑,不要每次都换随机种子。
- 生成候选片段要留下记录。同一镜头可以生成 2-3 条候选,选择动作最自然的一条,其余删掉或归档,避免素材堆积。
我一般会先用 5-6 个镜头做小批量测试,确认质量后再继续。不要一次性提交 50 个镜头,然后看天吃饭。
3.5 配音、音效和字幕
配音用 TTS,生成对白时注意标点和停顿。很多 TTS 对长句处理不好,建议在台词里使用短句。例如“方案是什么时候改的?”比“你能不能告诉我这次方案到底是在什么时间节点改的?”更容易被 TTS 读得自然。
字幕建议单独生成 SRT 文件并在剪辑软件里叠加,不要在提示词里要求生成文字水印。模型生成的文字经常乱码,后期叠字幕反而更可控。
背景音乐和音效可以来自版权明确的素材库,或者在合规前提下用 AI 生成配乐。如果平台要求提供授权信息,要保留使用记录。
3.6 剪辑合成和发布验证
剪辑阶段和传统短剧差不多:先按叙事顺序排列镜头;前 3 秒放冲突或悬念;把节奏拖沓的长镜头剪掉;配音和画面要对齐;字幕不能超出安全区域。
输出建议用 H.264 编码的 MP4,分辨率按平台要求调整,常见是 1080p。发布前做一次完整目检,重点看:人脸是否出现突变、场景信息是否符合剧情、字幕是否有错字、有没有生成出莫名水印。
如果平台有 AI 生成内容标识要求,按平台提示完成标注。这是合规问题,不要抱有侥幸心理。
4. 关键参数和验收标准:别只看“能跑”
4.1 常用参数怎么调
有几个参数最容易影响结果:
- 分辨率:先 1280x720 测试,最后交付再用 1080p。不要在测试阶段把分辨率拉满,消耗资源且不利于快速迭代。
- 帧率:短剧一般 24fps 或 30fps。24fps 更有电影感,30fps 更适合竖屏资讯流。
- 片段时长:5-8 秒。越短越容易控制质量。
- Seed:固定 seed 可以在相似画面间保持一致性,也方便后期重跑。
- 负面提示词:包含“变形手指、多余肢体、模糊、文字、水印”等常见问题描述。
这些参数通常不需要每个人都理解底层原理,但建议把当前参数记录在素材管理表里,知道哪张图是用哪套参数生成的。否则遇到质量问题,你很难回滚或重做。
4.2 验收标准
素材能不能进入下一环节,应该有一套明确标准。我这里整理一份自用的验收清单:
- 人物和参考图相比,面部、服装、发型没有明显变化。
- 画面中不存在手指崩坏、肢体多余或场景穿插。
- 动作符合镜头描述,没有出现平移闪烁。
- 单个视频片段能循环播放、不出现明显跳帧。
- 配音语速正常,情绪和台词内容匹配。
- 字幕文字准确,没有多余空格和错字。
如果第一条不过,不要继续生成,先回到角色设定卡和参考图。如果第二条不过,可以考虑降低片段时长或重跑。如果多数片段都不过,可能要考虑更换当前使用的模型或换一种镜头描述方式。
4.3 成本和吞吐量估算
做一个 3 分钟短剧,假设每个镜头 8 秒,大约需要 22-23 个可用镜头。由于视频生成有失败率,按 50% 的通过率估算,实际生成量会到 40-50 条。把算力成本、时间成本和人工筛选成本都放进预算,才不会出现“生成几小时,最后没有一条能用的局面”。
越往批量走,越要关注任务队列和并发。不要无限制提高并发,因为在线平台有账号和排队限制,云端 GPU 也会出现显存或带宽瓶颈。建议先跑 10 条任务看平均耗时和成功率,再决定是否加并发。
4.4 内容审核和平台合规检查
AI 生成内容不是天然安全。台词、画面、角色形象都可能有风险。我的习惯是在 TTS 生成前先做台词敏感词过滤,在视频生成后做画面抽帧检查。如果生成的人物与真实人物高度相似,需要更换参考图或提示词。未经授权使用真实人物肖像、知名品牌、受版权保护的音乐,都可能成为发布环节的雷。
平台规则也在变化,发布前要查看每个平台对时长、清晰度、AI 标识、广告推广内容的要求。不是所有平台都能接受