AI漫剧是最近半年很吃香的一种内容形态。它把网文里常见的穿书、系统、攻略、打脸情节,用 AI 绘制的画面加上微动态、配音和字幕做成几分钟一集的短内容。很多人最开始以为 AI 漫剧的难点在画图,真正上手之后才会发现,最卡人的其实是角色一致性、分镜编排、配音情绪和剪辑节奏。这篇内容我拿一个典型题材来完整拆一遍制作流程,就是“穿成将军嫡女绑定废柴攻略系统,直接摆烂躺平,系统惩罚全部转嫁到战神身上,高冷将军反倒开启疯狂自我攻略模式”。
适合谁看?想做 AI 漫剧但还没有跑通过完整流程的新手,以及已经能生成单张图、但一进到多镜头叙事就乱套的人。最值得关注的点是:AI 漫剧不是“一键生成视频”,它是一条可以拆开控制的流水线;你不需要把每个环节都做到极致,但必须把角色、情绪和叙事节奏这三件事控住。下面按实际落地顺序拆一遍。
1. 先想明白:AI漫剧到底在做什么,和短剧、动态漫有什么区别
1.1 为什么“穿书+攻略系统+摆烂躺平”适合做 AI 漫剧
这段剧情非常有代表性。穿书、系统、攻略、摆烂、转嫁惩罚、自我攻略,每一个元素都是网文平台验证过的高热度标签。AI漫剧不需要像真人短剧那样搭实景、找演员、跟组拍摄,也不需要像传统动画那样逐帧手绘。它只需要把文字剧情按镜头拆开,生成静态画面,再让画面产生一点点动态就可以叙事。因为观众看这类内容时,脑补能力在线,只要情绪和台词给到,一点轻微的动态就会觉得“它在演”。
这类题材对动作连贯性的要求不高。动作戏、打斗场面在AI漫剧里最容易翻车,但摆烂、躺平、系统惩罚弹窗、高冷将军自我攻略这类戏,大多是室内对话和情绪反应,镜头数量少,人物切换少,制作压力会小很多。
1.2 完整生产流程一览
一条AI漫剧的生产链路可以这样拆:
从剧本到分镜,再到角色设定、AI绘画、素材动态化、配音配乐、剪辑字幕,最后才是发布。这个顺序不建议乱。先定剧本和分镜,再做人设和出图,然后是动态化、配音、剪辑。
为什么一定要按这个顺序?因为 AI 漫剧本质上是用画面去完成叙事。你先把故事拆成镜头,才知道需要生成哪些图;先把角色定住,才知道每个镜头里的人物长什么样;先把台词写好,才知道配音的情绪在哪里。很多新人经常反过来,先到处生成好看的图,再凑剧情。这样最容易出现两个问题:图很漂亮,但剧情连接不上;角色不统一,每张图都像换了一个人。正确的做法是先画流程,再填内容。
1.3 工具清单与硬件条件
AI漫剧不需要每个人都使用同一套工具,但需要覆盖以下能力。
| 环节 | 常用工具/方案 | 用途 |
|---|---|---|
| AI绘图 | Midjourney、Stable Diffusion、通义万相、即梦 | 生成角色、场景、关键帧 |
| 图生视频 | 可灵、即梦、Runway、Stable Video Diffusion | 让静态图产生小幅度动态 |
| 配音 | 剪映自带配音、Edge TTS、ChatTTS、ElevenLabs | 生成角色台词 |
| 剪辑 | 剪映、必剪、PR、DaVinci | 合成视频、字幕、音效 |
| 项目管理 | Excel、飞书表格、Notion | 维护分镜表、角色卡、批次记录 |
硬件条件不需要很高。纯用云端工具,普通笔记本就可以做。如果要在本地跑 Stable Diffusion,推荐显存 8GB 以上,内存 16GB 以上,磁盘至少留 30GB。显存不够时,把分辨率降到 512×768 或 720p,把批量数量调小,也可以出素材。
注意:工具名和具体功能会随版本变化。这里不评价谁最好,建议先把手头能免费用或已买的工具跑通,再决定要不要换。
2. 剧本和分镜怎么拆:把穿书爽文变成可执行的镜头表
2.1 从小说梗概到一页纸剧本
标题只给了故事走向,实际制作前需要把它展开成“一页纸剧本”。一页纸剧本不是文学创作,而是按时间顺序列出:
主角是谁、发生了什么、情绪如何变化、转折点在哪里、结尾停在哪个钩子。
对于“穿成将军嫡女绑定废柴攻略系统”这个题材,可以这样展开:
- 女主苏晚穿越到将军府嫡女身上,绑定“废柴攻略系统”。
- 系统要求她去攻略高冷战神将军,女主选择摆烂躺平。
- 系统惩罚出现,但被转移到了战神身上。
- 战神被惩罚搞得生活各种不顺,反而开始注意到女主,开启自我攻略。
- 结尾停在一个钩子:战神主动来找女主,女主内心慌,但表面无所谓。
一页纸剧本里要标出不同段落的节奏。前 3 秒必须出人物和冲突,中间每隔 10 到 15 秒要有一个笑点或情绪点,结尾留钩子。这样观众才不会划走。
2.2 分镜表要包含哪些字段
好的分镜表可以让后期避免大量返工。建议一开始就包含这些字段:
| 镜号 | 时长 | 景别 | 画面内容 | 台词 | 情绪 | 音频/音效 | 提示词要点 |
|---|---|---|---|---|---|---|---|
| 1 | 3s | 全景 | 将军府门前,女主醒来 | 内心OS:我怎么在这里 | 茫然 | 风声、鸟鸣 | 古代府邸、清晨、雾气 |
| 2 | 3s | 近景 | 系统面板凭空出现 | 系统:请攻略战神 | 惊愕 | 弹窗提示音 | 蓝色半透明面板、古风房间 |
| 3 | 4s | 中景 | 女主听完任务,翻白眼躺倒 | 女主:麻烦,不想干 | 摆烂 | 轻快音效 | 女主躺床、无奈表情 |
分镜表不需要写得像文学剧本那样长,但要能直接喂给AI绘图工具。也就是说,“画面内容”要能转成提示词,不能只写“女主很漂亮”。
2.3 用标题里的剧情做一套分镜示例
下面给一个 60 秒左右的分镜示例,适合做成第 1 集的引子。时长是估算值,实际按配音节奏调整。
| 镜号 | 时长 | 景别 | 内容 | 情绪 |
|---|---|---|---|---|
| 1 | 4s | 全景 | 古风将军府,清晨,女主坐在床边 | 茫然 |
| 2 | 3s | 近景 | 系统面板弹出 | 惊讶 |
| 3 | 4s | 中景 | 女主听完任务,翻白眼躺倒 | 摆烂 |
| 4 | 3s | 近景 | 系统警告:惩罚启动 | 紧张 |
| 5 | 4s | 中景 | 战神在校场打喷嚏,长枪脱手 | 困惑 |
| 6 | 4s | 近景 | 女主发现惩罚被转移,偷笑 | 得意 |
| 7 | 5s | 近景 | 战神回头看了一眼女主方向 | 若有所思 |
| 8 | 3s | 特写 | 女主眼神躲闪,内心OS:别看我 | 慌乱 |
这套分镜的节奏是:建立身份、出现任务、女主反套路、系统惩罚、意外转移、钩子。第一集不一定讲完整个攻略,停在“战神开始注意到女主”就够了。
2.4 每个镜头的“为什么”
为什么要先定景别?因为 AI 绘图对景别非常敏感。同样一句“女主在房间”,近景和全景生成的构图完全不同。先定景别,提示词才有的放矢。
为什么要先定情绪?因为情绪决定光影、表情和动作描述。比如“女主偷笑”和“女主翻白眼”是两个完全不同的画面方向,先写情绪可以避免生成表情时不知道往哪个方向调整。
在实际操作中,我一般会把分镜表放到表格里,每一行对应一个镜头。出图时把“提示词要点”单独提出来生成,然后回到表格里标记哪些镜头成功、哪些需要重出。这个表格做完,后面的工作就不再依赖记忆,而是按表执行。
3. 角色设定与提示词:先锁死形象,再谈画面质量
3.1 角色一致性为什么是 AI 漫剧的第一道坎
AI 漫剧翻车率最高的问题,不是画面不够精致,而是同一个角色在不同镜头里长得不一样。前一秒鹅蛋脸杏眼,后一秒长脸圆下巴;上一场是浅蓝长裙,下一场变成深色短打。观众很难建立代入感。
解决办法不是靠运气反复抽卡,而是做一张“角色卡”。角色卡包含外貌、服装、发型、标识物、表情方向,以及固定关键词。之后每个镜头都使用同一套角色描述,关键镜头用参考图垫图。
这个步骤不能省。尤其是系统面板、惩罚特效这类后期要叠加的元素,如果角色不稳定,叠加得越多越违和。
3.2 人设提示词怎么写
提示词不是写得越多越好,但关键属性要写清楚。拿“苏晚”举例,一份可复制的角色卡可以这样组织:
角色:苏晚,将军府嫡女,穿越者 外貌:黑色长发,高马尾,银色发簪,鹅蛋脸,杏眼,眉尾略上扬 服装:浅蓝色窄袖长裙,袖口银白云纹,白色束腰 气质:慵懒,微挑眉,眼带狡黠,偶尔无语望天 固定标记:银色发簪,浅蓝长裙,云纹袖口每次出图时,把这段描述放在提示词开头,然后再加当前镜头的场景、景别和动作。比如镜头 3:
苏晚角色卡,躺在古代雕花床上,翻白眼,双手枕在脑后, 表情不耐烦,阳光从窗棂照进来,中景,中国古风插画,柔和光影这里不要只写“一个美女”。AI 会把“美女”理解成一切能想到的形象,气质完全不受控。写得越具体,越容易维持统一。
3.3 参考图、垫图、局部重绘的配合方式
光靠文字提示词很难做到百分之百一致。更稳妥的做法是:
- 先用角色卡生成 3 到 5 张正面正脸图,选一张最接近预期的作为“角色基准图”。
- 出正式分镜时,把基准图作为参考图/垫图,再叠加当前镜头的提示词。
- 如果参考图风格太强,导致镜头表情僵硬,就用局部重绘只改表情或动作,不要整图重来。
- 有些工具支持种子值锁定,找到稳定的种子后,后续同角色镜头尽量沿用。
这里不同工具的功能名称不一样。有的叫参考图,有的叫垫图,有的叫角色特征,没有统一的行业命名。但思路是一致的:先固定基准形象,再通过局部调整控制情绪和动作。
注意:不要一上来就追求所有镜头完全一致。完全一致会损失动态感和叙事感,只要观众能认出“这是同一个人”,制作效率就够用了。
4. 从静态图到动态镜头:生成素材的三种路线
4.1 路线A:只做微动态
AI 漫剧不是每一帧都靠视频模型生成。很多镜头只需要“微动态”:头发飘一下、衣摆动一下、眼睛眨一下、镜头缓慢推近。这类镜头用图生视频里的低幅度运动参数就可以完成。
优点:速度快、不容易崩、画质保持好。缺点:动作幅度小,不能表达激烈冲突。
适合:对话、情绪戏、系统面板出现、将军发呆这些场景。
4.2 路线B:图生视频
如果剧情里需要明显的动作,比如战神长枪脱手、女主倒头躺下、系统面板震动,可以让模型生成 2 到 5 秒的短视频片段。图生视频的输入是静态图加一段动作提示词,输出是带动态的视频素材。
常见参数可以这样设置:
| 参数 | 建议值 | 说明 |
|---|---|---|
| 分辨率 | 720p 起步 | 先保证能跑通,再考虑1080p |
| 帧率 | 12fps 到 16fps | 漫剧不需要30帧,帧率太高反而容易崩 |
| 运动幅度 | 低或中 | 幅度大时脸和手容易变形 |
| 镜头运动 | 推、拉、摇 | 避免复杂的穿越机镜头 |
| 时长 | 3秒左右 | 太长了内容不可控 |
提示词示例:
镜头缓慢推进,女主的头微微转过来,眼神从无辜变成狡黠, 长发和袖口轻轻飘动,窗帘在风中摆动,古风房间,浅蓝色长裙这里最容易犯的错是运动幅度拉满。画面确实动了,但脸也跟着变形,后期根本没法修。宁可让动作保守一点,多切一个镜头,也不要在一个镜头里要求太多。
4.3 路线C:局部重绘+转场
并不是每个镜头都需要生成完整动态。转场可以用剪辑完成:画面平移、缩放、淡入淡出、叠加系统 UI 动画,都会让观众觉得“有动态”。
比如“系统惩罚被转嫁到战神身上”这个点,不需要直接画“惩罚转移”的完整过程,可以拆成两个镜头:女主这边出现惩罚提示,战神那边长枪脱手。两组画面快速切换,就能让观众理解因果,同时绕开动态生成的难点。
4.4 资源占用:低配机器怎么试
如果机器只有 8GB 显存,先把分辨率降到 512×768 或 720p,一次只生成一个镜头。不要开大批量,10 张一批容易爆显存。云端工具则优先考虑免费额度,先用小尺寸参数验证提示词,确认效果后,再生成最终素材。
判断标准很简单:单镜头出片时间在可接受范围内、五官没有明显崩坏、动态合理,就可以继续下一镜。如果单镜头反复失败,先按第 7 章的排查路线处理。
5. 配音、配乐和字幕:让观众“看进去”而不是只看画面
5.1 配音情绪怎么调
画面合格只是第一步。AI 漫剧能不能吸引人往下看,配音情绪影响非常大。拿这个题材来说:
- 女主的语气要懒洋洋、不耐烦,带一点“你随便罚我都不在乎”的松弛感。
- 战神的声音要低沉、克制,不能炸,因为他是高冷人设。自我攻略时的语气是“嘴上冷静,内心开始在意”。
- 系统的提示音要机械、冷冰冰,和女主情绪形成反差。
使用 TTS 工具时,我会先选一个接近角色的声音,然后分别试听三句话。不要整段一次读完。第一遍只用一句话测试语速和音色,确定满意后再生成全部台词。
情绪不对时,可以通过标点符号、停顿词、速度参数来调整。比如“系统?麻烦你下次换个人坑。”比“系统麻烦你下次换个人坑”更容易让模型读出停顿感。
5.2 音效与 BGM 节奏
AI 漫剧不能只看画面和台词,音效决定了“爽点”能不能落地。
- 系统弹窗:用急促的电子提示音。
- 惩罚启动:用低鼓或警报音。
- 战神长枪脱手:用金属碰撞声加一个停顿。
- 女主偷笑:用轻快的拨弦或木鱼声。
- BGM 选择:前期轻快、中期悬疑、结尾留一个轻挑的收拍。
卡点位置通常在镜头切换处。我的习惯是先把配音轨道放好,再把 BGM 的鼓点对准每个镜头的第一帧,最后用淡入淡出处理音效,不要所有声音一起压上去。声音堆太满,反而会让爽点变糊。
5.3 字幕与画面同步的三个检查点
字幕是 AI 漫剧里容易被忽视但影响很大的环节。导出前至少检查三个点:
- 字幕不要压住人脸,尤其是下半张脸。系统设置里可以调整安全边距。
- 字幕断句要跟配音一致。不要出现配音已经说完、字幕还停在上一句。
- 错别字和标点。自动识别容易出现同音字错误,发布前必须肉眼扫一遍。
如果用了自动字幕,不要默认它能一次全对。自动字幕只是初稿,最终还是要手动过一遍。
6. 剪辑成片与发布前检查:先跑通单集,再谈批量生产
6.1 单集剪辑顺序
我推荐的剪辑顺序是:先排镜头,再配音,再配乐,然后加音效和字幕,最后统一调色。
先排镜头:把分镜素材按时间轴顺序放好,粗剪成一条叙事线,此时不纠结细节。 再配音:把旁白、台词、内心 OS 放上去,同时调整每个镜头的时长,让画面配合声音。 再配乐:根据配音节奏铺 BGM,不要让 BGM 盖过人声。 然后加音效和字幕:系统提示音、环境音、转场音,逐个加。 最后调色导出:保持统一色调。不要每个镜头都是完全不同的明暗。
这个顺序的好处是,任何一步出问题,都不需要从头再来。比如配音超时,只需要动画面时长,不需要重新构图。
6.2 批量生产时最容易忽略的问题
当你要做很多集时,节奏会变成另一个问题。常见坑点有:
- 文件命名混乱。建议每集一个目录,素材按“集数_镜头号_版本”命名,比如 S01E03_005_v2。
- 没有失败重试机制。单集可以手动重出,批量时必须有重新生成的批次记录。
- 输出目录不统一,后期找图找不到。建议建一个“分镜表/角色卡/素材/成片”的固定目录结构。
- 没有验证清单。别指望上一集顺利,这一集就能直接发布。每集都要过一遍画面、声音、字幕。
如果流程足够稳定,可以把剪辑模板设定好,后续每一集只需要替换素材和配音,就能接近一键成片。这里的“一键”不是 AI 工具自动帮你把整部剧写出来,而是把你自己的生产 SOP 固化下来,减少重复操作。
6.3 成品验证清单
导出成片之前,可以按这个清单过一遍:
- 角色是否还认得出是同一个:发型、服装、脸型有没有明显变化。
- 画面是否出现大面积崩坏:手指、眼睛、文字、兵器。
- 配音是否清楚:有没有喷麦、吞字、音量不平衡。
- 字幕是否遮挡人脸:上下边缘是否安全。
- 时长是否合适:单集控制在 60 到 120 秒,流量效率更高。
- 结尾是否有钩子:如果没有,观众看完不会关注下一集。
发布到平台前,还要注意标题、封面、简介是否符合平台规则,不要使用诱导性话术。生成内容如果涉及肖像、版权、敏感素材,要提前规避。
7. 常见翻车现场和排查链路
7.1 人物脸崩、服装变化、眼睛变形
现象:同一角色在不同镜头里长得不一样,或者同一个镜头里五官变形。
排查顺序:
- 先检查参考图。角色基准图是否足够清晰、正面、无遮挡。如果基准图本身是侧脸,后面各镜头都会跑偏。
- 再检查提示词。角色卡是否放在开头,有没有被长场景描述冲淡。有些工具提示词越长,前半段权重越高。
- 检查采样参数。分辨率过低、运动幅度过大、批量过小都会让脸部崩坏。
- 检查是否用了不同的工具。不同模型对“大眼睛”“高马尾”的理解不同,同一集尽量固定一个绘图模型。
7.2 声音和情绪不匹配、口型对不上
现象:画面是高冷战神,配音却像推销员;画面是女主偷笑,配音却像念课文。
排查顺序:
- 先重新听一遍配音,确认角色音色是否符合人设。
- 再看台词文本是否有标点、断句、语气词。TTS 很依赖文本分层。
- 口型不一致:AI 漫剧不需要完美口型,只要说话时嘴部有轻微动态即可。如果嘴部完全不动,切一个近景嘴巴特写镜头来补。
- 最后看时间轴:判断配音和画面对没对上,可能是素材时长不够,需要拉长镜头或加转场。
7.3 导出失败、画质差、时长不够
现象:剪辑预览正常,导出一半失败;或者导出后画质下降严重;或者内容不足 60 秒。
排查顺序:
- 先检查磁盘空间和导出路径。磁盘满、中文路径、权限不足都会导致导出失败。
- 检查工程分辨率。预览用 720p,导出却选 4K,可能造成卡死或内存不足。
- 时长不够通常不是技术问题,是分镜数不够。60 秒大约需要 12 到 16 个镜头,每个镜头 4 到 5 秒。如果镜头太少,就补过渡镜头,不要硬拉长单个镜头。
- 画质差:先确认原始素材分辨率,再看导出码率。很多平台会压缩二次编码,原始素材 1080p,导出码率 8Mbps 以上,压缩后才会比较清楚。
7.4 排错顺序总结
AI 漫剧的报错,很多看起来像工具问题,实际是前置条件问题。我的习惯排错顺序是:
先看输入材料,再看提示词和参考图,接着看参数设置,然后看工具版本,最后才怀疑模型能力。
大多数翻车都发生在输入侧。分镜表写得模糊、角色卡不统一、参考图质量差,再好的工具也会输出不稳定结果。
踩过几次之后会发现,AI 漫剧真正考察的不是哪个模型更强,而是你有没有把内容流程管清楚。先跑通一条 60 秒单集,再优化画质和批量,是目前最稳的上手路径。