AI漫剧制作全流程:从分镜到角色一致性,拆解短剧生产链路
2026/8/30 8:11:05 网站建设 项目流程

AI漫剧是最近半年很吃香的一种内容形态。它把网文里常见的穿书、系统、攻略、打脸情节,用 AI 绘制的画面加上微动态、配音和字幕做成几分钟一集的短内容。很多人最开始以为 AI 漫剧的难点在画图,真正上手之后才会发现,最卡人的其实是角色一致性、分镜编排、配音情绪和剪辑节奏。这篇内容我拿一个典型题材来完整拆一遍制作流程,就是“穿成将军嫡女绑定废柴攻略系统,直接摆烂躺平,系统惩罚全部转嫁到战神身上,高冷将军反倒开启疯狂自我攻略模式”。

适合谁看?想做 AI 漫剧但还没有跑通过完整流程的新手,以及已经能生成单张图、但一进到多镜头叙事就乱套的人。最值得关注的点是:AI 漫剧不是“一键生成视频”,它是一条可以拆开控制的流水线;你不需要把每个环节都做到极致,但必须把角色、情绪和叙事节奏这三件事控住。下面按实际落地顺序拆一遍。

1. 先想明白:AI漫剧到底在做什么,和短剧、动态漫有什么区别

1.1 为什么“穿书+攻略系统+摆烂躺平”适合做 AI 漫剧

这段剧情非常有代表性。穿书、系统、攻略、摆烂、转嫁惩罚、自我攻略,每一个元素都是网文平台验证过的高热度标签。AI漫剧不需要像真人短剧那样搭实景、找演员、跟组拍摄,也不需要像传统动画那样逐帧手绘。它只需要把文字剧情按镜头拆开,生成静态画面,再让画面产生一点点动态就可以叙事。因为观众看这类内容时,脑补能力在线,只要情绪和台词给到,一点轻微的动态就会觉得“它在演”。

这类题材对动作连贯性的要求不高。动作戏、打斗场面在AI漫剧里最容易翻车,但摆烂、躺平、系统惩罚弹窗、高冷将军自我攻略这类戏,大多是室内对话和情绪反应,镜头数量少,人物切换少,制作压力会小很多。

1.2 完整生产流程一览

一条AI漫剧的生产链路可以这样拆:

从剧本到分镜,再到角色设定、AI绘画、素材动态化、配音配乐、剪辑字幕,最后才是发布。这个顺序不建议乱。先定剧本和分镜,再做人设和出图,然后是动态化、配音、剪辑。

为什么一定要按这个顺序?因为 AI 漫剧本质上是用画面去完成叙事。你先把故事拆成镜头,才知道需要生成哪些图;先把角色定住,才知道每个镜头里的人物长什么样;先把台词写好,才知道配音的情绪在哪里。很多新人经常反过来,先到处生成好看的图,再凑剧情。这样最容易出现两个问题:图很漂亮,但剧情连接不上;角色不统一,每张图都像换了一个人。正确的做法是先画流程,再填内容。

1.3 工具清单与硬件条件

AI漫剧不需要每个人都使用同一套工具,但需要覆盖以下能力。

环节常用工具/方案用途
AI绘图Midjourney、Stable Diffusion、通义万相、即梦生成角色、场景、关键帧
图生视频可灵、即梦、Runway、Stable Video Diffusion让静态图产生小幅度动态
配音剪映自带配音、Edge TTS、ChatTTS、ElevenLabs生成角色台词
剪辑剪映、必剪、PR、DaVinci合成视频、字幕、音效
项目管理Excel、飞书表格、Notion维护分镜表、角色卡、批次记录

硬件条件不需要很高。纯用云端工具,普通笔记本就可以做。如果要在本地跑 Stable Diffusion,推荐显存 8GB 以上,内存 16GB 以上,磁盘至少留 30GB。显存不够时,把分辨率降到 512×768 或 720p,把批量数量调小,也可以出素材。

注意:工具名和具体功能会随版本变化。这里不评价谁最好,建议先把手头能免费用或已买的工具跑通,再决定要不要换。

2. 剧本和分镜怎么拆:把穿书爽文变成可执行的镜头表

2.1 从小说梗概到一页纸剧本

标题只给了故事走向,实际制作前需要把它展开成“一页纸剧本”。一页纸剧本不是文学创作,而是按时间顺序列出:

主角是谁、发生了什么、情绪如何变化、转折点在哪里、结尾停在哪个钩子。

对于“穿成将军嫡女绑定废柴攻略系统”这个题材,可以这样展开:

  • 女主苏晚穿越到将军府嫡女身上,绑定“废柴攻略系统”。
  • 系统要求她去攻略高冷战神将军,女主选择摆烂躺平。
  • 系统惩罚出现,但被转移到了战神身上。
  • 战神被惩罚搞得生活各种不顺,反而开始注意到女主,开启自我攻略。
  • 结尾停在一个钩子:战神主动来找女主,女主内心慌,但表面无所谓。

一页纸剧本里要标出不同段落的节奏。前 3 秒必须出人物和冲突,中间每隔 10 到 15 秒要有一个笑点或情绪点,结尾留钩子。这样观众才不会划走。

2.2 分镜表要包含哪些字段

好的分镜表可以让后期避免大量返工。建议一开始就包含这些字段:

镜号时长景别画面内容台词情绪音频/音效提示词要点
13s全景将军府门前,女主醒来内心OS:我怎么在这里茫然风声、鸟鸣古代府邸、清晨、雾气
23s近景系统面板凭空出现系统:请攻略战神惊愕弹窗提示音蓝色半透明面板、古风房间
34s中景女主听完任务,翻白眼躺倒女主:麻烦,不想干摆烂轻快音效女主躺床、无奈表情

分镜表不需要写得像文学剧本那样长,但要能直接喂给AI绘图工具。也就是说,“画面内容”要能转成提示词,不能只写“女主很漂亮”。

2.3 用标题里的剧情做一套分镜示例

下面给一个 60 秒左右的分镜示例,适合做成第 1 集的引子。时长是估算值,实际按配音节奏调整。

镜号时长景别内容情绪
14s全景古风将军府,清晨,女主坐在床边茫然
23s近景系统面板弹出惊讶
34s中景女主听完任务,翻白眼躺倒摆烂
43s近景系统警告:惩罚启动紧张
54s中景战神在校场打喷嚏,长枪脱手困惑
64s近景女主发现惩罚被转移,偷笑得意
75s近景战神回头看了一眼女主方向若有所思
83s特写女主眼神躲闪,内心OS:别看我慌乱

这套分镜的节奏是:建立身份、出现任务、女主反套路、系统惩罚、意外转移、钩子。第一集不一定讲完整个攻略,停在“战神开始注意到女主”就够了。

2.4 每个镜头的“为什么”

为什么要先定景别?因为 AI 绘图对景别非常敏感。同样一句“女主在房间”,近景和全景生成的构图完全不同。先定景别,提示词才有的放矢。

为什么要先定情绪?因为情绪决定光影、表情和动作描述。比如“女主偷笑”和“女主翻白眼”是两个完全不同的画面方向,先写情绪可以避免生成表情时不知道往哪个方向调整。

在实际操作中,我一般会把分镜表放到表格里,每一行对应一个镜头。出图时把“提示词要点”单独提出来生成,然后回到表格里标记哪些镜头成功、哪些需要重出。这个表格做完,后面的工作就不再依赖记忆,而是按表执行。

3. 角色设定与提示词:先锁死形象,再谈画面质量

3.1 角色一致性为什么是 AI 漫剧的第一道坎

AI 漫剧翻车率最高的问题,不是画面不够精致,而是同一个角色在不同镜头里长得不一样。前一秒鹅蛋脸杏眼,后一秒长脸圆下巴;上一场是浅蓝长裙,下一场变成深色短打。观众很难建立代入感。

解决办法不是靠运气反复抽卡,而是做一张“角色卡”。角色卡包含外貌、服装、发型、标识物、表情方向,以及固定关键词。之后每个镜头都使用同一套角色描述,关键镜头用参考图垫图。

这个步骤不能省。尤其是系统面板、惩罚特效这类后期要叠加的元素,如果角色不稳定,叠加得越多越违和。

3.2 人设提示词怎么写

提示词不是写得越多越好,但关键属性要写清楚。拿“苏晚”举例,一份可复制的角色卡可以这样组织:

角色:苏晚,将军府嫡女,穿越者 外貌:黑色长发,高马尾,银色发簪,鹅蛋脸,杏眼,眉尾略上扬 服装:浅蓝色窄袖长裙,袖口银白云纹,白色束腰 气质:慵懒,微挑眉,眼带狡黠,偶尔无语望天 固定标记:银色发簪,浅蓝长裙,云纹袖口

每次出图时,把这段描述放在提示词开头,然后再加当前镜头的场景、景别和动作。比如镜头 3:

苏晚角色卡,躺在古代雕花床上,翻白眼,双手枕在脑后, 表情不耐烦,阳光从窗棂照进来,中景,中国古风插画,柔和光影

这里不要只写“一个美女”。AI 会把“美女”理解成一切能想到的形象,气质完全不受控。写得越具体,越容易维持统一。

3.3 参考图、垫图、局部重绘的配合方式

光靠文字提示词很难做到百分之百一致。更稳妥的做法是:

  1. 先用角色卡生成 3 到 5 张正面正脸图,选一张最接近预期的作为“角色基准图”。
  2. 出正式分镜时,把基准图作为参考图/垫图,再叠加当前镜头的提示词。
  3. 如果参考图风格太强,导致镜头表情僵硬,就用局部重绘只改表情或动作,不要整图重来。
  4. 有些工具支持种子值锁定,找到稳定的种子后,后续同角色镜头尽量沿用。

这里不同工具的功能名称不一样。有的叫参考图,有的叫垫图,有的叫角色特征,没有统一的行业命名。但思路是一致的:先固定基准形象,再通过局部调整控制情绪和动作。

注意:不要一上来就追求所有镜头完全一致。完全一致会损失动态感和叙事感,只要观众能认出“这是同一个人”,制作效率就够用了。

4. 从静态图到动态镜头:生成素材的三种路线

4.1 路线A:只做微动态

AI 漫剧不是每一帧都靠视频模型生成。很多镜头只需要“微动态”:头发飘一下、衣摆动一下、眼睛眨一下、镜头缓慢推近。这类镜头用图生视频里的低幅度运动参数就可以完成。

优点:速度快、不容易崩、画质保持好。缺点:动作幅度小,不能表达激烈冲突。

适合:对话、情绪戏、系统面板出现、将军发呆这些场景。

4.2 路线B:图生视频

如果剧情里需要明显的动作,比如战神长枪脱手、女主倒头躺下、系统面板震动,可以让模型生成 2 到 5 秒的短视频片段。图生视频的输入是静态图加一段动作提示词,输出是带动态的视频素材。

常见参数可以这样设置:

参数建议值说明
分辨率720p 起步先保证能跑通,再考虑1080p
帧率12fps 到 16fps漫剧不需要30帧,帧率太高反而容易崩
运动幅度低或中幅度大时脸和手容易变形
镜头运动推、拉、摇避免复杂的穿越机镜头
时长3秒左右太长了内容不可控

提示词示例:

镜头缓慢推进,女主的头微微转过来,眼神从无辜变成狡黠, 长发和袖口轻轻飘动,窗帘在风中摆动,古风房间,浅蓝色长裙

这里最容易犯的错是运动幅度拉满。画面确实动了,但脸也跟着变形,后期根本没法修。宁可让动作保守一点,多切一个镜头,也不要在一个镜头里要求太多。

4.3 路线C:局部重绘+转场

并不是每个镜头都需要生成完整动态。转场可以用剪辑完成:画面平移、缩放、淡入淡出、叠加系统 UI 动画,都会让观众觉得“有动态”。

比如“系统惩罚被转嫁到战神身上”这个点,不需要直接画“惩罚转移”的完整过程,可以拆成两个镜头:女主这边出现惩罚提示,战神那边长枪脱手。两组画面快速切换,就能让观众理解因果,同时绕开动态生成的难点。

4.4 资源占用:低配机器怎么试

如果机器只有 8GB 显存,先把分辨率降到 512×768 或 720p,一次只生成一个镜头。不要开大批量,10 张一批容易爆显存。云端工具则优先考虑免费额度,先用小尺寸参数验证提示词,确认效果后,再生成最终素材。

判断标准很简单:单镜头出片时间在可接受范围内、五官没有明显崩坏、动态合理,就可以继续下一镜。如果单镜头反复失败,先按第 7 章的排查路线处理。

5. 配音、配乐和字幕:让观众“看进去”而不是只看画面

5.1 配音情绪怎么调

画面合格只是第一步。AI 漫剧能不能吸引人往下看,配音情绪影响非常大。拿这个题材来说:

  • 女主的语气要懒洋洋、不耐烦,带一点“你随便罚我都不在乎”的松弛感。
  • 战神的声音要低沉、克制,不能炸,因为他是高冷人设。自我攻略时的语气是“嘴上冷静,内心开始在意”。
  • 系统的提示音要机械、冷冰冰,和女主情绪形成反差。

使用 TTS 工具时,我会先选一个接近角色的声音,然后分别试听三句话。不要整段一次读完。第一遍只用一句话测试语速和音色,确定满意后再生成全部台词。

情绪不对时,可以通过标点符号、停顿词、速度参数来调整。比如“系统?麻烦你下次换个人坑。”比“系统麻烦你下次换个人坑”更容易让模型读出停顿感。

5.2 音效与 BGM 节奏

AI 漫剧不能只看画面和台词,音效决定了“爽点”能不能落地。

  • 系统弹窗:用急促的电子提示音。
  • 惩罚启动:用低鼓或警报音。
  • 战神长枪脱手:用金属碰撞声加一个停顿。
  • 女主偷笑:用轻快的拨弦或木鱼声。
  • BGM 选择:前期轻快、中期悬疑、结尾留一个轻挑的收拍。

卡点位置通常在镜头切换处。我的习惯是先把配音轨道放好,再把 BGM 的鼓点对准每个镜头的第一帧,最后用淡入淡出处理音效,不要所有声音一起压上去。声音堆太满,反而会让爽点变糊。

5.3 字幕与画面同步的三个检查点

字幕是 AI 漫剧里容易被忽视但影响很大的环节。导出前至少检查三个点:

  1. 字幕不要压住人脸,尤其是下半张脸。系统设置里可以调整安全边距。
  2. 字幕断句要跟配音一致。不要出现配音已经说完、字幕还停在上一句。
  3. 错别字和标点。自动识别容易出现同音字错误,发布前必须肉眼扫一遍。

如果用了自动字幕,不要默认它能一次全对。自动字幕只是初稿,最终还是要手动过一遍。

6. 剪辑成片与发布前检查:先跑通单集,再谈批量生产

6.1 单集剪辑顺序

我推荐的剪辑顺序是:先排镜头,再配音,再配乐,然后加音效和字幕,最后统一调色。

先排镜头:把分镜素材按时间轴顺序放好,粗剪成一条叙事线,此时不纠结细节。 再配音:把旁白、台词、内心 OS 放上去,同时调整每个镜头的时长,让画面配合声音。 再配乐:根据配音节奏铺 BGM,不要让 BGM 盖过人声。 然后加音效和字幕:系统提示音、环境音、转场音,逐个加。 最后调色导出:保持统一色调。不要每个镜头都是完全不同的明暗。

这个顺序的好处是,任何一步出问题,都不需要从头再来。比如配音超时,只需要动画面时长,不需要重新构图。

6.2 批量生产时最容易忽略的问题

当你要做很多集时,节奏会变成另一个问题。常见坑点有:

  • 文件命名混乱。建议每集一个目录,素材按“集数_镜头号_版本”命名,比如 S01E03_005_v2。
  • 没有失败重试机制。单集可以手动重出,批量时必须有重新生成的批次记录。
  • 输出目录不统一,后期找图找不到。建议建一个“分镜表/角色卡/素材/成片”的固定目录结构。
  • 没有验证清单。别指望上一集顺利,这一集就能直接发布。每集都要过一遍画面、声音、字幕。

如果流程足够稳定,可以把剪辑模板设定好,后续每一集只需要替换素材和配音,就能接近一键成片。这里的“一键”不是 AI 工具自动帮你把整部剧写出来,而是把你自己的生产 SOP 固化下来,减少重复操作。

6.3 成品验证清单

导出成片之前,可以按这个清单过一遍:

  • 角色是否还认得出是同一个:发型、服装、脸型有没有明显变化。
  • 画面是否出现大面积崩坏:手指、眼睛、文字、兵器。
  • 配音是否清楚:有没有喷麦、吞字、音量不平衡。
  • 字幕是否遮挡人脸:上下边缘是否安全。
  • 时长是否合适:单集控制在 60 到 120 秒,流量效率更高。
  • 结尾是否有钩子:如果没有,观众看完不会关注下一集。

发布到平台前,还要注意标题、封面、简介是否符合平台规则,不要使用诱导性话术。生成内容如果涉及肖像、版权、敏感素材,要提前规避。

7. 常见翻车现场和排查链路

7.1 人物脸崩、服装变化、眼睛变形

现象:同一角色在不同镜头里长得不一样,或者同一个镜头里五官变形。

排查顺序:

  1. 先检查参考图。角色基准图是否足够清晰、正面、无遮挡。如果基准图本身是侧脸,后面各镜头都会跑偏。
  2. 再检查提示词。角色卡是否放在开头,有没有被长场景描述冲淡。有些工具提示词越长,前半段权重越高。
  3. 检查采样参数。分辨率过低、运动幅度过大、批量过小都会让脸部崩坏。
  4. 检查是否用了不同的工具。不同模型对“大眼睛”“高马尾”的理解不同,同一集尽量固定一个绘图模型。

7.2 声音和情绪不匹配、口型对不上

现象:画面是高冷战神,配音却像推销员;画面是女主偷笑,配音却像念课文。

排查顺序:

  1. 先重新听一遍配音,确认角色音色是否符合人设。
  2. 再看台词文本是否有标点、断句、语气词。TTS 很依赖文本分层。
  3. 口型不一致:AI 漫剧不需要完美口型,只要说话时嘴部有轻微动态即可。如果嘴部完全不动,切一个近景嘴巴特写镜头来补。
  4. 最后看时间轴:判断配音和画面对没对上,可能是素材时长不够,需要拉长镜头或加转场。

7.3 导出失败、画质差、时长不够

现象:剪辑预览正常,导出一半失败;或者导出后画质下降严重;或者内容不足 60 秒。

排查顺序:

  1. 先检查磁盘空间和导出路径。磁盘满、中文路径、权限不足都会导致导出失败。
  2. 检查工程分辨率。预览用 720p,导出却选 4K,可能造成卡死或内存不足。
  3. 时长不够通常不是技术问题,是分镜数不够。60 秒大约需要 12 到 16 个镜头,每个镜头 4 到 5 秒。如果镜头太少,就补过渡镜头,不要硬拉长单个镜头。
  4. 画质差:先确认原始素材分辨率,再看导出码率。很多平台会压缩二次编码,原始素材 1080p,导出码率 8Mbps 以上,压缩后才会比较清楚。

7.4 排错顺序总结

AI 漫剧的报错,很多看起来像工具问题,实际是前置条件问题。我的习惯排错顺序是:

先看输入材料,再看提示词和参考图,接着看参数设置,然后看工具版本,最后才怀疑模型能力。

大多数翻车都发生在输入侧。分镜表写得模糊、角色卡不统一、参考图质量差,再好的工具也会输出不稳定结果。

踩过几次之后会发现,AI 漫剧真正考察的不是哪个模型更强,而是你有没有把内容流程管清楚。先跑通一条 60 秒单集,再优化画质和批量,是目前最稳的上手路径。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询