做AI漫剧,最容易踩的第一个坑就是把所有步骤都丢给同一个AI工具。实际上,AI漫剧制作更适合拆成一条流水线:剧本用AI助手先把草稿拉出来,分镜和角色用AI绘图生成,动态化用AI视频生成或局部动画工具处理,最后用剪辑软件配音、加字幕、铺BGM。这篇文章会重点讲即梦、ComfyUI和Seedance这一套组合,它们分别解决画面生成、角色一致性和动态视频。不管你是零基础想做AI短剧,还是已经会一点ComfyUI但没跑通过完整剧情项目,这条流程都可以直接照着复现。
零基础能不能直接上手?可以。但是要有预期:你可能前五条成片都只能当练习,真正能发布的内容需要重复生成、筛选、修补和重新剪辑。我更建议先做一条不超过30秒的样片,跑通一遍完整链路后,再考虑做第一集甚至整个系列。下面按我实际落地时会使用的顺序拆开讲。
1. 先看清AI漫剧制作的完整链路:剧本、分镜、动态化、成片
AI漫剧并不是一个单一模型干完全部事情。它更像一个流水线,每个环节用不同工具,最后拼成一条完整的动态视频。
1.1 不要把AI当全能导演:它是流水线里的不同工种
很多人第一次接触AI漫剧,会想着输入一句“帮我生成一集古装短剧”,然后等着AI吐出成片。这个预期目前还是会落空的。就算在线平台能直接生成短视频,它也只是一个片段,不是一整集故事。
你也别指望同一个提示词语气,既能把角色脸定住,又能让镜头运动、表情变化、背景连续。目前更稳妥的做法是分工:
- AI助手负责写剧情、拆对白、给分镜建议。
- AI绘图负责生成角色设定图和关键帧画面。
- AI视频生成负责把静态画面变成会动的片段。
- 剪辑软件负责把片段拼起来,加配音、字幕和BGM。
这样做的原因是:把任务拆小之后,每个环节都能单独检查质量。某个镜头脸崩了,只需要重新生成那一帧,而不是整集重来。
1.2 一套适合零基础的制作链路拆解
我一般会把完整的AI漫剧流程拆成六个步骤:
- 写剧本:先写一个简短的短剧脚本,明确场景、出场角色、核心冲突和对白。
- 定角色:确定主角的外貌特征,比如发型、服装颜色、配饰,生成一张正面、背面、侧面的设定图。
- 拆镜头:把剧本拆成一条条分镜,每一条描述一个画面和动作。
- 生成画面:用即梦或者ComfyUI生成每个镜头的静态图。
- 动态化:用图生视频能力,把静态图变成3到5秒的短视频片段。
- 后期合成:用剪辑软件把人声、字幕、BGM和画面组合成完整作品。
这套流程的好处是:你随时可以暂停。今天只做角色设定也行,只生成10个分镜也行,不用一次性把所有事情做完。
1.3 先做一条不超过30秒的样片,再考虑第一集
我接触这个方向之后,最大的一个建议就是先压短战线。不要一上来就规划十集,也不要直接做一集5分钟的长片。先做一条30秒的样片,你就能知道自己卡在哪。
30秒样片可以很简单:
- 前5秒:角色出场,定住脸。
- 中间15秒:一个冲突场景,比如对话、追逐、惊讶。
- 后10秒:一个反转或悬念,然后结束。
样片做完之后,你会明显感知到几个问题:角色侧脸是否变形、视频片段是否能拼接上、配音节奏是否自然、字幕放哪里不遮挡人物。这些只有实际跑一遍才会清楚。
2. 跑通前的准备:即梦账号、电脑配置和ComfyUI部署
做AI漫剧之前,不需要买特别贵的设备,但你得先知道不同工具有什么硬件要求。在线平台和本地工具的准备方式完全不一样。
2.1 在线平台能做什么:即梦、Seedance 这类能力的开箱即用
即梦这类在线AI创作平台,最大的价值是省环境。你只需要注册账号、打开页面、上传参考图或者输入提示词,就能生成图片和短视频。Seedance 这类视频生成模型,实际入口可能会在类似的在线平台上开放,也可能在不同版本里换位置,以你当前页面上开放的模型为准。
在线平台的优点很明显:
- 不用配置复杂依赖,浏览器打开就能用。
- 生成速度通常比自己本地跑更快,因为平台用了高性能服务。
- 模型更新由平台方负责,你不需要维护版本。
缺点也很现实:生成结果受平台审核规则限制,不适合生产内容的边界要提前看清楚;部分平台会有积分或时长限制,同一段素材不能无限重试。
所以在线平台适合零基础学习和快速出素材。如果你想更精细控制角色一致性,或者想批量实验不同参数,就需要本地部署ComfyUI。
2.2 本地ComfyUI的硬件底线:显存、内存和存储
ComfyUI是本地运行的节点式工作流工具。它比在线平台自由,但硬件门槛高不少。尤其是显存,直接影响你能不能跑动某些模型。
| 使用场景 | 配置建议 | 能跑什么 |
|---|---|---|
| 纯学习/只跑简单图片 | 16GB内存,独立显卡4到6GB显存 | 低分辨率小图,SD1.5类小模型 |
| 主流动态漫制作 | 16GB内存,NVIDIA显卡8到12GB显存 | SDXL等工作流,普通分辨率生成 |
| 需要高分辨率+批量任务 | 32GB内存,16GB以上显存 | 更复杂的工作流,更快的批量出图 |
如果你的电脑只有低显存,也不是完全不能玩。办法是降低分辨率、降低批次数、减少一次性排队的任务数量。比如一个批次只跑一张图,生成512分辨率,慢慢验证。
低配置能跑不代表适合批量。做AI漫剧需要反复生成同一角色,素材量大,显存太紧会频繁报错,体验会差很多。
存储也要预留。一个AI模型文件经常是几个GB到十几个GB,再加LoRA、VAE、插件和工作流缓存,100GB的空闲磁盘比较稳妥。
2.3 整合包不是万能的:模型路径、插件冲突和版本选择
很多新手会直接下载一键整合包,比如秋叶这类社区制作的整合包。整合包确实能省掉大部分安装流程,但别把它当成万事大吉。
最容易遇到的问题有三个:
- 模型放错目录。Checkpoint模型要放在
models/checkpoints,VAE放在models/vae,LoRA放在models/loras。放错之后节点会加载失败,或者生成黑图。 - 插件更新导致节点报错。某个插件升级后,原本能跑的工作流突然在“节点执行过程中发生错误”,这是很常见的情况。先看插件版本和ComfyUI核心版本是否匹配。
- 不同整合包自带的依赖版本不一致。你拿别人的工作流导入后,可能缺某个自定义节点,需要在ComfyUI Manager里先安装。
我的建议是:如果完全不懂ComfyUI,先用别人分享的完整工作流入门,但别只点“运行”。要点开每个节点,看它输入输出接的是什么类型。等你能把一个节点挨个解释清楚,才算真正开始会用了。
3. 从剧本到分镜:用即梦生成基础画面和分镜提示词
分镜是整个AI漫剧最耗时间的环节。分镜质量决定了后面视频生成的稳定程度。分镜提示词写得准,后续成本会下降一大半。
3.1 先写短剧脚本:场景、角色、动作和镜头分开列
不要只写一段小说式剧情,然后把整段话塞给AI。AI漫剧是短剧逻辑,节奏快,每一条分镜都应该有明确的画面感。
建议用表格整理:
| 场次 | 地点 | 角色 | 动作 | 台词 | 情绪 | 镜头 |
|---|---|---|---|---|---|---|
| 1 | 雨夜街道 | 女主 | 抬头 | “你终于来了。” | 紧张 | 半身中景,缓慢推近 |
| 2 | 咖啡店 | 男主 | 低头翻账单 | “这杯我请。” | 平静 | 侧面近景 |
先写8到10行这样的分镜表,再开始生成画面。不要先画图再编故事,那样很容易浪费大量生成次数。
3.2 分镜提示词怎么写:主体、环境、动作、镜头语言、画风
用即梦生成静态图时,提示词不需要堆太多形容词。关键是主体、环境、动作、镜头、画风五件事要说清楚。
下面这个例子是一段古装分镜提示词:
一位古代侠客,身穿深蓝色长衫,腰间佩剑,站在竹林里, 竹叶飘落,风吹动衣角, 他微微抬头看向远处,眼神警觉, 中景,镜头缓慢推近,构图留出左侧空间, 国风插画风格,线条干净,光影通透你可以根据剧集风格调整。如果是现代都市剧,就把“古代侠客”换成“穿黑色风衣的年轻女性”;如果是治愈系AI动漫,就把画风改成“浅色水彩风”。
关键是画风描述要固定。同一个角色在每一条分镜里都要带上相同的服装关键词,比如“深蓝色长衫”“黑色风衣”“红色发绳”。这样AI生成时更有机会保持一致性。
3.3 第一次生成后怎么判断能不能用:构图清晰、主体明确、无畸形
生成图片之后,不要急着导入视频生成工具。先过一遍基础检查:
- 脸部五官有没有明显变形。眼睛、手指、牙齿是最容易崩的地方。
- 角色是否和上一张图明显不像。如果发型、衣服颜色变了,说明提示词还不够稳定。
- 主体位置是否居中。如果主体被切割到画面边缘,后面推镜头会很奇怪。
- 画面里有没有莫名出现乱码文字、水印、残缺物体。
一旦发现角色形象不稳定,先回头修提示词,或者重新生成一张更好的角色设定图。不要指望视频生成环节帮你修复五官,那是更高成本的操作。
4. ComfyUI角色一致性实操:从套工作流到理解节点
ComfyUI在AI漫剧里的核心作用是角色一致性控制。在线平台虽然方便,但想精确控制同一个人的脸,还是本地工作流更有效率。
4.1 为什么漫剧最需要角色一致性:观众认脸,不认画风
AI漫剧观看过程中,观众最先注意到的是“这个角色这张脸怎么一直变”。正脸还是A角色,侧脸变成另一个人,换个角度又换了一张脸,剧情再好也看不下去。
所以角色一致性不是“可选优化”,而是能不能成片的关键。你必须尽可能让同一个角色在多个镜头里保持相近的五官、发型、服装。
要做到这一点,不能只靠输文字描述。更稳的做法是准备一张或者多张角色参考图,让AI生成时始终参考这张图。
4.2 角色一致性工作流里的核心节点:加载、提示词、采样、保存
ComfyUI是节点式工作流。一张图从模型加载到生成保存,可以拆成几个核心节点:
Load Checkpoint(加载大模型) CLIP Text Encode(正面提示词) CLIP Text Encode(负面提示词) Empty Latent Image(设置画布大小) KSampler(采样) VAE Decode(解码图片) Save Image(保存图片)它们的顺序不复杂:加载模型之后,把文本提示词转换成语义条件,再在空的画布上采样生成潜空间数据,最后解码成图片并保存。
很多报错就出在节点类型不匹配。比如你从VAE Decode输出的是一张Image类型图片,你不能直接把它连接到需要Latent类型的地方。连线变红或者节点变红,通常就是类型不匹配。
4.3 用参考图约束角色:IPAdapter、局部重绘和基础LoRA思路
想让角色更像同一个人,只靠正向提示词并不够,还需要参考图约束。
常见做法有几种:
- IPAdapter:把角色参考图作为额外条件输入到采样器里。生成时,模型会参考这张图的身份特征。适合保持脸型、发型、服装风格。
- 局部重绘:用遮罩选中画面中需要重绘的区域,比如只重绘衣服,保留脸不动。适合改服装改动作时维持面部稳定。
- LoRA:如果你有足够素材,可以训练一个专属角色LoRA。效果最稳,但门槛也最高。零基础可以先不碰。
对不同插件的安装,实际名称和节点接口会随着ComfyUI版本变化。你导入别人工作流后发现缺节点,不要慌,用ComfyUI Manager按提示补装即可。
别一上来就追求几十个节点的高级工作流。先把加载模型、写提示词、采样、保存这四步跑通,再慢慢加入参考图控制。
4.4 报错排查:节点连接、模型文件、显存不足三个高频问题
新手遇到ComfyUI报错,最常见的就是“节点在执行过程中发生错误”这类提示。看到这个提示,优先按照下面顺序排查:
- 看哪个节点变红。红色节点附近的报错信息会写得更具体。
- 检查输入连线类型是否正确。Image、Latent、Conditioning、Model不能混接。
- 检查模型路径。加载模型失败、模型名称找不到,多半是文件放错目录。
- 检查显存。任务跑到中间突然报错,去任务管理器看显存占用,如果接近满值,就降低分辨率和批次数。
- 回想最近有没有更新插件。更新后开始报错,多半是版本兼容问题,可以回退插件版本。
这套排查顺序能覆盖掉大部分本地ComfyUI的新手问题。越是感觉“工作流不可能有问题”,越要先看路径和插件版本这些看起来不起眼的地方。
5. 用Seedance和即梦把分镜变成动态视频:动态漫的核心环节
静态分镜生成之后,接下来就是把画面动起来。这个环节决定你是做成了“会动的漫画”,还是像一部完整的AI短剧。
5.1 图生视频和文生视频怎么选:先给角色图,再给动作描述
AI视频生成类工具通常有两种输入方式:
- 文生视频:只输入提示词,让AI直接生成一段视频。适合空镜、场景介绍、环境转场。
- 图生视频:输入一张静态图,再输入动作提示词,让AI在图上生成运动。适合角色镜头、关键剧情画面。
做AI漫剧时,我会优先选择图生视频。原因很简单:静态图里的角色是已经定好的,AI只需要在基础上运动,五官变形的概率相对更低。文生视频虽然画面自由度高,但角色连续性和一致性非常难控制。
你可以把即梦当作生成图像的入口,也可以用其他绘图工具。关键是你先有一张能用的基础图,再把它丢进支持图生视频的能力里。Seedance或者类似的视频生成模型,通常也支持输入参考图,具体入口以平台界面为准。
5.2 Seedance提示词:动作、镜头、时长和情绪一步到位
输入动态化提示词时,不要只写“动起来”。你要写清楚:谁在动、怎么动、镜头怎么动、情绪是什么、大概持续几秒。
下面是一个动态漫片段的提示词示例:
古代女子站在庭院中,头微微抬起, 风吹起她的发丝,花瓣飘落, 镜头从中景缓慢推进到面部特写, 眼神从平静转为惊讶, 画面流畅,人物五官不变形, 时间约3秒注意几个细节:
- 动作幅度要写具体。比如“平静地抬头”和“猛然抬头”生成结果完全不一样。
- 镜头运动要明确。是推近、拉远、平移还是环绕。
- 时长要符合平台能力。常见的短视频生成长度在3到5秒左右,超过支持范围的提示词不一定有效。
- 情绪描述会直接影响表情,别漏掉。
如果生成结果中出现角色脸变形、肢体扭曲、运动卡顿,就降低动作幅度,或者换一张静态图再试。不要在同一张图上反复重试超过五次,那样很容易浪费时间。
5.3 多片段怎么管:分镜编号、片段时长和素材归档
做一条长片,你会生成几十个片段。如果文件名随便起,比如001、002,后期一定会乱套。
我一般会按这个规则命名:
剧名_集数_场景_分镜序号_版本例如:
风起长安_S01E03_05_v2对应的意思是:剧名《风起长安》,第一集第三场,第五个分镜,第二个版本。
同时准备一个素材表,记录这些字段:
分镜序号:05 静态图:风起长安_S01E03_05_base.png 视频:风起长安_S01E03_05_v2.mp4 时长:3秒 动态幅度:中 是否采用:待定 问题:第二帧脸部轻微变形批量制作时,这个表越早建越好。不要等生成了一百个文件再想怎么整理。
5.4 动态漫和AI动画的区别:动态幅度、口型、镜头运动
很多人会把AI漫剧、AI短剧、AI动漫、AI动态漫这几件事混在一起。实际落地上,它们是不同难度的东西。
- AI动态漫:静态画面加少量运动,比如头发飘动、眼神变化、镜头推拉。成本低,稳定性高,最适合零基础入门。
- AI短剧:偏向真人影视感的视频片段,角色动作更丰富,拍摄逻辑更接近电影镜头。
- AI动漫/动画:更强调连续动作、口型同步、表情变化、物理规律。技术难度最高,需要更多帧和更多重试。
做第一集时,不要直接挑战复杂动作。用动态漫的方式完成:每段3到5秒,以镜头运动和小幅度动作为主。这样做能极大降低失败率,也能更快发布作品。
6. 后期剪辑与成片:配音、字幕、BGM和节奏
动态视频片段都生成完后,还要经过剪辑才能变成观感完整的剧集。很多人在这个环节翻车,不是因为画面不好,而是因为剪辑太乱。
6.1 先铺音轨,再剪画面,节奏会更稳
做短剧和动态漫,最影响观感的是节奏。画面一旦拖沓,观众会立刻跳走。
我会建议先把配音录好或合成好,再开始剪画面。这样你能听到每一句台词的节奏,再用手里的视频片段去配合对白。而不是先拼好画面,再配解说,那样经常会出现画面等声音或者声音等画面的空缺。
具体流程可以是:
- 在剪辑软件里建一条时间线。
- 放入配音音轨。
- 根据配音位置,把对应的视频片段摆到上面。
- 再插入空镜、转场、语气停顿和BGM。
这样剪出来的成片,节奏会比纯看画面拼接自然得多。
6.2 字幕与AI生成视频的匹配:不要每句话都满屏
AI生成视频里通常带有比较强的美术构图,字幕放不好会遮挡关键内容。我的经验是:
- 字幕字体统一,不加太多花纹。
- 字幕位置一般放在画面下方安全区,避开角色脸部。
- 台词较短时,一句话不要拆成四五个短句连续弹出,容易打断观看。
- 视频里如果已经自带平台水印或模型生成痕迹,后期应注意不要让它和字幕叠在一起。
如果你要做多集系列,最好一开始就固定字幕样式,包括字号、颜色、描边。这样观众对作品的统一感会更强。
6.3 批量成片时怎么管理工程:素材命名、备份、输出尺寸统一
做系列内容时,工程文件最容易变成一个大杂烩。我的做法是每一集单独建一个文件夹:
S01E01/ assets/ # 静态图、视频片段、音频 edit_project/ # 剪辑工程文件 export/ # 最终成片 notes.md # 本集的分镜表和素材备注导出的视频参数要尽量统一,尤其是平台要求竖屏还是横屏。如果你准备做抖音、快手、小红书这类平台,一开始就导出9:16竖屏;如果是B站和YouTube,再考虑16:9横屏。
更重要的是一键输出前先导出一个低分辨率版本检查一遍。不要直接渲染4K成片之后才发现某个镜头字幕错位。
7. 新手最容易踩的坑:变形、卡顿、报错和素材不统一
AI漫剧制作过程中,报错和画崩是常态,关键是你知道先看哪里。
7.1 角色五官变形优先检查这三个地方
遇到角色脸变形,先看这三件事:
第一,提示词太复杂。角色关键词和动作关键词混在一起,模型容易顾此失彼。建议把角色描述单独放在正向提示词开头,动作和环境放后面。
第二,参考图太脏。图片上有水印、低清晰度、脸部被遮挡,都会导致生成结果乱飘。角色参考图尽量选择干净的半身或脸部特写。
第三,动作幅度太大。转身、跳跃、大幅度回头这类动作在AI生成时很容易崩。先用小幅动作跑通,再逐步挑战复杂动作。
如果还是变形,就换图生视频而不是文生视频,或者用局部重绘先修脸再动起来。
7.2 速度慢不一定是电脑差:可能是内存、显存和插件互相拖累
本地跑ComfyUI时,生成速度慢有很多原因。显卡差只是其中之一。
你需要先看任务管理器里的数据:
- 内存满不满。如果内存占用长期90%以上,说明后台程序太多,或者图片批量数开太高。
- 显存占用情况。显存接近满载,说明分辨率或批次数需要降低。
- CPU和磁盘占用。模型加载和保存大图时,硬盘速度也会成为瓶颈。
另外,ComfyUI里如果队列里积压了太多任务,新手会以为是卡死,实际只是前面任务还没跑完。不要反复点“运行”,先清空队列,再跑一条任务验证。
7.3 批量制作时的失败重试和输出命名
批量生成意味着你会得到大量不合格素材。不要看到失败就立刻改全局参数,那样会连本来正常的任务一起破坏。
我的建议是:
- 先跑单条任务,确保输入、输出、日志都正常。
- 再小批量跑2到3条,观察有没有偶发问题。
- 最后再加大批量,同时注意失败重试次数和输出命名。
输出命名一定要能反映版本。比如S01E03_05_v2意思是第二版,如果细微调整了参数,保留原文件,另存为v3。不要覆盖旧文件,你后面可能还会想对比效果。
7.4 我的学习路线建议:每天两小时,按周推进
如果每天有2小时左右的时间,可以参考这个节奏:
第一周:熟悉在线平台,生成20张角色图,找到一种稳定画风。
第二周:跑顺ComfyUI基本工作流,加载模型、写提示词、生成图片、保存图片,搞定五个核心节点。
第三周:做一条30秒动态漫样片,完成静态图到视频片段再到成片的全部流程。
第四周:批量生成素材,整理分镜表,完成一集正式内容。
集中火力解决角色一致性,不要第一周就想着做50集。工具更新确实很快,但分镜、素材管理、批量重试和剪辑节奏这些经验,不会因为模型版本变化而过时。
AI漫剧这个事,最容易让人上头的是生成画面的瞬间惊喜,最容易劝退人的则是角色大变脸和一堆报错。真正能把内容稳定做出来的人,靠的并不是某个神级模型,而是把角色设定、分镜提示词、素材归档和失败排查做扎实。等你用自己的角色跑通一条30秒样片,很多之前觉得难的问题,自然就知道该怎么改了。