AI漫剧制作全流程:即梦+ComfyUI+Seedance实战指南
2026/9/7 11:59:57 网站建设 项目流程

做AI漫剧,最容易踩的第一个坑就是把所有步骤都丢给同一个AI工具。实际上,AI漫剧制作更适合拆成一条流水线:剧本用AI助手先把草稿拉出来,分镜和角色用AI绘图生成,动态化用AI视频生成或局部动画工具处理,最后用剪辑软件配音、加字幕、铺BGM。这篇文章会重点讲即梦、ComfyUI和Seedance这一套组合,它们分别解决画面生成、角色一致性和动态视频。不管你是零基础想做AI短剧,还是已经会一点ComfyUI但没跑通过完整剧情项目,这条流程都可以直接照着复现。

零基础能不能直接上手?可以。但是要有预期:你可能前五条成片都只能当练习,真正能发布的内容需要重复生成、筛选、修补和重新剪辑。我更建议先做一条不超过30秒的样片,跑通一遍完整链路后,再考虑做第一集甚至整个系列。下面按我实际落地时会使用的顺序拆开讲。

1. 先看清AI漫剧制作的完整链路:剧本、分镜、动态化、成片

AI漫剧并不是一个单一模型干完全部事情。它更像一个流水线,每个环节用不同工具,最后拼成一条完整的动态视频。

1.1 不要把AI当全能导演:它是流水线里的不同工种

很多人第一次接触AI漫剧,会想着输入一句“帮我生成一集古装短剧”,然后等着AI吐出成片。这个预期目前还是会落空的。就算在线平台能直接生成短视频,它也只是一个片段,不是一整集故事。

你也别指望同一个提示词语气,既能把角色脸定住,又能让镜头运动、表情变化、背景连续。目前更稳妥的做法是分工:

  • AI助手负责写剧情、拆对白、给分镜建议。
  • AI绘图负责生成角色设定图和关键帧画面。
  • AI视频生成负责把静态画面变成会动的片段。
  • 剪辑软件负责把片段拼起来,加配音、字幕和BGM。

这样做的原因是:把任务拆小之后,每个环节都能单独检查质量。某个镜头脸崩了,只需要重新生成那一帧,而不是整集重来。

1.2 一套适合零基础的制作链路拆解

我一般会把完整的AI漫剧流程拆成六个步骤:

  1. 写剧本:先写一个简短的短剧脚本,明确场景、出场角色、核心冲突和对白。
  2. 定角色:确定主角的外貌特征,比如发型、服装颜色、配饰,生成一张正面、背面、侧面的设定图。
  3. 拆镜头:把剧本拆成一条条分镜,每一条描述一个画面和动作。
  4. 生成画面:用即梦或者ComfyUI生成每个镜头的静态图。
  5. 动态化:用图生视频能力,把静态图变成3到5秒的短视频片段。
  6. 后期合成:用剪辑软件把人声、字幕、BGM和画面组合成完整作品。

这套流程的好处是:你随时可以暂停。今天只做角色设定也行,只生成10个分镜也行,不用一次性把所有事情做完。

1.3 先做一条不超过30秒的样片,再考虑第一集

我接触这个方向之后,最大的一个建议就是先压短战线。不要一上来就规划十集,也不要直接做一集5分钟的长片。先做一条30秒的样片,你就能知道自己卡在哪。

30秒样片可以很简单:

  • 前5秒:角色出场,定住脸。
  • 中间15秒:一个冲突场景,比如对话、追逐、惊讶。
  • 后10秒:一个反转或悬念,然后结束。

样片做完之后,你会明显感知到几个问题:角色侧脸是否变形、视频片段是否能拼接上、配音节奏是否自然、字幕放哪里不遮挡人物。这些只有实际跑一遍才会清楚。

2. 跑通前的准备:即梦账号、电脑配置和ComfyUI部署

做AI漫剧之前,不需要买特别贵的设备,但你得先知道不同工具有什么硬件要求。在线平台和本地工具的准备方式完全不一样。

2.1 在线平台能做什么:即梦、Seedance 这类能力的开箱即用

即梦这类在线AI创作平台,最大的价值是省环境。你只需要注册账号、打开页面、上传参考图或者输入提示词,就能生成图片和短视频。Seedance 这类视频生成模型,实际入口可能会在类似的在线平台上开放,也可能在不同版本里换位置,以你当前页面上开放的模型为准。

在线平台的优点很明显:

  • 不用配置复杂依赖,浏览器打开就能用。
  • 生成速度通常比自己本地跑更快,因为平台用了高性能服务。
  • 模型更新由平台方负责,你不需要维护版本。

缺点也很现实:生成结果受平台审核规则限制,不适合生产内容的边界要提前看清楚;部分平台会有积分或时长限制,同一段素材不能无限重试。

所以在线平台适合零基础学习和快速出素材。如果你想更精细控制角色一致性,或者想批量实验不同参数,就需要本地部署ComfyUI。

2.2 本地ComfyUI的硬件底线:显存、内存和存储

ComfyUI是本地运行的节点式工作流工具。它比在线平台自由,但硬件门槛高不少。尤其是显存,直接影响你能不能跑动某些模型。

使用场景配置建议能跑什么
纯学习/只跑简单图片16GB内存,独立显卡4到6GB显存低分辨率小图,SD1.5类小模型
主流动态漫制作16GB内存,NVIDIA显卡8到12GB显存SDXL等工作流,普通分辨率生成
需要高分辨率+批量任务32GB内存,16GB以上显存更复杂的工作流,更快的批量出图

如果你的电脑只有低显存,也不是完全不能玩。办法是降低分辨率、降低批次数、减少一次性排队的任务数量。比如一个批次只跑一张图,生成512分辨率,慢慢验证。

低配置能跑不代表适合批量。做AI漫剧需要反复生成同一角色,素材量大,显存太紧会频繁报错,体验会差很多。

存储也要预留。一个AI模型文件经常是几个GB到十几个GB,再加LoRA、VAE、插件和工作流缓存,100GB的空闲磁盘比较稳妥。

2.3 整合包不是万能的:模型路径、插件冲突和版本选择

很多新手会直接下载一键整合包,比如秋叶这类社区制作的整合包。整合包确实能省掉大部分安装流程,但别把它当成万事大吉。

最容易遇到的问题有三个:

  1. 模型放错目录。Checkpoint模型要放在models/checkpoints,VAE放在models/vae,LoRA放在models/loras。放错之后节点会加载失败,或者生成黑图。
  2. 插件更新导致节点报错。某个插件升级后,原本能跑的工作流突然在“节点执行过程中发生错误”,这是很常见的情况。先看插件版本和ComfyUI核心版本是否匹配。
  3. 不同整合包自带的依赖版本不一致。你拿别人的工作流导入后,可能缺某个自定义节点,需要在ComfyUI Manager里先安装。

我的建议是:如果完全不懂ComfyUI,先用别人分享的完整工作流入门,但别只点“运行”。要点开每个节点,看它输入输出接的是什么类型。等你能把一个节点挨个解释清楚,才算真正开始会用了。

3. 从剧本到分镜:用即梦生成基础画面和分镜提示词

分镜是整个AI漫剧最耗时间的环节。分镜质量决定了后面视频生成的稳定程度。分镜提示词写得准,后续成本会下降一大半。

3.1 先写短剧脚本:场景、角色、动作和镜头分开列

不要只写一段小说式剧情,然后把整段话塞给AI。AI漫剧是短剧逻辑,节奏快,每一条分镜都应该有明确的画面感。

建议用表格整理:

场次地点角色动作台词情绪镜头
1雨夜街道女主抬头“你终于来了。”紧张半身中景,缓慢推近
2咖啡店男主低头翻账单“这杯我请。”平静侧面近景

先写8到10行这样的分镜表,再开始生成画面。不要先画图再编故事,那样很容易浪费大量生成次数。

3.2 分镜提示词怎么写:主体、环境、动作、镜头语言、画风

用即梦生成静态图时,提示词不需要堆太多形容词。关键是主体、环境、动作、镜头、画风五件事要说清楚。

下面这个例子是一段古装分镜提示词:

一位古代侠客,身穿深蓝色长衫,腰间佩剑,站在竹林里, 竹叶飘落,风吹动衣角, 他微微抬头看向远处,眼神警觉, 中景,镜头缓慢推近,构图留出左侧空间, 国风插画风格,线条干净,光影通透

你可以根据剧集风格调整。如果是现代都市剧,就把“古代侠客”换成“穿黑色风衣的年轻女性”;如果是治愈系AI动漫,就把画风改成“浅色水彩风”。

关键是画风描述要固定。同一个角色在每一条分镜里都要带上相同的服装关键词,比如“深蓝色长衫”“黑色风衣”“红色发绳”。这样AI生成时更有机会保持一致性。

3.3 第一次生成后怎么判断能不能用:构图清晰、主体明确、无畸形

生成图片之后,不要急着导入视频生成工具。先过一遍基础检查:

  • 脸部五官有没有明显变形。眼睛、手指、牙齿是最容易崩的地方。
  • 角色是否和上一张图明显不像。如果发型、衣服颜色变了,说明提示词还不够稳定。
  • 主体位置是否居中。如果主体被切割到画面边缘,后面推镜头会很奇怪。
  • 画面里有没有莫名出现乱码文字、水印、残缺物体。

一旦发现角色形象不稳定,先回头修提示词,或者重新生成一张更好的角色设定图。不要指望视频生成环节帮你修复五官,那是更高成本的操作。

4. ComfyUI角色一致性实操:从套工作流到理解节点

ComfyUI在AI漫剧里的核心作用是角色一致性控制。在线平台虽然方便,但想精确控制同一个人的脸,还是本地工作流更有效率。

4.1 为什么漫剧最需要角色一致性:观众认脸,不认画风

AI漫剧观看过程中,观众最先注意到的是“这个角色这张脸怎么一直变”。正脸还是A角色,侧脸变成另一个人,换个角度又换了一张脸,剧情再好也看不下去。

所以角色一致性不是“可选优化”,而是能不能成片的关键。你必须尽可能让同一个角色在多个镜头里保持相近的五官、发型、服装。

要做到这一点,不能只靠输文字描述。更稳的做法是准备一张或者多张角色参考图,让AI生成时始终参考这张图。

4.2 角色一致性工作流里的核心节点:加载、提示词、采样、保存

ComfyUI是节点式工作流。一张图从模型加载到生成保存,可以拆成几个核心节点:

Load Checkpoint(加载大模型) CLIP Text Encode(正面提示词) CLIP Text Encode(负面提示词) Empty Latent Image(设置画布大小) KSampler(采样) VAE Decode(解码图片) Save Image(保存图片)

它们的顺序不复杂:加载模型之后,把文本提示词转换成语义条件,再在空的画布上采样生成潜空间数据,最后解码成图片并保存。

很多报错就出在节点类型不匹配。比如你从VAE Decode输出的是一张Image类型图片,你不能直接把它连接到需要Latent类型的地方。连线变红或者节点变红,通常就是类型不匹配。

4.3 用参考图约束角色:IPAdapter、局部重绘和基础LoRA思路

想让角色更像同一个人,只靠正向提示词并不够,还需要参考图约束。

常见做法有几种:

  1. IPAdapter:把角色参考图作为额外条件输入到采样器里。生成时,模型会参考这张图的身份特征。适合保持脸型、发型、服装风格。
  2. 局部重绘:用遮罩选中画面中需要重绘的区域,比如只重绘衣服,保留脸不动。适合改服装改动作时维持面部稳定。
  3. LoRA:如果你有足够素材,可以训练一个专属角色LoRA。效果最稳,但门槛也最高。零基础可以先不碰。

对不同插件的安装,实际名称和节点接口会随着ComfyUI版本变化。你导入别人工作流后发现缺节点,不要慌,用ComfyUI Manager按提示补装即可。

别一上来就追求几十个节点的高级工作流。先把加载模型、写提示词、采样、保存这四步跑通,再慢慢加入参考图控制。

4.4 报错排查:节点连接、模型文件、显存不足三个高频问题

新手遇到ComfyUI报错,最常见的就是“节点在执行过程中发生错误”这类提示。看到这个提示,优先按照下面顺序排查:

  1. 看哪个节点变红。红色节点附近的报错信息会写得更具体。
  2. 检查输入连线类型是否正确。Image、Latent、Conditioning、Model不能混接。
  3. 检查模型路径。加载模型失败、模型名称找不到,多半是文件放错目录。
  4. 检查显存。任务跑到中间突然报错,去任务管理器看显存占用,如果接近满值,就降低分辨率和批次数。
  5. 回想最近有没有更新插件。更新后开始报错,多半是版本兼容问题,可以回退插件版本。

这套排查顺序能覆盖掉大部分本地ComfyUI的新手问题。越是感觉“工作流不可能有问题”,越要先看路径和插件版本这些看起来不起眼的地方。

5. 用Seedance和即梦把分镜变成动态视频:动态漫的核心环节

静态分镜生成之后,接下来就是把画面动起来。这个环节决定你是做成了“会动的漫画”,还是像一部完整的AI短剧。

5.1 图生视频和文生视频怎么选:先给角色图,再给动作描述

AI视频生成类工具通常有两种输入方式:

  • 文生视频:只输入提示词,让AI直接生成一段视频。适合空镜、场景介绍、环境转场。
  • 图生视频:输入一张静态图,再输入动作提示词,让AI在图上生成运动。适合角色镜头、关键剧情画面。

做AI漫剧时,我会优先选择图生视频。原因很简单:静态图里的角色是已经定好的,AI只需要在基础上运动,五官变形的概率相对更低。文生视频虽然画面自由度高,但角色连续性和一致性非常难控制。

你可以把即梦当作生成图像的入口,也可以用其他绘图工具。关键是你先有一张能用的基础图,再把它丢进支持图生视频的能力里。Seedance或者类似的视频生成模型,通常也支持输入参考图,具体入口以平台界面为准。

5.2 Seedance提示词:动作、镜头、时长和情绪一步到位

输入动态化提示词时,不要只写“动起来”。你要写清楚:谁在动、怎么动、镜头怎么动、情绪是什么、大概持续几秒。

下面是一个动态漫片段的提示词示例:

古代女子站在庭院中,头微微抬起, 风吹起她的发丝,花瓣飘落, 镜头从中景缓慢推进到面部特写, 眼神从平静转为惊讶, 画面流畅,人物五官不变形, 时间约3秒

注意几个细节:

  • 动作幅度要写具体。比如“平静地抬头”和“猛然抬头”生成结果完全不一样。
  • 镜头运动要明确。是推近、拉远、平移还是环绕。
  • 时长要符合平台能力。常见的短视频生成长度在3到5秒左右,超过支持范围的提示词不一定有效。
  • 情绪描述会直接影响表情,别漏掉。

如果生成结果中出现角色脸变形、肢体扭曲、运动卡顿,就降低动作幅度,或者换一张静态图再试。不要在同一张图上反复重试超过五次,那样很容易浪费时间。

5.3 多片段怎么管:分镜编号、片段时长和素材归档

做一条长片,你会生成几十个片段。如果文件名随便起,比如001002,后期一定会乱套。

我一般会按这个规则命名:

剧名_集数_场景_分镜序号_版本

例如:

风起长安_S01E03_05_v2

对应的意思是:剧名《风起长安》,第一集第三场,第五个分镜,第二个版本。

同时准备一个素材表,记录这些字段:

分镜序号:05 静态图:风起长安_S01E03_05_base.png 视频:风起长安_S01E03_05_v2.mp4 时长:3秒 动态幅度:中 是否采用:待定 问题:第二帧脸部轻微变形

批量制作时,这个表越早建越好。不要等生成了一百个文件再想怎么整理。

5.4 动态漫和AI动画的区别:动态幅度、口型、镜头运动

很多人会把AI漫剧、AI短剧、AI动漫、AI动态漫这几件事混在一起。实际落地上,它们是不同难度的东西。

  • AI动态漫:静态画面加少量运动,比如头发飘动、眼神变化、镜头推拉。成本低,稳定性高,最适合零基础入门。
  • AI短剧:偏向真人影视感的视频片段,角色动作更丰富,拍摄逻辑更接近电影镜头。
  • AI动漫/动画:更强调连续动作、口型同步、表情变化、物理规律。技术难度最高,需要更多帧和更多重试。

做第一集时,不要直接挑战复杂动作。用动态漫的方式完成:每段3到5秒,以镜头运动和小幅度动作为主。这样做能极大降低失败率,也能更快发布作品。

6. 后期剪辑与成片:配音、字幕、BGM和节奏

动态视频片段都生成完后,还要经过剪辑才能变成观感完整的剧集。很多人在这个环节翻车,不是因为画面不好,而是因为剪辑太乱。

6.1 先铺音轨,再剪画面,节奏会更稳

做短剧和动态漫,最影响观感的是节奏。画面一旦拖沓,观众会立刻跳走。

我会建议先把配音录好或合成好,再开始剪画面。这样你能听到每一句台词的节奏,再用手里的视频片段去配合对白。而不是先拼好画面,再配解说,那样经常会出现画面等声音或者声音等画面的空缺。

具体流程可以是:

  1. 在剪辑软件里建一条时间线。
  2. 放入配音音轨。
  3. 根据配音位置,把对应的视频片段摆到上面。
  4. 再插入空镜、转场、语气停顿和BGM。

这样剪出来的成片,节奏会比纯看画面拼接自然得多。

6.2 字幕与AI生成视频的匹配:不要每句话都满屏

AI生成视频里通常带有比较强的美术构图,字幕放不好会遮挡关键内容。我的经验是:

  • 字幕字体统一,不加太多花纹。
  • 字幕位置一般放在画面下方安全区,避开角色脸部。
  • 台词较短时,一句话不要拆成四五个短句连续弹出,容易打断观看。
  • 视频里如果已经自带平台水印或模型生成痕迹,后期应注意不要让它和字幕叠在一起。

如果你要做多集系列,最好一开始就固定字幕样式,包括字号、颜色、描边。这样观众对作品的统一感会更强。

6.3 批量成片时怎么管理工程:素材命名、备份、输出尺寸统一

做系列内容时,工程文件最容易变成一个大杂烩。我的做法是每一集单独建一个文件夹:

S01E01/ assets/ # 静态图、视频片段、音频 edit_project/ # 剪辑工程文件 export/ # 最终成片 notes.md # 本集的分镜表和素材备注

导出的视频参数要尽量统一,尤其是平台要求竖屏还是横屏。如果你准备做抖音、快手、小红书这类平台,一开始就导出9:16竖屏;如果是B站和YouTube,再考虑16:9横屏。

更重要的是一键输出前先导出一个低分辨率版本检查一遍。不要直接渲染4K成片之后才发现某个镜头字幕错位。

7. 新手最容易踩的坑:变形、卡顿、报错和素材不统一

AI漫剧制作过程中,报错和画崩是常态,关键是你知道先看哪里。

7.1 角色五官变形优先检查这三个地方

遇到角色脸变形,先看这三件事:

第一,提示词太复杂。角色关键词和动作关键词混在一起,模型容易顾此失彼。建议把角色描述单独放在正向提示词开头,动作和环境放后面。

第二,参考图太脏。图片上有水印、低清晰度、脸部被遮挡,都会导致生成结果乱飘。角色参考图尽量选择干净的半身或脸部特写。

第三,动作幅度太大。转身、跳跃、大幅度回头这类动作在AI生成时很容易崩。先用小幅动作跑通,再逐步挑战复杂动作。

如果还是变形,就换图生视频而不是文生视频,或者用局部重绘先修脸再动起来。

7.2 速度慢不一定是电脑差:可能是内存、显存和插件互相拖累

本地跑ComfyUI时,生成速度慢有很多原因。显卡差只是其中之一。

你需要先看任务管理器里的数据:

  • 内存满不满。如果内存占用长期90%以上,说明后台程序太多,或者图片批量数开太高。
  • 显存占用情况。显存接近满载,说明分辨率或批次数需要降低。
  • CPU和磁盘占用。模型加载和保存大图时,硬盘速度也会成为瓶颈。

另外,ComfyUI里如果队列里积压了太多任务,新手会以为是卡死,实际只是前面任务还没跑完。不要反复点“运行”,先清空队列,再跑一条任务验证。

7.3 批量制作时的失败重试和输出命名

批量生成意味着你会得到大量不合格素材。不要看到失败就立刻改全局参数,那样会连本来正常的任务一起破坏。

我的建议是:

  1. 先跑单条任务,确保输入、输出、日志都正常。
  2. 再小批量跑2到3条,观察有没有偶发问题。
  3. 最后再加大批量,同时注意失败重试次数和输出命名。

输出命名一定要能反映版本。比如S01E03_05_v2意思是第二版,如果细微调整了参数,保留原文件,另存为v3。不要覆盖旧文件,你后面可能还会想对比效果。

7.4 我的学习路线建议:每天两小时,按周推进

如果每天有2小时左右的时间,可以参考这个节奏:

第一周:熟悉在线平台,生成20张角色图,找到一种稳定画风。

第二周:跑顺ComfyUI基本工作流,加载模型、写提示词、生成图片、保存图片,搞定五个核心节点。

第三周:做一条30秒动态漫样片,完成静态图到视频片段再到成片的全部流程。

第四周:批量生成素材,整理分镜表,完成一集正式内容。

集中火力解决角色一致性,不要第一周就想着做50集。工具更新确实很快,但分镜、素材管理、批量重试和剪辑节奏这些经验,不会因为模型版本变化而过时。

AI漫剧这个事,最容易让人上头的是生成画面的瞬间惊喜,最容易劝退人的则是角色大变脸和一堆报错。真正能把内容稳定做出来的人,靠的并不是某个神级模型,而是把角色设定、分镜提示词、素材归档和失败排查做扎实。等你用自己的角色跑通一条30秒样片,很多之前觉得难的问题,自然就知道该怎么改了。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询