AI漫剧制作全流程:从剧本分镜到图生视频的保姆级教程
2026/9/8 11:58:36 网站建设 项目流程

最近有不少朋友来问我,朋友圈里经常刷到的 AI 漫剧到底是怎么做出来的?自己也想试试,可网上的教程要么只讲某个平台的单点操作,要么就是几十秒听不出重点的短视频。这篇文章我把整套流程拆开讲,从剧本、分镜、AI 绘画、图生视频,到配音和剪辑,每一个环节都会说明“用什么工具、填什么参数、为什么要这么做”,手把手带你把一个 10 秒左右的 AI 漫剧片段完整做出来。适合刚入门的小白,也适合已经接触过 AI 绘画、但还不会串完整流程的同学。

1. AI漫剧是什么,为什么值得学

1.1 什么是AI漫剧

AI 漫剧,简单说就是用 AI 工具生成漫画风格的静态画面,再通过图生视频技术让画面动起来,最后配上台词、音效和剪辑节奏,形成一种类似动态漫画的短剧内容。它介于“漫画”和“真人短剧”之间,既有漫画的画面美感,又有短剧的观看节奏,非常适合手机端竖屏播放。

从技术链路来看,AI 漫剧并不是某一个大模型单独完成的,而是多个 AI 能力的组合:

  • 大语言模型负责写剧本、拆台词。
  • AI 绘画模型负责生成角色和场景。
  • 视频生成模型负责让画面运动起来。
  • 语音合成模型负责配音。
  • 传统剪辑工具负责把所有素材组装成片子。

所以,它本质上是一个“AI + 影视流程”的工程化创作过程。

1.2 为什么现在大家都在做 AI 漫剧

过去做一部二维动画短片,需要原画师、动画师、剪辑师、配音演员等多个角色协作,成本按秒计算。而 AI 漫剧把这套流程大幅压缩,一个人加上几个 AI 工具,就能完成过去一个小团队才能做的事情。

这也带来了几个明确的优势:

  • 制作门槛低:不需要会手绘,不需要懂 3D 建模,关键是会写提示词、会拆镜头。
  • 产出速度快:一个 1 分钟左右的片段,熟练之后可能只需要半天。
  • 批量复制性强:角色和画风确定后,后续续集只需要换剧情和场景。
  • 平台流量红利明显:目前短视频平台上有大量 AI 漫剧账号,观众对这种形式的新鲜感还在持续。

1.3 需要提前纠正的心态

有不少人觉得 AI 漫剧就是“输入一句话,自动生成一部剧”,这个理解需要纠正。现实是:AI 目前只能在“视觉生成”这一步替代传统绘画和动画,但在剧本结构、分镜设计、角色一致性、剪辑节奏这些环节,人的判断仍然决定作品质量。

如果你把 AI 当成一个“非常高产但需要你指挥的美术师”,心态就对了。你需要告诉它画什么、用什么角度、表达什么情绪,它才能真正产出可用的素材。

2. 全流程概览与实际分工

在动手之前,先建立整体认知。一条完整的 AI 漫剧制作链路可以拆成下面六步。

文字剧本 → 分镜拆解 → AI 绘画出图 → 图生视频 → 配音/音效 → 剪辑合成

下面用一张表把每个环节说清楚。

阶段核心任务使用的工具类型产出物
1. 剧本确定故事主题、角色、台词大语言模型、写作软件分集剧本
2. 分镜将剧本拆成一个个镜头表格、思维导图分镜表
3. 绘画根据分镜描述生成静态画面AI 绘画工具分镜静态图
4. 视频把静态图变成动态片段图生视频工具视频片段
5. 配音为台词生成语音,加背景音乐语音合成、音乐素材库音频文件
6. 剪辑拼接片段、对齐音画、调色剪辑软件成片

2.1 为什么必须要有“分镜”这一步

很多人第一次做 AI 漫剧,拿到剧本就急着去生成图片。结果经常是:图倒是很精美,但连不起来,角色、场景、角度全都不统一,剪出来像一堆幻灯片。

分镜的作用是在生成图片之前,把文字转换成具体的画面需求。一个合格的分镜表至少要写明:

  • 画面里有哪些角色和物体。
  • 角色在做什么动作。
  • 镜头距离角色多远(景别)。
  • 镜头是固定还是移动(运镜)。
  • 画面的情绪基调。
  • 对应台词和时长。

分镜表越清楚,后面每一张图就越有方向,剪辑时的连贯性也越好。

3. 制作环境与工具选择

3.1 硬件要求

AI 视频生成这一步,绝大多数情况下由云端算力完成,对本地电脑的压力不大,普通办公本也能跑通流程。但如果你打算在本地部署 Stable Diffusion,就需要一块性能还不错的显卡。

一个参考配置范围如下:

  • CPU:i5 或以上即可。
  • 内存:16GB 及以上。
  • 显卡:NVIDIA 显卡显存 8GB 以上,建议 12GB 或更高。
  • 硬盘:建议预留 50GB 以上空间,用于存放模型和素材。

如果你用的都是在线网页工具,那么普通的轻薄本也足够。剪辑环节建议内存稍大一些,因为现在的剪辑软件对内存占用并不低。

3.2 软件工具矩阵

市面上的 AI 工具更新非常快,我这里给出目前比较常见的几类选择,仅供选型参考。做一个具体项目时,你可以根据自己的组合习惯来搭工作流。

用途常见工具说明
AI 绘画Midjourney、Stable Diffusion、ComfyUI、通义万相、文心一格网页端出图质量稳定,本地端可控性高
AI 视频可灵、即梦、Runway、Pika、Luma核心能力是图生视频,也可以做文生视频
AI 配音剪映内置配音、ElevenLabs、TTSMaker根据台词文本直接合成自然语音
剪辑合成剪映、必剪、Premiere、DaVinci负责拼接、配乐、字幕、调色

3.3 新手选型建议

我的建议是:先用网页工具走通一条完整流程,再考虑本地部署。

理由很简单:本地部署 Stable Diffusion 会牵扯到 Python 环境、模型下载、显卡驱动、显存优化等一系列问题,容易让新手在第一步就被劝退。网页工具虽然可控性不如本地部署,但对于理解“提示词 → 图 → 视频”这条主链路已经足够了。

当你用网页工具做完几个完整作品,对流程有了体感,再回本地折腾部署,你会更容易理解那些参数和模型文件到底在干嘛。

4. 核心概念与参数拆解

4.1 AI绘画生成:从文字到画面

AI 绘画的核心是“通过文本提示词生成图像”。常见的形式有两种:

  • 文生图:直接输入描述,AI 生成一张图片。
  • 图生图:输入一张图片加上文字描述,AI 在保留原图结构的基础上改造出新图。

在 AI 漫剧制作中,图生图用得多一些。因为你需要先确定角色长相,再用这张角色图去生成不同场景里的画面,否则同一个角色每次生成都可能长不一样。

下面这些参数是 AI 绘画中最常遇到的:

参数作用常见问题
提示词描述画面内容、画风、光线、构图提示词越具体,画面越可控
反向提示词告诉模型不要出现的内容可用来排除模糊、多手指、畸形
种子值控制随机性,相同种子可复现同图选一个合适的种子值保持一致性
步数影响生成质量和耗时步数过高提升有限,一般取 20-50
提示词符合度控制画面服从提示词的程度值太高容易出现过度锐化
宽高比决定画面长宽比例竖屏短剧建议 9:16 或 3:4

以 Stable Diffusion WebUI 为例,一个典型配置如下:

提示词: masterpiece, best quality, 1girl, silver hair, red eyes, cyberpunk city, night, neon lights, rain, looking at viewer, half body, dynamic angle, cinematic lighting, detailed illustration 反向提示词: lowres, bad anatomy, bad hands, missing fingers, extra digits, blurry, jpeg artifacts, watermark

这里要说明的是:

  • 画风关键词用masterpiecebest quality拉高画面质量。
  • 人物描述放在最前面,越重要越靠前。
  • cinematic lighting是影视感的关键词,在漫剧画面里非常实用。
  • 反向提示词可以有效减少畸形手、模糊等常见问题。

4.2 AI视频生成:从图片到动态

AI 视频生成是目前整个链路里最“玄学”的环节。主流的方案是“图生视频”:上传一张静态图,再写一句“运动描述”,AI 会分析画面内容并生成一段几秒钟的视频。

图生视频的关键参数如下:

参数作用建议
运动幅度控制画面动态强弱新手先从小幅度开始
镜头控制推拉摇移等运镜方式优先使用工具预设的镜头方向
视频时长单次生成的秒数大多数工具默认 5-10 秒
帧率视频流畅度常见 24fps 或 30fps
运动提示词描述画面里谁在动、怎么动越具体越好,如“头发被风吹动”

运动提示词也有一些技巧。不要把描述重心放在整个场景上,而要放在“主体的动作”和“镜头的运动”上。

一个典型的运动提示词:

the girl turns her head and smiles, hair flowing in the wind, camera slowly pushes in

这句提示词前两段描述人物的动作,最后一段描述镜头的动作。AI 视频模型对“人物动作”和“镜头运动”的理解能力在逐渐增强,所以描述越结构化,效果越稳定。

4.3 镜头语言基础

AI 漫剧虽然是 AI 生成的画面,但它本质上还是影视内容,镜头语言依然决定观众看下来的体验。初学者不需要掌握特别深的理论,但只要理解下面三组概念,成片质感就能提升一大截。

第一组是“景别”。

景别作用使用场景
远景交代环境和空间关系故事开场、转场
中景展示人物动作和对话常见叙事镜头
特写突出表情、细节、情绪高情绪片段

一组 10 秒的片段里,如果全是同一个景别,画面会非常平。合理穿插特写和中景,节奏感立刻能拉起来。

第二组是“运镜”。

  • 推:镜头靠近主体,增强情绪张力。
  • 拉:镜头远离主体,展示环境,常用于结尾。
  • 摇:镜头在固定位置旋转,展示场景全貌。
  • 移:镜头横向移动,有跟随感。

图生视频工具大多内置了“推进”“拉远”“左移”“右移”等运镜选项。你可以根据分镜表提前规划好每个镜头用哪种运动。

第三组是“转场”。

  • 硬切:两个镜头直接衔接,节奏快。
  • 叠化:前一个画面淡出,后一个淡入,适合时间流逝。
  • 缩放转场:后一镜头从某一局部放大进入,短视频里常用。

这些转场既可以靠剪辑软件实现,也可以在生成视频时通过“运动提示词”提前预留。

4.4 角色一致性方案

角色一致性是 AI 漫剧制作里最大的痛点。同一个角色,第 3 秒和第 6 秒可能脸就变了。要解决这个问题,有几个常用方案。

第一,使用参考图。在 AI 绘画工具里上传定好的角色图,再配合文字提示词让模型基于这张图生成新的画面。大部分支持图生图或参考图功能的工具都能实现。

第二,固定种子值。绘画工具中的种子值决定了初始噪声,同一个种子值在相同提示词下能复现相似结构。实际制作时,可以先选一个满意的种子值,后续所有该角色的镜头都尽量使用同一个种子,再通过修改场景和动作关键词来变化构图。

第三,训练角色 LoRA。如果你已经熟悉 Stable Diffusion,可以收集角色不同角度的图片,训练一个专属角色模型。这种方法一致性最好,但成本也最高,适合做长系列作品时投入。

5. 保姆级实战:从 0 到 1 制作 10 秒 AI 漫剧片段

前面铺垫了不少概念,下面进入实战环节。这次我们做的目标是:一段约 10 秒的竖屏 AI 漫剧片段,包含 3 个镜头,有简单的剧情、台词和配音。

5.1 编写一段短剧本

剧本不需要长,关键是结构完整。这里以“废墟中的少女机甲师”为主题写一个微型片段:

场景:战后废墟城市 角色:少女机甲师「星野」,银发红瞳,身穿白色战斗服 镜头情绪:孤独、回忆、决定 台词: 星野(内心独白):“这座城市的天空,已经很久没有放晴了。” 星野(对 AI 伙伴):“启动引擎,我们再去试一次。”

这三句话刚好对应三个镜头,方便拆解。

5.2 拆解分镜脚本

把上面的剧本拆成分镜表。注意每一行都要包含镜头描述、景别、运镜、台词和预估时长。

镜号画面描述景别运镜台词时长
S01女孩站在废墟楼顶,抬头看灰色天空,雨丝飘落中景缓慢推进内心独白第一句4秒
S02女孩眼角特写,眼神从迷茫变得坚定特写固定内心独白第二句3秒
S03她转身走进身后的机甲驾驶舱,舱门关闭,指示灯亮起中景跟随横移“启动引擎”3秒

分镜拆完之后,后面的提示词生成就不再漫无目的了。你可以清楚地知道每张图应该画什么。

5.3 编写提示词并生成角色设定图

在生成每个镜头之前,先做一张角色设定图。这张图会变成一个“锚点”,后续所有镜头都尽量以它为参考。

角色设定图提示词示例:

masterpiece, best quality, 1girl, silver hair, red eyes, white pilot suit, short hair, determined expression, full body, standing pose, character sheet, simple grey background, studio lighting, anime style, detailed lineart

角色图生成后,检查是否符合你心中的“星野”。如果不满意,修改提示词重新生成;如果满意,把这个结果保存到一个固定目录,后续每个镜头都使用这张图作为参考图。

5.4 生成每个分镜的静态图

接下来逐个生成分镜头画面。以 S01 为例,提示词如下:

masterpiece, best quality, 1girl, silver hair, red eyes, white pilot suit, standing on ruined building rooftop, ruined city, gray sky, rain, broken metal bars, medium shot, looking up at sky, sad atmosphere, cinematic lighting, detailed illustration

生成之后注意检查三件事:

  • 角色长相是否和设定图一致。
  • 画面构图是否符合分镜表里的“中景”。
  • 场景氛围是否传达出“孤独、压抑”。

如果角色脸部变了,先别急着修细节。回到图生图模式,把设定图和当前图叠一下,再加关键词重新融合,这样比修图更快。

三个镜头都生成后,你的素材目录应该是这样:

ai-manju-demo/ ├── scripts/ │ └── story_001.md ├── prompts/ │ ├── character_prompt.md │ └── shot_prompts.md ├── assets/ │ ├── raw/ │ │ ├── character_sheet.png │ │ ├── shot01_v1.png │ │ ├── shot02_v1.png │ │ └── shot03_v1.png │ ├── clean/ │ └── audio/ ├── clips/ └── output/

这个目录结构方便你后续做系列作品时复用素材,不会越做越乱。

5.5 用图片生成视频

图片准备好之后,进入图生视频环节。以上传 S01 图为例,你需要在视频工具里设置如下参数:

  • 上传图片:选择shot01_v1.png
  • 运动提示词:girl looks up at the sky, rain falls slowly, camera slowly pushes in
  • 时长:4 秒
  • 镜头方向:推进
  • 运动幅度:低

这里有一个容易踩的坑:运动幅度太大,人物面部会发生明显变形。你想让雨飘得更明显,那就把“rain falls”写进提示词,而不要盲目拉高运动幅度。

S02 和 S03 也按照分镜表里的运镜设定依次生成。S02 建议固定镜头,S03 建议横移镜头,这样三个镜头之间的运动方式有变化。

生成完成后,把三段视频保存到clips/目录。

5.6 生成配音并完成剪辑

配音可以直接在剪映里操作。把台词文本粘贴到文本朗读功能里,选一个偏“冷静叙事”的声音,按分镜时长导出三句配音。

剪辑时,把三段视频按顺序放上轨道,然后把三句配音对齐到对应镜头。注意 S01 是 4 秒,S02 是 3 秒,S03 是 3 秒,配音时长要尽量匹配,否则容易出现“画面已经切了,声音还没说完”的问题。

最后加上背景音乐、简单的字幕条,导出成片。

如果你希望批量自动化处理视频合并,也可以使用 ffmpeg 命令行。假设你有三个视频片段和一段音频,可以这样合并:

# 将片段列表写入 concat 文件 cat > clips.txt <<EOF file 'clips/shot01.mp4' file 'clips/shot02.mp4' file 'clips/shot03.mp4' EOF # 合并三个片段 ffmpeg -f concat -safe 0 -i clips.txt -c copy temp.mp4 # 混入音轨 ffmpeg -i temp.mp4 -i assets/audio/voice_mix.mp3 -c:v copy -c:a aac final_output.mp4

最终输出的final_output.mp4就是这个 10 秒 AI 漫剧片段的成片。

6. 常见问题与排查思路

AI 漫剧流程里,新手最容易卡住的几个点,我整理成了表格。

问题现象常见原因解决思路
生成的人物脸部崩坏提示词缺少画质关键词,或运动幅度过大增加best quality,降低运动幅度
同一角色在多张图中长相不一致没有使用参考图或固定种子值用角色设定图做参考,固定种子
视频片段画面闪烁严重静态图和运动提示词不匹配简化运动提示词,降低运动幅度
画面像 PPT,运动感不足提示词只描述了场景,没有描述动作在提示词中同时描述主体动作和镜头运动
竖屏构图被裁剪忘了设置 9:16 宽高比在绘画和视频工具中都检查画幅比例
配音和画面时长不对齐分镜表没有控制台词时长写分镜时就限定时长,剪辑时按镜头精切
生成素材太多不好管理没有统一命名和目录规范S01_E02_Shot03的方式归档
部分平台对画面内容审核严格没有读平台内容规则避免暴力、敏感构图,理性合规创作

下面挑几个重点问题详细说明。

6.1 角色崩坏

角色崩坏的根本原因是 AI 绘画的随机性。每次生成时,模型都会重新“理解”人物特征,导致角色五官细节发生变异。

解决优先级如下:

  • 第一步:使用角色设定图作为参考图。
  • 第二步:固定种子值。
  • 第三步:在提示词中明确写出发色、眼睛颜色、服装样式。
  • 第四步:如果前三步还不够,考虑训练角色 LoRA。

只要角色一致性做好,后面所有环节的效率都会明显提升。

6.2 视频画面闪烁

图生视频工具在生成几秒的片段时,偶尔会出现动态区域的不稳定。闪烁往往发生在光线变化、布料飘动、雨雪等粒子效果较强的画面里。

我的建议是:

  • 优先做小幅度运动,让 AI 不做过激判断。
  • 粒子效果多的场景,运动幅度尽量保持低。
  • 成片后用剪辑软件的降噪功能轻微处理。

如果画面中有大面积雨雪,又不希望闪烁太严重,可以尝试减少雨雪的密度提示词,比如把heavy rain改成light rain

6.3 竖屏尺寸被裁剪

不少 AI 绘画工具默认生成的是 1:1 或 16:9 的图片,把这张图直接丢进视频工具,再裁剪到 9:16,角色很容易被切头或切身体。

更稳妥的做法是:在绘画阶段就直接设置 9:16 或 3:4 的宽高比,确保构图居中,人物主体不要顶到画面边缘。

7. 工程化与效率提升建议

7.1 素材命名规范

AI 漫剧往往不是一次性项目,而是连载式内容。前期命名不规范,后期剪辑时就会浪费时间。

推荐按以下格式命名:

S01_E02_Shot03_V2.png

含义是“第 1 季第 2 集第 3 个镜头的第 2 版”。同时在prompts/目录里保存对应的提示词文件,这样你可以随时回溯“这张图当时是怎么生成的”。

7.2 提示词工程化

不要每次生成都临时编提示词。把提示词拆成固定模块,能大幅提高出图效率。

比如你可以建立四个模块:

质量词:masterpiece, best quality 角色词:1girl, silver hair, red eyes, white pilot suit 环境词:ruined city, rain, gray sky 风格词:anime style, cinematic lighting

每次生成新镜头时,只需要改环境词,其他模块保留即可,这样既省时间,又能维持角色一致性。

7.3 批量处理思路

当镜头数量变多时,手动一张一张生成会比较累。如果你用的是支持 API 的绘画工具,可以考虑写脚本批量提交。

下面是一个使用 Python 管理素材和提交提示词文件的简单示例,它不会真正调用某一个具体 AI 的 API,只展示批量流程思路:

# 文件路径:tools/generate_batch.py # 用途:读取 prompts 目录下的提示词文件,逐个打印出来并保存生成记录 """ 本脚本是批量生成思路的最小示例。 实际使用时要根据你选择工具的 API 文档接入对应接口。 """ import os PROMPT_DIR = "prompts/shot_prompts" OUTPUT_LOG = "output/generation_log.txt" def list_prompt_files(directory): files = [] for fname in os.listdir(directory): if fname.endswith(".txt"): files.append(os.path.join(directory, fname)) return sorted(files) def main(): prompt_files = list_prompt_files(PROMPT_DIR) if not prompt_files: print("未找到提示词文件,请先在 prompts 目录创建 .txt 文件。") return with open(OUTPUT_LOG, "a", encoding="utf-8") as log: for index, prompt_file in enumerate(prompt_files, start=1): with open(prompt_file, "r", encoding="utf-8") as f: prompt = f.read().strip() print(f"[{index}] {prompt_file}: {prompt[:80]}...") log.write(f"{prompt_file}\n{prompt}\n---\n") if __name__ == "__main__": main()

这段代码的作用是把每个镜头的提示词文件批量读取出来并做记录,方便后续核对。真正的 API 调用要比这复杂,但核心思路是一样的:把“提示词”和“生成参数”结构化,然后批量执行。

7.4 质量把控与备份

在正式做长篇内容之前,先花时间建立自己的质量基线。比如:

  • 角色图至少生成 5 版,从中选 1 版。
  • 每个镜头图至少选 2 个候选再转视频。
  • 视频片段生成后立刻预览,有严重变形就重做。

另外,原始素材和成片一定要备份。AI 工具生成的内容,尤其是视频,往往有随机性,错过了可能很难完全复现。

7.5 版权与合规意识

AI 漫剧创作涉及版权问题,要养成几个习惯:

  • 了解所用 AI 工具的服务条款,确认生成内容能否商用。
  • 不要直接模仿现有动漫、影视 IP 的角色和画风。
  • 背景音乐优先使用无版权素材库,或者购买商用授权。
  • 发布到平台前,确认内容符合平台审核规则。

这些问题在前期不注意,后期可能带来下架甚至法律风险,需要从一开始就重视。

8. 总结与下一步

这篇教程从 AI 漫剧的概念讲起,带你梳理了从剧本、分镜、AI 绘画、图生视频到剪辑的完整链路。核心要点是:AI 漫剧不是一个“一键生成”的神奇工具,而是一套流程。角色一致性是最大的关键点,分镜脚本是质量的基石,其他环节更多是技术执行。

下一步,你可以先按照第 5 节的实战流程完整做一个 10 秒片段,感受一下整个链路。等跑通之后,再考虑横向扩展:做更长剧情、训练自己的角色 LoRA、或者用 API 搭建半自动化的批量生产流程。过程中遇到问题时,回到第 6 节的排查表,大部分高频卡点都能找到对应思路。

如果这篇文章对你有帮助,可以收藏备用。等你做出自己的第一条 AI 漫剧片段,再回来看一遍,应该会有不一样的理解。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询