我家那位最近有了一个固定流程:晚饭后说去一趟洗手间,然后四十分钟不出来。我开始以为他在偷偷打游戏,直到有次从门缝里看见,手机屏幕上正在放一种“漫画会动”的小短剧,人物能转身、能眨眼,画面卡在一个悬念上,紧接着又跳到下一集。他得意地告诉我,这东西叫AI短剧,不花钱一天能刷几百集。我第一反应是不信,但自己顺手在视频平台刷了十分钟,发现算法已经开始给我推第二十条同款内容了。再一查,从“AI漫剧”到“AI短剧制作全过程”的搜索量都在涨,连朋友圈里几个做自媒体的人,也开始讨论要不要批量生产这种视频。
这篇文章我想把这些天查资料、看内容、亲手做测试的经验一次说清楚。不吹不黑,先从“为什么它这么能刷”讲起,再拆开一部AI短剧背后究竟站了哪些AI工具,最后给一套零成本也能上手的制作流程,以及我在批量测试中踩过的坑。如果你只是好奇这玩意儿为什么火,或者正琢磨要不要入局做AI短剧,这篇应该都能给你一点参考。
1. 一天几百集是怎么刷出来的:AI短剧的供给爆发逻辑
1.1 先把概念理清楚:AI短剧、AI漫剧和动态漫画的边界
很多人第一次看到AI短剧,都会有一个共同困惑:这到底是短剧,还是漫画?它跟传统短剧最大的区别,就是画面不是真人在演,也不是传统动画团队一帧帧画出来的,而是AI根据文字描述生成静态图片,再通过视频生成模型把图片变成带动作的连续镜头。由于大部分作品保留着明显的漫画质感,业内早期叫“AI漫剧”,后来随着工具迭代,变成更广义的“AI短剧”。
那它跟动态漫画有没有区别?有。动态漫画一般是在已经画好的漫画原稿上做局部动效、镜头推拉,它的“画”来自人类画师;AI短剧则是从无到有,由大模型直接生成角色、场景和分镜。你可以把AI短剧理解成“人类负责构思和把关,AI负责出图、出动作、出声音”的一种新内容形态。现在很多平台的AI短剧,单集时长普遍在1到3分钟,信息密度极高,第一集结尾必留钩子,整个节奏就是冲着“让你点开下一集”去的。
理解了这一点,再看“一天刷几百集”就不奇怪了。它天生是为碎片时间设计的,不需要你记住复杂的人物关系,剧情套路基本就是打脸、重生、逆袭、战神回归这几板斧,只是套上了不同的皮。你刷到的每一集都像一颗高糖分的糖,停不下来不是因为你意志力差,而是这玩意儿的设计逻辑就是让你停不下来。
1.2 为什么AI能把制作成本打下来一个身位
传统真人短剧为什么不能做到“一天刷几百集”?不是创意不够,是产能被物理世界卡住了。真人短剧需要编剧、演员、摄影、灯光、场地、服化道,再快也得按天来算。哪怕一部低成本的微短剧,单集制作成本也要几千到几万,拍摄周期从几周到几个月不等。更新频率能保持日更的团队已经算高产,想做到“批量产出、一天上线几十条新内容”,几乎不可能。
AI短剧把其中大部分环节搬到数字空间里。一集的完整链条大概是:大模型写剧本,AI绘画工具生成角色和场景图,图生视频模型生成动态镜头,语音合成负责配音,自动剪辑再合成字幕和音效。这里面没有演员片酬,没有摄影棚租金,没有天气和档期问题。理论上,只要你的提示词稳定、工具熟练,一天生成几十条成片并不是天方夜谭。许多初期入局的个人创作者,甚至只靠一个账号加免费额度就能跑通流程。
成本降下来的另一个重要因素是“模板化”。AI最擅长的事情,就是从海量数据里学会某种模式的概率分布。爆款短剧的套路是最容易学的,冲突怎么铺、台词怎么写、结尾怎么留钩子,都有规律可言。创作者要做的不是绞尽脑汁想一个天马行空的故事,而是把已经被验证的模板交给AI,在关键节点上人工把关。所以供给端自然就爆发了。平台每天收到海量AI短剧投稿,再通过算法分发,观众这边感受到的就是:“怎么刷都刷不完,还都长得差不多。”
1.3 算法推荐与“爽感飞轮”:观众为什么停不下来
从需求端看,AI短剧恰好踩中了算法推荐想要的几个指标:完播率高、跳出率低、复看率高。单集很短,看完了大概率会顺手刷下一集;每一集结尾都留着悬念,钩子会驱动你继续下滑;内容极度通俗,不需要动脑,特别适合在通勤、睡前,或者上卫生间这种不想被外界打扰的时段。
你可能想问,为什么偏偏是“躲进厕所的丈夫”这类人群在沉迷?其实不限于男性,只是“厕所”成了最典型的私密刷剧场景。一个人在封闭空间里,眼皮子底下没有任何待办事项,手上的屏幕就成了最强的多巴胺来源。AI短剧没有复杂的视听门槛,戴个耳机就能看,比刷社交媒体还省力。而且它免费——至少表面上免费,代价是你看广告、停留时长、帮助平台增加数据。从商业角度讲,这种内容本身就是一种高度商品化的注意力产物。
我不是要批评谁,我自己也刷过,而且刷完确实会有一瞬间的“空”。只是想提醒一点:当你发现刷短剧的时间已经影响到正常生活节奏,比如一天几百集、半夜不睡觉,那就需要给自己设个“娱乐额度”。AI短剧本质上是一种内容消费品,它没有原罪,但沉溺于高度同质化的爽感,对个人的信息摄入结构其实是不健康的。这个坑咱们后面在内容创作部分还会提到,因为对一个创作者来说,理解用户为什么上瘾,才是做爆款的前提。
2. 拆开一部AI短剧看看:四个工序背后的AI工具链
2.1 剧本与分镜:大语言模型先当“代笔”
一部AI短剧的起点,不是画图,而是写剧本。这里的主角是各类大语言模型,比如ChatGPT、Claude、Kimi、通义千问、豆包等。只要把类型、集数、单集时长、主角设定、节奏要求写清楚,大模型就能在几十秒内产出一个完整的分集大纲和每集台词。你甚至可以把它当成一个全天在线、从不喊累的编剧助理,前期搭建世界观、中期写分集,后期不满意还能随时推翻重来。
实际操作中,提示词决定了剧本质量。我一般会让AI先列一个“总纲”,包括故事发生的世界观、主角的人设、核心冲突、金手指是什么;然后再针对单集生成“分集梗概+台词脚本+结尾钩子”。为了让AI少说空话,我会要求它“每一集必须有至少一个冲突反转,结尾必须停在一个未解决的问题上”。这个命令式的措辞看着粗暴,但实测效果远比“帮我写一个精彩短剧”好得多。
有人担心AI写出来的剧本同质化严重。确实如此,因为大模型默认取的是概率最大的词,写来写去容易一个味。解决办法是提供足够具体的“约束条件”:比如“女主是药膳师,反派是家族企业的营养师”“男主全程不出声,只靠眼神和动作表达”“故事发生在架空民国风格的南方水乡”。约束越具体,AI产出的东西就越不容易跟别人撞车。把大模型当成一个愿意听你指挥的高产小编剧,而不是一个全知全能的创意之神,是这步的关键心态。
2.2 画面生成:AI绘画负责“画”,图生视频负责“动”
剧本有了,下一步是把文字变成画面。目前用得比较多的AI绘画工具有Midjourney、Stable Diffusion、即梦、文心一格等。AI短剧的主流做法是先让AI生成足够多的分镜图,包括角色设定图、场景空镜、双人对话镜头、特写镜头,再把这些图片扔进图生视频工具里。分镜图的质量基本决定了成片的下限,所以这个环节不能偷懒。
图生视频是AI短剧从“静态漫画”变成“动态短剧”的关键一步。市面上常见的工具包括可灵、Vidu、Runway、Pika,以及不少国产平台。操作逻辑大同小异:上传一张或多张图,输入你对镜头运动的描述,比如“镜头缓慢推进,人物头发被风吹动”,模型会生成2到10秒的动态片段。生成完成后,如果某个镜头人物表情崩了,就重新生成或局部调整。为了让大家有个直观印象,我整理了一个目前常用的选型参考表。
| 工具类型 | 代表工具 | 主要用途 | 起步成本 | 我的评价 |
|---|---|---|---|---|
| 大语言模型 | ChatGPT、Kimi、豆包 | 剧本、分镜、台词 | 免费额度/低月费 | 写框架够用,关键要会提约束 |
| AI绘画 | Midjourney、SD、即梦 | 角色、场景、分镜图 | 免费额度/订阅制 | 追求一致性要学LoRA或参考图 |
| 图生视频 | 可灵、Runway、Pika | 让静态图动起来 | 免费积分/按量付费 | 运动幅度是玄学,多试 |
| TTS配音 | ElevenLabs、剪映配音 | 对白、旁白 | 免费额度/会员 | 情绪比音色更重要 |
| 剪辑 | 剪映、Premiere | 拼接、字幕、转场 | 免费为主 | 剪映足够起步 |
选哪个工具,取决于你的需求和预算。我自己的经验是,免费或低成本优先考虑国产工具,对中文场景和提示词理解更好;追求画质和动态细节可以试试Runway。没有绝对的最优工具,因为AI视频生成迭代太快,一个月前的评测可能就过时了。你真正要训练的是自己的审美和镜头感,工具只是不同牌子的画笔。
这里要做个提醒:不要一上来就追求整段视频一次生成。现在很多AI短剧平台确实可以输入提示词直接生成整集,但效果往往不可控。如果你是手工流水线,最优解是先定分镜,再逐镜头生成小片段,最后在剪辑软件里拼起来。这样虽然看起来“笨”,但容错率高,素材利用率也高。后面第三部分我会详细拆这段流程。
2.3 配音、音效和字幕:TTS与自动化剪辑的配合
画面和音频是两条线。AI短剧的配音大多依靠语音合成工具,比如ElevenLabs、微软Azure TTS、剪映自带配音、魔音工坊等。TTS的好处是快,直接把台词文本粘贴进去,几秒钟就能得到一条干净的人声,还能调语速、情绪和音色。对AI短剧来说,配音是决定“像不像正经剧”的关键因素,一个自然、有情绪起伏的声音,比画面更能拉观众入戏。
音效和BGM多数来自素材库,剪映自带曲库足够起步。字幕可以直接用剪映的识别字幕功能,或先用语音识别工具得到SRT字幕文件再导入。剪辑时,我会先在时间线上把每个镜头的顺序排好,再把对应的配音按台词位置对准,然后在镜头切换处加一些转场音效,比如“唰”一下的Comic Pop,能强化漫画感。整个过程听起来繁琐,但在剪映这类非线性剪辑工具里其实很快,熟练之后一个3分钟单集半小时就能粗剪完。
这整个流程完全可以半自动化。技术能力强一点的朋友,可以写脚本调用TTS接口批量生成配音,再用ffmpeg按时间轴拼接片段;不想碰代码,就用剪映的“图文成片”功能,把脚本贴进去,让软件自动匹配画面。很多AI编程工具也能帮你快速写出这类批量处理脚本,把“AI短剧制作全过程”进一步压缩成“AI agent自动流水线”。这些工具组合起来,等效于一条个人AI短剧生产线。
2.4 正在出现的“一站式AI剧生成平台”
如果你觉得“AI绘画+图生视频+TTS+剪辑”这套组合太折腾,市面上已经出现了一站式AI剧生成平台。它们的形态各有不同:有的是像角小蛙这类面向AI漫剧的工具,输入小说或剧本,自动生成分镜和配音短片;有的则是把AI短剧制作全过程打包成网页应用,让你在线完成从文本到成片。这类平台的核心卖点是“把多工具整合成一条流水线”,对小白非常友好。
这类平台的优点是好上手,尤其适合文案创作者,不需要学习Stable Diffusion、不用懂剪辑节奏。缺点也有:模板化程度高,生成结果雷同;部分平台限制免费用户的分辨率和水印;当流量起来之后,想精细化打磨某一集,平台反而成了瓶颈。我还遇到过的一个情况是,平台更新版本后,之前的生成参数可能失效,需要重新摸索,这种依赖会让你对工具的掌控感变弱。
我的建议是,新手可以先拿一站式平台跑通全流程,感受一下AI短剧的制作手感,然后再决定要不要往深度工具链迁移。别一上来就买一堆付费工具,先用免费额度把第一批烂片做出来,比研究什么工具最强重要得多。
3. 零成本从零做一条AI短剧:我的完整实操流程
3.1 先让大模型写一个带钩子的10集大纲
无论你用什么工具,先要有一个文本脚本。我以“10集×3分钟”的小短剧为例,给大家看一下我常用的提示词结构。
你是短视频平台爆款短剧编剧。请写一部现代都市“女配逆袭”题材短剧,共10集,每集约3分钟。主角是普通打工人林栀,反派是她的顶头上司和绿茶同事。要求:每集必须有冲突升级,结尾停在悬念上;台词口语化,不要旁白;三个主角的性格要突出;第一集就要让观众讨厌反派并站队女主。
把这段提示词丢给大模型,你会得到一个总纲和分集梗概。下一步是让人工卷起来:我把分集梗概逐条读一遍,改掉那些“废话文学”和“为了反转而反转”的情节,再让AI对某一集扩写成完整的台词稿。这里的关键是你要有“编导”思维,而不是直接复制粘贴。AI给出的初稿可能只有60分,但修改成本远低于从零写一集。
写台词时我会特别强调“信息前置”,就是说人物动机和关系必须在前30秒交代清楚。短剧最忌讳慢慢铺垫,因为观众随时会划走。给AI补充一句:“第一集前30秒必须让观众知道女主的处境有多惨。”你会发现它给出的开头会变得完全不同。这个小技巧从传统短剧编剧那里学来,放到AI短剧一样管用。
3.2 用“角色设定卡”锁住主角的脸
AI短剧最让人出戏的问题,就是角色不稳定:第一集女主是高马尾,到第三集突然变成短发了,观众直接懵掉。解决这个问题,必须从生成第一张图的时候就做好“角色设定卡”。
我在实际操作中分三步:
- 先用AI绘画工具生成一张主角初始形象图,要求半身、正面、清晰五官。比如“年轻女性,柳叶眉,眼角有泪痣,黑色长发扎成高马尾,穿着白色衬衫,简洁干净的职场漫画风格,正面视角”。
- 以这张图作为参考图,再生成同一个人物的侧面、背影、特写等不同角度。生成时保留参考图并固定seed值,同时在提示词里重复描述初始形象。
- 如果要用同一角色做很多集,建议训练一个角色LoRA。LoRA相当于给模型加装了一个“角色皮肤”,训练素材只需要10到20张不同角度的角色图,之后在提示词里写上触发关键词,角色就能保持统一。
零成本阶段,先用参考图+固定seed撑住,够用了。如果你发现某一集角色脸崩了,不需要全盘重画,用局部重绘把脸部区域单独重新生成,再合成本来画面即可。这个操作听着复杂,但在Stable Diffusion系工具里属于基础功能,很多一键整合包里都有图形界面。另外要注意“角色设定卡”不仅仅包括脸,还包括服装、发型、标志性配饰,这些元素越固定,AI在后面生成场景图时越不容易把角色带偏。
3.3 图生视频的生成策略:别一上来就做整集
很多新手第一次用图生视频工具,恨不得一次生成一分钟的完整片段,结果不是画面崩坏就是角色动作诡异。我踩过这个坑之后,把策略改成了“按镜头生成,少量多次”。
这里说的“镜头”,是指一个最小可独立的画面单元。比如“女主推门进入办公室”“反派从椅子上站起来冷笑”“窗外的雨滴落在玻璃上”分别就是不同镜头。每个镜头生成2到5秒的动态片段,生成时用一句话描述运动和情绪,不要搞复杂长句。比如我会写“镜头从肩膀后侧越过,女主抬头,眼神从低落变为坚定”,而不是“女主很生气然后决定反击”。
参数方面,分辨率建议统一为竖屏9:16,帧率在24到30之间。运动幅度是关键:幅度设太大,角色容易变形;幅度设太小,画面又像PPT。我一般把运动幅度调到中等,然后根据结果微调。如果某个镜头怎么调都不满意,就尝试从同一张图的不同裁剪区域生成,或者给画面增加前景遮挡物(比如桌子、门框),这样既能增强空间感,也能掩盖AI生成时的变形。
生成完所有分镜后,素材会有大量冗余。不要每一段都留着,我会把明显崩坏、构图重复的直接删掉,保留每个镜头最好的2到3个备选,方便剪辑时做动作衔接。这个阶段需要耐心,但它是AI短剧看起来“高级”和“廉价”的分水岭。
3.4 配音字幕与成片封装:怎么在半天内走完流程
剪辑是整个制作过程中最像“传统手艺”的一环。我会先把所有确认可用的视频片段按剧本顺序拖进剪映时间轴,然后把每句台词对应的TTS音频拖到对应片段下方。这里有个技巧:先铺音频再配画面,比先排画面再放声音要顺得多,因为TTS音频的长度天然决定了镜头需要停留多久。
接下来就是加字幕。剪映的自动识别字幕对标准普通话TTS准确率很高,基本不需要大改。如果你用的是特殊音色或者方言,也可以手动改几条。然后加上背景音乐、转场音效、片头片尾动画,最后统一导出。对于一部10集的短剧,如果是第一次做,整个流程可能花两三天;做到第三条以后,半天出一条并不是夸张。
这里说一句“不花钱”的真相:纯免费工具确实能跑通,但有代价。免费账号通常有每日生成次数限制,视频工具会加平台水印,配音工具的音色选择少。如果只是玩票,完全够用;如果打算稳定更新账号,建议做一个小预算:一个月几十块钱的会员组合,换来的是省下大量等待时间和更好的素材质量。投入产出比其实很高。
4. 批量生产最容易翻车的四个地方
4.1 主角脸一直在变,怎么让它稳定下来
这是AI短剧制作里被吐槽最多的问题。同一张角色设定图,换了个场景之后,人物五官和发型就走样了。原因是AI绘画的随机性太强,哪怕提示词一模一样,换一个seed值生成的脸就不一样。要稳定,核心思路是“给AI一个明确的锚点”。
参考图权重是第一个锚点,让模型在生成时尽量向参考图靠拢。第二个锚点是固定seed和步数,同一批种子下生成的风格会更接近。第三个锚点是角色LoRA,最稳定但前期准备成本高。如果你只是想在场景里固定某个角色,还有一个偏门但好用的方法:先生成一张“角色多视图设定图”,再在需要新场景时,把这张设定图和自己想要的场景描述一起丢给图生图模型,让模型“把设定图中的人物放到新场景里”。这比单纯靠提示词要稳得多。
批量制作时,我还会维护一个“角色资产表”,记录每个角色的触发词、seed、参考图路径、常用服装描述。每次生成新镜头前先对照这张表写提示词,而不是凭记忆自由发挥。这看起来有点死板,但当你同时做几个不同短剧时,就会发现它是救命稻草。
4.2 动态感不足,AI视频像PPT的解法
AI短剧翻车的另一个常见场面是:画面确实在动,但动得很有限——人物嘴巴在动,身体纹丝不动;镜头只做了个极缓慢的推近,整体观感就像加了滤镜的PPT。动态感不足,根子在于图生视频模型对输入图片的“动态潜力”感知不够强。
解法有几个方向。第一,在生成时提示词里明确写“镜头推拉摇移”或“人物转身、抬头、撩头发”这类具体动作,而不是写“动态一点”。第二,给图片增加动态元素,比如飘动的窗帘、落下的雨滴、翻动的衣角,这些元素会让视频看起来更“活”。第三,在剪辑阶段给静态镜头做后期补偿,比如用关键帧加一个轻微放大,或者模拟手持拍摄的抖动,缺点是容易显得廉价,要控制幅度。最后,如果某个镜头必须展示“角色说话”,可以优先用支持音频驱动的嘴型工具,让配音文件驱动人物嘴巴,观感会好很多。
我自己的经验是:一次生成动作幅度太大的视频,翻车率极高;反过来,生成一个“轻微动作+强镜头运动”的组合,成功率会高很多。所以我的默认写法是“人物站在原地轻微呼吸,镜头缓慢推近”,这样既稳又有动态感。台词部分再单独用嘴型工具处理,最后在剪辑台拼接。这套组合虽然多了一步,但很少出现不能用的素材。
4.3 同质化严重,平台不推流怎么办
当你刷到第100条AI短剧,会发现它们像同一个模子刻出来的。最直接的影响是观众审美疲劳,平台算法也会因为内容同质化而降低推荐权重。做AI短剧想要有流量,核心不是“生成得快”,而是“让人一眼记住你的画风和故事”。
差异化可以从几个维度入手。题材上避开最卷的“战神赘婿”“重生复仇”,试试职业剧、种田文、历史架空甚至科幻惊悚。美术风格上,水墨风、像素风、3D渲染风、复古胶片风都能和主流拉开差距。叙事节奏上,有人可以尝试“无对白纯音效”“双线并行”“伪纪录片”等玩法。我自己的感受是:工具越普及,创意和审美就越值钱。只会把热门题材复制粘贴、批量上传,最后只能被平台算法和观众双重抛弃。
另外一个小提醒:做批量生产时,不要开小号搬运同一个视频到多个平台,更不要做简单的镜像、倍速处理来逃避查重。现在平台对AI内容的识别能力也在变强,而且观众也不傻,同样的套路多看几次就失去新鲜感了。与其把精力花在“怎么多薅一点流量”上,不如琢磨怎么把某一种画风或某一类故事做到别人追不上。
4.4 版权、标识与内容合规:这条线不能碰
批量生产的另一面,是版权和合规风险。很多人以为AI生成的画面版权完全归自己,这是误解。如果你用的模型是基于特定版权图库训练的,或者参考了某个真人明星、某个动画角色,生成的图片可能涉及肖像权和著作权问题。我的建议是:不做真人明星形象,不直接用知名IP角色,不使用没有授权的背景音乐和音效,剧本做到原创或取得授权。
另一个容易被忽略的点是内容标识。现在国内主要平台对AI生成合成内容普遍有标识要求,发布时建议勾选“内容由AI生成”,不要故意隐藏。这是对自己创作过程的追溯,也是维护平台生态的基本动作。内容上更要谨慎,短剧虽短,但低俗、虚假、诱导不良行为等内容一样不能出现。越火的方向越容易刺激粗制滥造,也会招来更严的审核。别把“AI短剧”理解成“没人管的灰色地带”,真正想长期做,反而要更主动地建立内容边界。
这里我多说一句:很多人问“能不能用AI做一个什么都能聊、什么都能生成的对话产品”?我理解这种好奇心,但产品要能用得长久,恰恰需要清晰的边界和可控的输出,而不是没有约束。做AI短剧也一样,在规则内找到自己的表达空间,比总想着踩线要可持续得多。
5. 刷了也做了几条之后,我对AI短剧的几点真实感受
说了这么多技术细节,最后聊点我自己的观察。我做AI短剧测试不是为了单纯追风口,而是想搞明白一个事:AI到底是在帮人创作,还是替人创作?做了几条脚本和几十段素材之后,我的答案更接近前者。AI确实把绘画、配音、剪辑的门槛拉低到了“会用工具的普通人”这个层面,但一部片子能不能让人看下去,最稀缺的还是“判断力”。
这种判断力包含很多内容:知道哪个剧本有潜质,知道哪个镜头该留、哪个该删,知道配音语气和画面的情绪是否匹配,知道观众在第几秒会划走。这些判断力来自大量看片、拆解爆款、复盘自己的数据,任何一个AI模型都替代不了。你可以把AI短剧当成一个放大器:你的审美和创意越好,AI帮你放大的效果就越惊人;反过来,如果只是想偷懒,AI也会把你的平庸放大得格外明显。
如果你问我现在入局AI短剧还来得及吗,我的看法是:单纯靠“AI生成+搬运”赚快钱的窗口正在关闭,但AI应用开发的技能组合,还远没到饱和。平台需要差异化内容,观众需要好故事,AI只是把生产工具的稀缺变成创意的稀缺。你可以不把它当成全职方向,但抽一个周末,用免费工具做出一条属于自己的AI短剧,得到的体感一定比刷几百集更新鲜。
最后再分享一个实操层面的小事:我刚开始做的时候,特别执着于“用最高级的工具、最完美的参数”,结果一周下来什么都没发出来。后来改成“先上线一部中等的作品,再根据反馈迭代”,反而进步更快。AI短剧真正的门槛从来不是工具,而是你有没有那个“先做完一条烂片”的行动力。