做AI视频这事,我前后折腾了大半年。最开始用文生视频模型,发现一个残酷现实:单独抽卡生成两三秒的片段很容易,但要把这些片段串成一条“能看”、“好看”的完整视频,完全是另一码事。网上很多教程把“用AI做视频”讲得太玄乎,动辄要求你懂扩散模型原理、会写复杂的ComfyUI工作流,把一大批只想好好做内容的新手挡在门外。
这篇文章我不讲底层理论,只讲实操路径。我会从工具选型、分镜拆解、提示词写法、剪辑节奏这些真正决定成片质量的关键环节入手,把一条完整的AI视频制作流程掰开揉碎。没有专业剪辑基础的人能跟着做,有经验的内容创作者也能在流程优化和画面控制方面得到一些启发。
1. 动手前先想清楚:AI视频到底是怎么“做”出来的
很多人第一次打开AI视频工具,面对输入框就蒙了。这很正常,因为“用AI做视频”的本质不是“输入一句话就自动生成一部电影”,而是一条高度依赖人工设计的工作流。你负责创意、分镜、叙事和审美,AI负责把文字或图片变成动态画面。
1.1 AI视频的三种主流路线:文生视频、图生视频、视频生视频
先搞清楚路线,才知道自己该在哪个环节发力。
文生视频是最直观的模式:输入一句提示词,AI直接生成一段动态画面。我实测下来,目前的模型对单镜头、大场景、氛围感强的描述表现最好。比如“夕阳下,灰色狼群在雪原上奔跑,镜头缓慢拉近”,这种画面生成成功率很高。但如果你描述太复杂的交互动作,比如“两个人击掌之后转身走进不同的大门”,AI很容易在动作逻辑或人物一致性上翻车。
图生视频是我个人最推荐新手优先掌握的路线。你先用AI绘图工具做出一张满意的静态图,再把这张图交给视频模型“动起来”。这样做的好处非常明显:画面构图、色彩、主体造型都由你掌控,视频模型只需要负责运动。一致性问题的解决难度会大幅降低。我大量AI短剧项目,就是用图生视频配合角色参考图完成的。
视频生视频指的是用一段已有的实拍或动画素材,通过AI改变风格或局部内容。比如手持一段手机拍的城市夜景,让它转成赛博朋克动漫风。这条路线适合做风格化内容,但在运动和语义保持上仍有不少限制,新手可以等技术娴熟后再碰。
1.2 工具选型怎么看:别被参数忽悠了
市面上AI视频工具很多,可灵、即梦、Runway、Pika、海螺AI这些我都长期用过。很多教程喜欢列参数对比表,分辨率多少、帧率多少,但我的经验是:对新手来说,工具的易用性远比那几秒钟的提升重要。
选工具的核心标准有三条。第一,生成速度快不快,一个镜头动不动排队十分钟,你很难有耐心迭代。第二,可控性强不强,能否上传参考图、能否锁定首尾帧,这两个功能直接决定了你后期返工的成本。第三,账号体系稳不稳定,操作界面是否友好,这点很实际,再强大的工具,如果每次生成都要折腾半天网络或参数配置,你也坚持不下去。
我的建议是:先把一个工具的免费额度用完再说。不要同时开五六个会员,先用可灵或者即梦这类国产工具跑通“生成—筛选—后期”的完整流程,你会比那些只会刷各种工具测评的人更快做出第一条完整作品。
2. “好看”的关键:提示词、分镜与镜头语言
很多新手以为“好看”是AI决定的,其实不是。同样一个工具,有人生成画质精美、运镜流畅的镜头,有人生成的画面像噩梦,差别就在提示词和分镜设计上。
2.1 提示词不是越复杂越好,结构对了才算入门
我发现一个规律:新手写提示词喜欢堆砌形容词,“极致的画质、8K超高清、杰作、大师级、瑰丽奇幻、史诗感”,看起来很唬人,但AI对这类虚词敏感度不高,反而容易忽略真正的画面元素。
一条有效的AI视频提示词,应该包含五个结构化要素:主体、环境、光线、镜头运动、风格。举个例子,你写“黄昏时分的旧书店,阳光斜射,灰尘颗粒在光柱里飘动,镜头缓缓推进,油画风格”,AI生成的效果远比“非常唯美的书店,高清、梦幻”好得多。
如果你的素材来自图生视频,提示词的重点就不该放在“描述画面里有什么”,而应该放在“画面怎么动”。静态图已经把内容定死了,你只需要告诉AI运动方式:镜头拉近、人物转身、头发飘动、树叶摇晃。很多新手在图片已经生成的情况下,还在提示词里大段描述背景人物,结果AI为了迎合提示词反而破坏了原图的构图。
2.2 分镜脚本:AI视频想要好看的第二步,这决定了叙事流畅度
比提示词更重要的,是分镜意识。
我见过太多人做AI视频失败,不是生成能力不够,而是根本没有分镜脚本,上来就一句一句“生成”,最后剪辑时发现镜头之间毫无逻辑关系,画面割裂感极强。
真正的做法是:写脚本的时候就直接对应分镜表。每个分镜包含镜头号、画面内容、景别、运镜方式、预计时长、所需素材类型。比如一个15秒的短视频,拆成5到6个镜头,每个镜头2到3秒,相互之间有因果关系或者动作承接。AI视频生成的是镜头素材,不是成片,你在分镜阶段就决定了叙事是否流畅。
经典的景别逻辑值得借鉴:全景交代环境,中景展示人物动作,特写传递情绪。如果分镜里全是全景或全部是特写,剪出来的东西一定很平。AI视频的镜头运动也要有变化:推、拉、摇、移配合使用,连续五个镜头都在“缓慢推进”,观众很快就会审美疲劳。
3. 从零到成片:一条完整的AI视频制作流程拆解
前面说了那么多准备功夫,现在进入真正动手环节。我用一条15秒的“AI短剧预告片”作为案例,完整走一遍流程。
3.1 第一步:定主题、写脚本、拆分镜
主题越具体越好。以“雨夜追凶”为例,故事核心是一名侦探在霓虹闪烁的雨夜追赶一个神秘身影。短视频拍摄会拍一整条,AI视频只需要拍几个关键瞬间,我用5个分镜来覆盖:城市夜景空镜、侦探走入雨中、神秘身影闪现在巷口、侦探开始奔跑、两把雨伞交错后光影定格。
写脚本时我会把每个分镜的画面描述和情绪要求写清楚,顺手标注景别和运镜方向。这个过程看着麻烦,但其实比反复重写提示词节省大量时间。分镜一旦确定,后续每一帧素材的提示词就都有据可依,不会天马行空乱生成。
3.2 第二步:逐镜生成素材,但别拍脑袋就生成
有了分镜脚本,生成画面就有章法了。
对每个分镜,我通常先试跑一次,看生成结果跟设想差距多大。比如第一个分镜“雨夜城市空镜”,提示词我写“雨夜城市街道夜景,霓虹灯反射在湿漉漉的柏油路面,行人打着伞模糊移动,镜头缓慢向前推进”。生成出来的大概率是大场景氛围镜头,构图不错,但如果是“侦探视角穿过街道”的感觉,雨滴的层次就需要更清晰。这种情况下可以加上“画面底部有街道延伸的透视感,前景有车辆驶过的光影”这类描述来调整。
第二个分镜有明确主体,人物一致性想保证,最好先做一张人物参考图。我在AI绘图工具里固定同一组种子词描述角色,“穿黑色长款风衣、戴宽檐帽的中年男性”,生成一张侧身站立的图作为参考图,再用图生视频让它动起来。只用文字生成,同一个角色很难在两三个镜头里保持同款长相和衣服。
3.3 第三步:剪辑、配音、字幕与配乐
素材全部生成以后,剪辑环节决定最终质感。
我会在剪辑软件里按分镜顺序摆放素材,先不管单条素材是否完美,只看整体节奏是否成立。如果中间出现一个生成翻车的镜头,画面抖动或者脸崩了,先标记出来,不要急着原样重生成,试着用转场或者镜头长度的变化去补救。
配音方面,AI配音工具已经非常成熟,但我坚持一个原则:解说类内容的配音风格要跟画面氛围匹配。雨夜追凶这种内容,低沉缓慢的男声比激昂的女声合适得多。语速也要刻意放慢一点,给观众留出看画面的时间。
背景音乐选择上,尽量避免AI视频素材本身“自带的科技感”。科技感的电子音跟叙事内容是两回事,我会在音乐库中选带有悬疑感的低音钢琴或合成器配乐,音量压到人声下面,不抢戏。
字幕和画面要有时间差,别让字幕同步出现在画面中央。我习惯把字幕放在画面下方安全区内,关键词出字时稍微停顿半秒钟,人的阅读节奏更舒服。
3.4 第四步:输出设置与平台适配
输出环节看似简单,其实关乎视频最终呈现效果。
通用平台建议输出MP4格式,分辨率优先选择1080p以上。如果视频画面运动幅度大,码率不够会出现撕裂感,所以我会稍微提高输出码率,比平台默认值高20%左右。
不同平台的视频比例也很重要:抖音、B站横屏适合16:9,小红书、视频号适合竖屏9:16。AI视频生成的原始比例不一定是你要的,所以我都会在剪辑时预留出“防裁剪安全区”,重要的信息主体放在画面中心区域,避免平台自动裁剪把人物脸切掉。
4. 新手最容易踩的坑和对应排查思路
这部分是真正的经验价值。我在AI视频上踩过的坑,十个手指头数不过来,挑最典型的几个说。
4.1 最常见的5个翻车现场
| 问题 | 常见原因 | 排查思路 |
|---|---|---|
| 人物脸部变化 | 生成时没有锁定人脸 | 用图生视频并固定参考图,而不是单纯靠文字描述 |
| 画面崩坏/肢体异常 | 运动幅度过大或主体比例失衡 | 降低动作幅度,尝试慢速运动素材,后续用剪辑弥补 |
| 镜头之间毫无逻辑 | 没有分镜脚本 | 先拆5-8个分镜,再生成对应镜头,而不是随机生成 |
| 内容太空洞,画面好看但没内容 | 只关注生成画质,不关注叙事弧线 | 开局通过脚本明确“这段视频要让观众看懂什么” |
| 生成结果太慢,没有耐心迭代 | 工具选错或参数太高级 | 换用更轻量的工具,不要在免费额度消耗前追求最高画质 |
其中“人物脸部变化”是短剧场景下的头号问题。不同镜头里的人物五官、发型、服装不一致,观众一眼就能看穿这是AI生成的。做AI漫剧和AI短剧的内容创作者要注意这一点,角色一致性比单帧画质重要得多。
4.2 提升AI视频质量的高级技巧
排查完基础问题后,想进一步“好看”,可以试试这些技巧。
第一,善用“首尾帧”或“运动笔刷”类功能。首尾帧能锁定起始画面和结束画面,AI会自己补出中间的运动过程,非常适合做转场或推拉镜头。运动笔刷则能在画面中指定某个区域运动,其他区域保持静止,这在复杂场景中非常实用,不会出现“整体乱动”的效果。
第二,主体局部变化的提示词比整体变化的提示词更可靠。影视级的“人物从青年变成老年”“墙面从萧瑟变得繁花盛开”这类大跨度的视觉变化,AI经常处理得不够自然。只做局部变化,比如“眼睛颜色逐渐从黑色变成金色”或者“马路上倒影逐渐多出雨滴涟漪”,成功率更高,显得更精致。
第三,用剪辑节奏弥补生成缺陷。AI视频目前普遍偏短,单镜头一般3到5秒,单位时间内容信息量不足。我会在剪辑时把关键镜头切短,用快切制造节奏感,在氛围镜头保留更长时长,这样观众注意力反而更集中。
第四,利用“重绘”或“局部重绘”的能力修复画面问题,而不是重新生成整个镜头。很多新手遇到一条素材不满意,就重新抽卡,一次要等很久,质量还不稳定。如果只是画面角落有个多余物体或脸部细节不对劲,完全可以用局部重绘工具修掉,效率高得多。
5. 我的最后忠告:别做“参数工程师”,做“作品导演”
做了快一年AI视频,我最想对新手说的一句话是:不要沉迷于参数和提示词的细节钻研,把更多的精力花在创意和叙事上。
AI视频工具本质上是生产工具,用它是为了更高效地表达想法,而不是再培训一个“AI专家”。同一个提示词,有人用来拍出情感充沛的生活记录,有人只会生成一堆没有情绪的炫酷片段,差距在于谁掌握了镜头语言和叙事结构。即便技术上略有瑕疵,一个好的故事也能让观众忽略这些问题;反过来,画面再精致,没有内容核心,观众也只会划走。
最后分享一个很实用的习惯:每次完成一条AI视频,哪怕只有15秒,都把分镜脚本、提示词、生成参数和最终成片保存到一个文件夹里。下次做类似项目时直接调出来复用一个“稳定的工作流模板”,你会发现自己越做越快,因为AI生成其实是输入质量决定输出质量的过程,你的素材库就是最好的学习资料和灵感来源。