简介:面向AI视频创作初学者、有一定视频制作基础的创作者及希望提升视频创作效率的专业人士,详解DeepSeek与即梦AI协同创作的全流程。内容从前期准备切入,涵盖账号注册、界面熟悉、硬件与网络要求;随后讲解如何借助DeepSeek明确创作主题与目标、编写优质提示词并生成优化脚本;再过渡到即梦AI文生图操作、模型与参数调整、人物一致性保持,以及单图转视频、文本直出多镜头视频的转化方法;后期部分还梳理了音画匹配、字幕特效、多平台适配等合成技巧,并配有实战案例与进阶指导,帮助读者从0到1独立完成作品。资源为1份docx文档,压缩包大小37KB,图文结合、结构清晰,便于按章节查阅。文中也提醒版权合规、硬件配置和网络环境优化,并建议通过社区学习持续掌握AI视频创作新趋势。已有464人学习浏览。
1. 把 DeepSeek+即梦 拆成脚本后端与渲染前端的组合
做 AI 视频最花时间的从来不是点“生成”那一下,而是从创意到画面之间那段翻译过程。我第一次用即梦直出视频时,提示词写了两百字,最后生成的是几段互不相干的画面——问题不在生成器,而在脚本没有结构化。DeepSeek 和即梦的组合,本质是把工作流拆成两部分:DeepSeek 负责把主题、台词、画面描述、运镜、时长整理成机器可读的字段;即梦负责把这些字段渲染成图片、动态片段和成片素材。这套分工解决两类典型问题:提示词会写但画面抓不住重点,画面能生成但串不成一条完整的片子。适合短视频编导、个人自媒体,以及想用 API 把视频生产流程自动化跑起来的开发者。
2. 开工前的基础设施:账号、模型档位与硬件网络适配
账号注册和硬件选型看着是入门操作,但恰恰是后面批量生成时会反复卡壳的地方。网页版怎么登录、本地部署要什么显卡、API 和网页版的边界在哪里,这些不提前定好,等脚本写完了才发现工具链撑不住,返工成本远高于一开始的配置成本。
2.1 双平台接入与创作空间初始化
DeepSeek 网页版可以用手机号或邮箱注册,即梦除了手机号、邮箱之外还支持微信快捷登录,扫码授权就能跳过密码流程。两边登录后,先不用急着生成内容,把创作空间整理一下。我一般会在本地建四个目录:script、storyboard、video、export,分别放脚本、分镜图、原始视频片段和成片。等任务量上来之后,文件命名混乱导致的返工成本,比参数调错的成本高得多。
批量生成时的文件命名也要提前定规则。比如用“主题_日期_序号”的格式,dali_20250512_01.png这样的文件名,后面在即梦里做图生视频、在剪辑软件里按顺序拖素材,都能一眼看出来源。storyboard目录里只放最终确认的图,临时预览图单独放一个_draft子目录,避免误用未定稿的画面。
2.2 模型使用档位:网页版、API 调用与本地部署如何选
三个档位的选择逻辑很直接:网页版适合交互式调提示词,因为要反复试错;API 适合批量生成分镜,几十条脚本用网页版一条条复制太折腾;本地部署适合数据敏感或离线创作的场景,但硬件投入不低。三者的对比如下表。
| 使用方式 | 适用场景 | 硬件要求 | 成本特征 |
|---|---|---|---|
| 网页版 | 交互式调提示词、单条脚本生成 | 普通电脑 + 网络 | 免费或订阅制 |
| API 调用 | 批量生成分镜、接入自动化流程 | 普通电脑 + 网络 | 按 token 计费 |
| 本地部署 | 数据敏感、离线创作 | 24GB 显存起步 | 硬件投入 + 电费 |
实际用 API 生成分镜的最小请求长这样:
curl https://api.deepseek.com/chat/completions \ -H "Content-Type: application/json" \ -H "Authorization: Bearer $DEEPSEEK_API_KEY" \ -d '{ "model": "deepseek-chat", "messages": [ {"role": "system", "content": "你是短视频脚本策划,只输出结构化分镜表格。"}, {"role": "user", "content": "生成一个60秒大理旅行vlog分镜,包含画面描述、台词、运镜、时长。"} ], "temperature": 0.7 }'这段请求里,model指定使用的模型标识,messages里system定义 AI 的角色行为,user是实际任务指令,temperature控制随机性,0.7 适合创意生成,如果希望每次输出更稳定可以降到 0.4。把这段 curl 塞进定时任务或者剪辑软件的前置脚本里,就能做到“脚本词库更新 → 批量重写分镜 → 进入即梦生成”,不需要每次手动复制粘贴。如果你已经在用 Codex 这类编码工具,把 DeepSeek API 接进去的思路是类似的:换 endpoint 和 key,计费规则以官方文档为准。但视频分镜生成属于高上下文消耗,别直接照搬编码对话的缓存策略,上下文配额很快就可能触顶。
2.3 硬件与网络底线
本地部署 DeepSeek 这类开源模型,7B 或 13B 参数规模建议用 NVIDIA RTX 3090 24GB 这种入门卡,30B 以上直接上 A100;CPU 部分最低也要 16 核、主频 2.5GHz 以上,内存建议 64GB 起步,存储至少要 1TB NVMe SSD 放模型文件,训练数据再单独挂 2TB 以上的 HDD。分布式部署的话,10GbE 局域网是底线,千兆网卡在模型并行加载时会成为明显瓶颈。
即梦这类云端工具对本地硬件的要求低很多,4GB 显存的显卡、8GB 内存就能跑,真正的瓶颈在网络。生成视频时上传分镜图、下载成片,50Mbps 以上的带宽会顺畅得多。
提示:上传大文件时优先用有线连接。无线信号弱会导致上传重试,重试几次后一次批量任务可能白白多等十几分钟。
3. 用 DeepSeek 生成视频脚本:结构化提示词与分镜表格
DeepSeek 生成的脚本长什么样,取决于你给它多少约束。直接问“帮我写一个旅行视频脚本”,它大概率输出一段散文;但如果要求“输出表格,包含时间、地点、画面描述、台词、背景音乐”,它就能给出可以直接拿去喂给即梦的分镜。核心差异在于字段约束是否明确。
3.1 写提示词前先立三个坐标:主题、平台调性、篇幅
在写任何提示词之前,先用三个坐标把需求框死:主题、平台、篇幅。三个坐标的确定方法如下表。
| 坐标 | 要确定的内容 | 示例 |
|---|---|---|
| 主题 | 视频的核心内容 | “新手也能上手的蛋糕烘焙教程” |
| 平台 | 发布渠道与内容调性 | 抖音短平快,B站长内容,小红书情绪化 |
| 篇幅 | 时长与镜头数量 | 30秒 6-8 个镜头,60秒 12-15 个镜头 |
这三个坐标里最容易漏掉的是平台。同一个“大理旅行”主题,抖音版本需要前 3 秒出画面钩子,B 站版本可以接受 15 秒的铺垫,小红书版本则要把“打卡感”和情绪词前置。主题定了内容边界,平台定了节奏,篇幅定了分镜数量,三者都不确定时生成的脚本会两头不靠。
3.2 一个可直接复用的分镜脚本提示词模板
以下是我常用的提示词模板,结构上分成任务、具体要求、输出格式、约束四段:
任务:生成一个 60 秒大理旅行 vlog 分镜脚本。 具体要求: - 展示洱海骑行、喜洲古镇、苍山索道、日落观景台四个段落; - 每个镜头包含画面描述、台词、运镜方式、时长、背景音乐建议; - 台词口语化,符合第一人称旅行记录语气; - 场景之间要有自然过渡,逻辑衔接合理。 输出格式: - Markdown 表格,列名依次为:镜头号、时间、画面描述、台词、运镜、背景音乐。 约束: - 时长误差不超过 2 秒; - 不使用专业影评词汇。这段提示词里四个部分各有用途:“任务”给出明确产出物,“具体要求”限定内容范围和写作语气,“输出格式”把分镜变成表格而不是散文,“约束”避免生成过于书面的表述。重点在于“场景之间要有自然过渡”这句话,它直接解决了生成脚本最常见的逻辑断裂问题——前一个画面还在介绍美食,下一个画面突然切到山顶,没有任何衔接。表格输出比散文更好的另一个原因是,后端的字段可以直接被程序读取。如果你走 API 流程,表格的列名就是天然的 JSON key,解析成本比从散文里抽句子低一个数量级。
3.3 一次生成与迭代优化:如何对付逻辑断裂与对话长度上限
第一轮生成的脚本大概率不够细腻,最典型的问题是画面描述太笼统。我一般不会整体重写,而是只改局部:把生成结果里不满意的镜头单独抽出来,重新描述,要求它补一段细节。例如把“在米线店吃米线”改成“阳光洒在米线汤上,折射出诱人的光泽,筷子夹起米线时热气升腾”,画面的质感立刻不一样。
长视频脚本还有一个绕不开的坑:对话长度上限。分镜脚本动辄几十行,DeepSeek 单轮输出有长度限制,遇到“达到对话长度上限,请开启新对话”时,不要删掉整份脚本重来,而是直接要求它“继续输出第 4 到第 6 个镜头”。多镜头脚本分段输出后,再让 AI 把各段合并成一份完整表格,中间的逻辑由你手动确认,不要全交给模型拼接。
注意:多轮对话积累下来的提示词草稿,可以导出成文本放到本地素材库。社区里 DeepSeek harness 这类桌面工具,本质就是把多轮对话缓存下来做二次编辑,新会话直接粘贴底稿,省去从头调教的时间。
4. 即梦 AI 画面生成:文生图参数、一致性控制与参考图策略
脚本确认后,进入即梦 AI 的画面生成环节。这里最容易犯的错误是把整句脚本贴进文生图输入框。DeepSeek 生成的“画面描述”是给人看的自然语言,即梦的提示词需要的是主体、动作、环境、镜头、光线这些可执行要素,直接粘贴相当于让渲染器自己猜重点。
4.1 从脚本到提示词:把画面描述拆成可执行字段
以“游客骑着自行车沿着洱海前行,洱海波光粼粼,海菜花随风摇曳,远处是连绵的苍山”这句为例,直接粘贴进即梦也能生成图,但人物形象、景别、光线完全不可控。我会改写成字段式描述:
主体:一位年轻女性游客骑自行车 动作:沿着洱海生态廊道缓行,转头看向湖面 环境:洱海波光粼粼,海菜花随风摇曳,远处苍山连绵 镜头:中景,平视,跟拍视角 光线:自然光,顺光,画面通透字段化的好处是生成结果的可控性显著提升。“主体”决定了人物特征,“镜头”决定了景别,“光线”决定了整体影调。如果拿 ChatGPT 的绘图能力和即梦做对比,单张图的风格上限各有胜负,但短视频项目里更值得关注的是这种可控性——画面比例、人物一致性、分镜复用,这些决定了素材能不能在一条视频里统一风格。画面描述里的每个字段,在后续做单图转视频时也会影响运动幅度的判断,前期拆得越细,动态转化阶段的返工越少。
4.2 文生图参数:分辨率、采样器、采样步数怎么配
即梦文生图界面里的参数不多,真正需要理解的是分辨率、模型风格、采样器和采样步数四组。推荐配置如下表。
| 参数 | 推荐值 | 适用场景 |
|---|---|---|
| 分辨率 | 1024×768 / 1920×1080 / 3840×2160 | 分镜预览选低一档,成片定稿选高两档 |
| 模型风格 | 默认模型 / 写实模型 / 卡通模型 | 旅行纪实选写实,动画类选卡通 |
| 画面比例 | 16:9 / 9:16 / 1:1 | 横屏平台选 16:9,竖屏平台选 9:16 |
| 采样器 | Euler a / DPM++ 2M Karras | 快速试稿用 Euler a,细腻成图用 DPM++ 2M Karras |
| 采样步数 | 20-50 | 简单画面 20-30,复杂画面 40-50 |
分辨率决定细节上限,1920×1080 足够抖音和 B 站使用,4K 主要留给大屏播放,分镜预览阶段没必要每张都开 4K,生成速度会拖慢一倍以上。采样步数不是越大越好,50 步之后继续增加,画质提升肉眼几乎不可见,生成时间却会明显拉长。采样器的差异在复杂材质上最明显,比如水面反光、头发丝、金属质感,DPM++ 2M Karras 在这些细节上明显更细腻,但如果只是快速看看构图,Euler a 的出图速度更适合试稿。
4.3 保持人物一致性的三个办法
系列视频里最头疼的是人物跑脸。第一个镜头是黑色长发,第三个镜头变成了棕色卷发,整个视频的连贯性就毁了。我的做法是三条并行。
第一,初始提示词里把人物特征写完整,包括脸型、发型、眼睛颜色、服装款式和配色。比如“一位留着黑色长直发、瓜子脸、大眼睛的年轻女性,穿白色连衣裙,戴红色项链”,这比“一个女生”可控得多。
第二,上传参考图。即梦的文生图界面支持导入参考图,找一张人物设定清晰的图片传上去,后续生成时模型会在人物结构上对齐这张图,这是在提示词之外最有效的约束手段。
第三,每次生成时,提示词里“主体”字段必须原样复制,不能换个说法。“黑色长直发”写成“黑发”,在模型看来可能就是两张脸。连续生成十几个镜头后人物形象跑了,九成是主体字段被改动的结果,回查提示词通常一找一个准。
5. 从静态到动态:单图转视频、多镜头直出与运镜控制
静态图确认后,进入动态转化。这一步要区分两类任务:单张图转成一段动态画面,适合局部动作的表达;文本直出多镜头视频,适合脚本完整的段落。两类任务的参数逻辑不同,混在一起调会互相干扰。
5.1 单图转视频:运动幅度与镜头方向的搭配逻辑
单图转视频的核心参数是运动幅度。太低画面像PPT,太高容易出现拖影和变形。我的经验是先选低一档试跑,确认画面没有畸变再往上调。运动幅度的选择参考下表。
| 运动幅度 | 适合场景 | 典型动作 |
|---|---|---|
| 低 | 人物特写、情绪镜头 | 微微转头、手部小幅摆动 |
| 中 | 旅行记录、日常叙事 | 步行、骑车、环境缓移 |
| 高 | 场景快速切换、动感镜头 | 城市切换、镜头急拉 |
镜头方向同样需要和运动幅度配合。推镜头聚焦细节,适合人物面部表情的变化;拉镜头从特写拉远展示环境,适合交代空间关系;平移镜头跟随主体的运动方向,适合骑行、跑步、车队这类线性移动;旋转镜头围绕某个点转动,适合情绪转折或氛围渲染。搭配原则是:人物特写用低幅度加推,大场景用中高幅度加平移,情绪转折用旋转。
5.2 文本直出多镜头视频:机器可读的分镜脚本写法
即梦支持直接输入分镜脚本来生成多镜头视频,但格式要按它识别的规范来写。以下面的分镜为例:
[Scene 1] A young woman riding a bicycle along Erhai Lake, golden sunlight, medium shot, 4s, pan left [Scene 2] Close-up of the woman's face with a gentle smile, wind in her hair, 2s, zoom in [Scene 3] Wide shot of Cangshan Mountain and the lake, clouds moving slowly, 3s, rotate slow每个 Scene 块后面依次是画面描述、时长和运镜方式。时长单位是秒,决定了这段画面在成片中的停留时间;运镜关键词 pan left、zoom in、rotate slow 对应不同的镜头运动方向。这种格式的好处是,DeepSeek 完全能按照这个模板批量生成,脚本里每个分镜表格对应一个 Scene 块,即梦生成时会按顺序输出多个视频片段,后续在剪辑软件里直接按序列拼接即可。市面上可灵、海螺这些工具也能做静态图转动态,但即梦对文本直出多镜头的支持更贴近分镜流程,省掉了每张图先做图生视频再拼接的中间步骤。
5.3 音频与动态的同步:内置音乐库与本地导入
即梦内置音乐库,输入“轻松愉悦”“激昂振奋”这类关键词就能筛出匹配风格的音乐;对音乐有特殊要求时,也可以本地导入 MP3、WAV 格式的音频文件。这里有一个常见误区:不要在生成视频阶段就追求精细卡点。音乐高潮与画面切换的精确对齐,应该放到剪辑软件里做,生成阶段只需要明确氛围基调。生成阶段选的音乐会直接影响后续的剪辑结构,如果后面发现音乐风格不合适,整条视频的动态节奏都得重调,所以第一次选音乐时就要按平台调性来,而不是按个人喜好。
6. 后期合成:音画对齐、多平台适配与避坑清单
6.1 音画匹配与字幕特效的具体做法
在剪辑软件里导入音频后,先看波形。波峰对应音乐的高潮或重音,把特写镜头放在波峰处,视觉冲击力会翻倍;波谷则适合空镜或过渡画面,配合慢动作可以让节奏舒缓下来。像“这也太好吃了吧”这类情绪强的台词,波形会拉得很满,画面同步切到食物特写,观众的感官刺激会更直接。
字幕方面,剪映的“识别字幕”能自动生成时间轴,字体推荐思源黑体,避免版权风险;打字机效果让字幕逐字出现,短视频里观众注意力更容易被勾住。转场不要贪多,闪黑适合情节跳跃,淡入淡出适合时间过渡,一次视频保持一两种转场就够。
6.2 多平台导出规格与高频排错
不同平台对画幅的要求差异很大,导错比例会导致画面被强行裁切,人物头部出画是最高频的问题。常用规格如下表。
| 平台 | 画幅 | 分辨率 | 格式 |
|---|---|---|---|
| 抖音 / 快手 | 9:16 竖屏 | 1080×1920 | MP4 |
| 视频号 | 1:1 方形 | 1080×1080 | MP4 |
| B站 / YouTube | 16:9 横屏 | 1920×1080 或 3840×2160 | MP4 |
成片后如果某个镜头多了两秒,不需要重渲染整条视频,用 ffmpeg 直接从原片里截取指定区间:
ffmpeg -i input.mp4 -ss 00:00:12 -to 00:00:15 -c copy output.mp4这段命令里,-i指定输入文件,-ss是开始时间,-to是结束时间,-c copy表示不重新编码,速度接近秒出。注意-c copy的截取点会受关键帧位置影响,如果截出来的画面开头有短暂花屏,就把-ss参数移到-i前面再试一次。排错时记得按顺序排查:生成图片模糊,先提高分辨率再换 DPM++ 2M Karras,不要只加采样步数;音画不同步,检查剪辑软件里音频片段的时间轴起始点,自动对齐工具失灵时手动前移后移一两帧;脚本逻辑断裂,不必在剪辑里硬接,回到 DeepSeek 那轮对话,加上“注意场景之间的自然过渡”重新生成对应镜头,替换掉问题片段即可。
本文还有配套的精品资源,点击获取