今天给大家演示一个历史类短视频自动化生成工作流,这是一个基于 Coze 的多模态工作流示例。它通过大语言模型生成文案,再结合图像生成、语音合成和视频剪辑插件,最终完成一个从“主题输入”到“成品视频”的完整链路。整体效果直观:只需输入主题,就能自动产出带有解说、背景图和字幕的短视频。
文章目录
- 工作流介绍
- 核心模型
- Node节点
- 工作流程
- 大模型应用
- 主题文案生成节点
- 分镜脚本生成节点
- 故事主题提炼节点
- 使用方法
- 应用场景
- 开发与应用
工作流介绍
这个工作流的核心设计是以大语言模型为驱动,自动生成历史故事的口播文案,并通过分镜脚本拆解成场景描述,再利用图像生成模型绘制背景画面,同时调用语音合成插件配音,最终交给视频合成模块形成完整视频。它不仅能处理文本到图像、音频的跨模态转换,还能自动优化提示词和字幕时间轴,保证视频内容逻辑连贯,呈现效果专业。
核心模型
在工作流中,主要使用DeepSeek-V3 大语言模型作为文本生成引擎,负责撰写历史故事文案和分镜脚本。同时配合图像生成模型和语音合成插件,保证从文本到多模态输出的完整闭环。模型的配置参数(如 temperature、maxTokens 等)保证生成结果既有创造性,又符合视频节奏需求。
| 模型名称 | 说明 |
|---|---|
| DeepSeek-V3 | 用于生成历史口播文案、分镜脚本、故事主题提炼 |
| 图像生成模型(StableDiffusion/SD 插件) | 根据分镜脚本描述绘制古代风格背景图 |
| speech_synthesis 插件 |