☰
Pixelle-Video 上手指南:一个主题到 AI 短视频成片的完整路径
2026/10/2 21:34:13 网站建设 项目流程

Pixelle-Video 上手指南:一个主题到 AI 短视频成片的完整路径

【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

Pixelle-Video 是一个开源的 AI 短视频生成引擎,核心问题只有一个:你手里只有一个选题,却交不出成片。写文案、找素材、配音、剪辑这些事它全接过去,你只负责输入主题。读完这篇,你会在本机起一个 Web 服务,配好 API Key,10 分钟内拿到第一条自动生成的短视频。

先判断:Pixelle-Video 适合谁

先说结论:它适合想批量做口播、科普、书单这类"图文+配音"短视频、又不想碰剪辑软件的人。

适合的场景:

  • 账号日更,内容以知识讲解、观点输出为主,画面要求不高
  • 已有现成稿件,想把文字快速变成带配音的成品
  • 有 NVIDIA 显卡想本地白嫖,或者什么都没有想直接走云端

不适合的场景:

  • 需要真人出镜、复杂转场、逐帧调动的影视级内容——它的画面是"模板+AI 图/视频",上限就在那里
  • 完全没有 LLM API Key、也没有本地显卡的人——文案和配图至少得有一头是付费或本地的,全免费需要 Ollama 本地模型 + 本地 ComfyUI 两套环境,折腾程度不低

一句话边界:它解决的是"量产及格线以上的解说视频",不是"做出有设计感的片子"。

零基础跑起来:装环境、配 Key、出第一条片

整条最短路径就是三步:装依赖、起服务、在界面里配一次 Key。

第 1 步:装好两个前置依赖。

# macOS brew install ffmpeg # Ubuntu / Debian sudo apt install ffmpeg

再装一个 Python 包管理器 uv(一行命令,按系统提示走即可),装完用ffmpeg -version和uv --version各敲一次,有版本号输出就都好了。ffmpeg 负责最终的视频合成,缺了它界面都打不开。

第 2 步:克隆仓库并启动 Web 服务。

git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video uv run streamlit run web/app.py

uv run会自动建虚拟环境、装完全部依赖,不用手动pip install。Windows 用户更省事:直接下载官方的 Windows 整合包,解压后双击start.bat,依赖全省了。

服务起来后浏览器会自动打开http://localhost:8501,看到三栏界面(左侧内容输入、中间语音视觉、右侧生成预览)就算跑通了。

第 3 步:配一次 Key,生成第一条片。

  1. 展开左侧「⚙️ 系统配置」面板,在 LLM 配置里从下拉菜单选一个预设(比如通义千问,便宜且够用),把 API Key 粘进去,点「保存配置」。
  2. 左侧「内容输入」选「AI 生成内容」,输入一个具体主题,比如「为什么要养成阅读习惯」——越具体的主题,LLM 写出来的分镜越聚焦,比「宇宙」「成长」这类大词效果好。
  3. 中间栏全部保持默认:TTS 用 Edge-TTS,图像走默认工作流,模板任选一个竖屏 1080x1920 的。
  4. 右侧点「生成视频」。进度按「文案 → 逐分镜配图 → 合成语音 → 合成视频」推进,5 个分镜大约 2–5 分钟出片。

完成后右侧自动播放,显示时长、文件大小、分镜数;文件落在根目录output/文件夹,「📚 历史」页面里还能翻出来重看。

一条成片由哪几块拼成

别把它当成一个黑盒,拆开看就四块,每块都有明确的开关,改哪个配置出什么效果,心里要有数。

文案:LLM 按主题写稿并拆成分镜,默认 5 个。想换模型,改配置文件的llm字段(config.example.yaml 里有注释示例)——它兼容一切 OpenAI SDK 格式接口,通义千问、GPT、DeepSeek、本地 Ollama 都能接。手里已有稿件时切到「固定文案内容」模式,还能指定按段落、行或句子拆分。

画面:每个分镜配一张 AI 图或一段 AI 视频。三条路线:本地 ComfyUI(workflows/selfhost/)、云端 RunningHub(workflows/runninghub/)、直连供应商 API(DashScope、OpenAI、Kling 等,在api_providers配置)。默认尺寸 1024x1024,整体画风由提示词前缀统一控制。

声音:解说走 TTS 工作流,默认selfhost/tts_edge.json(Edge-TTS),也可选 Index-TTS 并上传参考音频克隆音色。BGM 分内置和自定义两类——自定义的 MP3/WAV 必须手动放进根目录bgm/文件夹才会出现在列表里。

合成:模板负责最终排版。模板文件都是 HTML + CSS,放在 templates/ 目录,按竖屏 1080x1920、横屏 1920x1080、方形 1080x1080 三个尺寸分组,文件前缀即类型:static_*纯文字,image_*用 AI 图做背景,video_*用 AI 视频做背景。文字、图片通过 Jinja2 变量({{ title }}、{{ text }}、{{ image }})注入。

整体链路可以参考这张官方流程图:

把成片调成你的风格:选路线、改模板、换音色

AI 配图路线怎么选

出片速度和成本的最大变量,就是图从哪来。在中间栏「图像生成」下拉框里选工作流:

  • 有 NVIDIA 显卡、本地起了 ComfyUI → 选selfhost工作流,最快且免费
  • 没有显卡 → 选 RunningHub 工作流,到系统配置面板填 RunningHub API Key
  • 只有云 API Key → 选api/...工作流,再到api_providers填对应供应商密钥

自建视频模板

模板就是 HTML + CSS,想有自己的版式:复制 templates/1920x1080/ 里任意一个现有模板,改掉样式后以.html存进对应尺寸目录,它会自动出现在模板下拉列表里,不用改任何代码。注意body尺寸必须和所在目录一致(竖屏目录就写 1080px × 1920px),否则文字排版会溢出画面。

克隆音色

想换成自己的声音:TTS 选 Index-TTS 这类支持克隆的工作流,上传一段清晰的人声 MP3 作为参考音频,生成的旁白就是那个音色。正式生成前先点「预览语音」试听,这是验证音色成本最低的环节。

翻车急救箱

症状:界面打不开或启动报错。原因:ffmpeg 没装,或 Python 版本低于 3.10。解法:先装 ffmpeg,用ffmpeg -version验证有输出;依赖装不上时执行uv cache clean清缓存,再重新uv sync一次。

症状:生成卡在「生成配图」一步不动。原因:选了 selfhost 工作流但本地 ComfyUI 没启动,或对应模型文件没下载。解法:确认浏览器能直接访问http://127.0.0.1:8188,再到配置面板点「测试连接」通过后再生成。

症状:文案生成不出来,提示 LLM 调用失败。原因:API Key 有误、账户余额不足、网络不通。解法:核对配置面板里的 Key 是否完整粘贴;用本地 Ollama 的话,确认服务已启动且模型已拉取。

症状:配图风格和模板画风不搭。原因:提示词前缀写了中文,或图像尺寸超出模型支持范围。解法:提示词前缀用英文风格词(例如 minimal sketch style),宽高在模型允许的范围内调整。

症状:生成特别慢。原因:分镜数多,或高峰期挤在云端 API。解法:把分镜数从 5 调小;有本地 GPU 时切到 selfhost 工作流,比云端明显快。

下一步

Pixelle-Video 把"一个主题到一条成片"压缩成了点一次按钮:写稿、配图、配音、混 BGM、合成全部自动完成,你的精力只需要花在选题和风格上。想继续往下玩——自定义视觉风格、声音克隆、模板开发、API 对接——仓库里的 docs/zh/ 中文文档有分场景的教程,照着第一条视频的生成记录一个个试即可。

【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询