Pixelle-Video:一句话生成数字人口播视频
2026/9/5 18:45:12 网站建设 项目流程

Pixelle-Video:一句话生成数字人口播视频

【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

当你只想说一句话,就拿到一条竖版口播视频,又不想碰剪辑、不出镜时,Pixelle-Video 的 AI 短视频生成刚好接住这个需求:输入一个主题,它自动写完文案、画出配图、合成配音,几分钟内出一条成片。

它到底能帮你省掉哪些事

过去你得自己出镜拍,先写脚本、再逐句画配图;现在只需输入一行主题,大模型写完解说词,图像模型逐分镜出图。

过去你得在软件里选音乐、铺音频、逐个调分镜;现在只需挑一个 TTS 音色、选一套视觉模板,系统自动合成成片,文件落在output/目录。

过去你得装 Python、ffmpeg 和一堆依赖;现在 Windows 用户用一键整合包双击就能启动,源码用户一条 uv 命令装完依赖。

黑金电影风标题与配图的版式示例

从一句话到一条视频的完整链路

整条链路拆成三块:文案与画面、声音与数字人、模板与合成。

大模型写文案,配图自动出

输入主题,输出一整段分镜文案,默认 5 个分镜,每镜预留配图位。

  • 接入通义千问、GPT-4o、DeepSeek 或本地 Ollama,均为 OpenAI 兼容接口
  • 配图走本地 ComfyUI 渲染,或接 RunningHub 云端,免本地显卡
  • 图生视频:选i2v_LTX2.json工作流,可把静图转成动态分镜

TTS 配音与数字人口播

文案直接转成配音,Edge-TTS 免费可用,多语言可选。

  • 切到 Index-TTS 工作流,上传参考音频即可克隆音色
  • 数字人口播只需上传一张人物形象图,选智能带货或自定义口播模式
  • 系统自动分析素材,合成数字人画面与配音

模板、BGM 与一键合成

每句解说按所选模板渲染画面,叠加背景音乐,最后合成视频文件。

  • 竖屏 1080x1920 模板 25 套、横屏 1920x1080 5 套、方屏 1080x1080 1 套
  • 风格覆盖极简科技、水墨治愈、卡通、电影黑金,按平台尺寸挑选

深色科技风图文版式示例

跟着做完:四步拿到第一个成片

  1. 获取代码并安装依赖(需 Python 3.10+,推荐 uv):
git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video && uv sync
  1. 启动 Web 界面,浏览器自动打开http://localhost:8501
uv run streamlit run web/app.py
  1. 在「系统配置」中选 LLM 预设(推荐通义千问)并填 API Key,图像服务填本地 ComfyUI 地址或 RunningHub 密钥,TTS 保持 Edge-TTS 默认,点「保存配置」。
  2. 在「内容输入」填主题(如“为什么要养成阅读习惯”),设分镜数(默认 5),选音色和模板,点「生成视频」,3–5 个分镜约 2–5 分钟出片。

三种部署姿势,按需选 📦

方案适用人群一句话说明
Windows 一键整合包无终端经验的用户双击start.bat即开,Python、ffmpeg 全内置
源码 + 本地 ComfyUI有 6GB+ 显存 N 卡的用户全程本地,配 Ollama 可实现 0 元成本
源码 + RunningHub 云端无本地显卡的用户只填 API Key,图像视频在云端渲染

谁在用它:三类典型用法

知识分享号:把读书笔记、行业观察做成竖版口播视频,脚本由大模型生成,你只负责审一遍语气再发布。

小技巧:竖屏 1080x1920 模板的字幕与节奏更贴合短视频平台。

电商产品口播:用数字人带货模式,上传一张商品或人物图,AI 自动写带货口播文案并合成成片。

小技巧:在「自定义口播」模式直接贴现成话术,输出不会自由发挥跑偏。

教育与企业培训:批量生产讲解型课程视频,统一音色和模板,系列课风格一致,更新时只改文案。

小技巧:用 Index-TTS 克隆一位稳定的讲师音色,整门课复用。

水墨山峰配标题文字的版式示例

踩坑速查 🛠

“必须要本地部署 ComfyUI 吗?”不必。纯文本模板零依赖;要 AI 配图就走 RunningHub 云端。

“我显卡只有 4G,能跑吗?”本地 ComfyUI 免谈,改用 RunningHub 云端渲染;LLM 用本地 Ollama 或云端通义千问都行。

“生成要等多久?”3–5 个分镜通常 2–5 分钟,主要看 LLM 响应与出图速度;纯文本模板最快。

“费用大概多少?”Ollama + 本地 ComfyUI = 0 元;LLM 用通义千问,一条 3 段视频约 0.01–0.05 元。

想看底层怎么跑

Web 层是 Streamlit,入口web/app.py;核心编排集中在pixelle_video/service.py,协调 LLM、TTS 与媒体服务;图像、语音、数字人能力都是workflows/下的 JSON 工作流,如digital_combination.json,成片版式在templates/目录。

下一步 🚀

  1. 读一遍 快速开始,把第一个视频完整跑通。
  2. 翻 示例画廊 的成品版式,挑一套你顺眼的模板再开工。
  3. 卡住先查 故障排查,没解决就去仓库 Issue 区提问。

【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询