如何用 pyVideoTrans 快速完成视频翻译与 AI 配音?完整教程
2026/8/21 19:09:16 网站建设 项目流程

如何用 pyVideoTrans 快速完成视频翻译与 AI 配音?完整教程

【免费下载链接】pyvideotransTranslate the video from one language to another and embed dubbing & subtitles.项目地址: https://gitcode.com/gh_mirrors/py/pyvideotrans

pyVideoTrans 是一款免费开源的视频翻译工具,把语音识别、多语言翻译、AI 配音和字幕生成整合成一条流水线,适合想发布多语言版本的内容创作者,也适合只想给视频加字幕的普通用户。

它到底能干什么 📼

这不是一款单一工具,而是一套 9 个阶段的处理流水线:抽音频、识别语音、翻译文本、合成配音、合成音视频。每个环节都可以单独换引擎——识别模块收录 22 种语音识别引擎,翻译模块收录 24 个翻译渠道,配音模块收录 34 种 TTS 引擎。它还支持说话人分离(自动判断视频里换过几次说话人,并给每人分配不同配音)和声音克隆(提供 5~10 秒清晰人声样本,即可模仿出相近音色)。

第一次使用的完整流程

Windows 用户直接下载预打包压缩包,解压到不含中文和空格的路径(如D:\pyVideoTrans),双击sp.exe即可。想从源码运行:

git clone https://gitcode.com/gh_mirrors/py/pyvideotrans cd pyvideotrans uv sync uv run sp.py

界面操作分三步:选视频并设置源语言;选目标语言和翻译引擎;选配音引擎后开始。产出默认放在输入文件同级的_video_out目录,里面是翻译字幕和带配音的视频。不想打开界面时,可直接用命令行做整段视频翻译:

uv run cli.py --task vtv --name "./videos/demo.mp4" \ --source_language_code zh-cn --target_language_code en --voice_role "en-US-GuyNeural"

命令行还有 stt/tts/sts 三种任务类型,分别对应语音转录、文字配音、字幕翻译,可以只取其中一环单独用。

按需求选引擎,而不是数引擎

引擎很多,按场景挑就行:

处理环节本地离线方案云端 API 方案成本与效果
语音识别Faster-Whisper阿里 Qwen本地免费离线;Qwen 中文准确率高
文本翻译Ollama + M2M100DeepSeek / ChatGPT / GoogleLLM 翻译最接近人工;Google 速度最快
AI 配音F5-TTS(声音克隆)Edge-TTSEdge-TTS 完全免费;F5-TTS 需 5~10 秒人声样本

两条选线原则:数据敏感或网络差,全本地;追求译文质量,优先 LLM 翻译。

参数与配置怎么调 🔧

  • 识别参数(降噪、标点恢复、LLM 重新断句)在识别参数设置里改,嘈杂环境或术语多的内容建议开启。
  • 说话人分离与角色配音分配在说话人分离处理中实现,给每个说话人指定不同声音后,对话场景更自然。
  • 有 NVIDIA 显卡时,装 CUDA 版 PyTorch 加 cuDNN 包即可加速,命令行加--cuda参数生效。

批量处理与边界情况

--name参数支持通配符,写./videos/*.mp4就能一次处理整个文件夹,再配合定时任务就是自动化翻译流水线。需要完全断网时,翻译用本地 Ollama + M2M100,识别用本地 Whisper,全程视频不出机器。Web UI 提供网页版操作,适合部署在远程服务器上访问。想扩展新引擎,按现有文件模式往对应模块目录里加一个实现文件即可,各阶段之间互不影响。

【免费下载链接】pyvideotransTranslate the video from one language to another and embed dubbing & subtitles.项目地址: https://gitcode.com/gh_mirrors/py/pyvideotrans

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询