维吾尔语TTS实战教程:用 mms-tts-uig-script_arabic-UQSpeech 合成你的第一句维吾尔语语音
2026/8/24 20:18:32 网站建设 项目流程

维吾尔语TTS实战教程:用 mms-tts-uig-script_arabic-UQSpeech 合成你的第一句维吾尔语语音

【免费下载链接】mms-tts-uig-script_arabic-UQSpeech项目地址: https://ai.gitcode.com/hf_mirrors/ixxan/mms-tts-uig-script_arabic-UQSpeech

如果你需要把一段维吾尔语文本变成发音自然的语音文件,多数通用多语种 TTS(Text-to-Speech,文本转语音)模型会在维吾尔语阿拉伯文字上读错音,而专用方案往往又重又难部署。mms-tts-uig-script_arabic-UQSpeech 是一个从 Facebook MMS-TTS 微调来的维吾尔语语音合成模型:几行代码加载就能出 16kHz 的语音,适合第一次接触维吾尔语语音合成的你。

为什么微调模型比通用多语种 TTS 更靠谱

通用多语种 TTS 按很多语言的音素库训练,而维吾尔语里有 ۆ、ۇ、ۈ、ې、ڭ 这些阿拉伯文里不存在的字母,通用模型找不到对应发音,只能读错。这个模型的字符集(见 vocab.json)只有 41 个字符,完整覆盖维吾尔语阿拉伯文字母、数字和常用标点,发音路径短,出错率低。

它的部署负担也很小:单说话人(num_speakers=1)、float32 权重,CPU 就能跑,推理全程走 transformers 库,不用单独搭音频链路——装好依赖、克隆仓库,就能出声音。

跑通第一个结果:装完到出声的三步

先拿到仓库:

git clone https://gitcode.com/hf_mirrors/ixxan/mms-tts-uig-script_arabic-UQSpeech cd mms-tts-uig-script_arabic-UQSpeech

做完这步,你会看到当前目录下有 model.safetensors、config.json、vocab.json 等文件,模型权重就位说明克隆成功。接着装依赖(Python 3.8+):

pip install transformers torch soundfile

然后在仓库根目录写一个最小脚本 tts_demo.py:

from transformers import VitsModel, AutoTokenizer import soundfile as sf model = VitsModel.from_pretrained("./") tokenizer = AutoTokenizer.from_pretrained("./") text = "ياخشىمۇسىز" # "你好" inputs = tokenizer(text, return_tensors="pt") outputs = model(**inputs) sf.write("output.wav", outputs.audio[0].numpy(), samplerate=16000)

执行python tts_demo.py,当前目录出现 output.wav 就成功了,播放它就能听到第一句合成的维吾尔语。采样率是 16000Hz,保存时务必写同样的数值。

调出想要的效果:影响听感的 3 个参数

模型默认值都在 config.json 里,但对听感影响最直接的是这三个:

  • speaking_rate(语速):默认 1.0,小于 1 节奏变慢、大于 1 变快,推荐区间 0.8~1.2
  • noise_scale(声音多样性):默认 0.667,调高后语调起伏更多
  • noise_scale_duration(时长随机性):默认 0.8,调高后停顿和节奏更有人味

调用时直接传进去:

outputs = model(**inputs, speaking_rate=1.2, noise_scale=0.667, noise_scale_duration=0.8)

先只把 speaking_rate 从 1.0 改成 0.9 和 1.2 各听一遍,两个 noise 参数保持默认。

它是怎么来的

模型在维吾尔语数据集 ixxan/mms-tts-uig-script_arabic-UQSpeech 上从 facebook/mms-tts 微调而来,底层是 VITS 架构(用对抗学习让合成波形更自然)。许可证为 CC-BY-NC-4.0:非商业用途免费,商用需取得授权。

出问题了先查这三处

  • 发音乱码或读错:输入不是 UTF-8,或文本里混了拉丁拼写的维吾尔语。修复:统一按 UTF-8 保存,改用阿拉伯文字母重写文本。
  • 输出静音或有"咔哒"声:文本里含有字符集之外的字符,分词器会把它归到 。修复:删掉混入的拉丁字母或特殊符号,能用的字符以 vocab.json 里的 41 个为准。
  • 加载或生成很慢:float32 模型首次运行要构建计算图。修复:有 GPU 就把模型放上去;没有就按短句分批生成,缩短单次等待。

维吾尔语TTS能落到哪些场景

场景解决的问题
维吾尔语语音助手演示快速做出会说维吾尔语的交互原型
教育与有声内容制作把文稿批量转成配音
无障碍辅助为视障用户提供维吾尔语朗读
语言资源数字化用文本语料批量建立语音样片

接下来做什么

先把示例里的文本换成你自己的一段话,熟悉听感;觉得单音色不合需求,就按 README 提到的 ixxan/ug-speech 微调代码,用自己的音频做二次微调,或者从 config.json 里的参数和字符集开始逐项调整。

【免费下载链接】mms-tts-uig-script_arabic-UQSpeech项目地址: https://ai.gitcode.com/hf_mirrors/ixxan/mms-tts-uig-script_arabic-UQSpeech

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询