MLX-Audio 上手教程:3条命令在 Apple Silicon 本地跑通文本转语音与转写
【免费下载链接】mlx-audioA text-to-speech (TTS), speech-to-text (STT) and speech-to-speech (STS) library built on Apple's MLX framework, providing efficient speech analysis on Apple Silicon.项目地址: https://gitcode.com/GitHub_Trending/ml/mlx-audio
有一台 Mac,想把三百页的小说变成有声书,或把会议录音转成文字,又不想把音频传给云端服务?MLX-Audio 是基于 Apple MLX 框架构建的文本转语音(TTS)、语音转文本(STT)与语音转语音(STS)库,全部推理都在 M 系列芯片本地完成,一行 pip 命令就能搭起属于你自己的语音 AI 开发环境。
第一次出声:2条命令跑通文本转语音 🎙️
装完后的第一件事,是听出一个声音来。首跑会自动从 HuggingFace 拉模型,第一次稍慢,之后就全在设备内跑:
pip install mlx-audio mlx_audio.tts.generate \ --model mlx-community/Qwen3-TTS-12Hz-0.6B-CustomVoice-8bit \ --text "Hello, world!" \ --voice Vivian \ --play加了--play,生成的音频直接播放;不加则存成.wav。参数全表可查 docs/getting-started/quickstart-cli.md。这就是你的第一次运行。
反过来也通:语音转文字与音频清洗 🔍
语音不只是"说",还要能"听"。官方快速上手里推荐的 STT 入口是 Whisper:
from mlx_audio.stt.generate import generate_transcription result = generate_transcription( model="mlx-community/whisper-large-v3-turbo-asr-fp16", audio="audio.wav", ) print(result.text)result.text就是转写结果。除了纯转写,还有一整套音频"手术":音源分离、降噪、说话人分离,见 mlx_audio/sts/models/ 里的 SAM-Audio、MossFormer2。用一句文字提示把录音里的人声单独抠出来,它也能做到。
进阶三招:声音克隆、量化与 API 服务 ⚙️
- 声音克隆:丢一段参考音频进去,就能模仿这个音色说话:
mlx_audio.tts.generate \ --model mlx-community/csm-1b \ --text "Hello from Sesame." \ --ref_audio ./reference_voice.wav --play- 量化:模型可压到 4 位、8 位等多个档位,官方模型列表里大量
-8bit、-4bit变体就是为此准备的,内存小的机器优先挑量化版。 - 服务化:
mlx_audio.server起一个本地服务,接口与 OpenAI 兼容(/v1/audio/speech、/v1/audio/transcriptions),现有 OpenAI SDK 换个 base_url 就能直接调。
落地实例:批量生成有声书
仓库里的 examples/bible-audiobook/ 是个完整样例:把一本书拆成章节,逐段调 TTS 生成,再统一转成 MP3。思路可以直接抄:长文切段 → 逐段生成 → 合并导出。想做个人有声书或播客片头,照这个流程走就行。
动手前先知道的几个坑
- 只支持 Apple Silicon:M1 到 M4 均可,Python 需 3.10 以上。
- WAV 零依赖,MP3 需要 ffmpeg:报音频格式错误时先查这条。
- Kokoro 要额外装 misaki:英文用
pip install misaki,日语、中文分别加[ja]、[zh]后缀。 - Qwen3-TTS 的Base版没有预置音色,想用
--voice得选 CustomVoice 版。
一套跑在 Mac 上的本地语音工具链
TTS、STT、STS 加音乐生成,一个库全占了,数据不出机器。想动手的话,先跑第一条mlx_audio.tts.generate听听效果。搞定。
【免费下载链接】mlx-audioA text-to-speech (TTS), speech-to-text (STT) and speech-to-speech (STS) library built on Apple's MLX framework, providing efficient speech analysis on Apple Silicon.项目地址: https://gitcode.com/GitHub_Trending/ml/mlx-audio
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考