
MLX-Audio 上手教程3条命令在 Apple Silicon 本地跑通文本转语音与转写【免费下载链接】mlx-audioA text-to-speech (TTS), speech-to-text (STT) and speech-to-speech (STS) library built on Apples MLX framework, providing efficient speech analysis on Apple Silicon.项目地址: https://gitcode.com/GitHub_Trending/ml/mlx-audio有一台 Mac想把三百页的小说变成有声书或把会议录音转成文字又不想把音频传给云端服务MLX-Audio 是基于 Apple MLX 框架构建的文本转语音TTS、语音转文本STT与语音转语音STS库全部推理都在 M 系列芯片本地完成一行 pip 命令就能搭起属于你自己的语音 AI 开发环境。第一次出声2条命令跑通文本转语音 ️装完后的第一件事是听出一个声音来。首跑会自动从 HuggingFace 拉模型第一次稍慢之后就全在设备内跑pip install mlx-audio mlx_audio.tts.generate \ --model mlx-community/Qwen3-TTS-12Hz-0.6B-CustomVoice-8bit \ --text Hello, world! \ --voice Vivian \ --play加了--play生成的音频直接播放不加则存成.wav。参数全表可查 docs/getting-started/quickstart-cli.md。这就是你的第一次运行。反过来也通语音转文字与音频清洗 语音不只是说还要能听。官方快速上手里推荐的 STT 入口是 Whisperfrom mlx_audio.stt.generate import generate_transcription result generate_transcription( modelmlx-community/whisper-large-v3-turbo-asr-fp16, audioaudio.wav, ) print(result.text)result.text就是转写结果。除了纯转写还有一整套音频手术音源分离、降噪、说话人分离见 mlx_audio/sts/models/ 里的 SAM-Audio、MossFormer2。用一句文字提示把录音里的人声单独抠出来它也能做到。进阶三招声音克隆、量化与 API 服务 ⚙️声音克隆丢一段参考音频进去就能模仿这个音色说话mlx_audio.tts.generate \ --model mlx-community/csm-1b \ --text Hello from Sesame. \ --ref_audio ./reference_voice.wav --play量化模型可压到 4 位、8 位等多个档位官方模型列表里大量-8bit、-4bit变体就是为此准备的内存小的机器优先挑量化版。服务化mlx_audio.server起一个本地服务接口与 OpenAI 兼容/v1/audio/speech、/v1/audio/transcriptions现有 OpenAI SDK 换个 base_url 就能直接调。落地实例批量生成有声书仓库里的 examples/bible-audiobook/ 是个完整样例把一本书拆成章节逐段调 TTS 生成再统一转成 MP3。思路可以直接抄长文切段 → 逐段生成 → 合并导出。想做个人有声书或播客片头照这个流程走就行。动手前先知道的几个坑只支持 Apple SiliconM1 到 M4 均可Python 需 3.10 以上。WAV 零依赖MP3 需要 ffmpeg报音频格式错误时先查这条。Kokoro 要额外装 misaki英文用pip install misaki日语、中文分别加[ja]、[zh]后缀。Qwen3-TTS 的Base版没有预置音色想用--voice得选 CustomVoice 版。一套跑在 Mac 上的本地语音工具链TTS、STT、STS 加音乐生成一个库全占了数据不出机器。想动手的话先跑第一条mlx_audio.tts.generate听听效果。搞定。【免费下载链接】mlx-audioA text-to-speech (TTS), speech-to-text (STT) and speech-to-speech (STS) library built on Apples MLX framework, providing efficient speech analysis on Apple Silicon.项目地址: https://gitcode.com/GitHub_Trending/ml/mlx-audio创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考