资讯动态

MLX-Audio:Mac上本地语音AI,到底有多快

发布时间:2026/9/20 7:05:01 来源:尧图企业网站定制
MLX-AudioMac上本地语音AI到底有多快【免费下载链接】mlx-audioA text-to-speech (TTS), speech-to-text (STT) and speech-to-speech (STS) library built on Apples MLX framework, providing efficient speech analysis on Apple Silicon.项目地址: https://gitcode.com/GitHub_Trending/ml/mlx-audioMLX-Audio 是开发者 prince-canuma 基于 Apple MLX 框架做的语音库本地 TTS文本转语音、STT语音转文本、STS语音增强/分离全部跑在 Apple Silicon 上。它解决的痛点很直接——音频不用上云M 系列 Mac 自己就能完成推理社区已把 20 种 TTS、20 种 STT 模型移植过来。 30秒跑通第一个 Demo最短路径是命令行一条安装、一条生成--play参数直接出声不落盘。pip install mlx-audio mlx_audio.tts.generate \ --model mlx-community/Qwen3-TTS-12Hz-0.6B-CustomVoice-8bit \ --text Hello, world! --voice Vivian --play首次运行会自动下载 8bit 量化版模型。量化≈给模型瘦身精度换速度。之后 Vivian 的声音就能播出来了。Python 侧同样三步load_model加载、model.generate(text, voice...)生成、result.audio就是波形数组mx.array自己存盘或继续处理都行。三大能力一张表TTS / STT / STS 各自能干什么能力边界先看这张表源码细节在 tts 模块 和 stt 模块 里能力能力边界适用场景推荐档位模型TTS 语音合成20 模型多语言、语音克隆、情感控制、批量生成、流式输出有声书、配音、语音助手轻量 Kokoro-82M / 均衡 Qwen3-TTS 0.6B / 旗舰 Higgs Audio v34B100 种语言STT 语音识别20 模型99 语言、流式识别、词级时间戳、说话人分离会议纪要、字幕、实时听写轻量 Parakeet 0.6B / 均衡 Whisper large-v3-turbo / 旗舰 VibeVoice-ASR9B长音频最长 60 分钟STS 语音处理音源分离、语音增强、全双工实时语音对话降噪、拆人声轨、语音对话MossFormer2 SE降噪/ SAM-Audio按文本分离音源/ NemotronLabs VoiceChat实时对话⚡ Apple Silicon 为什么快说白了就三个词统一内存、硬件加速、量化加速。统一内存CPU 和 GPU 共用同一块内存模型权重加载一次就行推理时不来回拷贝。好处是内存按参数规模算账即可——参考点7B 模型 bf16 全精度约需 17GB转成 4bit 后 16GB 统一内存轻松装下。硬件加速MLX 把计算调度到 M 系列芯片的 GPU 上执行M2 Ultra 上推理比纯 CPU 实现快 3-5 倍。原生量化格式除传统 affine 量化外还支持 mxfp4 / mxfp8Apple 原生浮点格式在 Mac 上性能最好和 nvfp4。换句话说同一模型选对量化格式占内存和速度都能再省一截。模型选型三档轻量 / 均衡 / 旗舰对号入座内存一列按参数规模粗估不需要精确到 MB档位方向代表模型参数规模内存占用一句话定位轻量TTSKokoro-82M / MOSS-TTS-Nano80M~100M极低4bit 量化后更省54 种预设音色出声最快轻量STTParakeet-0.6B0.6B低高精度识别v3 覆盖 25 种欧洲语言均衡TTSQwen3-TTS 0.6B / 1.7B8bit中等多语言 情感与语音设计日常主力均衡STTWhisper large-v3-turbofp16中等99 语言鲁棒性最强旗舰TTSHiggs Audio v34B高建议 4bit100 种语言的对话式合成 克隆旗舰STTVibeVoice-ASR9B高bf16 需几十 GB60 分钟长音频转录带说话人分离和时间戳拿不准就从均衡档的 8bit 版开始不行再降位宽或换小模型。 进阶玩法克隆、流式、增强三个最常用的进阶点每段代码都不超过 8 行。Mac 本地语音克隆最短路径给 OmniVoice 一段参考音频和它对应的文字即可覆盖 646 种语言。注意ref_text必须和参考音频内容对得上对不上音色相似度会打折from mlx_audio.tts.utils import load_model m load_model(mlx-community/OmniVoice-bf16) for r in m.generate(text这句话用参考说话人的声音读, languageenglish, ref_audioref.wav, ref_text参考音频的文字内容, duration_s5.0): audio r.audio流式识别怎么接Voxtral Realtime 是 Mistral 的 4B 流式识别模型4bit 版更快、fp16 精度更高。transcription_delay_ms控制延迟和准确度的权衡值越小出字越快但可能更不准from mlx_audio.stt.utils import load m load(mlx-community/Voxtral-Mini-4B-Realtime-2602-4bit) for chunk in m.generate(audio.wav, streamTrue): print(chunk, end, flushTrue)一行完成语音增强MossFormer2 SE 专门去噪输出 48kHz 干净人声from mlx_audio.sts import MossFormer2SEModel m MossFormer2SEModel.from_pretrained(starkdmi/MossFormer2_SE_48K_MLX) clean m.enhance(noisy_speech.wav)接入你的项目HTTP API 与自定义模型两条路径起一个 HTTP API 服务或把自研模型注册进库里。HTTP API服务是 OpenAI 兼容接口已有 OpenAI TTS 调用代码基本只改 base URL仓库自带 Web 界面mlx_audio/ui/3D 音频可视化npm run dev就能开mlx_audio.server --host 0.0.0.0 --port 8000 # 终端1启动 API 服务 # 终端2OpenAI 兼容的 TTS 调用 curl -X POST http://localhost:8000/v1/audio/speech \ -d {model: mlx-community/Kokoro-82M-bf16, input: 你好世界, voice: af_heart} \ --output speech.wav自定义模型想跑列表里没有的模型继承 tts 模块 里 base 中的基类实现generate方法再到 registry 注册命令行和 API 就能直接调它不用改上层调用代码。另外iOS/macOS 原生应用可以关注官方的 Swift 包 mlx-audio-swift走的是同一套 MLX 后端。 避坑清单症状保存 MP3/FLAC/OGG 报错 原因没装 ffmpegWAV 不依赖它其他编码格式都要 解法brew install ffmpeg后重试症状Kokoro 合成中文或日语效果异常 原因缺文本预处理依赖 misaki 解法pip install misaki[zh]或misaki[ja]英文用基础包即可症状加载大模型直接内存爆炸 原因选了 bf16 全精度7B 就要约 17GB 解法换 4bit/8bit 量化版或 mxfp4 格式内存立刻降下来症状语音克隆出来的音色不像 原因ref_text与参考音频实际内容不一致 解法参考音频转一份文字逐句填进去再克隆症状流式识别出字明显慢半拍 原因transcription_delay_ms调得太大 解法降到 240ms 附近找延迟与准确度的平衡点下一步三步走用 Kokoro-82M 跑通 CLI 和 Python 两种接口把模型 ID、音色名、--play这些概念过一遍挑 Qwen3-TTS 或 OmniVoice 做一次语音克隆重点理解ref_audio/ref_text这对参数把 Voxtral Realtime 流式识别接到自己的服务里试试 OpenAI 兼容 API 和自带 Web UI。关键入口架构文档、量化指南、模型实现总目录。一个库、一台 Mac合成、识别、增强全在本地闭环。先让第一句声音出来再谈选型不迟。【免费下载链接】mlx-audioA text-to-speech (TTS), speech-to-text (STT) and speech-to-speech (STS) library built on Apples MLX framework, providing efficient speech analysis on Apple Silicon.项目地址: https://gitcode.com/GitHub_Trending/ml/mlx-audio创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价