资讯动态

VoxCPM 实用指南:五步跑通零样本 TTS 与语音克隆

发布时间:2026/9/2 10:51:26 来源:尧图企业网站定制
VoxCPM 实用指南五步跑通零样本 TTS 与语音克隆【免费下载链接】VoxCPMVoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning项目地址: https://gitcode.com/GitHub_Trending/vo/VoxCPMVoxCPM 是一个无分词器tokenizer-free的 TTS 系统用扩散自回归架构直接生成连续语音表示支持多语种语音合成和零样本语音克隆。这篇文章带你用三条命令跑出第一段语音再覆盖 CLI、调优参数和生产部署要点。 3 分钟跑通第一个 Demo环境要求一张表说清项目要求Python3.10 – 3.123.10, 3.13PyTorch / CUDA2.5.0/12.0显存VoxCPM2 约 8 GBVoxCPM1.5 约 6 GB安装就一行pip install voxcpm然后用最少的代码跑一次 TTS首次运行会自动下载openbmb/VoxCPM2权重import soundfile as sf from voxcpm import VoxCPM model VoxCPM.from_pretrained(openbmb/VoxCPM2, load_denoiserFalse) wav model.generate(textVoxCPM 是一个无分词器的 TTS 系统。) sf.write(demo.wav, wav, model.tts_model.sample_rate)打开demo.wav就能听到结果命令行侧用voxcpm --help确认 CLI 可用即可。 日常使用姿势Python APIPython API 覆盖三种主要形态其中 Voice Design 不需要任何参考音频把音色描述放在文本开头的括号里就行# 语音设计括号内是音色描述无需参考音频 wav model.generate( text(年轻女声温柔甜美)你好这是 VoxCPM。, cfg_value2.0, seed42, ) # 零样本语音克隆传一段参考音频即可 wav model.generate(text这是克隆出的声音。, reference_wav_pathspeaker.wav) sf.write(clone.wav, wav, model.tts_model.sample_rate)如果还想复刻参考音频的节奏和情绪把参考音频及其转录文本传给prompt_wav_path/prompt_text即 Ultimate Cloning 模式相似度最高。命令行CLI 按功能拆成了design/clone/batch三个子命令# 语音设计--control 指定音色风格 voxcpm design \ --text VoxCPM2 brings studio-quality multilingual speech synthesis. \ --control Young female voice, warm and gentle \ --seed 42 \ --output out.wav # 零样本克隆--reference-audio 传参考音频 voxcpm clone \ --text 这是语音克隆演示。 \ --reference-audio speaker.wav \ --output clone.wav批量场景用voxcpm batch --input input.txt --output-dir outs输入文件每行一条文本。Web 界面仓库自带 Gradio 界面适合快速试效果python app.py --port 8808 # 浏览器打开 http://localhost:8808 python app.py --device auto # auto 自动选 CPU / MPS / CUDA界面里可以直接体验语音克隆和 Voice Design不用写代码。⚙️ 调优与进阶玩法默认参数效果不满意时主要动这三个旋钮cfg_value引导强度取值 0.1–10.0官方推荐 1.0–3.0。越高越贴风格指令过高会发闷。inference_timesteps扩散步数取值 1–100推荐 4–30。越大质量越好速度越慢。seed随机种子。Voice Design 和可控克隆的结果每次运行可能不同固定种子保证可复现。wav model.generate( text(稍快一点语气轻快)这是带风格控制的克隆语音。, reference_wav_pathspeaker.wav, cfg_value3.0, # 调高加强风格贴合度 inference_timesteps20, # 调高质量更好但更慢 seed42, )实时场景用流式接口音频分块产出边生成边播import numpy as np chunks [c for c in model.generate_streaming(text流式合成让实时应用成为可能。)] wav np.concatenate(chunks)另外5–10 分钟音频就能适配一个特定说话人LoRA 是推荐入口python scripts/train_voxcpm_finetune.py \ --config_path conf/voxcpm_v2/voxcpm_finetune_lora.yaml 上生产前必须知道的事版本选择VoxCPM22B、48kHz、30 种语言、支持 Voice Design 与可控克隆适合大多数场景只做中英且显存紧张选 VoxCPM1.50.6B、44.1kHz0.5B 是 16kHz 的轻量档。显存占用VoxCPM2 约 8 GB、VoxCPM1.5 约 6 GB、0.5B 约 5 GB单卡即可跑。吞吐与并发RTX 4090 上标准实现 RTF 约 0.30高并发用 Nano-vLLM 或 vLLM-OmniRTF 可到约 0.13vLLM-Omni 还提供 OpenAI 兼容的/v1/audio/speech接口。流式 vs 非流式generate一次性产出适合批量离线任务generate_streaming分块返回适合直播、语音助手这类低延迟场景。参考音频质量参考音频要干净、单声道、少背景音追求高相似度克隆时额外提供参考音频的逐字转录Ultimate Cloning。 踩坑速查模型下载卡住或失败→ 网络无法直连 HuggingFace → 先通过 ModelScope 下载权重到本地from_pretrained传本地目录。加载或推理时显存不足OOM→ VoxCPM2 需要约 8 GB → 换openbmb/VoxCPM1.5约 6 GB或 0.5B约 5 GB。克隆相似度不够高→ 只传了参考音频 → 再传prompt_wav_path和参考音频的逐字prompt_text走 Ultimate Cloning。Voice Design 风格不稳定→ 官方说明可控生成结果有波动 → 换 2–3 个seed多生成几次挑最贴近描述的一条。VoxCPM 把多语种 TTS 和零样本语音克隆收进一个开源模型装完voxcpm三条命令就能出声。【免费下载链接】VoxCPMVoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning项目地址: https://gitcode.com/GitHub_Trending/vo/VoxCPM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价