资讯动态

VoxCPM2 开源 TTS 指南:30 语言多说话人合成与声音克隆实战

发布时间:2026/9/2 11:14:31 来源:尧图企业网站定制
VoxCPM2 开源 TTS 指南30 语言多说话人合成与声音克隆实战【免费下载链接】VoxCPMVoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning项目地址: https://gitcode.com/GitHub_Trending/vo/VoxCPM你有一段 3 分钟的口播文案需要在 10 分钟内生成 5 种不同音色、3 种语速的音频变体。手动录制或调用在线 TTS API 都不够快而VoxCPM2的 tokenizer-free 扩散自回归架构恰好为此而生——它直接输出 48kHz 连续语音跳过离散 token 化的中间步骤让多语言、多说话人批量合成变成一条 Python 脚本。VoxCPM2 由面壁智能开源2B 参数、Apache-2.0 许可训练数据覆盖 200 万 小时多语言语音支持30 种语言与 9 种中文方言无需语言标签即可切换。下面用最短路径跑通安装、首次合成与声音克隆。 定位与差异VoxCPM2 在 TTS 方案中的位置一句话VoxCPM2 是无需语言标签即可跨 30 种语言直接合成并支持纯文本描述创建全新音色与参考音频可控克隆的开源语音引擎。维度在线 TTS API传统开源 TTSVoxCPM2语言覆盖通常 5~10 种按语种计费中英为主30 种语言 9 种方言无标签切换音色创建固定音色列表需录音训练自然语言描述即可生成输出采样率多为 16~24kHz24kHz48kHz 原生内置超分实时率RTX 4090取决于并发0.5~2.0~0.3标准/ ~0.13vLLM 加速商用许可按量计费视项目而定Apache-2.0免费商用 安装与首次合成4 步跑通确认环境Python ≥ 3.103.13、PyTorch ≥ 2.5.0、CUDA ≥ 12.0。python --version pip show torch安装一行命令完成依赖自动拉取。pip install voxcpm命令行首次合成无需写代码直接出 wav。voxcpm design --text 你好欢迎体验 VoxCPM2。 --output hello.wav验证输出用任意播放器打开hello.wav应为 48kHz 采样率、自然语速的中文语音。批量处理时将文本每行一条写入 txt执行voxcpm batch --input input.txt --output-dir outs/即可。不想敲命令行执行python app.py --port 8808后浏览器访问http://localhost:8808即可使用 Gradio Web 界面支持参考音频上传与参数调节。 功能精读三个核心能力纯文本声音设计不录音直接描述出一个新音色能做什么把音色描述写在文本开头的括号里模型即可生成对应气质的全新声音无需任何参考音频。适合有声书多角色快速试音、播客 A/B 测试、产品 Demo 配音。怎么用CLI 加--control参数或 Python 中把描述放在text开头括号内。voxcpm design \ --text 大家好今天的科技新闻来了。 \ --control 中年男声低沉稳重语速偏慢 \ --seed 42 \ --output news.wav得到什么一个与描述匹配、可直接投入使用的 48kHz 音频。若首次结果不满意换--seed值多生成 1~2 次即可。参考音频可控克隆保留音色调整风格能做什么上传一段 5~30 秒的参考音频模型克隆其音色同时接受更快更欢快等风格指令在保留原始音色的前提下改变表达方式。怎么用voxcpm clone \ --text 这是克隆后的语音。 \ --reference-audio speaker.wav \ --control 语速加快语气轻快 \ --output clone.wav得到什么音色与参考音频高度一致但语速、情感按指令调整。适合将同一说话人的录音适配到不同场景——新闻稿、广告旁白、教学视频各出一版。模型架构为什么跳过 Tokenizer 反而更自然VoxCPM2 在 AudioVAE V2 的连续潜空间中工作数据流为LocEnc → TSLM → RALM → LocDiT四阶段管线。跳过离散 token 化意味着不损失频谱细节也避免了 token 边界带来的机器感这是 48kHz 原生输出的底层原因。下方架构图展示了完整管线左侧 Unified Sequence Organization 列出了 TTS、Voice Design、Controllable Cloning 四种输入模式右侧 AudioVAE V2 模块完成 16kHz→48kHz 的非对称解码。对照初代 VoxCPM 架构可看到 V2 增加了参考音频输入通道Ref_Audio与 ASR 对齐模块支持更精细的克隆控制⚠️ 避坑与常见问题显存不足8GBVoxCPM2 约需 8GB VRAM。换用 VoxCPM1.5~6GB或 VoxCPM-0.5B~5GB安装不变模型名改为对应版本号即可。声音设计结果波动官方提示 Voice Design 与 Controllable Cloning 存在 run-to-run 差异建议固定--seed并多生成 2~3 次择优。CPU / Apple Silicon 能跑吗python app.py --device auto自动检测M 系列芯片走 MPSRTF 会上升但功能完整社区 llama.cpp-omni 项目提供 GGUF 纯 CPU 方案。批量处理大文件使用voxcpm batch命令输入文件每行一条文本输出目录自动按行号命名 wav。下一步现在执行pip install voxcpm voxcpm design --text 测试 --output test.wav3 分钟内你会听到第一条 48kHz 语音。后续可参考 conf/voxcpm_v2/ 下的 YAML 配置做 LoRA 微调5~10 分钟录音即可适配特定说话人。社区交流入口见下方群码【免费下载链接】VoxCPMVoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning项目地址: https://gitcode.com/GitHub_Trending/vo/VoxCPM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价