资讯动态

ChatTTS 音色定制:给视频配旁白的快速上手

发布时间:2026/9/20 4:17:24 来源:尧图企业网站定制
ChatTTS 音色定制给视频配旁白的快速上手【免费下载链接】ChatTTS-ui一个简单的本地网页界面使用ChatTTS将文字合成为语音同时支持对外提供API接口。A simple native web interface that uses ChatTTS to synthesize text into speech, along with support for external API interfaces.项目地址: https://gitcode.com/GitHub_Trending/ch/ChatTTS-ui想换一换配音的音色翻了几页 README 还找不到入口——这种情况不该发生。ChatTTS-ui 是本地网页版的 ChatTTS 音色定制工具浏览器里选音色、点一下按钮就出 wav也能直接调 API 批量合成视频旁白和播客声音。会跑 docker 就能上手。跑通它最短部署路径这一段只解决一件事用最少命令把服务跑起来不折腾 Python 环境。git clone https://gitcode.com/GitHub_Trending/ch/ChatTTS-ui chat-tts-ui cd chat-tts-ui docker compose -f docker-compose.gpu.yaml up -d没有 GPU 的机器把最后一行的 -f 参数换成 docker-compose.cpu.yaml 即可源码方式建 venv、pip 装依赖、python app.py留给开发者细节在 README 里。第一次启动会多花几分钟模型会自动下载并缓存到本地 models 目录之后的启动就不再联网拉模型。验证成功的标准日志里出现启动:[0.0.0.0, 9966]后浏览器打开 http://127.0.0.1:9966看到文本输入框、音色下拉框和合成按钮的页面就是跑通了——输入一句话点合成浏览器里能直接播放生成的 wav 音频。合成效果由哪三个旋钮决定这一段解决合成出来不好听、不知道往哪调的问题只讲对效果影响最大的三个参数其余先别碰。voice 与 custom_voice音色值控制的是音色身份。下拉框有 2222、7869、6653、4099、5099 几个预设在自定义音色值里填一个大于 0 的整数该数即作为种子生效下拉框的选择被忽略。注意换号不是渐变——2222 和 2223 是两个完全不同的声音。起始建议先用 2222 熟悉流程再挑 3000、8000 这类种子试听。temperature温度控制合成时的随机程度。往 0.1 压读法稳定一致但容易平淡拉到 0.5 到 0.8语气起伏和呼吸感更活也更容易抽到怪腔。推荐起始值 0.3。prompt效果标记控制特殊声音效果填的是标记串而不是数字。[laugh_0] 带一个轻笑[break_3] 插入一段停顿[oral_2] 加一点口腔音多个标记连写可以叠加。纯旁白场景留空即可。参数控制什么推荐起始voice预设音色编号2222custom_voice自定义种子覆盖 voice0关闭temperature随机程度0.3prompt效果标记留空top_p、top_k、skip_refine 等其余参数先保持默认跑通后再按需微调。批量合成时怎么调 API这一段解决不点网页按钮也能出音频的问题用三个场景把接口能力串起来。场景一批量试听多个种子。要做的事同一句话换个种子合成一轮挑出顺耳的。做法/tts 接口一次 POST 就出结果——import requests for seed in range(3000, 3010): r requests.post(http://127.0.0.1:9966/tts, data{ text: 这是一段批量生成的旁白测试。, custom_voice: seed, }) print(r.json())返回是 JSONcode 为 0 且带 audio_files 数组含 wav 文件名和可直接下载的 url即成功code 为 1 时 msg 字段就是失败原因。场景二接进现成的配音流程。要做的事让 pyVideoTrans 用这个服务做后端。做法在它的设置里找到 ChatTTS 一栏请求地址填 http://127.0.0.1:9966点测试通过后主界面直接选 ChatTTS 即可不用写代码。场景三换成自己下载的音色。要做的事把别处试过的音色固定下来长期使用。做法把音色文件放进项目根的 speaker/ 目录csv 和旧版 pt 会被界面直接识别从第三方站点下下来的、以 seed_ 开头 _emb.pt 结尾的 pt 文件0.96 之后内核换了不兼容放进 speaker/ 后执行python cover-pt.py会生成同名 -cover.pt 文件界面里出现的就是转换后可用的音色。报错排查与进阶用法这一段解决跑不动和合成结果不对两类最常见的故障。症状首次启动下载模型时报 proxy 类错误或超时。原因模型默认从魔塔modelscope下载不支持走代理。解法关掉代理重跑模型完整缓存到本地后之后的启动不再依赖外网。症状英伟达显卡显存大于 4G仍走 CPU 合成很慢。原因装的是 CPU 版 torch。解法先pip uninstall -y torch torchaudio再装 cu128 的 CUDA 版显存不足 4G 时强制走 CPU 是正常行为。症状同一个种子值这次和上次或换台机器的音色有细微差别。原因种子是随机生成的入口不是固定录音。解法把种子当试听编号听到合适的记下来写进脚本复用别期待输出逐字节一致。需要让局域网内其他人访问时才用把 .env 里的 WEB_ADDRESS 从 127.0.0.1:9966 改成你的局域网 IP 加端口重启容器生效。需要向合作方交付一组固定声音素材时才用写个脚本循环调用 /tts 批量导出 wav 建素材库踩过的坑在 FAQ 里都有记录。先在网页上把 2222 到 5099 五个预设音色各合成一句存下来再挑一个种子值批量跑二十条听哪个适合你的旁白。【免费下载链接】ChatTTS-ui一个简单的本地网页界面使用ChatTTS将文字合成为语音同时支持对外提供API接口。A simple native web interface that uses ChatTTS to synthesize text into speech, along with support for external API interfaces.项目地址: https://gitcode.com/GitHub_Trending/ch/ChatTTS-ui创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价