资讯动态

MOSS-TTS 时长控制完全指南:用 tokens 参数精确调节语速与节奏

发布时间:2026/9/2 12:53:47 来源:尧图企业网站定制
MOSS-TTS 时长控制完全指南用 tokens 参数精确调节语速与节奏【免费下载链接】MOSS-TTSMOSS‑TTS Family is an open‑source speech and sound generation model family from MOSI.AI and the OpenMOSS team. It is designed for high‑fidelity, high‑expressiveness, and complex real‑world scenarios, covering stable long‑form speech, multi‑speaker dialogue, voice/character design, environmental sound effects, and real‑time streaming TTS.项目地址: https://gitcode.com/GitHub_Trending/mo/MOSS-TTSMOSS-TTS 是 MOSI.AI 与 OpenMOSS 团队开源的语音生成模型家族其旗舰模型 MOSS-TTS 支持token 级时长控制——只需一个tokens参数就能精确指定合成语音的时长从而直接调节语速与节奏适合配音、有声书、视频口播等对时长有严格要求的场景。一、tokens 参数是什么1 秒 ≈ 12.5 个 tokensMOSS-TTS 把语音转成离散音频 token 序列其音频分帧率为12.5 Hz即每秒约 12.5 个 tokens。这是官方文档给出的核心换算规则换算关系数值分帧率12.5 tokens/秒tokens125≈ 10 秒tokens325≈ 26 秒tokens600≈ 48 秒 理解了tokens 时间轴上的帧数时长控制就变成了一道简单的乘法题想要 N 秒的语音就设tokens N × 12.5。二、如何设置 tokens三步上手在官方示例中时长控制只需在构建用户消息时传入tokens参数详见 README.md 与 docs/moss_tts_model_card.md 的 Duration control 章节conversations [ # 默认语速不传 tokens [processor.build_user_message(texttext_2)], # 时长控制同一段文本压缩到约 26 秒 / 放慢到约 48 秒 [processor.build_user_message(texttext_2, tokens325)], [processor.build_user_message(texttext_2, tokens600)], ]快速开始git clone https://gitcode.com/GitHub_Trending/mo/MOSS-TTS cd MOSS-TTS uv pip install -e .tokens是build_user_message的可选参数类型int官方文档定义Expected number of audio tokens. 1s ≈ 12.5 tokens。不传时模型按自然语速合成。三、语速调节实用技巧从文本长度估算合理 tokens在 Gradio 演示应用 clis/moss_tts_app.py 中官方内置了一套文本长度 → tokens的估算逻辑可直接借鉴文本语言每字符经验 token 数说明中文≈ 3.1中文信息密度高token 消耗快英文≈ 0.9英文单位长度 token 消耗少演示应用会自动把滑块限制在默认值的 0.5 倍 ~ 1.5 倍区间内见 moss_tts_app.py 中estimate_duration_tokens这是一个很实用的经验区间tokens 低于默认值 50%语音会明显加快可能显得急促tokens 高于默认值 150%语音会明显拖慢可能显得不自然。建议工作流先用默认语速生成一遍再按 ±20%~50% 微调tokens试听后确定最终值。四、MossTTSDelay 架构时长控制为什么稳定MOSS-TTS 采用MossTTSDelay架构单 Transformer 主干 多头并行 RVQ 预测 delay 调度长上下文稳定性强这正是 token 级时长控制可靠的前提——模型在 12.5 Hz 的固定时间轴上逐帧生成音频 token目标 tokens 数量即目标时长。其他支持时长控制的模型MOSS-TTS-Local-Transformer-v1.5同样使用 12.5 Hz 分帧率tokens125即约 10 秒见 moss_tts_local_v1.5/README.mdMOSS-SoundEffect音效生成也支持tokens时长标签规则相同1s ≈ 12.5 tokens见 docs/moss_sound_effect_model_card.md五、tokens 与 [pause X.Ys] 的区别全局节奏 vs 局部停顿控制方式作用范围适用场景tokensN全局整段语音总时长卡准片尾时间、控制整体语速[pause X.Ys]局部文本内指定位置插入停顿强调、留白、自然呼吸感v1.5 还支持显式停顿标记例如text 我今天学习了一首中国的古诗它的名字是[pause 3.2s]静夜思 [processor.build_user_message(texttext)]两者可组合使用tokens管总时长预算[pause]管节奏编排。六、常见问题与注意事项Q1Continuation续写模式为什么不能用 tokens续写模式依赖前缀音频自然延续官方演示中该模式下时长控制会被自动禁用Duration control is disabled for Continuation modes.见 moss_tts_app.py 的supports_duration_control。Q2tokens 设很大语音会无限长吗不会。model.generate中的max_new_tokens示例默认 4096即约 5.3 分钟是硬上限tokens只是期望值。Q3语速加快后会不会变电音适度调整0.5~1.5 倍默认 tokens下音质保持稳定超出该区间时节奏可能不自然建议结合采样参数audio_temperature等综合调优参数说明见 docs/moss_tts_model_card.md 的 Generation Hyperparameters 表格。七、相关文档导航资料路径旗舰模型卡含 tokens 参数定义docs/moss_tts_model_card.md交互式演示带时长滑块clis/moss_tts_app.pyLocal v1.5 推理示例moss_tts_local_v1.5/README.md音效时长控制docs/moss_sound_effect_model_card.md掌握tokens × 12.5 秒数这一条规则你就能在 MOSS-TTS 中精确控制每一句语音的语速与节奏让合成音频严丝合缝地匹配你的内容节奏。【免费下载链接】MOSS-TTSMOSS‑TTS Family is an open‑source speech and sound generation model family from MOSI.AI and the OpenMOSS team. It is designed for high‑fidelity, high‑expressiveness, and complex real‑world scenarios, covering stable long‑form speech, multi‑speaker dialogue, voice/character design, environmental sound effects, and real‑time streaming TTS.项目地址: https://gitcode.com/GitHub_Trending/mo/MOSS-TTS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价