⚠️ 在开始阅读之前如果你对实时 Agent / 数字人 / 多模态系统 / LiveKit 架构感兴趣欢迎先到 GitHub 给项目点一个 ⭐ Star这是对开源作者最大的支持。AlphaAvatar 项目地址强烈建议先收藏该项目正在持续更新维护 https://github.com/AlphaAvatar/AlphaAvatarAIPapers 项目地址具有更全的有关LLM/Agent/Speech/Visual/Omni论文分类 https://github.com/AlphaAvatar/AIPaperNotes摘要我们推出了TiCo一种时间可控的语音对话模型 (SDM)。该模型能够遵循时间约束指令例如“请生成一个持续约 15 秒的回复”并生成时长可控的语音回复。这项功能对于语音助手和交互式 Agent 等实际语音系统至关重要因为控制回复时长可以提升交互质量。然而尽管现有模型能够生成自然的语音回复但它们缺乏时间感知能力难以遵循与时长相关的指令。为了系统地评估这一点我们推出了TiCo-Bench这是首个针对 SDM 中时间可控指令执行能力的基准测试。现有的开源和商业模型在该基准测试中经常无法满足明确的时间约束。TiCo 通过Spoken Time Markers (STM)例如10.6 秒使 SDM 能够在生成过程中估计已过去的说话时间从而解决了这一局限性。这些标记有助于模型保持时间感知并调整剩余内容以达到目标时长。 TiCo 无需问答配对数据即可高效进行后训练它依赖于自生成和带有可验证奖赏的强化学习。实验结果表明TiCo 在保持响应质量的前提下相比其骨干网络将持续时间误差降低了2.7倍相比最强的基线网络降低了1.6倍。1.Introduction正如本杰明·富兰克林的名言“时间就是金钱”所言时间在人类生活中具有根本价值。在人机交互中时间是一项至关重要的资源它直接影响可用性、部署成本以及安全关键决策。对于Spoken Dialogue Models (SDMs)而言这一点尤为重要。语音对话模型在个人助理、可穿戴设备和医疗保健系统等实际应用中正日益受到关注。在这些场景中响应不仅要准确自然而且通常还需严格控制时长。例如驾驶时可能需要语音助手提供路况信息可穿戴设备可能由于电池或带宽限制而需要简洁的语音反馈。同样在医疗或紧急情况下语音助手可能需要在严格的时间压力下提供简短而有效的指示。在所有这些情况下控制响应时长的能力是实际部署的关键要求。尽管时间可控性至关重要但在语音对话模型中这方面的研究仍然远远不够。在文本大语言模型LLM领域以往研究表明模型通常难以遵循明确的长度约束指令。此外LLM 的输出常常表现出冗长或长度偏差这种现象与基于偏好的评估和对齐方式有关。这种倾向削弱了模型遵循指令的能力并对用户体验产生负面影响。尽管基准测试、提示和训练策略已开始着手解决文本 LLM 的长度可控性问题但由于其重要的实际应用价值这一研究方向仍然活跃且持续受到关注。然而在 SDM 中控制响应时长比控制文本输出长度要困难得多。在语音生成中词数只是实际时长的近似值。一个词可能包含不同数量的音节而且语音时长会随语音组成、语言环境和韵律结构而变化。此外语速也会因说话者、说话风格和交际环境而异这取决于说话者和听者。因此简单地限制生成的词数并不能保证对最终语音时长进行精确控制。这种不匹配使得时长控制成为语音对话系统中一个独特且更具挑战性的问题。鉴于目前对 SDM 时间可控性的研究有限我们首先引入了TiCo-Bench这是一个旨在评估 SDM 时间可控指令执行能力的基准测试程序。我们的评估结果表明现有的 SDM 难以可靠地满足明确的时间约束。为了应对这一挑战我们引入了TiCo图1一种时间可控的 SDM它可以通过语音时间标记实时估计和调节生成的语音时长。TiCo 是通过对 SDM 进行后训练而获得的使其在生成过程中具备内部时间感知机制从而能够跟踪时间进程并相应地调整其响应。具体来说TiCo 采用两阶段训练流程。在第一阶段模型利用自生成能力构建监督数据以学习持续时间感知从而将中间生成状态与时间进程关联起来并估计已过去的说话时间。在第二阶段应用可验证奖赏强化学习RLVR其中奖赏基于说话时间标记自动验证以进一步优化响应分布并提高对持续时间相关指令的遵循度。该阶段旨在使模型在保持响应质量包括实用性和连贯性的同时更好地满足目标时间约束。我们的贡献总结如下我们提出了TiCo这是一个时间可控的口语对话模型采用两阶段后训练程序进行训练使其能够在推理过程中生成Spoken Time Markers (STMs)并对响应持续时间进行实时控制。我们推出了TiCo-Bench这是第一个旨在评估口语对话模型时间可控性的基准测试用于衡量它们是否能够遵循明确的持续时间相关指令。我们进行了大量的实验结果表明 TiCo 显著提高了持续时间可控性同时保持了响应质量并进一步证明所学习的能力可以推广到训练期间所观察到的持续时间范围之外。2. Related Works2.1 Spoken Dialogue Models口语对话模型SDM旨在通过直接理解和生成口语对话实现自然的人机交互。与依赖级联式自动语音识别ASR、文本生成和文本转语音TTS模块的传统语音助手不同近年来SDM 越来越多地采用端到端或紧密集成的建模范式。然而与在语义丰富的文本空间中运行的基于文本的大语言模型LLM相比由于语音信号的高度可变性和复杂性语音的处理难度要大得多。因此许多最新的 SDM 引入了中间表示最常见的是文本以支持在生成语音响应过程中的语义规划。这包括推理以提高响应质量、调用工具以利用外部模块以及对语音内容进行更直接的指导。具体来说SDM 首先接收输入查询文本或语音形式以生成中间表示然后由语音生成器使用该中间表示生成最终的输出语音表示例如音标和声学 token最后合成波形。我们在附录 J 中提供了代表性 SDM 及其中间表示的综述。近年来一些基准测试开始从响应质量以外的维度评估 SDM例如语音风格、交互性、可控性和时间感知。尽管已经出现了关于可控性和时间感知的基准测试但据我们所知TiCo 是第一个通过高效的后训练方法明确实现 SDM 时间可控生成的方法。值得注意的是TiCo 与 TTS 系统中的时长建模有着本质区别。TTS 中的时长建模主要侧重于将文本与合成语音对齐而 TiCo 则致力于生成时间可控的语音响应。这种设定要求语音对话模型 (SDM) 在生成过程中进行语义规划和推理并动态适应时间相关的约束。此外TiCo 与以往的时间理解工作截然不同后者旨在赋予语音模型解释输入音频中时间信息的能力例如“音频中‘狗叫’的时间间隔是多少”。相比之下TiCo 关注的是生成过程中的时间感知而非对输入的时间理解。2.2 Length-Control Large Language ModelsLLM 中的长度控制研究主要集中在三个方面。1无需训练或解码时间的方法通过采样、零样本提示或EOS标记重加权来强制执行长度控制。2指令微调方法在生成过程中注入长度跟踪信号例如目标距离编码、潜在跟踪标记或显式位置标记。3第三种方法利用强化学习RL或偏好优化来解耦长度偏差与响应质量并通过强制执行简洁步骤或针对更复杂的问题扩展轨迹来控制推理长度。所有这些方法都针对文本其中词数是长度的直接指标。而 TiCo 则针对口语对话其中词数只是语音时长的粗略指标因为实际的语音时长取决于文本输出之外的副语言因素。3.TiCo语音到语音的口语对话模型 (SDM) 可以看作是一个条件生成模型它根据用户的输入语音查询xsp\textbf x^{sp}xsp和文本指令p\textbf pp例如系统提示生成口语响应ysp\textbf y^{sp}ysp。现代 SDM 通常引入中间表示z\textbf zz来连接高层语义推理和底层语音合成。具体来说中间序列生成器pθp_θpθ首先根据用户输入生成一个中间表示z∼pθ(z∣xsp,p).(1)\textbf z\sim p_{\theta}(\textbf z|\textbf x^{sp},\textbf p).\tag{1}z∼pθ(z∣xsp,p).(1)最终的语音回复由语音生成器qϕq_ϕqϕ生成ysp∼qϕ(ysp∣z,xsp,p).(2)\textbf y^{sp}\sim q_ϕ(\textbf y^{sp}|\textbf z,\textbf x^{sp},\textbf p).\tag{2}ysp∼qϕ(ysp∣z,xsp,p).(2)不同的架构对公式 (2) 施加不同的条件独立性假设。在级联系统中语音合成模块无法访问原始用户语音或指令因此生成过程简化为qϕ(ysp∣z)q_ϕ(\textbf y^{sp} | \textbf z)qϕ(ysp∣z)。在端到端模型中ysp\textbf y^{sp}ysp的生成可能还取决于xsp\textbf x^{sp}xsp和p\textbf pp例如在 Qwen-Omni 的“Thinker-Talker”设计中。3.1 TiCo Stage1: Time-Awareness Training此阶段图 1上训练模型生成Spoken Time Markers作为中间表征z\textbf zz的一部分使得z\textbf zz不仅编码语义内容还编码其在条件上下文(xsp,p)(\textbf x^{sp}, \textbf p)(xsp,p)下与最终口语响应ysp\textbf y^{sp}ysp的预期时间对齐。这些标记通过自生成过程插入到zzz中并在训练期间用作预测目标。Spoken Time Marker。口语时间标记是一种特殊 token用于指示中间表征中给定位置之前估计的累计口语持续时间。从概念上讲这些标记充当中间语义计划z\textbf zz和在相同条件上下文(xsp,p)(\textbf x^{sp}, \textbf p)(xsp,p)下实际口语响应ysp\textbf y^{sp}ysp之间的离散化对齐信号。受 TimeMarker 的启发我们以文本形式表示这些标记例如 6.8 seconds。在中间层级估计时长并非易事。一个词可能对应多个音节其声学时长会随语境和语速而变化。因此需要显式地估计时长才能弥合中间表示和最终语音实现之间的差距。Training Data Construction。令D{(xsp,p)}\mathcal D \{(\textbf x^{sp}, \textbf p)\}D{(xsp,p)}表示输入语音查询-指令对的集合。在此阶段我们通过自生成构建时间感知训练目标然后进行基于自动语音识别 (ASR) 的对齐。具体来说给定每个输入(xsp,p)∈D(\textbf x^{sp}, \textbf p) ∈ \mathcal D(xsp,p)∈D模型首先自由生成一个中间表示zzz及其对应的语音响应ysp\textbf y^{sp}ysp。基于 ASR 的对齐。具体而言对于每个输入(xsp,p)∈D(\mathbf{x}^{\mathrm{sp}}, \mathbf{p}) \in \mathcal{D}(xsp,p)∈D模型首先自由生成一个中间表示z\mathbf{z}z及其对应的语音响应ysp\mathbf{y}^{\mathrm{sp}}ysp。随后我们应用基于 ASR 的对齐来估计z)与(ysp\mathbf{z}) 与 (\mathbf{y}^{\mathrm{sp}}z)与(ysp之间的时间对应关系。基于对齐后的时间戳我们定义一个语音时间标记Spoken Time Markers序列t[t1,…,tM]\mathbf{t}[t_1,\ldots,t_M]t[t1,…,tM]其中每个tjt_jtj表示z\mathbf{z}z中某个对齐位置处估计的累计说话时长。我们将这些标记与中间 token 交错插入从而得到一个增强序列z~[z1,…,zi,tj,…,zN,tM].(3) \tilde{\mathbf{z}}[z_1,\ldots,z_i,t_j,\ldots,z_N,t_M]. \tag{3}z~[z1,…,zi,tj,…,zN,tM].(3)因此增强序列z~\tilde{\mathbf{z}}z~不仅编码了语义内容还编码了由对齐所引入的时间信息该信息在相同输入条件(xsp,p)(\mathbf{x}^{\mathrm{sp}},\mathbf{p})(xsp,p)下将z\mathbf{z}z与最终的语音响应关联起来。这一过程得到一个对齐后的训练集DSFT(xsp,p,z~)\mathcal{D}_{\mathrm{SFT}}{(\mathbf{x}^{\mathrm{sp}},\mathbf{p},\tilde{\mathbf{z}})}DSFT(xsp,p,z~)。我们以自回归方式对增强后的中间序列进行建模pθ(z~∣xsp,p)∏n1∣z~∣pθ(z~n∣z~n,xsp,p).(4) p_\theta(\tilde{\mathbf{z}}\mid \mathbf{x}^{\mathrm{sp}},\mathbf{p}) \prod_{n1}^{|\tilde{\mathbf{z}}|} p_\theta \left( \tilde z_n \mid \tilde{\mathbf{z}}_{n}, \mathbf{x}^{\mathrm{sp}}, \mathbf{p} \right). \tag{4}pθ(z~∣xsp,p)n1∏∣z~∣pθ(z~n∣z~n,xsp,p).(4)随后我们优化标准的监督微调SFT目标LSFT−E(xsp,p,z~)∼DSFT[∑n1∣z~∣logpθ(z~n∣z~n,xsp,p)].(5) \mathcal{L}_{\mathrm{SFT}} -\mathbb{E}_{(\mathbf{x}^{\mathrm{sp}},\mathbf{p},\tilde{\mathbf{z}})\sim\mathcal{D}_{\mathrm{SFT}}} \left[ \sum_{n1}^{|\tilde{\mathbf{z}}|} \log p_\theta \left( \tilde z_n \mid \tilde{\mathbf{z}}_{n}, \mathbf{x}^{\mathrm{sp}}, \mathbf{p} \right) \right]. \tag{5}LSFT−E(xsp,p,z~)∼DSFTn1∑∣z~∣logpθ(z~n∣z~n,xsp,p).(5)值得注意的是自生成self-generation具有两个优点1它消除了收集成对问答监督数据的需求2生成的响应遵循模型自身的输出分布从而提高了训练稳定性。3.2 TiCo Stage 2: Time-Controllable Training4.Experiments