资讯动态

MOSS-TTS OpenClaw 技能实战:飞书语音消息一键发送

发布时间:2026/9/17 12:03:34 来源:尧图企业网站定制
MOSS-TTS OpenClaw 技能实战飞书语音消息一键发送【免费下载链接】MOSS-TTSAn open-source model family for long-form speech, dialogue synthesis, voice design, sound effects, and real-time streaming TTS项目地址: https://gitcode.com/GitHub_Trending/mo/MOSS-TTSMOSS-TTS 是 MOSI.AI 与 OpenMOSS 团队开源的语音与声音生成模型家族覆盖长文本朗读、多说话人对话、音色设计、音效生成与实时流式 TTS。借助上架在 龙虾 ClawHub 平台的 OpenClaw 技能你可以在飞书上让 AI一键发送语音消息——不用写代码、不用本地部署三步即可上手。为什么是 MOSS-TTS日常工作中把一段文字变成自然语音是高频需求给飞书群发条语音通知、生成播客旁白、做语音助理回复……自己搭一套 TTS 服务通常要装环境、下模型、写接口门槛不低。MOSS-TTS 家族把这条链路拆成了 5 个可独立使用、也可组合的量产级模型模型定位MOSS-TTS旗舰 TTS高保真 零样本语音克隆、长文本生成MOSS-TTSD多说话人超长对话生成MOSS-VoiceGenerator文本指令直接设计音色无需参考音频MOSS-TTS-Realtime实时流式 TTSTTFB 低至 180msMOSS-SoundEffect文本生成自然/城市场景等音效其中 MOSS-TTS-Realtime 的整体响应LLM 首句 TTS 首包约为377ms非常适合搭建低时延语音智能体。更多细节可查阅 docs/moss_tts_model_card.md 与 docs/moss_tts_realtime_model_card.md。什么是 OpenClaw 技能OpenClaw 技能可以理解为给 AI 助手装的插件安装一条命令装好就能直接调用某个服务能力。MOSS-TTS 官方在 ClawHub 上架了两个技能技能说明安装命令feishu-voice-tts在飞书直接发送语音消息clawhub install feishu-voice-ttsmoss-tts-voice调用 MOSS-TTS API 生成语音文件clawhub install moss-tts-voice两个技能共用同一套服务语音合成由 MOSS-TTS 云端 API 完成API Key 在MOSI AI Studio平台获取。技能官方说明见 README_zh.md 的 OpenClaw API Skills 小节。飞书语音消息一键发送三步上手第 1 步获取 MOSS-TTS API Key注册 MOSI AI Studio 平台在控制台创建 API Key。这是唯一的前置准备无需购买 GPU、无需下载模型。第 2 步安装 feishu-voice-tts 技能在已安装 OpenClawClawHub CLI的终端中执行clawhub install feishu-voice-tts按照技能引导配置 MOSI AI Studio 的 API Key 与飞书机器人凭据即可。整个过程是交互式问答全程不超过 1 分钟。第 3 步让 OpenClaw 在飞书里说人话安装完成后直接用自然语言下指令例如给某某群发一条语音今天下午三点开会请准时参加把这段周报读出来发到飞书用参考音频里的音色克隆一条欢迎语音OpenClaw 会自动完成文本 → 语音合成 → 飞书语音消息整条链路最终你会在飞书里收到一条可以长按拖动、带小喇叭图标的标准语音消息而不是一个冷冰冰的 mp3 文件。小技巧MOSS-TTS-v1.5 支持[pause X.Ys]内联停顿标记和拼音/IPA 发音控制。发正式通知时可以在文本中插入停顿如各位同事[pause 1.5s]下午好语音会更自然。moss-tts-voice 技能更底层的语音生成如果不想发飞书只想把文本变成可下载的音频文件可以装moss-tts-voiceclawhub install moss-tts-voice典型用法把这篇 5000 字的文章合成一段播客音频用 reference_zh.wav 的音色克隆一段英文旁白生成 30 秒的雨声城市环境音效它直接暴露了 MOSS-TTS API 的能力多语种合成、零样本语音克隆、时长控制等。仓库内 assets/audio/ 目录下的reference_zh.wav、reference_en.m4a等参考音频都可以直接拿来体验音色克隆效果。语音背后模型是怎么工作的好奇的同学可以花 30 秒看懂核心架构旗舰模型基于MossTTSDelay架构——一个 Decoder-Only LLM用延迟模式并行预测多层 RVQ 音频 Token再经音频解码器还原波形。这正是它能在 8B 参数量下取得 Seed-TTS-eval 开源最佳成绩、且长文本依然稳定的原因。源码位于 moss_tts_delay/modeling_moss_tts.py。如果你还想更进一步——自己部署、做语音智能体本地部署configs/llama_cpp/cpu-only.yaml 提供纯 CPU运行配置完全无 GPU 需求8GB 显存显卡也有对应的trt-8gb.yaml低显存方案详见 moss_tts_delay/llama_cpp/README_zh.md网页体验直接运行 clis/moss_tts_app.py 启动 Gradio 界面拖拽即听实时语音智能体moss_tts_realtime/fast_api.py 提供服务化接口可搭配 LLM 流式输出做语音对话微调自己的音色三种架构的微调教程分别在 moss_tts_delay/finetuning/README_zh.md、moss_tts_local/finetuning/README_zh.md常见问题速答Q安装技能需要本地 GPU 吗不需要。OpenClaw 技能走云端 API 合成任何能运行 OpenClaw 的设备都行。Q语音消息的音色可以自定义吗可以。moss-tts-voice技能支持传入参考音频做零样本克隆feishu-voice-tts也可在技能配置中指定参考音色。Q支持哪些语言MOSS-TTS-v1.5 支持31 种语言包括中英混合、粤语、日语、韩语、法语等多语种合成时记得带上语言标签效果最佳。Q想完全离线运行怎么办克隆仓库后按 moss_tts_delay/llama_cpp/README_zh.md 配置 llama.cpp 后端可无 PyTorch、纯 CPU 运行配合 moss_tts_local_v1.5/streaming.py 还能做 48kHz 立体声实时流式解码。写在最后从文字到飞书语音消息过去需要一个后端团队现在只需要一条安装命令。MOSS-TTS 把业界领先的开源 TTS 能力封装成 OpenClaw 技能让普通用户也能零门槛用上高保真语音克隆与多语种合成。先装上feishu-voice-tts试试下一条群通知就让它用声音说话吧 ️【免费下载链接】MOSS-TTSAn open-source model family for long-form speech, dialogue synthesis, voice design, sound effects, and real-time streaming TTS项目地址: https://gitcode.com/GitHub_Trending/mo/MOSS-TTS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价