资讯动态

Dify.AI 语音助手:3步打通语音交互完整链路

发布时间:2026/8/29 10:51:08 来源:尧图企业网站定制
Dify.AI 语音助手3步打通语音交互完整链路【免费下载链接】difyBuild Agentic workflows, RAG pipelines, with rich AI model and tool support on one collaborative workspace. Deploy on cloud, VPC, or self-hosted, so teams move from prototype to production without rebuilding the stack.项目地址: https://gitcode.com/GitHub_Trending/di/dify用户对客服说了三分钟系统却只回一句未识别Dify.AI 语音助手解决的就是这个问题录音转文字LLM 生成回答TTS 再把回答读出来。这条 Dify.AI 语音交互链路跟着本文 3 步就能跑通。能力全景一张表看清语音链路本节回答一个问题Dify.AI 的语音功能到底覆盖哪些能力、边界在哪。功能支持格式限制适用场景语音转文字STTmp3 / m4a / wav / amr / mpga单文件 30MB录音转写、语音留言、通话质检文字转语音TTS输出 AAC / MP3 / FLAC / WAV / OGG / WebM / MP4 音频流音色取决于所选模型提供商回答朗读、有声内容、无障碍播报整条链路只有四个环节声音进、文字出、文字出、声音出中间环节由应用本身完成STT 把音频交给模型提供商转成文本文本进入你配置的对话流或工作流LLM 的输出再交给 TTS。整段逻辑集中在 api/services/audio_service.py接口定义见 api/controllers/service_api/app/audio.py。3步打通语音闭环最小可行路径 本节给出跑通 Dify.AI STT 配置和 TTS 调用的最短路径。第 1 步添加语音模型提供商做什么在模型提供商里选择一个带语音能力的提供商如 OpenAI填入 API Key。配什么STT 用whisper-1TTS 用tts-1之类的 TTS 模型。注意什么提供商若完全不支持语音模型调用会直接报provider_not_support_speech_to_text先确认模型列表。第 2 步打开应用功能开关做什么在应用的功能面板打开 speech_to_text 和 text_to_speech。配什么TTS 在这里选音色比如alloy中性或nova女性、更亲和。注意什么开关没打开时接口返回speech_to_text_disabled这是新手最常见的报错。第 3 步两个接口验证闭环# STT上传录音返回文本 curl -X POST {base_url}/v1/apps/{app_id}/audio-to-text \ -H Authorization: Bearer {api_key} -F filedemo.mp3 # TTS提交文本返回音频二进制 curl -X POST {base_url}/v1/apps/{app_id}/text-to-audio \ -H Authorization: Bearer {api_key} \ -H Content-Type: application/json \ -d {text:你好我是Dify语音助手,voice:nova}一个返回 JSON 文本一个直接回音频字节流Content-Type会标明具体容器格式。到这里录音进、声音出的最小闭环已经成立。场景实战一语音客服——通话录音变工单要解决什么客服每天花大量时间人工听录音、手敲工单既慢又容易漏信息。怎么配只开 STT 开关。把通话录音传给 audio-to-text拿回文本后拼进你的 LLM 提示词让它输出问题摘要 处理建议两个字段。需要回放某条历史语音回复时不用重发文本传消息 ID 即可# 回放某条消息的语音传 message_id无需重发 text curl -X POST {base_url}/v1/apps/{app_id}/text-to-audio \ -H Authorization: Bearer {api_key} \ -d {message_id:message_id}效果如何3 分钟录音 10 秒变文字客服只需核对字段转写工作从人工变成接口调用。场景实战二内容创作——一句话出有声稿要解决什么做有声读物、视频口播时配音是最耗时的环节。怎么配只开 TTS。Dify.AI TTS 音色选择的诀窍是先查看当前提供商返回的音色列表按性别和风格挑——中性通用选alloy讲故事选fable客服类选亲和感更强的nova中文内容建议换用对中文优化的提供商自然度差异明显。效果如何脚本交给 LLM 生成或人工写好调 text-to-audio 拿到可播放的 MP3/AAC 流直接进剪辑工具单人一天能产出数小时配音量。避坑清单6个高频报错对照表 ⚠️本节把真实接口会抛出的错误集中列出报错时直接查表。现象原因处理方法speech_to_text_disabled应用功能开关未打开到功能面板打开 speech_to_textprovider_not_initialize没配置有效 API Key到模型提供商补填密钥413audio_too_large文件超过 30MB前端压缩音频或分段上传415unsupported_audio_type格式不在白名单转成 mp3 / m4a / wav / amr 再传no voice availableTTS 未指定且无默认音色在 payload 里显式传voice参数provider_quota_exceeded提供商额度用尽充值或切换到备用提供商进阶与趋势跑通最小闭环后你可以往三个方向走一是实时双向语音把上传整段文件换成流式输入输出做准实时的语音对话二是音色个性化用提供商的音色克隆能力让助手拥有专属声音三是多语言实时转译STT 识别一种语言、LLM 转译、TTS 用另一种语言读出来。语音能力的源码入口api/、前端录音与播放组件web/app/components/base/audio-btn/和官方文档docs/都已就位。现在就拉下项目按上面 3 步把你的第一个 Dify.AI 语音助手跑起来吧。【免费下载链接】difyBuild Agentic workflows, RAG pipelines, with rich AI model and tool support on one collaborative workspace. Deploy on cloud, VPC, or self-hosted, so teams move from prototype to production without rebuilding the stack.项目地址: https://gitcode.com/GitHub_Trending/di/dify创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价