资讯动态

Qwen-Agent 本地部署:用 LM Studio 跑通离线 Agent 的完整配置

发布时间:2026/9/10 7:35:34 来源:尧图企业网站定制
Qwen-Agent 本地部署用 LM Studio 跑通离线 Agent 的完整配置【免费下载链接】Qwen-AgentAgent framework and applications built upon Qwen3.0, featuring Function Calling, MCP, Code Interpreter, RAG, Chrome extension, etc.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen-Agent把 Qwen-Agent 的模型服务从云端 API 换成本机数据不再出网响应不再排队。本文以 LM Studio 为例演示如何把它作为 OpenAI 兼容的模型服务接入 Qwen-Agent 的 LLM 适配层跑通对话、代码执行和文档问答。先做个决定本地部署值不值得做两种方式各有所长先看差异再动手维度本地部署LM Studio云端 API延迟取决于本机显卡一般数百毫秒内出首 token无网络往返受网络与排队影响波动较大隐私请求和文件都在本机处理敏感数据不出机器内容经服务商传输成本一次性硬件投入调用次数不限按 token 计费量大有感知能力边界受显存限制7B 级为主工具调用能力弱于旗舰模型可用最新旗舰模型多模态齐全维护需自行加载模型、管端口、看显存开箱即用 判断标准如果你的场景是隐私敏感的文档问答、内部数据代码分析且对模型能力要求是够用而非最强本地部署值得做否则可以先跑通云端再按需迁移。准备启动 LM Studio 模型服务安装 LM Studio在模型库中下载一个 GGUF 格式的模型Qwen 系列对工具调用格式支持较好7B 级别即可起步。在 Server 页签点击启动默认监听1234端口对外提供/v1路径的 OpenAI 兼容接口。用一条命令自检服务是否就绪curl http://localhost:1234/v1/models能返回模型列表 JSON 就说明服务可用。 为什么先做这步后面 Qwen-Agent 的所有连接问题80% 出在服务端根本没起来先确认再配客户端省得两头排查。配置安装 Qwen-Agent 并写最小配置pip install -U qwen-agent[gui,rag,code_interpreter,mcp]如果需要跟最新开发版走也可以拉源码安装git clone https://gitcode.com/GitHub_Trending/qw/Qwen-Agent cd Qwen-Agent pip install -e ./[gui,rag,code_interpreter,mcp]然后写一份最小的llm_cfgllm_cfg { model: lmstudio-community/Qwen2-7B-Instruct-GGUF, # 与 LM Studio 中加载的模型名一致 model_server: http://localhost:1234/v1, api_key: lm-studio, # 本地服务一般不校验占位即可 } 这里的关键是model_server以http开头查看 qwen_agent/llm/ 的加载逻辑可以发现配置了 http 地址后框架会自动选用oai适配器对应 oai.py 中的TextChatAtOAI也就是说 LM Studio 走的是标准 OpenAI 兼容链路不需要写任何自定义适配器。完整参数说明可参考 configuration.md。接入把本地模型挂到 Agent 上from qwen_agent.agents import Assistant bot Assistant( llmllm_cfg, name本地助手, system_message你是一个本地运行的助手回答尽量简洁。 ) for rsp in bot.run([{role: user, content: 用一句话介绍你自己}]): print(rsp)能打印出回复说明 Qwen-Agent 到 LM Studio 的链路已打通。⚙️ 为什么用Assistant做冒烟测试它是功能面最广的入口后面接代码解释器、RAG 时配置结构不变只改function_list。想验证代码执行能力参考 examples/react_data_analysis.py 的写法把llm_cfg换成上面的配置function_list传入[code_interpreter]即可让 Agent 在本机沙箱里跑 Python 画图、处理表格from qwen_agent.agents import ReActChat bot ReActChat( llmllm_cfg, namecode interpreter, function_list[code_interpreter] )文档问答场景同理参考 examples/assistant_rag.py在消息里带上{file: xxx.pdf}框架会先解析文档再让模型作答PDF 内容全程在本机流转。能力边界与取舍诚实列出本地化方案的边界避免踩坑多模态oai适配器只处理文本。若要在 LM Studio 里加载 VLM如 Qwen 的 VL 系列model_type需显式写qwenvl_oai否则框架按纯文本链路处理图片输入。工具调用函数调用、并行工具调用依赖模型本身的能力。7B 以下的小模型经常拼错 JSON 参数Qwen 系列 instruct 版本稳定性最好。硬件参考区间8GB 显存起步跑 7B/8B4-bit 量化16GB 以上再考虑 14B/32B 级别量化级别越高如从 4-bit 升到 8-bit质量越好但占显存越多。上下文长度generate_cfg里的max_input_tokens必须低于本地模型实际支持的上限否则长对话会报截断错误默认值 90000 对 7B 模型来说偏大建议按模型实际能力调低。排障地图现象可能原因处理动作Connection refusedLM Studio 服务未启动或端口被占确认 Server 页签已启动curl http://localhost:1234/v1/models复测换端口后同步改model_server404 / model not found配置的model与 LM Studio 中加载的模型名不一致先curl /v1/models查看真实模型 ID照抄进配置回复里 JSON 参数残缺、工具没被调用模型太小或量化过重指令遵循能力不足换 Qwen 系列 instruct 版本或提高量化精度生成速度慢、首 token 久模型相对显存偏大频繁换页降一档模型规模或换 4-bit 量化长对话报错max_input_tokens超过本地模型上下文在generate_cfg中下调该值收尾到这里Qwen-Agent 已经能挂在本机模型上离线运行对话、代码解释器、文档问答都走本地链路配置上只是换了model_server一个字段。后续想调生成行为top_p、max_tokens、思考模式等都集中在generate_cfg里改即可。延伸阅读configuration.mdllm_cfg全部参数与本地模型示例examples/各类 Agent 的最小可运行范例qwen_agent/llm/各模型适配层源码遇到特殊服务对接可直接看这里【免费下载链接】Qwen-AgentAgent framework and applications built upon Qwen3.0, featuring Function Calling, MCP, Code Interpreter, RAG, Chrome extension, etc.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen-Agent创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价