资讯动态

告别Token焦虑!本地部署Hermes + Qwen3.6,打造你的私人AI助理

发布时间:2026/8/24 9:49:32 来源:尧图企业网站定制
大家好我是硅谷茶馆。最近和大闺女讨论游戏对战问题我俩准备进行人物设计和对战方案设计她问我既然云端AI那么方便为什么还要花时间在本地部署我告诉她你可以为了真正的自由和安心。如果现在让我推荐一套最适合普通用户跑本地模型 Agent 的方案我会毫不犹豫地推荐Hermes Qwen3.6 最新开源模型。这套组合最大的优势就是免费、好用、灵活而且非常适合日常使用。为什么值得本地化部署云端AI虽然强大但在处理长文档、代码项目或私人资料时Token费用容易累积而且把敏感内容上传到网络总让人有些顾虑。Qwen3.6开源后本地运行的性能有了明显提升配合Hermes Agent后它不再只是聊天工具更能执行具体任务、连接Telegram甚至帮你处理日常工作流。环境准备用WSL2搭建稳定环境在Windows系统下我推荐使用WSL2Windows Subsystem for Linux性能损耗小稳定性较好。1、开启WSL2以管理员身份打开PowerShell运行wsl --install -d Ubuntu-24.04安装完成后重启电脑并用nvidia-smi检查显卡驱动是否正常识别需安装支持WSL2的NVIDIA驱动。2、安装CUDA在WSL Ubuntu环境中运行sudo apt update sudo apt install -y cuda-toolkit-12-8安装后记得把CUDA路径添加到~/.bashrc环境变量避免后续编译找不到GPU。核心部署用llama.cpp运行Qwen3.6llama.cpp支持GGUF格式能有效降低显存占用适合不同配置的电脑。编译llama.cppsudoaptinstall-ycmake build-essentialgitgitclone https://github.com/ggerganov/llama.cppcdllama.cpp cmake-Bbuild-DGGML_CUDAON-DCMAKE_CUDA_ARCHITECTURES89cmake--buildbuild -j$(nproc)好如果出现这个错误的话这主要是因为 CUDA Toolkit 没装导致的。WSL2 里需要单独装运行wget https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2404/x86_64/cuda-keyring_1.1-1_all.deb sudo dpkg -i cuda-keyring_1.1-1_all.deb sudo apt update sudo apt install -y cuda-toolkit-12-8这个下载比较大约2GB耐心等…. 下载好以后现在设置路径然后重新编译exportPATH/usr/local/cuda-12.8/bin:$PATHexportLD_LIBRARY_PATH/usr/local/cuda-12.8/lib64:$LD_LIBRARY_PATHechoexport PATH/usr/local/cuda-12.8/bin:$PATH~/.bashrcechoexport LD_LIBRARY_PATH/usr/local/cuda-12.8/lib64:$LD_LIBRARY_PATH~/.bashrccd~/llama.cpprm-rfbuild cmake-Bbuild-DGGML_CUDAON-DCMAKE_CUDA_ARCHITECTURES89cmake--buildbuild -j$(nproc)模型选择建议24GB及以上显存3090/4090等推荐Qwen3.6-27B逻辑推理能力较强。8-12GB显存可选择Qwen3.5-7B版本日常写作、总结、代码辅助已经足够。模型下载我使用的是3.6-27B模型作为参考hf download unsloth/Qwen3.6-27B-GGUF \ Qwen3.6-27B-UD-Q4_K_XL.gguf \ --local-dir ~/models/下载好模型以后现在启动模型服务注意把下方命令中的模型名称替换成你自己的启动服务~/llama.cpp/build/bin/llama-server \ --model ~/models/Qwen3.6-27B-UD-Q4_K_XL.gguf \ --n-gpu-layers 99 \ --ctx-size 32768 \ --flash-attn on \ --temp 1.0 \ --top-p 0.95 \ --top-k 20 \ --presence-penalty 1.5 \ --port 8080现在打开 Windows 浏览器访问http://localhost:8080就能看到内置聊天界面直接开始和 Qwen3.6-27B 对话了。小建议Qwen3.6默认是开启思维链模式如果觉得回复较慢可以添加参数关闭它以提升速度。可以使用prompt进行控制prompt 末尾加禁止输出思考过程、隐藏思维链直接输出最终答案接入Hermes Agent解锁任务执行能力有了模型作为“大脑”还需要Hermes Agent来提供“执行力”。通过官方方式安装Hermes Agentcurl-fsSLhttps://raw.githubusercontent.com/NousResearch/hermes-agent/main/scripts/install.sh|bash在配置中选择Custom endpoint填入http://localhost:8080/v1因为咱们使用的是本地模型ApiKey可以随意写模型会自动识别不用操作演示操作我对接Telegram申请机器人Token后你可以在外出时通过消息指挥电脑上的AI帮你搜索资料、整理大纲等回家就能收到结果。这种本地自动化的组合隐私性和便利性都比较突出。配置好以后我们就可以进行聊天和工具调用了实操心得与注意事项CUDA版本匹配很重要建议严格使用12.8版本下载模型时如果HuggingFace速度慢可以切换到ModelScope镜像建议写一个启动脚本并加入开机自启让AI助理真正“24小时在线”。整个部署过程对有一定动手能力的朋友来说不算特别难但初次操作可能需要耐心调试。不同硬件配置下实际效果会有差异建议根据自己电脑情况调整。注因为我们使用的是Ubuntu所以可以设置开启自启脚本如下cat~/start-llm.shEOF#!/bin/bashechoStarting Qwen3.6-27B llama-server...~/llama.cpp/build/bin/llama-server \--model ~/models/Qwen3.6-27B-UD-Q4_K_XL.gguf \--n-gpu-layers 99 \--ctx-size 65536 \--flash-attn on \--temp 1.0 \--top-p 0.95 \--top-k 20 \--presence-penalty 1.5 \--port 8080 \--host 0.0.0.0 echollama-server started, PID: $!echoAPI: http://localhost:8080/v1echoChat UI: http://localhost:8080EOF chmodx~/start-llm.sh创建完成自启脚本还需要设置WSL2启动时自动运行的命令设置完每次打开WSL2终端都会自动跑模型了echo# Auto-start llama-server~/.bashrcechoif ! pgrep -f llama-server /dev/null 21; then~/.bashrcecho ~/start-llm.sh~/.bashrcechofi~/.bashrc我让它帮我写了一个网站统计功能可以看看消耗的tokens本地的不用担心浪费咱们普通客户使用本地模型就够用了如果是大项目还是要对接付费模型的。总结这套Hermes Qwen3.6的本地方案提供了一种私密、免费且可长期使用的AI工作方式。适合有一定显卡配置的朋友尝试让闲置的GPU发挥更多价值。如果你也对本地AI部署感兴趣欢迎在评论区分享你的配置和使用心得我们一起交流进步。喜欢这篇文章的朋友欢迎点赞收藏并关注「硅谷茶馆」我会继续分享实用、干货的AI工具和部署经验。祝大家新的一周高效顺遂本文基于个人实操经验整理涉及的技术操作请以官方文档为准不同环境可能存在差异请注意备份数据并谨慎操作。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价