资讯动态

Xinference 中部署与使用 GLM-4.1V-Thinking 多模态推理模型完整指南

发布时间:2026/9/17 0:03:26 来源:尧图企业网站定制
Xinference 中部署与使用 GLM-4.1V-Thinking 多模态推理模型完整指南【免费下载链接】inferenceSwap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.项目地址: https://gitcode.com/GitHub_Trending/in/inference本篇技术指南以 Xinference 内置模型规格文档glm-4.1v-thinking.rst为核心系统讲解在 Xinference 中通过统一推理 API 部署 9B 级视觉语言推理模型 GLM-4.1V-9B-Thinking 的完整流程包括三种模型格式pytorch / AWQ / GPTQ的规格差异、xinference launch启动命令的逐参数说明、模型注册表llm_family.json中蕴含的模板与停止符等底层配置以及 Xinference 对模型think推理过程内容的解析机制。读完本文你将能独立完成该模型的本地或云端部署并正确调用其 chat、vision、reasoning、tools 四大能力。GLM-4.1V-Thinking 模型规格总览GLM-4.1V-Thinking 是一个面向视觉语言推理场景的开源多模态模型。根据 Xinference 内置模型规格文档的描述其设计目标是探索视觉语言模型推理能力的上限designed to explore the upper limits of reasoning in vision-language models。在 Xinference 的模型注册表中该模型的完整定义位于 xinference/model/llm/llm_family.json核心元数据如下属性值Context Length上下文长度65536即 64K tokensModel Name模型名glm-4.1v-thinkingLanguages支持语言en英语、zh中文Abilities能力chat、vision、reasoning、toolsModel Type模型类型glm4vArchitectures架构Glm4vForConditionalGeneration从能力组合可以看出这不是一个普通的纯文本对话模型vision表明它接受图像输入reasoning表明它具备思维链式推理能力输出中会包含思考过程tools表明它支持函数调用等工具使用场景这四种能力叠加使其适合做图文理解、视觉问答、多模态推理等任务。三种模型格式与对应启动命令与多数 9B 级模型一样GLM-4.1V-Thinking 提供了原始权重pytorch与两种主流量化格式AWQ、GPTQ共三种模型规格。每种规格对应不同的模型仓库 ID、量化方式与运行引擎。Spec 1pytorch 原始权重9BModel Format模型格式pytorchModel Size参数量9 BillionQuantizations量化方式none不量化使用 FP16/BF16 原始精度Engines推理引擎vLLM、TransformersModel IDzai-org/GLM-4.1V-9B-ThinkingHugging Face/ZhipuAI/GLM-4.1V-9B-ThinkingModelScope启动命令如下${engine}从 vLLM / Transformers 中选择${quantization}填写 nonexinference launch --model-engine ${engine} --model-name glm-4.1v-thinking --size-in-billions 9 --model-format pytorch --quantization ${quantization}即最完整的写法为xinference launch --model-engine vllm --model-name glm-4.1v-thinking --size-in-billions 9 --model-format pytorch --quantization noneSpec 2AWQ 量化9BModel Format模型格式awqModel Size参数量9 BillionQuantizations量化方式Int44-bit 权重量化Engines推理引擎vLLM、TransformersModel IDQuantTrio/GLM-4.1V-9B-Thinking-AWQHugging Face/tclf90/GLM-4.1V-9B-Thinking-AWQModelScope启动命令xinference launch --model-engine ${engine} --model-name glm-4.1v-thinking --size-in-billions 9 --model-format awq --quantization ${quantization}即xinference launch --model-engine vllm --model-name glm-4.1v-thinking --size-in-billions 9 --model-format awq --quantization Int4Spec 3GPTQ 量化9BModel Format模型格式gptqModel Size参数量9 BillionQuantizations量化方式Int4-Int8Mix混合精度量化Engines推理引擎vLLM、TransformersModel IDQuantTrio/GLM-4.1V-9B-Thinking-GPTQ-Int4-Int8MixHugging Face/tclf90/GLM-4.1V-9B-Thinking-GPTQ-Int4-Int8MixModelScope启动命令xinference launch --model-engine ${engine} --model-name glm-4.1v-thinking --size-in-billions 9 --model-format gptq --quantization ${quantization}即xinference launch --model-engine vllm --model-name glm-4.1v-thinking --size-in-billions 9 --model-format gptq --quantization Int4-Int8Mix选择建议显存充足、追求最佳效果时选择 pytorch 原始精度显存受限或需要更高吞吐时优先考虑 AWQ Int4GPTQ Int4-Int8Mix 则是另一种混合精度折中方案。三种格式在 vLLM 与 Transformers 两个引擎下均可运行。launch 命令参数逐项解析上述启动命令中的参数均定义于 xinference/deploy/cmdline.py下表逐一说明其含义参数简写必填说明--model-engine-en是LLM 类型必填指定推理引擎此处可选vllm或Transformers--model-name-n是要启动的模型名称此处为glm-4.1v-thinking--size-in-billions-s视模型而定以十亿为单位的模型参数量此处为9--model-format-f否模型格式如pytorch、awq、gptq、ggufv2等--quantization-q否量化方式如none、Int4、Int4-Int8Mix此外围绕启动命令还可以按需追加以下常用选项同样定义于 cmdline.py--model-uid/-u为模型指定自定义 UID默认为 None不指定时 Xinference 自动生成。--replica/-r模型副本数默认 1用于多副本负载均衡。--n-worker模型使用的 worker 数量默认 1。--n-gpu使用的 GPU 数量默认auto当n_worker 1时表示每个 worker 的 GPU 数。--worker-ip分布式场景下指定模型运行在哪个 worker按 IP。--gpu-idx指定 worker 上的哪些 GPU 可运行该模型用逗号分隔。--endpoint/-eXinference 服务端点地址。需要说明的是命令中的${engine}与${quantization}是占位符实际执行时必须替换为上文表格中列出的真实取值。该模型三种格式在 vLLM 引擎下运行时会自动将vllm相关依赖与system_numpy组装进对应的虚拟环境见 llm_family.jsonTransformers 引擎则要求transformers4.53.2。源码级配置llm_family.json 中的模型定义在 Xinference 中内置模型的可用性来自模型注册表。GLM-4.1V-Thinking 的完整定义可在 xinference/model/llm/llm_family.json 中查到除了上文已列的元数据还有几个对部署行为有直接影响的字段模型来源model_src每个 spec 的model_src字段同时登记了 Hugging Face 与 ModelScope 两个下载源pytorch spec 在 Hugging Face 上固定了精确的model_revisioncommitb627c82cd8fc9175ff2b82b33fb439eba260055f保证每次下载权重一致ModelScope 端则使用master分支。awq / gptq 两个量化 spec 在 ModelScope 端同样固定为master分支。Xinference 启动时会自动根据该配置从可用的模型源拉取权重无需手工下载。对话模板chat_template模型自带完整的 Jinja 对话模板关键点在于对多模态内容的编码用户消息中的image类型内容会被编码为|begin_of_image||image||end_of_image|占位符video类型内容对应|begin_of_video||video||end_of_video|文本内容正常拼接系统消息使用|system|前缀助手消息使用|assistant|前缀。这意味着你可以直接通过 OpenAI 兼容的 Chat Completions API在messages中携带{type: image, image_url: ...}形式的多模态内容模板会自动完成拼装这正是该模型vision能力的底层支撑。停止标记stop / stop_token_idsstop|endoftext|、|user|、|observation|stop_token_ids151329、151336、151338生成时遇到这些标记或 token id 会立即终止避免模型继续输出多余内容如幻觉出的下一个用户轮次。推理标记reasoning_start_tag / reasoning_end_tag模型注册表中声明了推理过程标记reasoning_start_tagthinkreasoning_end_tag/think这两个标记是 Xinference 流式解析思考内容的关键依据。Xinference 在启动模型时会将它们透传给推理引擎见 xinference/model/llm/core.py 与 xinference/model/llm/init.py供流式输出解析使用。推理内容reasoning_content的解析机制作为 reasoning 模型GLM-4.1V-Thinking 的回复分为思考过程与最终答案两部分思考过程包裹在think与/think之间。Xinference 通过 xinference/model/llm/reasoning_parser.py 中的ReasoningParser对这两部分进行区分与剥离在流式输出SSE chunks场景下解析器按 token 增量delta持续跟踪think//think标记的位置reasoning_parser.py当think出现在前一文本、/think出现在增量文本中时增量中被/think截断的部分归入reasoning_content其余部分归入content当两个标记同时出现在同一增量中时同样按标记切分分别填充reasoning_content与content未出现结束标记时当前增量整体作为reasoning_content返回content置为None。也就是说调用方可以在流式响应中直接读取delta.reasoning_content字段获取模型的实时思考过程而content字段始终只包含最终回答。该机制对 DeepSeek-R1 系列等其他带思考标记的模型同样适用解析器注释中即以此为例是 Xinference 统一处理推理模型输出的通用能力。启动后的调用方式模型启动成功后会以 Xinference 统一的 OpenAI 兼容 API 暴露服务。假设默认端点http://localhost:9997可通过以下方式验证与调用1. 查看已启动模型xinference list2. 发起多模态对话请求携带图片curl -X POST http://localhost:9997/v1/chat/completions \ -H Content-Type: application/json \ -d { model: glm-4.1v-thinking, messages: [ { role: user, content: [ {type: image_url, image_url: {url: https://example.com/your-image.jpg}}, {type: text, text: 请分析这张图片并给出推理结论} ] } ], stream: true }注意请求体中的model字段即模型名glm-4.1v-thinking如需自定义可在启动时用--model-uid指定。3. 解析流式响应中的推理内容开启stream: true后每个 chunk 的delta字段中可能同时出现reasoning_content思考过程与content正式回答两个子字段分别对应上文解析机制的输出。对于需要直接使用 Python 的开发者可借助 Xinference 官方客户端封装请求细节相关实现见 xinference/client/restful/restful_client.py。小结与注意事项部署选择按显存与精度需求在 pytorchnone、AWQInt4、GPTQInt4-Int8Mix三种格式中做选择引擎建议优先 vLLM吞吐更高Transformers 可作为兼容性兜底。命令占位符务必用真实值替换${engine}与${quantization}否则启动会失败。多模态输入借助内置 chat_template图片/视频内容会自动转换为模型要求的特殊 token 序列。推理内容思考过程通过reasoning_content字段与正式答案分离流式与非流式场景均可获取。模型源权重默认从 Hugging Face 或 ModelScope 自动下载模型注册表中固定了精确 revision可复现性有保证。如需进一步了解 Xinference 的安装与整体使用方式可参阅 getting_started/installation.rst 与 getting_started/using_xinference.rst若需查看该模型规格文档的原始来源见 doc/source/models/builtin/llm/glm-4.1v-thinking.rst。【免费下载链接】inferenceSwap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.项目地址: https://gitcode.com/GitHub_Trending/in/inference创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价