资讯动态

Qwen3开源发布:Think Deeper, Act Faster!社区推理、部署、微调、MCP调用实战教程来啦!

发布时间:2026/8/27 14:37:21 来源:尧图企业网站定制
前言今天通义千问Qwen团队正式开源推出 Qwen3这是 Qwen 系列大型语言模型的最新成员。最新的Qwen3系列模型具备双模推理能力深入思考/快速响应、支持119种语言及方言并强化了Agent功能与代码执行能力全面满足复杂问题处理与全球化应用需求。其中旗舰模型 Qwen3-235B-A22B 在代码、数学、通用能力等基准测试中与 DeepSeek-R1、o1、o3-mini、Grok-3 和 Gemini-2.5-Pro 等顶级模型相比表现出极具竞争力的结果。此外小型 MoE 模型 Qwen3-30B-A3B 的激活参数数量是 QwQ-32B 的 10%表现更胜一筹甚至像 Qwen3-4B 这样的小模型也能匹敌 Qwen2.5-72B-Instruct 的性能。本次Qwen3开源了两个 MoE 模型的权重Qwen3-235B-A22B一个拥有 2350 多亿总参数和 220 多亿激活参数的大模型以及Qwen3-30B-A3B一个拥有约 300 亿总参数和 30 亿激活参数的小型 MoE 模型。此外六个 Dense 模型也已开源包括 Qwen3-32B、Qwen3-14B、Qwen3-8B、Qwen3-4B、Qwen3-1.7B 和 Qwen3-0.6B均在 Apache 2.0 许可下开源。Githubhttps://github.com/QwenLM/Qwen3Bloghttps://qwenlm.github.io/zh/blog/qwen3/模型合集https://www.modelscope.cn/collections/Qwen3-9743180bdc6b48创空间体验https://www.modelscope.cn/studios/Qwen/qwen3-chat-demo模型亮点小编敲黑板Qwen3 模型支持两种思考模式思考模式在这种模式下模型会逐步推理经过深思熟虑后给出最终答案适合需要深入思考的复杂问题。非思考模式在此模式中模型提供快速、近乎即时响应适用于对速度要求高于深度的简单问题。多语言Qwen3 模型支持 119 种语言和方言其中包括印欧语系、汉藏语系、亚非语系、南岛语系、德拉威语、突厥语系 、壮侗语系、乌拉尔语系、南亚语系等等。这一广泛的多语言能力为国际应用开辟了新的可能性让全球用户都能受益于这些模型的强大功能。增强的 Agent 能力优化了 Qwen3 模型的 Agent 和 代码能力同时也加强了对 MCP 的支持后文附使用Qwen3系列模型与MCP结合的实战教程1、推理部署Transformers在 transformers 中使用 Qwen3-30B-A3B frommodelscopeimportAutoModelForCausalLM,AutoTokenizermodel_nameQwen/Qwen3-30B-A3B# load the tokenizer and the modeltokenizer AutoTokenizer.from_pretrained(model_name)model AutoModelForCausalLM.from_pretrained( model_name, torch_dtypeauto, device_mapauto)# prepare the model inputprompt Give me a short introduction to large language model.messages [ {role: user, content: prompt}]text tokenizer.apply_chat_template( messages, tokenizeFalse, add_generation_promptTrue, enable_thinkingTrue # Switch between thinking and non-thinking modes. Default is True.)model_inputs tokenizer([text], return_tensorspt).to(model.device)# conduct text completiongenerated_ids model.generate( **model_inputs, max_new_tokens32768)output_ids generated_ids[0][len(model_inputs.input_ids[0]):].tolist() # parsing thinking contenttry: # rindex finding 151668 (/think) index len(output_ids) - output_ids[::-1].index(151668)except ValueError: index 0thinking_content tokenizer.decode(output_ids[:index], skip_special_tokensTrue).strip(\n)content tokenizer.decode(output_ids[index:], skip_special_tokensTrue).strip(\n)print(thinking content:, thinking_content)print(content:, content)禁用思考模式只需对参数 enable_thinking 进行如下修改texttokenizer.apply_chat_template(messages,tokenizeFalse,add_generation_promptTrue,enable_thinkingFalse# True is the default value for enable_thinking.)多工具部署开发者朋友们可以使用 sglang0.4.6.post1 或 vllm0.8.4 来创建一个与 OpenAI API 兼容的 API endpointSGLang:SGLANG_USE_MODELSCOPE1python-m sglang.launch_server--model-path Qwen/Qwen3-32B--reasoning-parser qwen3vLLM:VLLM_USE_MODELSCOPE1vllm serve Qwen/Qwen3-32B--enable-reasoning--reasoning-parser deepseek_r1要禁用思考模式可以移除参数 --reasoning-parser以及 --enable-reasoning如果用于本地开发可以通过运行简单的命令 ollama run qwen3:30b-a3b 来使用 ollama 与模型进行交互。您也可以使用 LMStudio 或者 llama.cpp 以及 ktransformers 等代码库进行本地开发Ollama:ollama run modelscope.cn/unsloth/Qwen3-8B-GGUFOllama默认是thinking模式如果需要切换到非thinking模式在prompt后拼接上/no_think 即可。此外Ollama请确保升级到新版本v0.6.6或以上。使用魔搭API-Inference直接调用魔搭平台的API-Inference也第一时间为Qwen3系列模型提供了支持。魔搭的用户可通过API调用的方式直接使用。具体API-Inference的使用方式可参见各个模型页面例如 https://www.modelscope.cn/models/Qwen/Qwen3-32B说明或者参见API-Inference文档https://www.modelscope.cn/docs/model-service/API-Inference/intro。值得特别说明的是Qwen3系列模型可自由切换思考与普通模式在API接口上通过extra_body的参数来控制。默认enable_thinking配置打开可按需关闭。在开启思考模式的时候还可以通过thinking_budget参数来限制思考的长度一般推荐thinking_budget不要配置过小以4096以上为宜。调用示例fromopenaiimportOpenAIclientOpenAI(base_urlhttps://api-inference.modelscope.cn/v1/,api_keyMODELSCOPE_SDK_TOKEN,# ModelScope Token)# set extra_body for thinking controlextra_body { # enable thinking, set to False to disable enable_thinking: True, # use thinking_budget to contorl num of tokens used for thinking # thinking_budget: 4096}response client.chat.completions.create( modelQwen/Qwen3-32B, # ModelScope Model-Id messages[ { role: user, content: 9.9和9.11谁大 } ], streamTrue, extra_bodyextra_body)done_thinking Falsefor chunk in response: thinking_chunk chunk.choices[0].delta.reasoning_content answer_chunk chunk.choices[0].delta.content if thinking_chunk ! : print(thinking_chunk, end, flushTrue) elif answer_chunk ! : if not done_thinking: print(\n\n Final Answer \n) done_thinking True print(answer_chunk, end, flushTrue)输出结果嗯我现在要比较9.9和9.11哪个更大。首先我应该先理解这两个数字的结构。9.9是一个小数而9.11看起来也是一个小数不过可能有些人可能会误解为日期或者其他形式不过题目里明确说是比较数值大小所以应该按照数学上的小数来处理。首先我需要确认这两个数的小数点位置。9.9是九又十分之九也就是90.99.9。而9.11则是九又百分之一十一也就是90.119.11。这时候我需要比较这两个小数的大小。通常比较小数的方法是从左到右逐位比较直到找到不同的数字为止。首先比较整数部分两个数都是9所以这部分相等。接下来比较小数部分。第一个数是0.9第二个数是0.11。这时候需要注意小数位数的问题。0.9可以看作0.90因为小数末尾的零不改变数值的大小。这样两个小数就变成了0.90和0.11。现在比较0.90和0.11的话第一位小数是9和1显然9比1大所以0.90大于0.11因此整个数9.9即9.90比9.11大。Final Answer9.9和9.11的比较可以通过以下步骤进行1.**整数部分**两者均为9相等。2.**小数部分**-9.9可写为**9.90**补零不改变数值。-比较十分位9.90的十分位是**9**9.11的十分位是**1**。-由于 $91$因此**9.909.11**。**结论** $$\boxed{9.99.11}$$感谢阿里云百炼平台提供背后算力支持使用ModelScope MCP实验场集成Qwen3系列模型提供了对于智能体和工具调用更好的能力支持能够在在思考和非思考模式下精确集成外部工具。我们也第一时间将多个Qwen3模型集成到了ModelScope MCP实验场提供Qwen3在MCP场景上的工具调用能力的体验。愉快的让Qwen3帮我们订个出行前的准备2、模型微调我们介绍使用ms-swift对Qwen/Qwen3-8B进行SFT/GRPO以及使用Megatron-SWIFT对Qwen/Qwen3-30B-A3B进行SFT。ms-swift是魔搭社区官方提供的大模型与多模态大模型训练部署框架。ms-swift开源地址https://github.com/modelscope/ms-swift我们将展示可运行的微调demo并给出自定义数据集的格式。在开始微调之前请确保您的环境已准备妥当。git clone https://github.com/modelscope/ms-swift.gitcd ms-swiftpip install-e.pip install liger-kernel transformers-USFT对Qwen3-8B进行训练的脚本如下在ModelScope提供的免费GPU Notebook中即可运行# 训练显存22GB# 你可以指定--dataset AI-ModelScope/alpaca-gpt4-data-zh来跑通实验CUDA_VISIBLE_DEVICES0 \swift sft \ --model Qwen/Qwen3-8B \ --train_type lora \ --dataset dataset-path \ --torch_dtype bfloat16 \ --num_train_epochs 1 \ --per_device_train_batch_size 1 \ --per_device_eval_batch_size 1 \ --learning_rate 1e-4 \ --lora_rank 8 \ --lora_alpha 32 \ --target_modules all-linear \ --gradient_accumulation_steps 4 \ --eval_steps 50 \ --save_steps 50 \ --save_total_limit 2 \ --logging_steps 5 \ --max_length 2048 \ --output_dir output \ --warmup_ratio 0.05 \ --dataloader_num_workers 4 \ --packing true \ --user_liger_kernel true自定义数据集格式如下system字段可选指定--dataset dataset_path即可{messages:[{role:user,content:浙江的省会在哪},{role:assistant,content:think\nxxx\n/think\n\n浙江的省会在杭州。}]}GRPO以Qwen3-8B为例下面使用ms-swift框架对进行GRPO训练使用AI-MO/NuminaMath-TIR作为数据集并使用accuracy函数计算模型回答的准确率奖励, 计算奖励需要安装以下环境pip install math_verify0.5.2自定义数据集格式与SFT类似其中assistant部分不必需。如果使用accuracy奖励则需要solution列来计算准确率。# llm{messages: [{role: system, content: You are a useful and harmless assistant}, {role: user, content: Tell me tomorrows weather}]}{messages: [{role: system, content: You are a useful and harmless math calculator}, {role: user, content: What is 1 1?}, {role: assistant, content: It equals 2}, {role: user, content: What about adding 1?}]}{messages: [{role: user, content: What is your name?}]}# mllm{messages: [{role: user, content: imageWhat is the difference between the two images?}], images: [/xxx/x.jpg]}{messages: [{role: user, content: imageimageWhat is the difference between the two images?}], images: [/xxx/y.jpg, /xxx/z.png]}也可以使用自定义的奖励函数/奖励模型进行训练数据集中的列会传到奖励函数的**kwargs中自定义奖励函数的例子参考swift/examples/train/grpo/plugin/plugin.py--external_plugins examples/train/grpo/plugin/plugin.py \--reward_funcs external_math_acc external_math_format \--reward_model AI-ModelScope/Skywork-Reward-Llama-3.1-8B-v0.2在训练过程中我们使用vLLM来加速采样过程。设置num_infer_workers8我们为每个device都部署一个vLLM engine来加速采样过程。训练脚本# 70G*8CUDA_VISIBLE_DEVICES0,1,2,3,4,5,6,7 \NPROC_PER_NODE8 \swift rlhf \ --rlhf_type grpo \ --model Qwen/Qwen3-8B \ --train_type full \ --dataset AI-MO/NuminaMath-TIR \ --torch_dtype bfloat16 \ --num_train_epochs 1 \ --per_device_train_batch_size 2 \ --per_device_eval_batch_size 2 \ --learning_rate 1e-6 \ --save_total_limit 2 \ --logging_steps 5 \ --output_dir output \ --gradient_accumulation_steps 1 \ --warmup_ratio 0.05 \ --dataloader_num_workers 4 \ --max_completion_length 4096 \ --vllm_max_model_len 8192 \ --reward_funcs accuracy \ --num_generations 16 \ --use_vllm true \ --vllm_gpu_memory_utilization 0.4 \ --sleep_level 1 \ --offload_model true \ --offload_optimizer true \ --gc_collect_after_offload true \ --deepspeed zero3 \ --num_infer_workers 8 \ --tensor_parallel_size 1 \ --temperature 1.0 \ --top_p 0.85 \ --report_to wandb \ --log_completions true \ --overlong_filter trueMoE训练Megatron-SWIFTms-swift引入了Megatron的并行技术来加速大模型的训练包括数据并行、张量并行、流水线并行、序列并行上下文并行专家并行。支持Qwen3、Qwen3-MoE、Qwen2.5、Llama3、Deepseek-R1蒸馏系等模型的预训练和微调。对于环境准备镜像和HF与MCore模型权重的转换可以参考Megatron-SWIFT训练文档这里不详细展开https://swift.readthedocs.io/zh-cn/latest/Instruction/Megatron-SWIFT%E8%AE%AD%E7%BB%83.html我们使用DLC启动训练命令训练环境是2机8 * 80GiB A800# https://help.aliyun.com/zh/pai/user-guide/general-environment-variables# 请确保两个节点的保存权重路径相同NNODES$WORLD_SIZE \NODE_RANK$RANK \megatron sft \ --load Qwen3-30B-A3B-Base-mcore \ --dataset liucong/Chinese-DeepSeek-R1-Distill-data-110k-SFT \ --tensor_model_parallel_size 2 \ --expert_model_parallel_size 8 \ --moe_grouped_gemm true \ --moe_shared_expert_overlap true \ --moe_aux_loss_coeff 0.01 \ --micro_batch_size 1 \ --global_batch_size 16 \ --packing true \ --recompute_granularity full \ --recompute_method uniform \ --recompute_num_layers 1 \ --train_iters 2000 \ --eval_iters 50 \ --finetune true \ --cross_entropy_loss_fusion true \ --lr 1e-5 \ --lr_warmup_iters 100 \ --min_lr 1e-6 \ --save megatron_output/Qwen3-30B-A3B-Base \ --eval_interval 200 \ --save_interval 200 \ --max_length 8192 \ --num_workers 8 \ --dataset_num_proc 8 \ --no_save_optim true \ --no_save_rng true \ --sequence_parallel true \ --use_flash_attn true训练loss图部分自定义数据集格式与swift sft相同可以在本文上方找到指定--dataset dataset_path即可。使用megatron sft和swift sft进行Qwen3-30B-A3B模型全参数训练速度/显存占用对比如下Megatron-LMDeepSpeed-ZeRO2DeepSpeed-ZeRO3训练速度9.6s/it-91.2s/it显存占用16*60GiBOOM16*80GiB最后的最后感谢你们的阅读和喜欢作为一位在一线互联网行业奋斗多年的老兵我深知在这个瞬息万变的技术领域中持续学习和进步的重要性。为了帮助更多热爱技术、渴望成长的朋友我特别整理了一份涵盖大模型领域的宝贵资料集。这些资料不仅是我多年积累的心血结晶也是我在行业一线实战经验的总结。这些学习资料不仅深入浅出而且非常实用让大家系统而高效地掌握AI大模型的各个知识点。如果你愿意花时间沉下心来学习相信它们一定能为你提供实质性的帮助。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】大模型知识脑图为了成为更好的 AI大模型 开发者这里为大家提供了总的路线图。它的用处就在于你可以按照上面的知识点去找对应的学习资源保证自己学得较为全面。经典书籍阅读阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。实战案例光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。面试资料我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下640套AI大模型报告合集这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价