资讯动态

Qwen2.5-VL 用自然语言驱动桌面和手机操作

发布时间:2026/9/8 17:58:37 来源:尧图企业网站定制
Qwen2.5-VL 用自然语言驱动桌面和手机操作【免费下载链接】Qwen3-VLQwen3-VL is the multimodal large language model series developed by Qwen team, Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen3-VL你输入打开右边第三条 issueQwen2.5-VL 智能体看一眼你的屏幕自己找到那条列表项返回一个点击坐标。这种看屏幕、动手作的能力内置在这个多模态模型里移动端还支持点击、滑动等触控操作。下面是跑通它的完整路径。它是怎么做到的原理速览一句话版本流程是截图进去动作出来。你把当前屏幕图片和一句指令发给模型。模型在图里定位按钮、输入框、列表项判断该在哪个坐标做什么输出一条 JSON 函数调用比如 left_click 加一组坐标。你按约定执行再截一张新图喂回去形成看 → 想 → 做的循环。两个工具类定义在 cookbooks/utils/agent_function_call.pyComputerUse 管桌面MobileUse 管手机。返回的坐标是模型和真机之间唯一的接口它和你实际屏幕怎么对齐是后面最容易踩的坑放到坑那节细说。跑起来从零到第一次交互⚡ 依赖就几个包环境里执行pip install qwen-vl-utils qwen-agent openai transformers即可。再把DASHSCOPE_API_KEY环境变量设为你的百炼 API key。演示 notebook 走 API 调用不用本地部署模型。不想写代码的话直接跑现成演示cookbooks/computer_use.ipynb 演示桌面版截图 → 模型给动作 → 画点验证的完整流程。移动版在 cookbooks/mobile_agent.ipynb用中英文两套 App 界面演示了完整的搜索流程。最小可运行片段的核心就四步截图编码成 base64、连同指令发给模型、解析返回的函数调用、执行动作screenshot cookbooks/assets/computer_use/computer_use2.jpeg user_query open the third issue # 截图 base64 编码 指令发给模型 resp client.chat.completions.create(modelMODEL_ID, messagesmessages) action json.loads(resp.choices[0].message.content) print(action) # {action: left_click, coordinate: [x, y]}跑完会得到带点击坐标的 JSON 动作notebook 再用draw_point在图上画红点方便确认是否点中了目标。把执行动作、重新截图、再发模型接成小循环模型会自己判断何时该输出 terminate 结束任务。桌面 vs 移动端两种控制模式一次讲清两种模式共用同一套逻辑——截图进、JSON 动作出差别在支持的手势和动作的执行通道。操作类型坐标体系典型场景对应工具类鼠标点击/拖拽、键盘输入、滚轮桌面分辨率下的实际像素桌面批处理、表单录入ComputerUse点击、长按、滑动、系统键、开 App手机屏幕内像素坐标走 adb 注入应用自动化测试、信息查询MobileUse桌面版的手势清单更细double_click、triple_click、scroll 都有还支持用 answer 直接回答你的提问{action: left_click, coordinate: [973, 132]} {action: type, text: https://example.com}移动版多的是触控专属手势还能调系统键、按名字打开 App{action: swipe, coordinate: [540, 1800], coordinate2: [540, 600]} {action: system_button, button: Back}两个工具类的描述文本会直接写进模型提示词所以模型知道自己能做什么、屏幕多大这就是坐标格式由它们说了算的原因。让它真正好用三个容易踩的坑仓库里的演示能跑但接上自己的执行循环时下面三处基本都会遇到。坑 1点偏了现象点击位置落在元素旁边。原因坐标是 0–999 归一化空间不是你的屏幕分辨率。解法先按 999 等比换算成实际像素再执行。坑 2动作比页面快现象点了下一页页面还停在旧屏。原因动作后页面还在加载立刻截图截到的是旧画面。解法让模型先输出 wait 动作重截屏再决定下一步。坑 3截图原图直传现象高分辨率截图响应慢甚至被截断。原因全像素图片占用的图像 token 太多。解法用 smart_resize 先缩放到目标尺寸区间再发。接下来可以试试智能体这条线跑通之后可以顺着这两个邻近能力继续看。cookbooks/2d_grounding.ipynb一句话给出图中物体的定位框是检验坐标落点最直接的例子。cookbooks/spatial_understanding.ipynb展示模型在复杂场景里判断人物和车辆位置的方式是点击定位能力的基础。想深挖模型本身和其他能力边界直接看 README.md。【免费下载链接】Qwen3-VLQwen3-VL is the multimodal large language model series developed by Qwen team, Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen3-VL创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价