资讯动态

3步跑通UI-TARS:开源GUI自动化智能体从部署到出动作的完整指南

发布时间:2026/8/23 17:36:58 来源:尧图企业网站定制
3步跑通UI-TARS开源GUI自动化智能体从部署到出动作的完整指南【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARSUI-TARS 是一个基于视觉语言模型的开源多模态 GUI 智能体能够看懂屏幕截图、理解任务指令再输出可执行的鼠标键盘动作在虚拟桌面和移动环境中完成浏览器导航、办公软件操作、游戏通关等任务。本文按先懂它、再跑起来、最后调得准的顺序带你完成从部署到坐标解析的完整链路。 先搞清楚UI-TARS 是什么UI-TARS-1.5 继承自同名研究论文的基础架构在此基础上引入强化学习训练出的推理能力模型在动手之前会先输出一段思考Thought再给出动作Action。这种先想后做的模式让它在复杂、多步任务中的表现明显优于直接出动作的模型。它的几个关键特点视觉语言双通道输入是屏幕截图加自然语言指令输出是结构化的 GUI 操作跨平台同一套智能体思路可覆盖桌面Windows/Linux/macOS与移动设备Android 模拟器思考-行动分离Thought 与 Action 分开输出便于审计和后续处理完全开源模型、部署文档、解析工具包ui-tars 包都可自行下载扩展⚡ 三步跑通 UI-TARS克隆、部署、装解析包第一步拿到代码git clone https://gitcode.com/GitHub_Trending/ui/UI-TARS cd UI-TARS第二步部署模型并调用接口推荐走 Hugging Face Inference Endpoints 的云端部署路线按以下顺序配置即可在端点目录页选择UI-TARS 1.5 7B并导入模型硬件配置选GPU L40S 1GPU 48G官方同时推荐 Nvidia L4 或 A100容器参数按此设置Max Input Length (per Query): 65536Max Batch Prefill Tokens: 65536Max Number of Tokens (per Query): 65537环境变量加两项避免部署或请求失败CUDA_GRAPHS0PAYLOAD_LIMIT8000000防止大图片导致请求失败部署完成后进入容器页把镜像更新为ghcr.io/huggingface/text-generation-inference:3.2.1再点 Update 生效端点就绪后用 OpenAI 兼容 SDK 发请求仓库自带的data/test_messages.json就是可直接复用的请求样例from openai import OpenAI client OpenAI( base_urlhttps://xxx, # 你的 Inference Endpoint 地址 api_keyhf_xxx ) completion client.chat.completions.create( modeltgi, messagesmessages, # 参考 data/test_messages.json temperature0.0, max_tokens400, ) print(completion.choices[0].message.content)正常返回形如Thought: 我看到Preferences窗口已经打开了……让我点击它看看里面有什么选项。 Action: click(start_box(177,549))第三步安装解析工具包模型输出的是文本真正动手要靠 ui-tars 包做后处理pip install ui-tars # 或使用 uv 包管理器 uv pip install ui-tars 模型输出变真实动作坐标解析到 PyAutoGUI 代码这一步决定了点得准不准。Qwen2.5-VL 基座使用绝对坐标定位对象模型输出的坐标是相对于它内部处理后的图像尺寸不能直接当屏幕坐标用必须先换算回原始分辨率再生成执行代码。下面这段示例演示了完整链路解析响应为结构化输出再转成 PyAutoGUI 可执行代码from ui_tars.action_parser import parse_action_to_structure_output, parsing_response_to_pyautogui_code response Thought: Click the button\nAction: click(start_box(100,200)) original_image_width, original_image_height 1920, 1080 # 解析响应为结构化输出 parsed_dict parse_action_to_structure_output( response, factor1000, origin_resized_heightoriginal_image_height, origin_resized_widthoriginal_image_width, model_typeqwen25vl ) # 生成 PyAutoGUI 代码 parsed_pyautogui_code parsing_response_to_pyautogui_code( responsesparsed_dict, image_heightoriginal_image_height, image_widthoriginal_image_width ) print(parsed_pyautogui_code)坐标换算的核心逻辑是模型先把原图按比例缩放smart_resize宽高对齐到因子 28 的倍数输出坐标属于缩放后的坐标系要得到真实点击位置就用原图坐标 模型输出坐标 / 缩放后尺寸 × 原图尺寸反向映射。下图是仓库中自带的可视化示例左图为原始屏幕右图红点标出了模型输出坐标映射回原图后的实际落点。如果你想自己跑一遍可视化脚本仓库根目录的README_coordinates.md里有完整的可执行代码更完整的动作空间解析可参考 OSWorld 中的uitars_agent.py实现。 提示词模板怎么选桌面、手机还是纯定位模板集中在codes/ui_tars/prompt.py中共三套对应三种使用场景模板适用场景特点COMPUTER_USEWindows、Linux、macOS 桌面任务覆盖鼠标单击/双击/右键、拖拽、键盘快捷键、文本输入、滚动等桌面操作适合浏览器导航、办公软件交互、文件管理MOBILE_USE移动设备或 Android 模拟器增加移动端专属动作long_press、open_app、press_home、press_back适合启动应用、滚动视图、填写输入框GROUNDING轻量任务、模型训练与评估只输出Action不带Thought推理过程用于单独考察定位能力选择规则很简单目标是桌面选COMPUTER_USE目标是手机应用选MOBILE_USE只想知道它准不准而不关心推理过程选GROUNDING。 成绩单解读UI-TARS-1.5 到底强在哪先看线上基准的整体对比最优值加粗场景基准UI-TARS-1.5OpenAI CUAClaude 3.7之前的 SOTA计算机使用OSworld100步42.536.42838.1200步计算机使用Windows Agent Arena50步42.1--29.8浏览器使用WebVoyager84.88784.187浏览器使用Online-Mind2web75.87162.971手机使用Android World64.2--59.5游戏场景的表现更能体现先想后做的优势UI-TARS-1.5 在多款 Poki 游戏上拿满 100 分模型2048energyfree-the-keyGem-11hex-frvrOpenAI CUA31.0432.800.0046.2792.25Claude 3.743.0541.600.000.0030.76UI-TARS-1.5100.00100.00100.00100.00100.00需要留意的是已开源的 UI-TARS-1.5-7B 侧重通用计算机使用游戏场景的优势主要由更大的 1.5 模型贡献选型时别把 7B 直接套到游戏任务上。⚠️ 用之前先知道四个绕不开的限制滥用风险模型能成功通过 CAPTCHA 等验证挑战可能被用于未授权访问或自动化受保护内容部署到生产环境前要做安全评估计算资源大规模任务或长时间游戏场景仍需可观的算力7B 云端部署也至少需要 48G 显存档位的 GPU幻觉问题偶尔会生成不准确的描述、误识别 GUI 元素或在推理错误时采取次优动作模糊或陌生界面下更明显模型规模公开的 UI-TARS-1.5-7B 针对通用计算机使用优化未针对游戏场景专门调优 延伸阅读与引用仓库内值得按顺序读的四份材料README_deploy.mdHugging Face 端点部署的完整图文步骤与 API 调用示例README_coordinates.md坐标处理的完整可视化脚本codes/ui_tars/prompt.py三套提示词模板源码codes/ui_tars/action_parser.py动作解析与 PyAutoGUI 代码生成的核心实现仓库根目录的UI_TARS_paper.pdf技术报告全文研究引用时使用article{qin2025ui, title{UI-TARS: Pioneering Automated GUI Interaction with Native Agents}, author{Qin, Yujia and Ye, Yining and Fang, Junjie and Wang, Haoming and Liang, Shihao and Tian, Shizuo and Zhang, Junda and Li, Jiahao and Li, Yunxin and Huang, Shijue and others}, journal{arXiv preprint arXiv:2501.12326}, year{2025} }先按三步跑通部分完成第一次推理再把坐标解析接到你的真实桌面环境上跑一个简单任务是体会 UI-TARS 能力最快的方式。【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价