10 分钟从 clone 到 AI 浏览器自动化跑通Browser-Use 新手完整指南【免费下载链接】browser-use Make websites accessible for AI agents. Automate tasks online with ease.项目地址: https://gitcode.com/GitHub_Trending/br/browser-use你去倒杯水的工夫它已经自己打开了网页、登录了后台、把 200 个表单点完提交回来时屏幕上只剩一份整理好的 CSV。这就是 Browser-Use 干的事——一个开源的 AI 浏览器自动化框架你用一句人话描述任务它在真实的 Chromium 浏览器里替你点击、输入、滚动、下载。下面这条主线带你走完整流程装环境 → 跑通第一个任务 → 挑场景 → 换大脑 → 稳定到生产每一步都给你做什么、看到什么、卡住怎么办。一句话看懂 Browser-Use 能干什么、不能干什么一句话定位Browser-Use 让你把自然语言任务丢给 AI由它驱动真实浏览器把活干完底层开源免费MIT 协议你只为所用的大模型 API 付费。它擅长重复性网页操作——查数据、填表、批量录入、巡检、下载。 它不适合需要毫秒级精度的像素级 UI 测试、强对抗的高频爬虫、以及任何错了不能重来且没让你加确认步骤的操作。10 秒判断如果你的工作是在网页上反复点同样的东西继续往下看如果是要渲染测试或性能压测划走。三步装好环境最快跑通第一个自动化任务先说清楚你会看到的三个阶段每一步做完都有明确的看到什么。第 1 步clone 并安装2 分钟git clone https://gitcode.com/GitHub_Trending/br/browser-use cd browser-use pip install browser-use注意项目要求 Python 3.11 及以上版本低于这个版本先升级解释器。第 2 步给大脑配把钥匙1 分钟在.env文件里写一行 API 密钥比如BROWSER_USE_API_KEY你的密钥OpenAI、Google 的密钥也支持。密钥只放环境变量别写进代码。第 3 步跑第一个任务看它干活最小脚本就十几行import asyncio from browser_use import Agent, ChatBrowserUse async def main(): agent Agent( task查找 browser-use 项目在 GitHub 上的星标数, llmChatBrowserUse(modelopenai/gpt-5.5), ) history await agent.run() print(history) asyncio.run(main())运行后你会看到一个真实浏览器窗口自己打开 → 导航到项目页面 → 页面截图和 DOM 摘要被喂给模型 → 它读出色数字 → 调done动作把答案交回来。卡住了怎么办浏览器没弹出多半是系统缺 Chromium 依赖装一下对应的系统库即可模型一直卡在同一个动作上看终端日志里每步的思考内容通常是任务描述里有歧义比如点那个按钮——哪个报 401检查密钥变量名和值之间有没有空格。从你的一天里偷走的活抓取、录入、核对、巡检它接受的是任务描述不是代码。按你一天的工作流分组每组给一句能直接抄改的描述。抓取类比价、竞品监控、数据导出访问京东、天猫、拼多多记录 iPhone 15 的当前售价和评价数量整理成一份 CSV 文件列包含商品名、价格、评价数。录入类批量填表、入职申请、工单提交登录公司招聘系统为以下候选人填写入职申请表张三前端开发、李四后端开发。必填项全部核对无误后再提交提交后截图留档。核对类验收、对账、审批检查打开订单后台逐页核对过去 7 天的退款单找出金额与支付流水不一致的订单列出订单号和差额。巡检类站点存活、定时检查检查公司官网首页如果返回 404、加载超过 10 秒或出现报错记录本次检查的时间戳和结果。定时执行部分用你熟悉的调度器cron 或任务计划程序包一层即可。更重的活它也能接项目里有个演示应用让 AI 先抓取官网信息再生成广告图和落地页。下面是它生成的落地页长这样完整代码在examples/apps/ad-use/目录。装上你自己的零件自定义工具、浏览器配置、事件钩子给它加新本事自定义工具内置动作点击、输入、滚动、截图覆盖不了的时候自己注册一个。写法很简单from browser_use import Tools tools Tools() tools.action(description计算两个数字的和) def add_numbers(a: int, b: int) - int: return a b把tools传进Agent(task..., toolstools)就生效。注意description是给模型看的说明书写得越准它调用得越准——描述含糊它要么不调用要么乱调用。跑完你能在历史里看到它在需要求和的那一步主动调了这个工具而不是自己心算。示例可参考examples/custom-functions/里的notification.py任务完成后发邮件。调浏览器行为在哪改、改什么浏览器参数集中在browser_use/browser/profile.py的BrowserProfile里常用的几个proxy走代理、headless决定是否开窗口、allowed_domains限定它能访问的域名、keep_alive控制任务结束后浏览器是否保留、storage_state加载已有登录态。改一个字段行为就变一份不用碰内核代码。挂事件钩子浏览器会话基于事件总线页面加载、下载完成、弹窗出现都是事件。想在这些时机挂自己的回调比如下载完成就归档文件参考browser_use/browser/watchdogs/目录下各类 watchdog 的写法照着注册监听即可。给它挑个大脑浏览器自动化模型怎么选同一个任务换不同模型成功率差别很大。这是官方基准测试BU Bench V1的结果选型建议一句到位性能优先图上成功率最高的官方优化模型85%一骑绝尘。预算有限GPT-5.566%、Gemini 3.5 Flash65%这类通用模型成本低成功率仍在 65% 上下。本地部署接 Ollama 跑本地模型图里 Luna 只有 31%但数据不出内网适合敏感业务别指望精度。中间档开源库直连 Claude Opus 4.7 有 74%预算允许时性价比不错。从演示到稳定跑让浏览器自动化无聊地重复演示惊艳生产无聊。无聊才是目标。稳定性任务描述里写清可验证的完成标准提交成功并看到完成提示比提交一下靠谱得多用max_steps参数给任务兜底防死循环默认 500 步接近上限时框架会警告并强制收尾按任务复杂度调小更省钱网络类错误优先设置重试别一超时就整单失败。安全API 密钥只进环境变量敏感网站的账号密码走 2FA 集成examples/custom-functions/里有 OnePassword 和 Google 2FA 的现成写法而不是明文喂给模型用allowed_domains把自动化任务的访问范围锁到最小。性能并发 Agent 别贪多每个都占一份浏览器内存3 个以内先跑顺再谈扩容大站点任务优先关掉图片加载提速不需要窗口的场景开headless。这套方案已被大量真实场景验证过——项目社区规模到了 6.9 万星这个量级你踩的坑大概率有人踩过先看tests/目录。你会真正问的 5 个问题它免费吗框架本身开源免费MIT 协议。你只为大模型 API 调用付费本地部署则连这部分也省了。不会写代码能用吗能。最小示例十几行照抄改任务描述即可上手复杂场景直接抄examples/目录里的现成脚本再改参数。支持哪些浏览器基于 Chromium 内核Chrome、Edge 等现代浏览器都可以还能接你本机已登录的 Chrome profile。需要登录的网站怎么办支持保存 Cookie 和会话状态首次登录后用export_storage_state把状态存成 JSON后续任务通过storage_state加载自动保持登录态写法见examples/browser/save_cookies.py。会被网站检测出来吗内置拟人操作和随机延迟来降低风险。高安全级别站点建议先小规模试跑再谈放量。你接下来的 30 分钟行动清单第 0–10 分钟按第三节的三步装好环境跑通查星标的最小任务。第 10–25 分钟去examples/目录挑一个最像你日常工作的示例抓取、巡检、多标签页都在里面改掉任务描述跑起来。第 25–30 分钟给自己的高频任务加一个自定义工具或者把模型换成你手上最便宜的档试试。常用入口完整文档看根目录README.md各场景示例看examples/边界情况测试看tests/模型接入写法看examples/models/浏览器行为调参见browser_use/browser/profile.py。现在打开终端第一条git clone敲下去十分钟后再看这篇文章时你已经有一个替你点网页的 AI 了。【免费下载链接】browser-use Make websites accessible for AI agents. Automate tasks online with ease.项目地址: https://gitcode.com/GitHub_Trending/br/browser-use创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考