公司动态
AI 浏览器自动化完整指南:5 分钟跑通 Browser-Use,把重复网页工作交给 AI
AI 浏览器自动化完整指南5 分钟跑通 Browser-Use把重复网页工作交给 AI【免费下载链接】browser-use Make websites accessible for AI agents. Automate tasks online with ease.项目地址: https://gitcode.com/GitHub_Trending/br/browser-use每天登录五个系统导数据、填几十份结构一样的表、挨个点网页看有没有挂掉——这些重复网页操作其实可以不用人干。AI 浏览器自动化框架 Browser-Use 能让 AI 像人一样操作真实浏览器你写一句话任务它自己点开页面、点按钮、填表单、导出结果。时间账每周你到底花了多少小时在网页重复劳动上把上周的操作在脑子里过一遍做个简单估算早会前逐个打开 5 个后台系统登录、导出、重命名、归档约 20 分钟填表10 份申请单每份 3 分钟复制粘贴加核对半小时没了巡检每天 2 次点开竞品页和自己的官网确认还活着每次 5 分钟。算下来这类不难、但琐碎重复的活每周吃掉你 4~5 小时。更贵的是它的隐性成本人肉执行意味着人会走神、点错、漏一项返工时间还要再翻一倍。这正是 AI Agent 的适用区间——规则明确、重复度高、需要真实浏览器环境的工作。把它当成一位永远不腻的实习生你负责派工单写任务描述它负责动手。三句话定位Browser-Use 是什么Browser-Use 是一个开源MIT 协议的 Python 库让大模型在真实 Chromium 浏览器里像人一样完成网页任务。核心能力看页面、点按钮、填表单、滚动、下载、提取数据支持任意主流大模型当大脑也支持 Ollama 本地模型。部署方式本地 pip 装好就能跑数据留在自己机器上另有托管版云端 Agent 可选。5 分钟跑通最小 AI 浏览器自动化示例环境准备只要 4 步Python 3.11# 1. 安装框架 pip install browser-use # 2. 在当前目录创建 .env写入你的大模型密钥 # BROWSER_USE_API_KEY你的密钥 # 也支持 GOOGLE_API_KEY、ANTHROPIC_API_KEY、OPENAI_API_KEY # 3. 把下面的脚本存为 agent.py # 4. 运行 python agent.py最小示例agent.py来自项目官方快速入门import asyncio from browser_use import Agent, ChatBrowserUse async def main(): agent Agent( task去 GitHub 上找到 browser-use 项目报告当前的 Star 数, llmChatBrowserUse(modelopenai/gpt-5.5), ) history await agent.run() asyncio.run(main())运行后你会亲眼看到一个真实浏览器窗口自动弹出打开 GitHub导航到项目主页识别页面内容最后把 Star 数字作为结果返回。整个过程你只需要换一行task描述——这就是它的用法形态不是写操作代码而是写任务。任务描述公式让 AI 一遍做对网页任务任务写得好不好直接决定成功率。用一个四段式公式对象去哪、对什么动作做什么产出留下什么东西验收标准怎样算做完三个不同场景的模板照着改就能用场景一批量预约类OA 系统登录公司会议室预约系统为下周二上午 10:00 预约 1 号大会议室邀请张三、李四、王五。预约完成后截图作为凭证并把会议室号写进结果里。场景二数据采集类招聘网站在招聘网站搜索Java 后端把前 10 条岗位的职位名、公司、薪资范围收集到 CSV 文件文件名为 java_jobs.csv。场景三单据处理类报销系统登录报销系统导出上月全部报销单按日期、金额、类别三列整理成 Excel并在最后一行汇总总金额。对比一下帮我看看那个网站和上面这种写法后者给了明确的对象、产出和验收线AI 每一步都知道自己该不该停。更重的活它也能接比如项目里有个 examples/apps/ad-use/ 演示应用让 AI 先浏览落地页提取品牌信息再自动产出广告素材进阶三招加自定义工具、调浏览器配置、选对大模型招一加本事自定义工具。用装饰器注册一个函数AI 会在需要时主动调用它而不是自己瞎算from browser_use import Agent, Tools tools Tools() tools.action(description计算两个数字的和) def add_numbers(a: int, b: int) - int: return a b agent Agent(task..., llmllm, toolstools)招二调配置。浏览器行为代理、下载路径、加载超时、是否禁用图片加载等集中在 browser_use/browser/profile.py 的 BrowserProfile 里调整事件系统则支持在页面加载、下载完成等时机挂自己的回调点到为止即可默认配置通常够用。招三选大脑。官方用 100 个真实浏览器任务做基准测试结果如下追求成功率用官方优化的bu-*模型官方口径比其它模型快 3~5 倍预算有限openai/gpt-5.5等通用模型可用成本更低数据敏感Ollama 接本地模型数据不出内网。稳定三层让网页自动化任务长期跑得下去稳定性任务描述里写死可验证的验收标准截图留档文件名为 xxx.csvAI 才知道何时算完给任务设max_steps步数上限防止死循环空转任务里明确网络失败时重试一次再放弃而不是默认失败。安全API 密钥只放.env或环境变量绝不写进代码账号密码走sensitive_data参数注入参考 examples/features/sensitive_data.py避免明文进模型上下文访问域名范围收窄到任务需要的几个站点别给全网权限。性能并发 Agent 别贪多每个 Chrome 实例都吃内存官方 FAQ 也提醒并行多开不好管理3 个以内先跑顺大站点任务在 BrowserProfile 里关掉图片加载页面加载能明显提速需要登录的站直接复用真实 Chrome 配置examples/browser/real_browser.py省掉每次重新登录的开销。FAQ 快答browser-use 上手常见问题框架收费吗开源免费MIT 协议只为所用大模型的 API 调用付费跑 Ollama 本地模型连这部分也能省。不写代码能用吗能。上面最小示例只有 10 来行照抄再改任务描述即可更复杂的场景参考 examples/ 里的现成脚本。需要登录的网站怎么办支持复用已有 Chrome 配置或保存 Cookie/会话状态首次登录后后续任务保持登录态。支持中文网站吗支持中英文页面都能处理任务描述直接用中文写。会被网站检测到吗内置拟人化操作高安全站点建议先小规模试跑再放量云端方案还提供隐身浏览器和代理轮换。选 CLI 还是 Python 库一次性任务交给已有 AgentCLI 方式要在自己代码里做可重复、可并发的自动化就用 Python 库。三步行动清单今天就开始第一步10 分钟内按上面 4 步装好环境跑通查 Star 数的最小任务第二步今天去 examples/ 找一个最像你日常工作的脚本表单、采集、下载都有现成的改掉任务描述再跑一遍第三步本周给高频任务注册一个自定义工具或把llm换成 Ollama 本地模型。常用资源完整文档入口 README.md、各场景示例 examples/、边界情况测试 tests/、能力速查 skills/。重复的网页操作从今天起派工单就行。现在打开终端跑通你的第一个任务。【免费下载链接】browser-use Make websites accessible for AI agents. Automate tasks online with ease.项目地址: https://gitcode.com/GitHub_Trending/br/browser-use创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考