首页 > AI教程 >微软开源Webwright,浏览器Agent跳出猜点死胡同

微软开源Webwright,浏览器Agent跳出猜点死胡同

来源:互联网 2026-06-24 06:26:14

2026年5月,微软开源终端原生WebAgent框架Webwright,其核心思路是让LLM直接编写可运行的Playwright脚本,将网页操作转化为可复用Python程序,摆脱了传统单步调用大模型的局限。性能达到SOTA,在Online-Mind2Web和Odysseys基准测试中刷新开源框架最好成绩,并已适配ClaudeCode、OpenAICodex等

2026年5月,微软开源了终端原生Web Agent框架Webwright,这一消息迅速在Agent开发社区引发广泛关注。

首先明确几个核心判断:该框架的设计思路,彻底突破了传统的“单步操作”模式。

长期稳定更新的攒劲资源: >>>点此立即查看<<<

过去绝大多数浏览器Agent遵循相似的路径:查看页面、预测下一步、点击、再预测。每一步都需要调用一次大模型。在LLM能力有限的阶段,这套逻辑确实能够正常工作。但随着模型代码生成能力不断增强,这种“小步慢跑”的设计反而成为瓶颈。

Webwright的思路截然不同,它更接近真实工程师实现自动化的方式:

  • 让LLM直接生成可运行的Playwright脚本,将网页操作转化为可复用的Python程序。
  • 所有状态——脚本、截图、日志——均存储在本地工作区。浏览器会话仅作为一个可随时启动、检查和丢弃的运行环境,本身不承担状态载体功能。
  • 架构极简:核心仅三个模块,总代码量约1500行。不包含多智能体系统、图引擎、额外插件层,仅依赖四个库:httpx、pydantic、playwright、typer。

这种模式的优势在于,Agent完成任务后,留下的不是一次性操作痕迹,而是一份可直接修改、复用和分享的自动化脚本。这正是其核心价值所在。

性能达到SOTA级别

Webwright在两大主流浏览器Agent基准测试中,均刷新了当前开源框架的最佳成绩。以下为使用100步预算的测试结果:

  • Online-Mind2Web(包含300个真实网页任务):使用GPT-5.4达到86.7%的准确率,为同类开源框架最高;使用Claude Opus 4.7达到84.7%,且在难例拆分上超过GPT-5.4(80.5% vs 76.6%)。
  • Odysseys(200个长程任务,平均需要76.1步):使用GPT-5.4获得60.1%的完成率,较此前SOTA提升15.6个百分点,比基于坐标预测的基线GPT-5.4提升26.6个百分点。

此外,测试还发现一个有趣的现象:即使是Qwen-3.5-9B这样的小模型,配合预置工具脚本,也能在Online-Mind2Web的难例上达到66.2%的完成率。对于低成本部署场景而言,这一表现相当扎实。

微软开源Webwright,浏览器Agent跳出猜点死胡同Odysseys长程任务评测结果对比

微软开源Webwright,浏览器Agent跳出猜点死胡同Online-Mind2Web任务评测结果对比

生态集成与附加功能

Webwright已完成主流Agent生态的适配,无需修改现有工作流即可直接接入:

  • Claude Code:通过插件市场安装后,支持两个命令——/webwright:run(执行一次性任务)和/webwright:craft(生成可复用的参数化脚本)。
  • OpenAI Codex:同样通过插件市场安装,使用@webwright即可调用。
  • OpenClaw、Hermes Agent:共用同一套skill目录,加载即可使用。

此外,还有两个实用功能值得关注:

  • Task2UI模式:任务完成后自动将结果渲染为可交互的HTML应用,省去手动可视化步骤。
  • 全程可审计:每次运行的轨迹、截图、日志均保存在本地,便于调试和回溯。

与同类项目的核心区别

社区中也有用户询问Webwright与browser-use、agent-browser等项目有何不同。官方给出的架构对比清晰如下:

维度

Stagehand (Browserbase)

agent-browser (Vercel)

browser-use

Webwright

范式

混合:代码 自然语言原语

供其他Agent调用的CLI工具

基于DOM快照的自主LLM循环

带终端的编码Agent,浏览器只是启动的运行环境

动作空间

Playwright代码,或自然语言转译的Playwright

离散子命令(打开、点击、截图等)

LLM选择的索引式点击/输入

自由格式Python,自己写完整Playwright脚本

状态载体

浏览器会话

浏览器会话

浏览器会话

本地工作区(代码、截图、日志),浏览器可丢弃

循环形态

命令式,需要时做多步操作

每个微操作调用一次CLI

观察→预测动作→执行循环

写代码→执行→检查截图→修复代码

行业共识:Agent需跳出单步操作的局限

Webwright的设计思路在社区中获得广泛认同,许多从业者认为这代表了浏览器Agent的正确方向。

有开发者指出,绝大多数自动化的瓶颈不在动作层,而在决策循环。Playwright的点击速度已足够快,真正的问题在于“该点击什么”。如果新工具能压缩这一决策差距,那将是完全不同的品类;如果只是重新包装CDP调用,则充其量是横向移动。

FSB(Full Self Browsing)的作者Lakshman Turlapati更直接地表示:Webwright证明了方向是对的。Agent不应仅猜测下一步该点击哪里,还应将真实浏览器会话、DOM、截图、日志和恢复机制整合到同一控制层中。FSB所做的是Chrome端的MCP层,使Codex、Claude、Cursor等Agent能直接控制用户的真实Chrome,同时保留原有Cookie、扩展、登录态,并实现敏感信息不泄露、多Agent tab隔离。该方案特别适用于处理收件箱分类、客服回复、数据拉取等需要登录态的重复工作。

还有开发者表示,Webwright本质上就是面向浏览场景的编码Agent。此前手动使用“Copilot CLI Playwright MCP”搭建过类似工作流,现在终于迎来了更官方的方案,已为OpenClaw和Hermes Agent安装,用于收集AI编码的模式数据,进一步提升Agent的编程能力。

快速上手

基础运行

环境要求:Python 3.10或更高版本,Playwright安装的Chromium,以及对应后端的API密钥(OpenAI/Anthropic/OpenRouter)。

# 安装
pip install -e .
playwright install chromium

# 运行示例任务
python -m webwright.run.cli -c base.yaml -c model_openai.yaml -t "Search for flights from SEA to JFK on 2026-08-15 to 2026-08-20" --start-url https://www.google.com/flights --task-id demo_openai -o outputs/default

作为Claude Code插件安装

# 添加插件市场
/plugin marketplace add microsoft/Webwright
# 安装插件
/plugin install webwright@webwright

相关链接

侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述

热游推荐

更多
湘ICP备14008430号-1 湘公网安备 43070302000280号
All Rights Reserved
本站为非盈利网站,不接受任何广告。本站所有软件,都由网友
上传,如有侵犯你的版权,请发邮件给xiayx666@163.com
抵制不良色情、反动、暴力游戏。注意自我保护,谨防受骗上当。
适度游戏益脑,沉迷游戏伤身。合理安排时间,享受健康生活。