ego (lite) 只是一款浏览器;ego 才是你跨设备的个人 Agent。
加入候补名单
WebMCPMCP浏览器自动化AI 智能体Chrome

WebMCP 详解:它如何改变浏览器自动化(以及哪里没有改变)

2026年9月01日11 分钟阅读
最近更新 2026年9月11日
像素艺术风格的蓝色智能体跪坐,面前是终端屏幕,背景是星空和雪山,用于展示 WebMCP

WebMCP 是一项拟议中的浏览器 API,它代表用户为 AI 智能体发现、描述并执行结构化工具。网站声明某个操作的作用以及它接受哪些输入;智能体调用该工具,而不是猜测要点击哪个按钮或字段。这可以让表单、预订流程或诊断任务更快、更可靠,但它并不是浏览器自动化的通用替代方案。 Chrome 的 WebMCP 文档

实际选择属于架构层面。WebMCP 是服务端协作:站点所有者发布面向智能体的契约。浏览器自动化是客户端观察:智能体操作已经存在的界面,包括已授权的登录会话。当你控制站点并能定义安全工具时,使用前者;当你需要处理当今的 Web 时,使用后者。 安全工具指引

什么是 WebMCP?

WebMCP(Web Model Context Protocol)是来自 Chrome 团队和 WebMCP 社区的一项面向浏览器的 API 提案。Chrome 的文档将其描述为一种为智能体构建并暴露结构化工具的方式,同时保留可见的 Web 应用和用户的控制权。站点可以将搜索、结账、日期选择器、支持或诊断工具作为渐进增强发布;当没有智能体时,人类可以继续使用同一页面。 Chrome 的源试用公告

Chrome for Developers 的 WebMCP 文档,展示定义、导航和页面大纲
Chrome 的官方文档将 WebMCP 描述为一项向 AI 智能体暴露结构化工具的拟议标准。这是来源背景,不是我们的行为测试。

WebMCP 如何工作?

WebMCP 页面向浏览器注册工具。每个工具都有名称、描述、输入 schema,以及一个在页面中运行的实现。命令式 API 使用 JavaScript 执行自定义操作;声明式 API 标注普通 HTML 表单。Chrome 文档指出了对智能体重要的三个部分:发现、用于输入和输出的 JSON Schema,以及描述当前页面能做什么的状态。

结果可能是一条更短的操作路径。无需读取庞大的 DOM、推断某个按钮表示 submit_application,并寄希望于选择器在重新设计后仍然有效,智能体可以用 schema 描述的字段调用命名工具。该操作仍在网站中可见地执行,因此页面可以显示进度,并在购买或其他改变状态的操作前请求确认。

Chrome Labs Hotel Chain 演示位于 WebMCP Inspector 旁,后者列出 lookup_amenity、search_location 和 view_hotel schema
在我们的运行中,Inspector 1.9.15 直接从可见的 Hotel Chain 演示页面发现了命名工具及其输入 schema。

我们的 WebMCP 动手测试中发生了什么?

2026 年 9 月 11 日,我们在 macOS 上使用 Google Chrome 152.0.7977.76 和 WebMCP Model Context Tool Inspector 1.9.15,对官方 Chrome Labs Hotel Chain 演示运行了一次引导测试。操作员使用了合成访客数据,没有使用 Gemini API 密钥,也没有使用真实的酒店、支付或账户凭据。这是一次行为走查,不是速度或可靠性基准测试。

  1. Inspector 发现了页面的工具和 schema。我们调用 search_location,参数为巴黎、9 月 18 日、三晚、一名成人;页面显示了两处酒店。
  2. 我们使用 breakfast 调用了 filter_search_results。可见结果数量从两个变为一个,只剩 Montmartre Suites。
  3. 我们打开了那家酒店,启动了预订流程,并提供了合成身份 Alex Chen。该工具准备好了表单,但没有最终完成预订。
  4. 页面停在“确认预订”。只有在人工操作员点击该控件后,演示才显示“预订已确认”。
在 WebMCP 早餐筛选工具调用后,Hotel Chain Paris 结果缩减为 Montmartre Suites
一次有效工具调用改变了可见页面状态:早餐筛选将巴黎结果从两家酒店减少到一家。
酒店预订审核页面显示了 WebMCP complete_booking 工具输入旁边的“确认预订”按钮
该工具填写了合成客人详细信息,但会产生实际后果的操作仍位于可见的人工确认控件之后。
人工批准合成预订后,Hotel Chain 演示显示“预订已确认”
人工点击后,演示显示“预订已确认”,Inspector 报告成功。没有创建真实预订。

一个工具方面的限制也很重要:在我们的手动 Execute Tool 流程之后,Inspector 的 Copy trace 操作返回了一个空 JSON 数组。因此,我们使用截图和结构化步骤记录作为本次运行的证据,并且不将该 trace 结果推广到其他 Inspector 模式。

WebMCP 与浏览器自动化有何不同?

WebMCP 和浏览器自动化解决不同的失效模式。当网站发布良好的契约时,WebMCP 消除歧义。传统自动化,包括 Playwright、Selenium、browser-use 或驱动真实浏览器的智能体,通过读取渲染后的页面并与之交互来处理不发布契约的网站。因此,WebMCP 补充了自动化:客户端可以在可用时调用页面工具,在不可用时回退到普通浏览。

这种区别最容易作为能力边界来审计。在选择路径之前,请阅读正向和负向两列。

方法它能做什么它不能做什么
WebMCP调用页面暴露的具名且由 schema 描述的工具访问不注册工具或导入单独浏览器登录的页面
基于 DOM 的自动化使用选择器、截图或无障碍状态操作几乎任何已渲染页面无需解读界面即可知道网站预期的操作
真实浏览器会话复用使用显式预配且经授权的已登录浏览器状态保证访问、绕过 CAPTCHA 或覆盖网站策略

切实可行的落地从一个只读工具、一个受支持的浏览器和一个可见的确认步骤开始。只有在回退路径正常工作后才扩展。

会话边界同样重要。WebMCP 运行在客户端访问的那个页面里,它不会把用户的 Chrome Cookie 转移到新的云端会话。对于没有 WebMCP 的网站,ego (lite) 允许你导入自己的 Chrome 浏览器配置文件(Profile),让 Agent 从一个你已经登录的浏览器开始工作,这意味着两步验证(2FA)、SSO 跳转和验证码(CAPTCHA)提示出现的频率会低得多,而且由你决定开放多少登录态。这个 Space(隔离空间)不是远程虚拟机,也不是租户隔离边界。这条路线改变的是浏览器能为你做什么,而不是网站的 UI 契约。 OpenClaw 2.0 的发布说明

使用这张评估表让决策更明确,而不是将 WebMCP 视为通用升级。

评估问题选择 WebMCP 的情形...选择浏览器自动化的情形...
你是否控制该网站?是;你可以发布页面工具并保障其安全否;你需要操作第三方网站
该任务是否需要已有登录?页面自身的已认证会话就足够了智能体必须复用单独预配的本地会话
部署目标是什么?面向受支持客户端的稳定、带类型的契约无需接入工作即可跨页面立即使用的工作流

什么时候应该使用 WebMCP?

当你拥有该应用、能够定义稳定的任务边界,并希望智能体完成结构化工作时,选择 WebMCP,例如客服表单、旅行搜索、结账或内部诊断。它特别适用于复杂界面:人类知道想要执行的操作,但智能体原本需要进行大量需要解释的点击。保持工具小巧、带类型且可观测。

当你无法控制站点、需要已有的授权登录、必须在许多不相关站点上工作,或需要今天就能使用的工作流而不是等站点采用之后,选择真实浏览器自动化。对于已投入使用的 CI 脚本,确定性自动化仍然适用;对于交互式登录工作,可见的本地浏览器让智能体获得与人能够审查的相同账户和页面状态。

WebMCP 有哪些安全限制?

WebMCP 本身不会授予权限。Chrome 通过源隔离和工具的 Permissions Policy 来限制这些 API;跨源 iframe 默认禁用。站点只能向它信任的源公开工具,并且 Chrome 的安全指南建议:对于不会产生变更的工具使用 readOnlyHint,当输出包含用户生成或外部文本时使用 untrustedContentHint。

提示注入仍然可能发生,因为智能体会同时处理指令和网页内容。保持描述和输出简洁,在服务器端验证输入,对会产生重大后果的操作要求用户确认,并只公开所需的最少源和工具。WebMCP 是更清晰的接口,而不是跳过身份验证、授权、审计日志或人工审查的理由。

WebMCP 有哪些挑战和局限?

WebMCP 的主要限制是采用:客户端必须访问兼容页面,浏览器必须实现这个实验性 API。Chrome 还指出,无头场景不是主要设计目标,复杂应用可能需要重构状态,并且该提案仍在变化。

这在可预见的未来会形成混合技术栈。一个站点可能公开一个出色的结账工具,同时把账户设置保留为普通 DOM 控件;一个浏览器可能在测试中支持 WebMCP,但在你的生产机群中不支持。保留常规自动化回退方案,并在重复运行中衡量工具错误、确认率和人工交接。

如今如何试用 WebMCP?

对于本地实验,在 Chrome 中启用 chrome://flags/#enable-webmcp-testing 并重新启动。对于实机测试,Chrome 的文档引导开发者使用 Chrome 149 源试用。使用官方演示和 Model Context Tool Inspector Extension 查看已注册工具、手动调用它们,并测试有效和无效输入。由于该提案仍在积极讨论中,请固定浏览器版本并预期 API 会发生变化。 OpenAI WebMCP 挑战赛

如果你是智能体用户而不是站点所有者,就不需要等待 WebMCP 被采用。在受支持的编码智能体中运行 /ego-browser,描述有边界的任务,并保持浏览器会话和权限显式。两种方法将共存:WebMCP 让配合的站点更容易操作;真实浏览器自动化则覆盖其余站点。

常见问题

WebMCP 和 MCP 服务器是同一个东西吗?

不是。传统 MCP 服务器是向客户端公开工具的外部进程或服务。WebMCP 从网页本身向浏览器中的智能体公开工具,并带有浏览器源和 Permissions Policy 边界。

WebMCP 能自动化不支持 WebMCP 的站点吗?

不能。客户端必须访问注册了工具的页面。对于尚未采用 WebMCP 的站点,请使用普通浏览器自动化;当身份验证或某个挑战需要人工输入时,请停下来等待人工输入。

谁需要实现 WebMCP?

网站所有者实现 WebMCP 工具;智能体客户端和浏览器必须支持使用这些工具。访问者不能向不相关的站点添加工具。

WebMCP 的主要优势是什么?

WebMCP 为智能体提供具名操作、由 schema 描述的输入以及页面状态,从而减少在配合站点上的选择器猜测和解释型点击。应用仍然需要验证每个 payload。

WebMCP 的主要限制是什么?

WebMCP 需要页面采纳和浏览器支持,在 Chrome 中仍处于实验阶段,并且不能解决无头模式一致性、身份验证策略或提示注入。

WebMCP 工具能否在无人参与的情况下运行?

一些低风险工具可以自动运行,但敏感操作应请求用户交互和确认。Chrome 设计面向本地浏览器工作流,且由人参与其中。

WebMCP 会向每个 iframe 暴露工具吗?

不会。源隔离和工具 Permissions Policy 会限制注册;跨源 iframe 需要明确权限和受信任的暴露。

WebMCP API 会保持稳定多久?

目前还没有稳定性保证。Chrome 将 WebMCP 标记为正在积极讨论的拟定标准,因此请固定版本并关注 explainer 和 origin-trial 说明。

我可以在已登录的账户下使用 WebMCP 吗?

页面可以在其自身的已认证会话中暴露工具,但 WebMCP 不会将 cookie 转移到另一个浏览器。请将授权和确认保留在站点的安全模型中。

当站点缺少 WebMCP 时,我应该使用什么?

使用常规的浏览器自动化。当任务需要一份已授权的本地会话时,ego (lite) 会导入你的 Chrome 浏览器配置文件(Profile),让 Agent 继承你真实的登录态。

我可以在哪里阅读实现指南?

从 Chrome 的 WebMCP 文档、安全工具指南、origin-trial 页面以及 GitHub 上的 WebMCP explainer 开始;链接列在下方来源说明中。