← 文章 / AI技术
infoq 2026/6/24 · 2026-06-24 21:09:21 · 0 阅读

Chrome 推出 WebMCP 标准提案(Origin Trial):为智能体提供原生 Web 操作能力

![](https://dbyun-product.oss-cn-chengdu.aliyuncs.com/crawl/bee1ef0605946fa14ca432e4593d4216.jpg) > 日程已上线 100%!6.26-27 AICon 上海站: 13大专题+1个动手实验室、近60场重磅议题,集结清华、复旦等知名高校教授及阿里、腾讯、字节、小红书、Google Cloud等头部企业技术专家,围绕Agent工程化落地等相关议题展开分享, 点击了解详情 谷歌这样解释 WebMCP 的设计初衷: > 通过定义这些工具,你可以明确告诉智能体应该如何以及在何处与网站交互。这样一来,智能体便能够调用面向机器的接口,在数秒内完成复杂任务,同时获得更高的可靠性、准确性和个性化能力。举例来说,假设用户正在规划一次多城市旅行。过去,用户只能看着智能体一步步填写旅行表单;而现在,用户可以授权智能体直接调用后端 API,瞬间生成结合天气因素优化过的个性化行程方案,并提交给用户确认。 在没有 WebMCP 的情况下,如果 AI 智能体希望代表用户完成某项操作,通常需要经历一套相当复杂的流程:首先下载相关网页的 DOM,然后分析页面中的按钮和控件作用,接着截取页面截图并进行图像识别。最后推断目标按钮在屏幕上的坐标位置,并模拟鼠标点击。正如业内 与主要面向后端场景的 WebMCP 规范目前定义了两种 API 形式。第一种是 ```
<form  toolname="Search flights"  tooldescription="This form searches flights and displays [...]"  toolautosubmit>
``` 复制代码 第二种是命令式 API(Imperative API)。它通过 `modelContext` 接口注册工具。注册工具时需要提供工具名称、描述以及输入参数 Schema: ``` pre class=" language-js">document.modelContext.registerTool({ name: 'toggle_layer', description: 'Control pizza layers (sauce, cheese). Use "add", "remove", or "toggle".', inputSchema: { type: 'object', properties: { layer: { type: 'string', enum: ['sauce-layer', 'cheese-layer'] }, action: { type: 'string', enum: ['add', 'remove', 'toggle'] }, }, required: ['layer'], }, execute: async ({ layer, action }) => { await toggleLayer(layer, action); return `Performed ${action || 'toggle'} on layer: ${layer}`; },}); ``` 复制代码 注册完成后,工具可以直接执行页面逻辑、管理状态,并将执行结果 一位为 Chrome DevTools 开发 WebMCP Polyfill 的早期实践者表示,WebMCP 带来了非常明显的效率提升。根据他的测试结果, > Playwright 和 Chrome DevTools MCP Server 目前已经成为智能体驱动 Web 应用测试的事实标准。但它们的 Token 利用效率非常差。截图、执行操作、再截图的循环会迅速耗尽上下文窗口。 > 我一直在使用浏览器自动化来替代 TDD(因为智能体生成的测试中过度使用 Mock),但必须解决 Token 膨胀问题。因此,我 Fork 了 Chrome DevTools MCP Server,让它能够直接执行来自客户端 JavaScript 的 WebMCP 工具。 > 初步测试显示,Token 使用量大约下降了 90%。更难量化但同样重要的收益来自执行速度和确定性,两者都得到了显著提升。 不过,WebMCP 并非没有风险。提案作者特别提醒开发者,大语言模型容易受到`untrustedContentHint` 标记,以提醒智能体对相关输入进行严格的安全审查。相反,对于不会修改状态的只读操作,则可以使用 `readOnlyHint`,帮助智能体判断是否能够跳过人工确认步骤。 除了安全问题之外,WebMCP 还会带来一些运营层面的风险。例如,一个退款工具可能已经开放调用,但背后的退款政策却已经过时。此时,智能体仍然能够准确执行操作,只不过执行的是错误的业务逻辑。又或者,某位用户虽然能够访问某个页面,但实际上并不满足对应业务规则要求。过去,人类操作过程中可能会通过经验判断避免错误,而浏览器智能体则可能直接暴露这种权限设计漏洞。因此,开发者被建议 一些早期采用者也发现,虽然 WebMCP 谷歌还建议开发者尽量保持工具描述和返回结果的简洁性。目前推荐的长度限制包括:工具描述不超过 500 个字符;参数描述不超过 150 个字符;工具名称和参数名称不超过 30 个字符;单次工具输出不超过 1500 个字符。 在 I/O 2026 大会上,Chrome 团队 查看英文原文:
原始来源: infoq

评论 (0)