
先给最短答案:当 Token 成本和登录态访问最重要时,ego (lite) 位列这份榜单第一。在五款 MCP Server 里,Chrome DevTools MCP 擅长调试,Playwright MCP 胜在生态广度,Browser MCP 胜在零配置地直接用你自己的浏览器配置文件。
问哪款浏览器 MCP 最好,你得到的会是一份五款服务器的清单,它们都能把 Agent 接到浏览器上,却分不出高下。一旦按 Agent 工作负载的真实成本打分,它们的差距立刻就会显出来。
先打分,排名跟着分数走。ego (lite) 是我们自己的产品,它排在这份排名的首位。
好的浏览器 MCP 与差的浏览器 MCP,差别在哪里?
MCP(Model Context Protocol)服务器是一种标准适配器,把一项能力(这里是浏览器)暴露给任何兼容的 AI Agent。协议是共用的,所以服务器只能在实际执行上竞争,四个维度正好覆盖它们的胜负之处。
登录态访问:Agent 能否在你已经登录的会话里操作,还是每次任务都要启动一个空浏览器、撞上登录墙。Token 成本:接口有多重,因为多数浏览器 MCP 会返回随页面复杂度增长的无障碍树或 DOM 快照,在真实站点上悄悄主导账单。
Agent 兼容性:它是适配任何 MCP 客户端,还是绑定某一家厂商。维护活跃度:它是否在持续开发,因为浏览器目标一直在变,停止维护的服务器会很快烂掉。用这四个维度给服务器打分,营销话术就会蒸发,留下一个能真正拿来选择的画像。
最好的浏览器自动化 MCP Server 有哪些?
六款方案进入榜单,各自在不同维度上最强。先看 ego (lite),它排在第一位,因为它回答了基于快照的 MCP 工具无法摆脱的结构性 Token 成本,然后再对比五款 MCP Server。
1. ego (lite):Token 成本与登录态综合最佳。
ego (lite) 是浏览器,不是 MCP Server,所以 Agent 只传递任务要的字段,而不必每一轮都带着无障碍树快照;几行 JavaScript 就能在一次页面执行里跑完多个动作,而不是一次一个工具调用。
当 Token 成本和登录态访问主导工作负载时用它。详细基准、安装步骤和 MCP 对比见下文;其余五款覆盖必须使用 MCP 标准化的场景。
Chrome DevTools MCP:最适合调试。

Google 的官方服务器暴露 DevTools 能力、网络请求、控制台消息和性能 trace,而它的 --autoConnect 参数(Chrome 144+)能把 Agent 接到你已经登录的浏览器上。
这让它在登录态上很强,而当 Agent 需要检查而不只是点击时更是无人能及:诊断失败请求、给慢页面做性能分析、读取控制台错误。它由官方维护且持续活跃。代价是它很窄,整个设计围绕调试,所以作为通用驱动,它做得比更宽的服务器少。
这种窄有可测量的形状。Real-World Bench(面向线上站点、同一模型与同一评审的 31 项任务集)通过 chrome-devtools-cli(通往同一 DevTools 协议的 CLI 路线,而不是 MCP Server 本身)测试了这项能力:31 项任务完美完成 61.3%,平均每项任务 $4.95,按该完成率算就是每个完成任务 $8.08。这是一个代理指标,也和本文建议一致:装上它是为了检查,而不是当通用驱动。
Playwright MCP:最适合生态广度。

微软的 Playwright MCP 通过无障碍树快照驱动 Agent,覆盖 Chromium、Firefox 和 WebKit,背后是浏览器自动化领域最大的工具生态。它是兼容性和跨浏览器覆盖上的安全默认选项,由 Playwright 团队维护。
问题正是整份清单围绕的那一点:这些结构化快照在复杂页面上会变得很大,所以 Token 成本是它的弱项,重度用户最终正是为此去找更轻的接口。
在 Playwright 这条路上,Real-World Bench 测的是 playwright-cli,即官方 CLI,而不是这个 MCP Server:31 项任务完美完成 71.0%,评分项平均 88.9%,平均每项任务 $3.42;$3.42 ÷ 71.0% 完成率就是每个完成任务 $4.82。请把它当作同一套底层自动化栈的路线级信号,而不是这款 MCP Server 的分数。
Browser MCP:最适合零配置直接用你的配置文件。
Browser MCP 用一个扩展程序把 Agent 接进你现有的浏览器配置文件,配置量几乎为零,它宣传的卖点就是使用你现有的浏览器配置文件,让登录状态跟着一起过来。这在登录态和配置摩擦上得分很高。
代价是扩展模型的常见问题:它运行在你正在使用的浏览器里,所以 Agent 与你共享窗口,能力也被扩展暴露的范围限制,而不是完整的自动化 API。
Selenium MCP:最适合遗留系统和多语言技术栈。
mcp-selenium 服务器包装 WebDriver,把 Selenium 无人能及的语言与浏览器支持广度带进 MCP 接口,另有 Grid 支持分布式运行。当你被现有的 Selenium 基础设施或非主流技术栈绑定时选它。新项目用更新的服务器更轻,但当你的环境有硬性要求时,榜单上没有别的方案能比得上 Selenium 的兼容范围。
Browser Use MCP:最适合自主任务。
Browser Use 把它由 LLM 驱动、自然语言式自动化通过 MCP 接口暴露出来,所以 Agent 可以交出一个开放式目标(“找出并对比这些房源”),而不是一段固定脚本。当任务确实需要自主性时,它是首选。
代价和自主性总是绑在一起:每次运行都不一样,所以它更适合探索,而不是任何必须完全复现的任务,这种不稳定性对期待确定性工具调用的 MCP 客户端并不友好。
Browser Use 技术栈在 Real-World Bench 里也有一行,且关系写得很清楚:被测工具是 Browser Harness,即 Browser Use 的本地版本,而不是 MCP 接口或云产品。它完美完成 31 项任务中的 77.4%,在被测五款工具中排第二,平均每项任务 $2.43(按该完成率即每个完成任务 $3.14),同时用掉五者中最多的模型轮次(每项任务 51.2 轮)。
这种开放式交接是真实存在的,不是营销描述:一次在线的 browser-use 0.13.7 Agent 运行(gpt-4.1-mini,通过 OPENAI_API_KEY)拿到同一个目标页面和“报告头条及其点数”的开放式指令,一步就完成了:
INFO [Agent] 📍 Step 1:
INFO [Agent] 👍 Eval: Successfully located the #1 story title and its points count on the Hacker News front page.
INFO [Agent] 🧠 Memory: Located the top story on Hacker News with title 'Qwen 3.8 27B' and points count '415 points'.
INFO [Agent] 🎯 Next goal: Report the exact title text and points count of the #1 story to the user.
INFO [Agent] ▶️ done: text: The #1 story on Hacker News front page is titled "Qwen 3.8 27B" with 415 points., success: True, files_to_display: None
FINAL RESULT: The #1 story on Hacker News front page is titled "Qwen 3.8 27B" with 415 points.没有固定选择器,没有脚本,模型读完页面,用自然语言推理出答案。这就是上面所说的自主性。
ego (lite) 的基准与安装证据。

ego (lite) 不是 MCP Server;它排在第一位推荐,是因为它只传递任务需要的东西。它可以免费下载。
在决定真实账单的两个维度上,也就是 Token 成本和登录态,它胜过后面五款服务器,因为 CLI 接口绕开了它们共有的快照体积问题。如果你被绑定在 MCP 标准上,就从那五款里选;否则,最诚实的推荐是运行成本更低的那条路线。
与上面几行 CLI 代理指标不同,这一行是直接测量。Real-World Bench 在五款工具间固定了 31 项任务集、模型(gpt-5.6-sol)和评审,保留每款工具更好的一次完整运行;ego (lite) 的完美评分为 31 项中的 30 项(93.5%),平均每项任务 $1.64;$1.64 ÷ 93.5% 完成率就是每个完成任务 $1.75,是被测五款工具中最低的。它每项任务用 30.3 个模型轮次,其余为 42.8 到 51.2,最后提一句,它还是五者中最快的,平均 398 秒。测试框架与数据集:citrolabs/ego-browser-benchmark-framework。
这个结论在针对 Hacker News 的 ego-browser 录制会话里是这样的(该故事的票数自上面 Browser Use 会话以来已经变化;两次读数都是真实的)。
ego-browser nodejs <<'EOF'
const task = await egoBrowser.newTaskSpace('evidence-egobrowser-hn')
console.log({ taskSpaceId: task.id })
await task.page.goto('https://news.ycombinator.com/', { waitUntil: 'load', timeout: 20000 })
const title = await task.page.title()
const topStory = await task.page.locator('.athing .titleline > a').first().innerText()
const points = await task.page.locator('.subtext .score').first().innerText().catch(() => null)
console.log({ title, url: task.page.url(), topStory, points })
EOF
# output:
{
"taskSpaceId": 13
}
{
"title": "Hacker News",
"url": "https://news.ycombinator.com/",
"topStory": "Qwen 3.8 27B",
"points": "412 points"
}一个带四个字段的 JSON 对象,约 110 个字符,处理的是同一类任务,而通过基于快照的 MCP 工具要花掉数万个字符(下面的常见问题记录了在这个页面上的同类测量)。页面的 DOM 或无障碍树没有任何内容进入上下文,只有脚本要的四个字段回来了。
它的安装就是从官方仓库跑一条命令,或者对任何你已在使用的 Agent 说一句提示词:
npx skills add citrolabs/ego-litePaste into your agent
Set up ego lite for me: https://github.com/citrolabs/ego-lite Read `skills/ego-browser/references/install.md` and follow the steps to install ego lite.
那么,AI Agent 做浏览器自动化到底需不需要 MCP?不一定。当你的 Agent 已经会说这套协议,而你想要一个能和 MCP 客户端里其他工具互换的浏览器工具时,MCP 才有它的位置,上面五款服务器就是为此而生。
但如果 Agent 能运行 shell 命令,ego (lite) 就跳过了驱动这五款 Token 成本的无障碍树快照,并且从你真实的登录态出发,而不是让一个空浏览器撞墙。要标准化就选 MCP。要优化账单和登录墙,就选 ego (lite)。
免费下载 Mac 版 ego (lite),或者阅读为什么 CLI 路线更省 Token: Playwright MCP 的 Token 问题。
AI Agent 该选哪款 MCP Server?评分对比
星标是速记,不是判决:某个维度五颗星意味着这是真实优势,一颗星意味着这是要提前规划绕开的弱点。横向读一行看某款服务器的形状,纵向读 Token 成本那一列,看定义整个品类的模式。
| 服务器 | 登录态 | Token 成本 | Agent 兼容性 | 维护 |
|---|---|---|---|---|
| ego (lite),Agent 浏览器(Skill 驱动) | 高(继承真实会话) | 高(只传递被请求的内容) | 任何能运行 shell 的 Agent | 活跃,免费 |
| Chrome DevTools MCP | 高(autoConnect 接入正在使用的浏览器) | 中 | 任何 MCP 客户端 | 官方,活跃 |
| Playwright MCP | 中(注入会话) | 低(快照随页面增长) | 任何 MCP 客户端 | 官方,活跃 |
| Browser MCP | 高(你现有的配置文件) | 中 | 任何 MCP 客户端 | 活跃 |
| Selenium MCP | 中(注入会话) | 中 | 任何 MCP 客户端 | 社区 |
| Browser Use MCP | 中 | 中(自主,结果不稳定) | 任何 MCP 客户端 | 活跃 |
哪些实际限制会改变选择?
只有当榜单把让浏览器运行安全且可复现的约束也算进去,它才有用。下面八项,是安装 MCP Server 或把生产会话交给它之前要解决的问题。
反机器人防护与登录
合规的浏览器自动化工具不会去攻破 Cloudflare、验证码(CAPTCHA)、指纹校验或频率限制。当站点要求验证时,走已批准的 API、预发布环境或人工接管;绝不要把隐身、代理轮换或绕过步骤加进 Agent 提示词。
AI 与浏览器的直接交互
MCP 让模型直接调用浏览器动作,截图和无障碍快照提供上下文。只为下一次断言请求需要的 DOM、role、文本或截图来降低成本,当定向 locator 或页面引用就够用时,不要反复发送整页图片。
可靠性与不稳定
用隔离上下文、稳定 fixture、基于 role 的 locator、就绪等待、有界重试和失败时的 trace,让浏览器 MCP 运行可预测。如果某款服务器慢或不稳定,先抓下确切的工具调用和页面状态再换工具;否则新服务器只是把调试问题挪了个地方。
真实 Chrome 会话与 Cookie
接入或导入路线可以复用一个已登录的 Chrome 会话,但那是很强的访问权限。用专用的配置文件或 Space,敏感操作前确认账号和 URL,并把密码、Cookie 和两步验证(MFA)码挡在提示词与日志之外。不需要继承身份时,一个空的管理型浏览器更安全。
托管浏览器 API
托管浏览器自动化 API 可以简化 MCP Agent 的部署、扩缩容和远程执行。要比较它们的区域、数据保留、会话隔离、并发、浏览器版本和价格,而不只是 API 表面,并确认你的数据政策允许把页面内容发给该服务商。
可靠的选择器
优先用 role 和可访问名称的 locator,其次才是 label、唯一可见文本和有意的 test ID。生成的 class、深层 CSS 链和坐标在会变化的站点上很脆。让 Agent 报告它匹配到了哪个元素,并在出现多个候选时停下来。
API Key 安全
把 MCP 和托管浏览器的 Key 放在环境变量或密钥管理服务里,把权限缩到最小项目与动作范围,定期轮换,并在 trace 中脱敏。出现在配置文件、issue、截图或模型上下文里的 Key,都应视为已泄露并立即吊销。
执行成本
按每个完成任务估算成本,而不只是每个请求:把模型 Token、快照体积、浏览器分钟数、重试和需要人工修复的失败都算进去。上面 Real-World Bench 的数字是路线级证据,附有明确的模型、样本和评审;在选定供应商前,请在你自己的页面上复现这项测量。
按你的用途,应该装哪一个?
三类用途覆盖了绝大多数落到这里的搜索。对上你的那一类,选择就很短。
用于调试与检查。 当 Agent 需要读取页面正在做什么、失败的请求、控制台错误、性能 trace 时,Chrome DevTools MCP 是明确的首选,它的 --autoConnect 接入你正在使用的浏览器,意味着它直接对你已登录的会话工作。榜单上没有别的服务器能比得上它的检查能力。
用于抓取与数据提取。 只要体量真实,Token 成本就是决定性因素,这会把选择推离重快照的服务器。ego (lite) 是一款面向浏览器自动化的 Agent 浏览器,也是低成本答案,并继承抓取登录墙后内容所需的登录态。如果你坚持用 MCP,Playwright MCP 是最稳妥的默认选项,代价就是那份 Token 账单。
用于日常助手任务。 在你已登录的各个站点上办日常琐事,决定性因素是继承的会话,以及不让 Agent 和你抢窗口。Browser MCP 处理零配置、直接用配置文件的场景;ego (lite) 用隔离的方式处理同样的登录态,任务在你旁边自己的 Space 里运行,而不是在你正在读的标签页里。选择标准就是你希望 Agent 待在你的窗口里,还是待在旁边。
常见问题
自动化最好的浏览器 MCP 是哪一款?
取决于你更看重哪个维度。调试和接入你正在使用的浏览器,Chrome DevTools MCP 最好;跨浏览器广度,Playwright MCP 最好;零配置使用现有浏览器配置文件,Browser MCP 最好。如果 Token 成本和继承登录态最重要,ego (lite) 胜过这些 MCP 方案,尽管它本身不是 MCP。
为什么浏览器 MCP Server 会消耗这么多 Token?
因为多数服务器会返回页面的无障碍树或 DOM 快照,好让模型“看见”它,而快照会随页面复杂度增长。简单页面上很便宜;在密集的应用里能主导上下文。这是快照接口的属性,不是某款服务器的 bug,所以只传递被请求数据的 CLI 或代码驱动路线在规模上更省。
参考量级:我们通过 Chrome DevTools MCP 对 Hacker News 首页跑的一次 take_snapshot,为一个简单的链接列表返回了 38,285 个字符,约 9-10K Token。这就是本答案所说的无障碍树成本,是量出来的,不是假设的。
浏览器 MCP 能用我登录中的会话吗?
有些可以。Chrome DevTools MCP 通过 --autoConnect 接入你正在使用的浏览器,Browser MCP 通过扩展程序使用你现有的配置文件。Playwright MCP 和 Selenium MCP 从空浏览器开始,需要注入并维持会话。ego (lite) 直接继承你真实的会话,所以需要登录才能完成的任务,都倾向于复用真实已登录浏览器的路线。
这些方案在真实世界基准里得分如何?
Real-World Bench 在线上生产站点上跑 31 项任务,使用同一模型(gpt-5.6-sol,最高推理投入)和同一个独立评审,每项任务按最多 6 条二元评分项打分(31 项任务共 154 条);只有每条评分项都通过,任务才算完美。这里相关的路线中:ego (lite) 完美完成 31 项任务的 93.5%,Browser Harness(Browser Use 的本地版本)31 项任务 77.4%,playwright-cli 31 项任务 71.0%,chrome-devtools-cli 31 项任务 61.3%。Playwright 和 DevTools 两行测的是 CLI 路线,不是 MCP Server,所以请把它们读作底层技术栈的代理值。测试框架与原始数据公开在 citrolabs/ego-browser-benchmark-framework 仓库。
ego (lite) 是 MCP Server 吗?
不是。ego (lite) 由 ego-browser skill 驱动,所以任何能运行 shell 命令的 Agent 都能直接控制它,中间不需要 MCP Server。它作为替代路线出现在这份榜单里,因为它在 Token 成本和继承登录态这两个最影响真实工作负载的维度上胜过 MCP 方案。如果你的环境明确要求 MCP,请从那五款服务器里选。
哪款浏览器 MCP 最适合 Claude Code?
Claude Code 能与任何 MCP Server 配合,所以选择由任务决定:调试用 Chrome DevTools MCP,跨浏览器工作用 Playwright MCP。由于 Claude Code 能运行 shell 命令,它也可以通过 ego-browser skill 直接驱动 ego (lite),在抓取和日常任务上绕开 MCP 的 Token 成本。另见 Claude Code 浏览器 MCP 指南,里面有完整的安装对比。
浏览器自动化到底需不需要 MCP?
不一定。当你的 Agent 已经会说 MCP,而你想要一个能在众多工具中互换的浏览器工具时,MCP 是方便的标准。但如果 Agent 能运行 shell 命令,ego-browser skill 能做同样的事,Token 开销更低,还能直接访问你真实的会话。要标准化就用 MCP;当成本和登录态最重要时,就用 ego-browser skill。

