ego (lite) 只是一款浏览器;ego 才是你跨设备的个人 Agent。
加入候补名单
浏览器自动化AI Agent 浏览器多任务Chromiumagent-browser替代方案

AI Agent 网页自动化最快浏览器

2026年5月21日8 分钟阅读
一只机械手指向经典复古 Macintosh 电脑的屏幕,屏幕上展示了 ego (lite) 的并行浏览器界面和多个工作区卡片

ego (lite) 是一款让你和 AI Agent 并行工作的浏览器。你的标签页始终归你使用,而 Agent 可以在各自的 Spaces 中同时运行多个浏览器任务,以更少的 Token 更快完成工作。

去年,我们很多人一直在尝试获得 AI Agent( Claude Code, Codex,Continue)在真实的浏览器中进行真正的浏览器自动化。从登录的管理面板中提取列表。填写供应商表格。在临时环境中运行 QA。这些工具已经存在,但实际操作的体验仍然很粗糙。

ego (lite) 正是我们为解决这个问题所做的尝试。

什么是 ego (lite)

ego (lite) 深度构建于 Chrome 生态之中,采用与 Chrome 相同的引擎,并完整迁移你的书签、扩展和登录会话。你无需改变浏览习惯,安装后即可使用。

真正让它与众不同的是它对 Agent 的原生支持:

  • 以代码为基础,而非依赖 CLI;在复杂任务中运行得更快,Token 消耗也更低。 ego (lite) 向 Agent 提供的能力会封装成可由 Agent 直接调用的 JavaScript 函数。这样,Agent 就能做自己最擅长的事:编写代码,将多步骤任务组合成一次执行,而不是陷入“调用两条命令、查看结果、再调用两条命令”的循环。与传统 CLI 方式相比,复杂工作流的完成速度提高 20%–50%,任务成功率更高,每项任务所需的工具调用次数也大幅减少。我们与 Vercel agent-browser 的内部基准测试也呈现相同趋势:工作流越复杂,差距越大。
  • 为每个 Agent 提供专用Space。 ego (lite) 为每个 Agent 提供一个完全隔离的 Space。你在前台浏览,Agent 在后台工作,彼此互不干扰。你随时都能看到哪个 Space 正在运行 Agent,并可以接管或停止任务。如果你用过桥接 Chrome 的 agent-browser 工具,就会理解窗口和标签页四处弹出的混乱。ego (lite) 从根本上解决了这个问题。
  • 您的 Agent 可以在 Spaces(同一浏览器内的并行工作区)中执行多项任务。 每个Spaces都有自己的 AI Agent 或自己的任务,所有这些都同时运行。 Claude Code 在 10 个平行Spaces中丰富 10 个线索。 Codex 在另外 5 个网站中抓取 5 个竞争对手网站。它们不会碰撞或窃取您的标签。您的鼠标停留在您离开的位置。
  • 市场上最强的页面Snapshot。 得益于内核级定制,ego (lite) 能生成最高质量的页面 Snapshot,也就是文本模型用来“看见”并操作网页的视图。即使面对深度嵌套的 iframe 等其他方案经常失效的困难场景,它也能可靠处理。
  • 任何 Agent 都可以推动它通过 ego-browser. ego-browser 是任意 Agent 产品(Claude Code、Codex、Cursor 或自定义 Agent)与 ego (lite) 之间的连接层。它把浏览器能力封装为一组页面内 JavaScript 工具:snapshot、fill、click、wait、navigate 和 capture。 Agent 编写一段 JavaScript 来调用这些工具,ego-browser 再在页面中一次性执行。
  • 经验积累会让你的 Agent 越用越快(即将推出)。 Agent 执行浏览器任务时,大部分时间都耗在反复试错上。ego (lite) 官方 Skill 会把每次成功操作提炼成可复用的工具和工作流,让后续类似任务最多提速 5 倍。下文会进一步介绍。

我们为什么打造 ego (lite)

我们对“GUI 正在消亡”这个问题有自己的看法。 GUI 将会继续存在。从根本上改变的是提供它的人。如今,每个平台都有自己的预构建界面。明天,您的私人 Agent 会即时为您生成一份。

这就是未来。今天的现实是,Agent 已经必须做很多实际工作,而世界还不是为他们而建的。许多服务仍然不提供 API 和 MCP。信息和功能保持锁定在 GUI 内,为人类用户打包。如果您尝试过使用 Codex 或 Claude Code 进行研究,或完成依赖于 SaaS 工具的工作,您就会知道这意味着什么。 Agent 仍然需要打开浏览器并与这个旧世界对话。

因此,越来越多的 Agent 产品正在将浏览器固定在自己身上。有些在客户端中嵌入了精简的浏览器。其他人提供了一个桥接到您现有的Chrome的扩展。它们都工作得不够好。 Chrome-桥接方法不稳定:登录会话有时会延续,而其他会话则不会,标签页无缘无故地弹出到新的windows,有头模式和无头模式会失控。嵌入式方法不是真正的浏览器,它在任何复杂的事情上都会崩溃。

所有这些都达不到要求,还有一个更深层次的原因。 浏览器从来就不是为 Agent 设计的。 Chrome、标签页、windows、导航、权限中的每个交互细节都是围绕人类用户构建的。没有人问自主 Agent 将如何使用它。桥接工具和嵌入式工具都是系统上的补丁,永远不会为 Agent 留下空间。问题是自然结果。

问题的另一半:这些工具都没有认真思考 Agent 的浏览器实际上应该是什么。他们过度包装浏览器并向 Agent 提供一些 CLI 命令,低估了 Agent 可以自行编排的内容。或者他们以另一种方式摇摆,暴露原始协议,并将所有原始噪声转储到模型上。

这就是我们打造 ego (lite) 的原因。我们希望从根本上重新思考浏览器,让它成为你、 Agent 与网络之间最顺畅的连接。

我们如何构建 ego (lite)

在编写任何代码之前,我们必须解决一个问题:Agent 应该如何与浏览器交互?

我们的答案是三层。

第一层是愿景和行动。 Agent 以人类的方式“查看”页面,然后单击、键入、滚动。这是任何浏览器都应该给 Agent 的基线。

第二层是包装方法调用。我们采用了经常出现的操作(Snapshot是规范的操作),并为它们提供了清晰的抽象。我们故意退缩。没有堆积一百种方法。目标是保持抽象清晰,而不是详尽无遗。

第三层是直接访问浏览器底层功能。当 Agent 真正需要原始控制时,它就在那里。

三层的要点是 Agent 选择适合任务的层。简单的点击不需要原始协议调用。复杂的流程不会被压缩到单个 CLI 命令中。

为什么是 JavaScript,而不是 Python 或 Shell

基于 CLI 的代码是架构选择。其中,为什么是 JavaScript 而不是 Python 或 Shell?有两个原因推动了它。

首先是认知负担。ego (lite) 注入页面的内容本身就是 JavaScript。如果后台编排代码使用另一种语言,Agent 每次执行任务都要在两套语法之间切换,徒增不必要的阻力。整个任务统一使用一种语言,Agent 就只需以一种模式思考。

其次是环境稳定性。我们不能假设每位用户都安装了 Python,也不能假设他们的 Shell 与我们的行为一致。因此,我们不依赖用户环境,而是随产品提供运行时。我们复用浏览器内置的 V8 引擎,精简 Node.js 的其余部分,并在 ego (lite) 中内置完整的 Node 运行时,安装包只增加 6 MB。

ego (lite) 有多快?

ego (lite) is the fastest browser for AI agents to run web automation according to our published benchmark. The speed comes from optimizing the entire system for AI-driven browser work.

Speed does not come from a single feature. The ego-browser skill and the ego (lite) browser are designed and tuned together, with focused optimizations across the entire stack.

  • How agents observe and understand pages
  • How browser actions are grouped and executed
  • How navigation and page readiness are detected
  • How slow pages, iframes, dynamic content, and embedded applications are handled
  • How Snapshots are generated and delivered
  • How retries, waits, timeouts, and failures are managed
  • How multiple tasks run concurrently in separate Spaces
  • How much context and how many tokens each task consumes

When we find browser-engine behavior that causes unnecessary waiting, incomplete page state, false timeouts, or redundant agent work, we fix it at the correct layer, including the Chromium runtime itself when necessary. We also upstream improvements where appropriate.

For example, we fixed Chromium snapshot timing for slow-loading iframes so the agent waits for a usable frame instead of receiving an incomplete tree. We also tune navigation waits to the task: a search workflow can continue after the page structure is ready, while a screenshot waits for the resources it actually needs.

The ego-browser skill is optimized in the same way. Compact semantic Snapshots, stable element references, task-aware waiting strategies, and multi-action JavaScript execution help the agent spend less time coordinating with the browser and more time completing the task.

Each improvement is small on its own. Together, they reduce unnecessary waits, retries, false timeouts, model turns, and tokens. The result is a faster, cheaper, smoother, and more predictable workflow.

我们在四项复杂浏览器自动化任务中,对比测试了 ego (lite) 与 Vercel 的 agent-browser。ego (lite) 完成每项任务的速度最多快 3.45 倍,同时显著减少了 Token 消耗。

基准图表比较了 ego (lite) 和 Vercel 的agent-browser在四个现实浏览器自动化任务上的情况:抓取 X 帖子、申请 LinkedIn 工作、估计 Redfin 抵押贷款以及预订 Expedia 航班。 ego (lite) 在每项任务上运行得更快、更便宜,而agent-browser在 Expedia 航班预订上被机器人检测阻止。

任务越艰巨,差距就越大。

两个设计决策产生了影响。首先是上面的三层JavaScript交互。 Agent 编写一个代码片段,在一次传递中运行多个操作,而不是一次链接一个 CLI 调用。其次,在我们的自定义 Chromium 引擎中构建的内核级Snapshot,它涉及跨源 iframe、shadow DOM 和 JavaScript-shim Snapshot程序默默删除的第三方 SDK 小部件。

使用得越多,速度就越快(即将推出)

我们正在 ego (lite) 官方 Skill 中测试一种经验积累机制。每个成功任务都会按网站域名提炼成可复用的工具和工作流。下次 Agent 执行类似任务时,可以直接加载这些工具,跳过反复试错。

理想的版本是 Agent 在运行任务时捕获经验。我们首先尝试过。评估结果让我们退缩了。当要求模型在同一运行中同时优化任务本身和经验捕获时,任务成功率会下降并且执行速度会减慢。试图同时做好两件事就意味着两件事都做不好。

So we split it into two phases.在执行过程中,Agent 专注于任务,不执行任何其他操作。任务完成后,就会进入一个单独的积累阶段,Agent 阅读相关文档并构建工具和课程。这种渐进式披露方法达到了我们所追求的加速效果。对复杂任务的内部测试显示重复运行最多 快 2.6 倍 比第一次运行明显减少 Token 消耗。

用户体验仍然是我们不满意的地方。任务完成后,用户必须等待累积步骤才能得出最终结果,而且这种等待并不顺利。我们正在考虑的一个方向就是把积累放到用户手里。让用户决定是否在任务结束后触发体验捕获。无需强制等待,用户可以更好地控制其 Agent 的增长方式。

我们仍在对其进行完善,一旦达到标准,我们将广泛发布。

ego (lite) 在我们产品体系中的定位很简单:一款你和 Agent 都能使用的浏览器,仅此而已。

ego (lite) 与现有工具有什么区别?

功能ego (lite)Browser Useagent-browser (Vercel)ChatGPT AtlasPerplexity Comet
多任务
可重复使用的技能
继承Chrome的数据
同一个浏览器,独立工作区
压缩语义输入
由外部 Agent 控制
数据存储在本地
无登录摩擦
日常使用的浏览器
免费

为什么我们被称为“ego”

现代文化严重倾向于“低自我”。我们明白了意图。太多的自我确实会伤害别人。但趋势已经偏离了重点。它已成为一种将自我压抑包装为美德的言辞,并将人们磨成更大机器中的齿轮。

随着人工智能承担越来越多的工作,我们的想法却恰恰相反。现在是重新审视“自我”价值的时刻。工具越强大,其背后的人类判断、个性和独立思考就变得越有价值。它们不应该被稀释。它们应该被放大。

真正的危险不是计算机将开始像人一样思考,而是人将开始像计算机一样思考。

所以我们称之为 ego。不是呼吁自私。打赌你的直觉、你的身份和你自己的判断首先值得保护。

ego (lite) 中的“lite”意味着它并不是 ego 的全部。完整版 ego 还包括个人 Agent 、云端沙盒环境、浏览器之外的系统级能力以及记忆系统。我们将两者作为独立产品发布。

尝试一下

目前,ego (lite) 在 macOS 上免费提供,Windows 和 Linux 版本已列入路线图。所有浏览器操作都由你自己的 Agent 驱动,而不是由我们的服务器执行,因此 ego (lite) 可以继续对个人用户免费。

入职会询问您一个问题(是否迁移您的 Chrome 数据)并处理其余问题。

如果你一直为如何让 AI Agent 接入真实浏览器而苦恼,不妨试试 ego (lite),它不会让你失望。

最后请记住:ego (lite) 让 Agent 获得真正操作浏览器的能力,既能读取网页内容,也能执行实际操作。因此,请确保获准驱动它的 Agent 来自可信来源。