ego (lite) 只是一個瀏覽器,ego 則是你跨裝置的個人 Agent。
加入候補名單
瀏覽器自動化AI Agent 瀏覽器多工處理Chromiumagent-browser 替代方案

AI Agent 跑網頁自動化最快的瀏覽器

2026年5月21日8 最小閱讀量
一隻機械手指著復古經典 Macintosh 電腦螢幕,畫面顯示 ego (lite) 的平行瀏覽器介面與多張工作區卡片

ego (lite) 是一款讓你和你的 AI Agent 平行工作的瀏覽器。你的 Agent 在自己的 Space 中執行多項瀏覽器任務,你的分頁完全不受干擾,任務完成得更快、Token 消耗也更少。

過去一年,我們很多人都在嘗試讓 AI Agent( Claude Code, Codex、Continue)在真實瀏覽器中做真正的瀏覽器自動化。從已登入的管理後台拉出一份清單、填寫廠商表單、在測試環境跑 QA。這些工具都存在,但實際動手做起來的體驗還是很粗糙。

ego (lite) 是我們解決這個問題的嘗試。

什麼是 ego (lite)

ego (lite) 深植於 Chrome 生態系內部。跟 Chrome 用同一顆引擎,你的書籤、擴充功能和登入狀態全部完整帶過來。你不用改變瀏覽習慣,開箱即用。

真正讓它與眾不同的,是它對 Agent 的原生支援:

  • 以程式碼為基礎,而非以 CLI 指令為基礎,複雜任務執行更快、Token 消耗更少。 ego (lite) 提供給 Agent 的能力,都包裝成 Agent 能直接呼叫的 JavaScript 函式。Agent 得以發揮它最擅長的事:寫程式碼,把多步驟任務組合成單一輸出,而不是卡在「呼叫兩個指令、看結果、再呼叫兩個指令」的迴圈裡。跟傳統 CLI 做法相比,複雜工作流程完成速度快 20–50%,任務成功率更高,每項任務的工具呼叫次數也大幅減少。同樣的模式,在對比 Vercel 的 agent-browser 的內部效能實測中也出現了:工作流程越困難,差距就越大。
  • 每個 Agent 都有專屬的 Space。 ego (lite) 讓每個 Agent 都擁有自己完全獨立的 Space。你在前台瀏覽,你的 Agent 在背景工作,兩者互不干擾。你隨時能看到哪個 Space 有 Agent 在執行,也能隨時接手或停止它。如果你用過橋接到 Chrome 的 agent-browser 工具,你就知道視窗和分頁到處亂跳的混亂場面。ego (lite) 從根本解決了這個問題。
  • 你的 Agent 在 Space 中多工處理,那是同一個瀏覽器裡的平行工作區。 每個 Space 都有自己的 AI Agent 或自己的任務,全部同時執行。Claude Code 在 10 個平行的 Space 中充實 10 筆名單資料,Codex 在另外 5 個 Space 中爬取 5 個競品網站。它們不會互相衝突,也不會搶走你的分頁,你的滑鼠留在你原本放的地方。
  • 市面上最強的頁面 Snapshot。 多虧了核心層級的客製化,ego (lite) 產生市面上品質最高的頁面 Snapshot,這是模型用來「看見」並操作網頁所依賴的視圖文字。它能穩定處理深層巢狀 iframe 這類棘手情境,正是其他做法一貫失手的地方。
  • 任何 Agent 都能透過 ego-browser. ego-browser 是任何 Agent 產品(Claude Code、Codex、Cursor 或自訂 Agent)與 ego (lite) 之間的連接層。它把瀏覽器包裝成一組頁面內 JavaScript 工具:snapshot、fill、click、wait、navigate、capture。Agent 寫一段呼叫這些工具的 JavaScript 程式碼,ego-browser 就在頁面上一次執行完畢。
  • 經驗累積機制,讓你越常用,Agent 跑得越快(即將推出)。 Agent 執行瀏覽器任務時,大部分時間都花在試錯上。ego (lite) 的官方 Skill,會把每個成功的操作都提煉成可重複使用的工具和工作流程,之後類似的任務最快能快 5 倍。更多細節在下面說明。

我們為什麼打造 ego (lite)

對於「GUI 是不是要死了」這個問題,我們有自己的看法。GUI 會繼續存在,真正會從根本改變的是由誰提供它。今天每個平台都自己打包好一套現成介面;明天你的個人 Agent 會即時為你生成介面。

那是未來的事。現實是,Agent 現在就得做很多真正的工作,而這個世界還沒替它們準備好。很多服務至今沒有 API,也沒有 MCP,資訊和功能都鎖在 GUI 裡,是為人類使用者打包的。如果你試過用 Codex 或 Claude Code 做研究,或推進依賴 SaaS 工具的工作,你就知道這代表什麼——Agent 還是得打開瀏覽器,跟這個舊世界對話。

所以越來越多 Agent 產品開始把瀏覽器硬掛在自己身上。有些內嵌一個閹割版瀏覽器,有些則靠擴充功能橋接到你原本的 Chrome。沒有一個做得夠好。Chrome 橋接法很不穩定:登入狀態有時候帶得過去、有時候帶不過去,分頁莫名其妙跳出新視窗,有畫面和無頭模式亂切換失控。內嵌法根本不是真正的瀏覽器,一遇到複雜情況就整個崩潰。

這些方法之所以都不夠好,有更深層的原因。 瀏覽器從一開始就不是為 Agent 設計的。 Chrome 裡每一項互動細節——分頁、視窗、導航、權限——都是圍繞人類使用者打造的,從來沒人問過自主 Agent 該怎麼跟它互動。橋接工具和內嵌工具都只是在一個從一開始就沒替 Agent 留餘地的系統上打補丁,各種問題自然就是必然的結果。

問題的另一半在於:這些工具沒有一個認真思考過,給 Agent 用的瀏覽器到底該是什麼樣子。它們要嘛把瀏覽器包裝得太過頭,只丟給 Agent 幾個 CLI 指令,低估了 Agent 自己統籌調度的能力;要嘛走另一個極端,直接暴露底層協定,把所有原始雜訊一股腦丟給模型。

這正是我們打造 ego (lite) 的原因。我們想從頭重新思考瀏覽器該是什麼樣子,讓它成為你、你的 Agent 和網路之間最順暢的接口。

我們怎麼打造 ego (lite)

在寫任何程式碼之前,我們得先解決一個問題:Agent 該怎麼跟瀏覽器互動?

我們的答案分成三層。

第一層是視覺與動作。Agent 用跟人類一樣的方式「看」頁面,然後點擊、輸入、捲動。這是任何瀏覽器都該提供給 Agent 的基本能力。

第二層是包裝過的方法呼叫。我們挑出最常用到的操作,Snapshot 就是最典型的例子,為它們設計了乾淨的抽象介面。我們刻意克制,沒有堆一百個方法上去,目標是讓抽象保持精準,而不是求全求多。

第三層是直接存取瀏覽器底層能力。當 Agent 真的需要底層控制權時,這一層就在那裡等著它。

這三層架構的重點在於,Agent 能挑選最適合任務的那一層。簡單的點擊不需要用到底層協定呼叫,複雜的流程也不會被硬塞進單一個 CLI 指令裡。

為什麼是 JavaScript,不是 Python 或 Shell

選擇程式碼而非 CLI 指令,是架構上的決定。那為什麼是 JavaScript,不是 Python 或 Shell?有兩個原因。

第一點是認知負擔。ego (lite) 注入頁面的內容本來就是 JavaScript。如果背景的統籌程式碼用的是另一種語言,Agent 每次執行任務都得在兩種語法情境間切換,這是不必要的摩擦。整個任務統一用一種語言,代表 Agent 只需要用一種思維模式思考。

第二點是環境穩定性。我們不能假設每個使用者都裝了 Python,或有一個跟我們一樣行為的 shell。與其依賴使用者的環境,我們選擇自己帶著執行環境走:重複使用瀏覽器內建的 V8 引擎,精簡掉 Node.js 其餘的部分,把一套完整的 Node 執行環境內建在 ego (lite) 中。安裝檔大小只增加 6MB。

ego (lite) 到底有多快?

ego (lite) is the fastest browser for AI agents to run web automation according to our published benchmark. The speed comes from optimizing the entire system for AI-driven browser work.

Speed does not come from a single feature. The ego-browser skill and the ego (lite) browser are designed and tuned together, with focused optimizations across the entire stack.

  • How agents observe and understand pages
  • How browser actions are grouped and executed
  • How navigation and page readiness are detected
  • How slow pages, iframes, dynamic content, and embedded applications are handled
  • How Snapshots are generated and delivered
  • How retries, waits, timeouts, and failures are managed
  • How multiple tasks run concurrently in separate Spaces
  • How much context and how many tokens each task consumes

When we find browser-engine behavior that causes unnecessary waiting, incomplete page state, false timeouts, or redundant agent work, we fix it at the correct layer, including the Chromium runtime itself when necessary. We also upstream improvements where appropriate.

For example, we fixed Chromium snapshot timing for slow-loading iframes so the agent waits for a usable frame instead of receiving an incomplete tree. We also tune navigation waits to the task: a search workflow can continue after the page structure is ready, while a screenshot waits for the resources it actually needs.

The ego-browser skill is optimized in the same way. Compact semantic Snapshots, stable element references, task-aware waiting strategies, and multi-action JavaScript execution help the agent spend less time coordinating with the browser and more time completing the task.

Each improvement is small on its own. Together, they reduce unnecessary waits, retries, false timeouts, model turns, and tokens. The result is a faster, cheaper, smoother, and more predictable workflow.

我們拿 ego (lite) 對比 Vercel 的 agent-browser,在四項複雜的瀏覽器自動化任務上實測。ego (lite) 每項任務最快能快 3.45 倍,Token 消耗也大幅減少。

效能實測圖表,比較 ego (lite) 和 Vercel 的 agent-browser 在四項真實世界瀏覽器自動化任務上的表現——爬取 X 貼文、投遞 LinkedIn 履歷、估算 Redfin 房貸、訂 Expedia 機票。ego (lite) 在每項任務上都跑得更快、更省錢,而 agent-browser 在 Expedia 訂票任務上則被機器人偵測攔截。

任務越困難,差距就越大。

有兩個設計決策造成了差異。第一是前面提到的三層 JavaScript 互動架構:Agent 寫一段程式碼,一次執行多個動作,而不是一次串接一個 CLI 呼叫。第二是內建在我們自訂 Chromium 引擎中的核心層級 Snapshot,能穿透一般 JS 補丁式 Snapshot 工具會悄悄漏掉的跨網域 iframe、shadow DOM 和第三方 SDK 元件。

用得越多,跑得越快(即將推出)

我們正在 ego (lite) 的官方 Skill 中測試一套經驗累積機制。每個成功完成的任務,都會被提煉成依網域範圍劃分的可重複使用工具和工作流程。下次你的 Agent 執行類似任務時,就會直接載入這些工具,跳過試錯過程。

理想的版本,是讓 Agent 在執行任務的同時就擷取經驗。我們一開始就是這樣試的,但評估結果讓我們打了退堂鼓。當模型被要求在同一次執行中,同時兼顧任務本身和經驗擷取,任務成功率會下降,執行速度也會變慢。想同時把兩件事都做好,結果往往是兩件事都做不好。

所以我們把它拆成兩個階段。執行期間,Agent 專心處理任務,不做別的事。任務完成後,一個獨立的累積階段才會啟動,讓 Agent 讀取相關文件,累積工具和經驗。這種漸進揭露的做法,達到了我們原本想要的提速效果。內部針對複雜任務的測試顯示,重複執行最快能提速到 快 2.6 倍 ,Token 消耗大幅減少。

使用者體驗還是我們不滿意的地方。任務完成後,使用者得等累積步驟跑完才拿得到最終結果,這段等待目前還不夠順暢。我們正在考慮的一個方向,是把累積的主導權交給使用者,讓使用者自己決定任務結束後要不要啟動經驗擷取,不強迫等待,也讓使用者對自己 Agent 的成長方式有更多掌控權。

我們還在持續打磨這個功能,達到標準後就會全面推出。

ego (lite) 在我們產品線中的定位很單純:一款同時為你和你的 Agent 服務的瀏覽器,不多也不少。

ego (lite) 跟現有工具比起來有什麼不同

功能ego (lite)Browser Useagent-browser (Vercel)ChatGPT AtlasPerplexity Comet
多工處理
可重複使用的 Skill
繼承 Chrome 的資料
同一個瀏覽器,各自獨立的工作區
壓縮後的語意輸入
可由外部 Agent 操作
資料存於本機
沒有登入摩擦成本
日常使用的瀏覽器
免費

為什麼我們叫「ego」

現代文化很推崇「低 ego」。我們理解這個出發點,過度的自我確實會傷害到別人。但這股風潮已經走過頭了,變成一種把自我壓抑包裝成美德的說詞,把人磨成一台更龐大機器裡的一顆螺絲釘。

隨著 AI 承擔越來越多工作,我們的看法正好相反。現在正是重新審視「自我」價值的時刻。工具越強大,背後的人類判斷力、個人特質和獨立思考就越珍貴,不該被稀釋,而該被放大。

真正的危險不在於電腦開始像人一樣思考,而在於人開始像電腦一樣思考。

所以我們把它叫做 ego。這不是叫你自私自利,而是打賭:你的直覺、你的個人特質、你自己的判斷力,本來就值得被守護。

ego (lite) 裡的「lite」,意思是這並不是 ego 的全部。ego 還有一個完整版本,具備個人 Agent、雲端沙盒環境、超越瀏覽器範疇的系統層級能力,以及記憶系統。我們把這兩者作為獨立產品推出。

試試看

ego (lite) 目前 macOS 版免費。Windows 和 Linux 已排入路線圖。所有瀏覽器操作都由你自己的 Agent 驅動,不是我們的伺服器。這正是我們能讓 ego (lite) 個人使用永久免費的原因。

導覽設定只會問你一個問題(是否要匯入 Chrome 資料),剩下的都幫你處理好。

如果你曾經為了把 AI Agent 接進真實瀏覽器而傷透腦筋,去試試 ego (lite),不會讓你失望。

最後有一點值得記住:ego (lite) 讓你的 Agent 具備真正操作瀏覽器的能力——既能讀取頁面內容,也能執行實際動作——所以請確保你讓它操作的 Agent 來自你信任的來源。