ego (lite) 只是一個瀏覽器,ego 則是你跨裝置的個人 Agent。
加入候補名單
瀏覽器自動化AI Agent 瀏覽器多工處理Chromiumagent-browser 替代方案

AI Agent 跑網頁自動化最快的瀏覽器

2026年5月21日8 最小閱讀量
一隻機械手指著復古經典 Macintosh 電腦螢幕,畫面顯示 ego (lite) 的平行瀏覽器介面與多張工作區卡片

ego (lite) 是一款讓你和你的 AI Agent 平行工作的瀏覽器。你的 Agent 在自己的 Space 中執行多項瀏覽器任務,你的分頁完全不受干擾,任務完成得更快、Token 消耗也更少。

過去一年,我們很多人都在嘗試讓 AI Agent( Claude Code, Codex、Continue)在真實瀏覽器中做真正的瀏覽器自動化。從已登入的管理後台拉出一份清單、填寫廠商表單、在測試環境跑 QA。這些工具都存在,但實際動手做起來的體驗還是很粗糙。

ego (lite) 是我們解決這個問題的嘗試。

什麼是 ego (lite)

ego (lite) 深植於 Chrome 生態系內部。跟 Chrome 用同一顆引擎,你的書籤、擴充功能和登入狀態全部完整帶過來。你不用改變瀏覽習慣,開箱即用。

真正讓它與眾不同的,是它對 Agent 的原生支援:

  • 以程式碼為基礎,而非以 CLI 指令為基礎,複雜任務執行更快、Token 消耗更少。 ego (lite) 提供給 Agent 的能力,都包裝成 Agent 能直接呼叫的 JavaScript 函式。Agent 得以發揮它最擅長的事:寫程式碼,把多步驟任務組合成單一輸出,而不是卡在「呼叫兩個指令、看結果、再呼叫兩個指令」的迴圈裡。跟傳統 CLI 做法相比,複雜工作流程完成速度快 20–50%,任務成功率更高,每項任務的工具呼叫次數也大幅減少。同樣的模式,在對比 Vercel 的 agent-browser 的內部效能實測中也出現了:工作流程越困難,差距就越大。
  • 每個 Agent 都有專屬的 Space。 ego (lite) 讓每個 Agent 都擁有自己完全獨立的 Space。你在前台瀏覽,你的 Agent 在背景工作,兩者互不干擾。你隨時能看到哪個 Space 有 Agent 在執行,也能隨時接手或停止它。如果你用過橋接到 Chrome 的 agent-browser 工具,你就知道視窗和分頁到處亂跳的混亂場面。ego (lite) 從根本解決了這個問題。
  • 你的 Agent 在 Space 中多工處理,那是同一個瀏覽器裡的平行工作區。 每個 Space 都有自己的 AI Agent 或自己的任務,全部同時執行。Claude Code 在 10 個平行的 Space 中充實 10 筆名單資料,Codex 在另外 5 個 Space 中爬取 5 個競品網站。它們不會互相衝突,也不會搶走你的分頁,你的滑鼠留在你原本放的地方。
  • 市面上最強的頁面 Snapshot。 多虧了核心層級的客製化,ego (lite) 產生市面上品質最高的頁面 Snapshot,這是模型用來「看見」並操作網頁所依賴的視圖文字。它能穩定處理深層巢狀 iframe 這類棘手情境,正是其他做法一貫失手的地方。
  • 任何 Agent 都能透過 ego-browser. ego-browser 是任何 Agent 產品(Claude Code、Codex、Cursor 或自訂 Agent)與 ego (lite) 之間的連接層。它把瀏覽器包裝成一組頁面內 JavaScript 工具:snapshot、fill、click、wait、navigate、capture。Agent 寫一段呼叫這些工具的 JavaScript 程式碼,ego-browser 就在頁面上一次執行完畢。
  • 經驗累積機制,讓你越常用,Agent 跑得越快(即將推出)。 Agent 執行瀏覽器任務時,大部分時間都花在試錯上。ego (lite) 的官方 Skill,會把每個成功的操作都提煉成可重複使用的工具和工作流程,之後類似的任務最快能快 5 倍。更多細節在下面說明。

我們為什麼打造 ego (lite)

對於「GUI 是不是要死了」這個問題,我們有自己的看法。GUI 會繼續存在,真正會從根本改變的是由誰提供它。今天每個平台都自己打包好一套現成介面;明天你的個人 Agent 會即時為你生成介面。

那是未來的事。現實是,Agent 現在就得做很多真正的工作,而這個世界還沒替它們準備好。很多服務至今沒有 API,也沒有 MCP,資訊和功能都鎖在 GUI 裡,是為人類使用者打包的。如果你試過用 Codex 或 Claude Code 做研究,或推進依賴 SaaS 工具的工作,你就知道這代表什麼——Agent 還是得打開瀏覽器,跟這個舊世界對話。

所以越來越多 Agent 產品開始把瀏覽器硬掛在自己身上。有些內嵌一個閹割版瀏覽器,有些則靠擴充功能橋接到你原本的 Chrome。沒有一個做得夠好。Chrome 橋接法很不穩定:登入狀態有時候帶得過去、有時候帶不過去,分頁莫名其妙跳出新視窗,有畫面和無頭模式亂切換失控。內嵌法根本不是真正的瀏覽器,一遇到複雜情況就整個崩潰。

這些方法之所以都不夠好,有更深層的原因。 瀏覽器從一開始就不是為 Agent 設計的。 Chrome 裡每一項互動細節——分頁、視窗、導航、權限——都是圍繞人類使用者打造的,從來沒人問過自主 Agent 該怎麼跟它互動。橋接工具和內嵌工具都只是在一個從一開始就沒替 Agent 留餘地的系統上打補丁,各種問題自然就是必然的結果。

問題的另一半在於:這些工具沒有一個認真思考過,給 Agent 用的瀏覽器到底該是什麼樣子。它們要嘛把瀏覽器包裝得太過頭,只丟給 Agent 幾個 CLI 指令,低估了 Agent 自己統籌調度的能力;要嘛走另一個極端,直接暴露底層協定,把所有原始雜訊一股腦丟給模型。

這正是我們打造 ego (lite) 的原因。我們想從頭重新思考瀏覽器該是什麼樣子,讓它成為你、你的 Agent 和網路之間最順暢的接口。

我們怎麼打造 ego (lite)

在寫任何程式碼之前,我們得先解決一個問題:Agent 該怎麼跟瀏覽器互動?

我們的答案分成三層。

第一層是視覺與動作。Agent 用跟人類一樣的方式「看」頁面,然後點擊、輸入、捲動。這是任何瀏覽器都該提供給 Agent 的基本能力。

第二層是包裝過的方法呼叫。我們挑出最常用到的操作,Snapshot 就是最典型的例子,為它們設計了乾淨的抽象介面。我們刻意克制,沒有堆一百個方法上去,目標是讓抽象保持精準,而不是求全求多。

第三層是直接存取瀏覽器底層能力。當 Agent 真的需要底層控制權時,這一層就在那裡等著它。

這三層架構的重點在於,Agent 能挑選最適合任務的那一層。簡單的點擊不需要用到底層協定呼叫,複雜的流程也不會被硬塞進單一個 CLI 指令裡。

為什麼是 JavaScript,不是 Python 或 Shell

選擇程式碼而非 CLI 指令,是架構上的決定。那為什麼是 JavaScript,不是 Python 或 Shell?有兩個原因。

第一點是認知負擔。ego (lite) 注入頁面的內容本來就是 JavaScript。如果背景的統籌程式碼用的是另一種語言,Agent 每次執行任務都得在兩種語法情境間切換,這是不必要的摩擦。整個任務統一用一種語言,代表 Agent 只需要用一種思維模式思考。

第二點是環境穩定性。我們不能假設每個使用者都裝了 Python,或有一個跟我們一樣行為的 shell。與其依賴使用者的環境,我們選擇自己帶著執行環境走:重複使用瀏覽器內建的 V8 引擎,精簡掉 Node.js 其餘的部分,把一套完整的 Node 執行環境內建在 ego (lite) 中。安裝檔大小只增加 6MB。

ego (lite) 到底有多快?

我們拿 ego (lite) 對比 Vercel 的 agent-browser,在四項複雜的瀏覽器自動化任務上實測。ego (lite) 每項任務最快能快 3.45 倍,Token 消耗也大幅減少。

效能實測圖表,比較 ego (lite) 和 Vercel 的 agent-browser 在四項真實世界瀏覽器自動化任務上的表現——爬取 X 貼文、投遞 LinkedIn 履歷、估算 Redfin 房貸、訂 Expedia 機票。ego (lite) 在每項任務上都跑得更快、更省錢,而 agent-browser 在 Expedia 訂票任務上則被機器人偵測攔截。

任務越困難,差距就越大。

有兩個設計決策造成了差異。第一是前面提到的三層 JavaScript 互動架構:Agent 寫一段程式碼,一次執行多個動作,而不是一次串接一個 CLI 呼叫。第二是內建在我們自訂 Chromium 引擎中的核心層級 Snapshot,能穿透一般 JS 補丁式 Snapshot 工具會悄悄漏掉的跨網域 iframe、shadow DOM 和第三方 SDK 元件。

用得越多,跑得越快(即將推出)

我們正在 ego (lite) 的官方 Skill 中測試一套經驗累積機制。每個成功完成的任務,都會被提煉成依網域範圍劃分的可重複使用工具和工作流程。下次你的 Agent 執行類似任務時,就會直接載入這些工具,跳過試錯過程。

理想的版本,是讓 Agent 在執行任務的同時就擷取經驗。我們一開始就是這樣試的,但評估結果讓我們打了退堂鼓。當模型被要求在同一次執行中,同時兼顧任務本身和經驗擷取,任務成功率會下降,執行速度也會變慢。想同時把兩件事都做好,結果往往是兩件事都做不好。

所以我們把它拆成兩個階段。執行期間,Agent 專心處理任務,不做別的事。任務完成後,一個獨立的累積階段才會啟動,讓 Agent 讀取相關文件,累積工具和經驗。這種漸進揭露的做法,達到了我們原本想要的提速效果。內部針對複雜任務的測試顯示,重複執行最快能提速到 快 2.6 倍 ,Token 消耗大幅減少。

使用者體驗還是我們不滿意的地方。任務完成後,使用者得等累積步驟跑完才拿得到最終結果,這段等待目前還不夠順暢。我們正在考慮的一個方向,是把累積的主導權交給使用者,讓使用者自己決定任務結束後要不要啟動經驗擷取,不強迫等待,也讓使用者對自己 Agent 的成長方式有更多掌控權。

我們還在持續打磨這個功能,達到標準後就會全面推出。

ego (lite) 在我們產品線中的定位很單純:一款同時為你和你的 Agent 服務的瀏覽器,不多也不少。

ego (lite) 跟現有工具比起來有什麼不同

功能ego (lite)Browser Useagent-browser (Vercel)ChatGPT AtlasPerplexity Comet
多工處理
可重複使用的 Skill
繼承 Chrome 的資料
同一個瀏覽器,各自獨立的工作區
壓縮後的語意輸入
可由外部 Agent 操作
資料存於本機
沒有登入摩擦成本
日常使用的瀏覽器
免費

為什麼我們叫「ego」

現代文化很推崇「低 ego」。我們理解這個出發點,過度的自我確實會傷害到別人。但這股風潮已經走過頭了,變成一種把自我壓抑包裝成美德的說詞,把人磨成一台更龐大機器裡的一顆螺絲釘。

隨著 AI 承擔越來越多工作,我們的看法正好相反。現在正是重新審視「自我」價值的時刻。工具越強大,背後的人類判斷力、個人特質和獨立思考就越珍貴,不該被稀釋,而該被放大。

真正的危險不在於電腦開始像人一樣思考,而在於人開始像電腦一樣思考。

所以我們把它叫做 ego。這不是叫你自私自利,而是打賭:你的直覺、你的個人特質、你自己的判斷力,本來就值得被守護。

ego (lite) 裡的「lite」,意思是這並不是 ego 的全部。ego 還有一個完整版本,具備個人 Agent、雲端沙盒環境、超越瀏覽器範疇的系統層級能力,以及記憶系統。我們把這兩者作為獨立產品推出。

試試看

ego (lite) 目前 macOS 版免費。Windows 和 Linux 已排入路線圖。所有瀏覽器操作都由你自己的 Agent 驅動,不是我們的伺服器。這正是我們能讓 ego (lite) 個人使用永久免費的原因。

導覽設定只會問你一個問題(是否要匯入 Chrome 資料),剩下的都幫你處理好。

如果你曾經為了把 AI Agent 接進真實瀏覽器而傷透腦筋,去試試 ego (lite),不會讓你失望。

最後有一點值得記住:ego (lite) 讓你的 Agent 具備真正操作瀏覽器的能力——既能讀取頁面內容,也能執行實際動作——所以請確保你讓它操作的 Agent 來自你信任的來源。