ego (lite) 只是一款浏览器;ego 才是你跨设备的个人 Agent。
加入候补名单
CodexComputer Useego (lite)浏览器自动化

Codex Computer Use 对比 ego (lite):浏览器实测基准

2026年9月11日12 分钟阅读
Codex 与 ego (lite) 图标位于蓝色海洋上方,配有基准秒表和测试清单

我们在 2026 年 9 月 11 日让 Codex Computer Use 和 ego (lite) 跑完五个浏览器任务。两者都完成了每一次计时运行。ego (lite) 在每个用例中都取得了更低的中位机械执行时间,并把工作保留在专用的本地浏览器 Space 内。

本次对比每条路径各运行 15 次,共 30 次。ego (lite) 使用浏览器级语义;Codex 通过 macOS 辅助功能和截图来观察并控制原生 Chrome。这一区别有助于解释耗时差距,但结果仅适用于这套浏览器测试集。我们没有测量每个任务的模型成本或额度成本。

什么时候 ego (lite) 更适合浏览器自动化?

ego (lite) 是一款面向人和 AI Agent 的完整本地 Chromium 浏览器;按产品类别来说,它是一款 Agent 浏览器。当任务留在浏览器内,并且受益于用户提供的状态或专用的可见 Space 时,它更合适。在这套受控的五用例测试集中,这条浏览器专用路径记录的中位执行时间低于原生 Codex Computer Use 路径;该结果并非通用的速度或可靠性排名。

当工作流必须离开浏览器并操作桌面软件时,Codex Computer Use 仍然有用。那是不同的产品需求。对于常规表单填写、提取、已登录导航或可重复的浏览器工作流,其通用桌面控制路径可能带来浏览器专用工具不需要的观察开销。

我们是如何运行这次基准测试的?

我们使用的是一台 Apple 芯片的 Mac,运行 macOS 26.5.1、ChatGPT/Codex app 26.903.61454,以及 ego 0.5.1.2 搭配 Chromium 152.0.7977.54。测试目标是 The Internet,一个公开的浏览器自动化测试站点。每个用例运行三次,每一次派发的操作都必须以可验证的页面状态变化收尾。

对于 Codex Computer Use,我们创建了相互隔离的原生 Chrome 进程,并使用 macOS 辅助功能树(accessibility tree)加窗口截图来进行观察和控制。对于 ego (lite),我们使用一个专用 Space,配合语义化浏览器定位器和快照。计时从目标页面加载完成后开始,涵盖观察、操作、等待和最终验证。计时不包含初始导航和模型推理,因此这些是观察到的端到端控制路径耗时,而不是从提示到回答的延迟,也不是浏览器引擎的原始速度。

我们测试了哪些浏览器自动化用例?

这套测试有意把直接的 DOM 操作与有状态、异步行为结合在一起。它的规模小到可以复现,覆盖面又足以暴露不止一次顺利路径上的点击。

用例任务通过条件
表单登录填入公开的测试凭据并提交。安全 URL 和成功提示同时出现。
动态控件移除一个复选框,启用一个延迟输入框,并输入 benchmark-ready。复选框消失,且已启用的输入框中包含该值。
添加/移除添加三个 Delete 按钮,然后移除两个。恰好剩下一个 Delete 按钮。
表格提取返回欠款金额最高的人。Jason Doe, jdoe@hotmail.com, $100.00。
会话重载重新加载一个已认证的安全页面。重新加载后会话仍保持已认证状态。

30 次基准运行结果说明了什么?

两条路径都通过了全部 15 次计时运行。在全部五个用例中,ego (lite) 记录到的中位机械执行时间都更低。绝对中位差最大的是重复添加/移除操作:ego (lite) 为 1.806 秒,原生 Computer Use 为 15.346 秒。在这套设置中,原生路径在状态变化前后包含了辅助功能观察和验证。

用例ego (lite)Codex Computer Use
表单登录3/3 passed · 1.076 s median3/3 passed · 9.685 s median
动态控件3/3 passed · 7.431 s median3/3 passed · 13.012 s median
添加/移除3/3 passed · 1.806 s median3/3 passed · 15.346 s median
表格提取3/3 passed · 9 ms median3/3 passed · 284 ms median
会话重载3/3 passed · 450 ms median3/3 passed · 2.358 s median

所有单次计时、环境细节、通过断言和被排除的试运行都可以在基准数据文件

ego (lite) 完成同一项动态控件基准测试后的状态
ego (lite) 在其专属浏览器 Space 内到达了经过验证的动态控件最终状态。浏览器原生语义直接产出了值、启用状态和异步完成消息,无需走桌面无障碍循环。
Codex Computer Use 完成动态控件基准测试后的原生 Chrome
Codex Computer Use 通过原生 Chrome 窗口,借助操作系统层面的观察与验证到达了相同的最终状态。该路径在本例中录得更高的中位数。截图于 2026 年 9 月 11 日;这是真实的最终状态产物。

定价证据说明了什么?

成本分为两层。ego (lite) 浏览器可免费下载,其面向 Agent 的 harness 和 skill 采用 MIT 许可。外部 Agent 是另一回事:Codex、Claude Code 或其他模型可能仍需订阅或按 API 用量付费。由于我们没有为每次运行记录额度消耗,这项测试只能说明耗时差异,不能证明固定节省了多少费用。

截至 2026 年 9 月 11 日,OpenAI 的Pro 套餐文档列出 Pro $100 的用量额度是 Plus 的五倍,Pro $200 是 Plus 的二十倍。OpenAI 在 9 月 10 日暂时停止了新的 Pro $200 购买,已有订阅不受影响。这些是更大的额度,而不是无限量的 Computer Use。OpenAI 还说明,Work 和 Codex 共用一个 Agent 额度,其消耗量因任务、上下文、推理、速度、模型和工具而异。符合条件的账户在包含的用量用尽后,可以使用购买的额度。这些文档表明 Computer Use 会占用付费套餐的容量,但并没有给出单次浏览器操作的价格。

OpenAI 当前的Business 与 Enterprise/Edu 费率卡估算一次典型的 GPT-5.6 Sol Codex 任务需要 5 到 30 credits,Astra Fast 的收费是 Standard 的 2.5 倍,并给出 Codex 的平均使用成本为每位开发者每月 100 到 200 美元。实际用量差异很大。这些企业级估算无法为个人套餐下的一次浏览器点击定价,那需要匹配的模型和 credit 记录。

ego (lite) 的开放 harness 如何扩展浏览器层?

ego (lite) 的控制层可以独立于某一家模型厂商演进。2026 年 9 月 11 日的 GitHub API 快照显示 15,691 个 star、820 个 fork 和 10 位贡献者。公开仓库以 MIT 许可公开了 harness、Agent skill、issue、pull request 和 Discussions。浏览器应用是单独的免费下载,因此不应把整个产品描述为开源。

已有第三方项目在扩展这一控制层。dsh-ego-browser把 ego-browser 和可复用的站点记忆带到另一个 Agent harness;ego-to-skill把录制的交互转化为可复用的自动化 skill。公开的ego Discord在调研时,该邀请页面显示约有 522 名成员、66 人在线。这些数字会变化,它们只是某个时间点的快照,反映仓库之外的支持与技能分享情况。

ego (lite) 与 Codex Computer Use 有何不同?

ego (lite) 是一个完整的本地 Chromium Agent 浏览器,而不是通用的鼠标加屏幕操作器。兼容的 Agent 通过 ego-browser 控制它,并在一个专用的本地 Space 中工作,具备浏览器原生语义、用户自行提供的状态,以及可见的接管控制。Codex Computer Use 观察的是操作系统,因此它可以离开 Chrome 继续进入桌面应用;这种更广的覆盖面在浏览器之外很有价值,但在本次仅针对浏览器的测试中增加了观察开销。

维度ego (lite)Codex Computer Use
主要操作面专用的本地 Chromium 浏览器 SpacemacOS 或 Windows 图形应用,包括浏览器
观察方式浏览器快照、语义定位器和页面级状态截图和操作系统辅助功能状态
浏览器状态存在于所选的 ego (lite) Space 和用户导入的浏览器状态中取决于所选应用、内置 Browser 或扩展程序路径
人工交接Space 在浏览器 UI 中提供 Agent 控制、Take over 和 Stop由应用权限和审批控制
增量工具成本免费下载浏览器,harness 采用 MIT 许可;外部模型用量仍需另行计费所选 ChatGPT 或 API 套餐包含的额度或购买的额度
生态模式面向多个兼容 Agent harness 的浏览器层,带有公开的 skills、issues、fork 和第三方集成与 OpenAI 的模型、套餐和权限绑定的第一方 Codex 能力
最适合需要本地会话连续性和接管能力的可重复浏览器工作离开浏览器或依赖仅桌面端 UI 的任务

在一次原生 Chrome 运行中,基准测试已经到达成功登录状态后,浏览器显示了一条密码泄露警告。要继续在该窗口中操作,必须先关闭这条警告。这是特定环境下的浏览器中断,并不能证明 Codex 可靠性更低,也不能证明 ego (lite) 能避开所有浏览器警告,因此它被排除在计时通过/失败结果之外,仅作为一项操作观察记录报告。

为什么 Codex Browser 路径与 ego (lite) 不是同一款产品?

ego (lite) 产品为用户和兼容的 AI Agent 提供一个完整的本地 Chromium 浏览器。它把浏览器执行、显式提供或导入的浏览器状态、并行任务 Space,以及可见的暂停和接管控制整合在一起。OpenAI 则把类似需求分散到三条路径:内置 Browser 使用与个人常规浏览器不同的配置文件(Profile),扩展程序连接现有的受支持浏览器标签页,Computer Use 提供更广的 GUI 控制。某一项功能对得上,并不代表产品等价;每条路径仍有各自的权限、会话模型和操作边界。

OpenAI Browser 文档,说明独立配置文件(Profile)和浏览器扩展程序
OpenAI 当前的 Browser 文档把内置配置文件(Profile)与扩展程序路径区分开来。ego (lite) 则把浏览器执行、用户提供的状态、并行 Space 和接管整合在一个一致的产品中,而不是分散到多条路径。2026 年 9 月 11 日用 ego-browser 截取。

当前官方的安装配置与权限说明见 OpenAI 的Computer Use 文档Browser 文档。可复现的测试目标仍可在The Internet

这次基准测试有哪些限制?

观察到的耗时差异只适用于这套纯浏览器测试集,不代表所有交互界面。五个确定性用例、每个用例跑三次,无法代表开放网络。我们没有测试验证码(CAPTCHA)、多因素认证、结账、上传、反爬系统、纯 canvas 界面、跨应用工作流、移动端模拟,也没有测试持续数小时的任务。我们同样没有比较模型规划能力,因为任务脚本和通过条件都是事先固定的。留存的记录也无法确认冷启动、缓存或进程重置条件是否完全一致。

数据能说明的范围更窄:两条路径都完成了每一次计时运行,ego (lite) 在这五个用例中记录到的中位数更低。它的路径不包含原生 Codex 路径所用的操作系统辅助功能观察,而它专用的 Space 把会话状态和人工接管都留在浏览器工作流内。Codex Computer Use 覆盖的范围更广,当任务既需要桌面应用又需要浏览器时,它可能更合适。

FAQ

在这次测试中,Codex Computer Use 真的控制了 Chrome 吗?

是的。Codex 的主要基准测试使用的是隔离的原生 Google Chrome 进程,通过 macOS 辅助功能和截图进行控制。内置 Browser 是单独检查的,并没有用它替代原生 Computer Use 的结果。

测试在速度和可靠性上说明了什么?

两条路径都通过了 15/15 次计时运行,而 ego (lite) 在全部五个用例中都取得了更低的中位数。样本量太小且受控程度高,无法据此断定生产网站上的可靠性,也无法给出通用的速度排名。

这次基准测试能证明 ego (lite) 成本更低吗?

不能。ego (lite) 浏览器免费,其 harness 采用 MIT 许可,但控制它的模型仍可能产生费用。我们没有记录可对应的额度或 API 用量,因此这次测试支持的是耗时对比,而不是固定的省钱结论。

什么时候该选 Codex Computer Use,什么时候该选 ego (lite)?

当工作流依赖桌面软件、系统设置或浏览器之外的界面时,选 Codex。以浏览器为中心的工作,如果能受益于专用的本地 Space、用户自行提供的状态、浏览器原生自动化和即时接管,就选 ego (lite)。