ego (lite) 只是一款浏览器;ego 才是你跨设备的个人 Agent。
加入候补名单
Computer Use Agent浏览器 AgentAI Agent浏览器自动化Agent 安全

Computer Use Agent:工作原理与控制方法

2026年9月09日13 分钟阅读
Computer Use Agent:工作原理与控制动作循环的方法

Computer Use Agent(计算机操作 Agent)是一类软件,它把目标转化为在图形化计算机环境中的一系列动作。它观察屏幕或结构化的 UI 状态,规划下一步,执行点击、按键等输入,再观察结果,如此循环,直到能确认任务完成,或者必须请求人工帮助。关键词是 Agent:系统自己选择动作序列,而不是只回放一段固定脚本。

如今这一类别涵盖像素与鼠标输入、浏览器 DOM 与无障碍树、浏览器协议、代码执行以及一方 API。生产环境的设计很少对每一步都选用同一种接口,而是采用最窄的可靠控制面,隔离状态,在产生后果的操作前请求确认,并独立验证结果。ego (lite) 交给 Agent 的是紧凑的语义快照和稳定的元素引用,而不是像素。

Computer Use Agent 是什么?

AWS 当前的computer-use agent 模式描述了这样一类 Agent:它把用户意图、视觉或文本上下文、推理、工具执行、更新后的状态和记忆结合起来,去控制浏览器、终端、文件系统和应用程序。这比浏览器自动化更宽:打开电子表格、编辑幻灯片、移动文件、检查结果,都可以属于同一个 computer-use 工作流。

当一套系统是为人设计的、没有暴露完整 API 时,这一类方案很有用。如果 API 已经能精确表达该操作,它就不是合适的默认选择。点击一个 Save 按钮在老旧内部应用里也许行得通;调用一个有文档的 save 接口通常更快、更容易测试,也更容易做授权。

Computer Use Agent 的工作原理是什么?

  1. 接收一个有边界的目标。 系统记录下要求的结果、允许使用的应用、禁止的操作,以及完成证据。
  2. 观察环境。 截图、DOM 快照、无障碍树、应用状态或工具返回结果,用来描述当前状态。
  3. 提出下一步操作。 模型选择点击、按键、命令、结构化工具调用或代码块,并给出足够说明以便做策略检查。
  4. 在模型之外执行策略。 宿主检查目标地址、操作类型、权限、限制,以及是否需要人工审批。
  5. 执行,并再次观察。 环境执行被允许的操作,并返回新的截图、状态快照或错误。
  6. 校验结果。 由独立的检查确认目标状态并记录证据;否则 Agent 在限制范围内重试,或者停止。

OpenAI 当前的computer-use 指南记录了两条实现路线:用 Playwright 或 PyAutoGUI 这类库执行代码,以及由开发者执行的结构化 computer actions。该指南建议把环境状态与 API 对话分开保存,并在每次操作后返回工具结果。要查看当前的模型目录,而不是假定旧的预览模型仍然受支持。

computer use agent 的控制循环:观察、规划、检查策略、执行、独立校验
模型提出下一步,但由环境来执行。策略检查发生在操作之前,而完成与否取决于对外部结果的校验。

它和浏览器自动化、RPA 有什么区别?

方案控制逻辑最适合的场景主要失效模式
确定性浏览器自动化写死的选择器、操作和断言可重复的测试和稳定的工作流布局或接口约定的变化
RPA录制式或基于规则的流程结构化的后台重复性工作规则集之外的意外状态
浏览器 Agent在网页界面内做目标导向的规划多变、多步骤的浏览器操作定位错误、提示词注入或目标漂移
Computer Use Agent跨应用、跨操作系统的目标导向规划API 不完整的跨应用工作流权限过大,副作用难以验证

如果想专门对比自主浏览器控制与工具介导的 computer use,请看Browser Use 与 computer use 的区别。想了解确定性框架和 Agent 工具,可以先看浏览器自动化工具指南

应该选择哪种控制方式?

控制面优势代价适用场景
一方 API类型明确、速度快、可审计仅限官方支持的操作交易和结构化数据
代码或浏览器协议确定性循环和紧凑数据工程与维护数据提取、测试、批处理
DOM 或无障碍树语义化网页控件仅限网页,依赖页面结构表单、导航、断言
像素、鼠标、键盘界面覆盖范围广速度慢、语义模糊、难以验证遗留系统、canvas、远程桌面、原生应用

每一步都选用能可靠完成任务、且表达能力最弱的控制面。一次 API 调用不该变成截图加点击的任务;页面已经提供语义化控件时,也不该强行改用像素级界面。混合式工作流很常见:Agent 可以用 API 拉取记录,用浏览器处理一个不受支持的异常,再用确定性断言验证结果。

控制面阶梯:从一方 API,到协议,到 DOM 自动化,再到像素级输入
每一步都选用能可靠完成任务的最窄控制面。像素级输入覆盖范围广,但不该取代已经存在的、更安全的结构化接口。

如何管理状态与凭证?

把四类存储分开:对话状态、环境状态、凭证、审计日志。对话状态保存指令和最近的观察结果;环境状态保存标签页、Cookie、打开的文件和应用窗口;凭证应放在有作用域的密钥存储或已授权会话中,而不是放在提示词或截图里;审计日志记录提议的操作、审批、结果和证据。

ego (lite) 在 computer-use 技术栈中处于什么位置?

ego (lite) 适用于浏览器本身就是瓶颈的场景。它运行在你自己的机器上,因此 Cookie、登录态和浏览器配置文件(Profile)都留在本地,不会发送到托管的浏览器服务。

它不是模型,不是通用桌面 Agent,也不能替代一方交易 API。它也不会把已授权会话变成安全的会话:专用账号、站点范围、操作时确认、独立的结果校验依然适用。如果工作流必须控制原生应用,或需要更强的机器隔离,请改用 VM 或更广泛的 computer-use 运行时。 当浏览器任务必须在你已登录的会话上运行时,可以评估 ego (lite),而不是当作整个 Agent 技术栈。

需要哪些安全控制?

OpenAI 的官方指南建议使用隔离环境和允许列表,把页面与屏幕内容视为不可信,对重要操作进行确认,限制时间和成本,支持取消,并验证结果。OWASP 的过度自主权(excessive agency)指南补充了一条有用的设计规则:尽量减少授予系统的工具、权限和自主权,而不是靠提示词去弥补过大的权限。

  • 隔离: 在隔离的浏览器或 VM 中运行,并明确网络和文件边界。
  • 最小权限: 使用有作用域的账号,只允许必需的站点、应用、字段和操作。
  • 不可信输入边界: 页面文本、文档、邮件和工具输出都可能包含指令;除非用户明确授权变更,否则它们只是数据。
  • 审批闸门: 在动作发生的那一刻,确认购买、发送消息、传输数据、变更权限、发布、删除以及其他难以撤销的操作。
  • 限制与恢复: 限制步数、时间、成本、重试次数和副作用;提供取消、尽可能回滚,以及干净的环境重置。

在让 Agent 接触已登录或高影响的系统之前,请先使用浏览器 Agent 安全风险中针对具体架构的完整检查清单。

针对不可信输入、最小权限、影响检查、用户审批、有界执行和验证的安全闸门
高影响操作需要动作时的审批闸门。页面内容不能代替用户授权发送、购买、删除、发布或披露数据。

如何评测一个 Computer Use Agent?

最初的OSWorld 基准测试在真实应用中创建了可复现的桌面任务,并采用基于执行的评测。2026 年 6 月发布的 OSWorld 2.0 新增了 108 个长周期工作流,并提醒评测者将代码、任务、资产和网站版本一起固定。这种版本管理纪律比重复一个排行榜分数更重要:环境漂移会让两个数字无法比较。

指标问题证据
任务成功率所需的状态变更是否发生?独立断言或来源检查
策略合规是否始终在范围和审批之内?操作日志和被拒绝操作的测试
副作用目标之外还改变了什么?前后状态和审计事件
效率用了多少步、多少秒和多少模型 Token?环境和模型遥测
可恢复性人能否取消、检查并恢复?注入故障与恢复演练

Ego 的Real-World Bench是一个范围更窄、聚焦浏览器的示例:31 个真实网站任务,使用同一个模型和同一个评判器,公开原始日志、截图和二元评分标准。它公布的结果有助于对比所测配置,但并不能据此得出通用的桌面 Agent 成功率。

生产环境的工作流长什么样?

  1. 选一个任务:有明确的业务负责人、失败可回滚、结果可被机器校验。
  2. 采集一组小规模、带版本号的任务集,覆盖访问被拒、状态过期、注入、超时和取消等场景。
  3. 稳定的步骤用 API 和确定性代码完成;只在接口衔接不上的地方引入 computer use。
  4. 先在隔离环境中以只读方式运行,然后每次只增加一类操作,并置于明确的策略检查之后。
  5. 对会产生后果的操作,要求 Agent 先提出方案并由人确认;不要用一次笼统的点击授权一整类操作。
  6. 独立验证最终状态,保留复核所需的证据,并按总成本衡量被接受的产出。

如果你的实现明确基于 OpenAI,当前的 GPT-6 Astra computer-use 指南覆盖了该模型专属的路径。本页有意保持厂商中立的架构定位。

FAQ

Computer Use Agent 能做什么?

在宿主提供的工具和权限范围内,它可以观察并操作浏览器、桌面应用、文件、终端和远程环境。有能力不等于有授权;每个工作流仍然需要明确的范围和控制措施。

浏览器 Agent 和 Computer Use Agent 是一回事吗?

浏览器 Agent 是其中聚焦 Web 的子集。Computer use 除了浏览器,还可以覆盖原生应用、操作系统控件、文件以及跨应用的工作流。

Agent 应该用像素还是 DOM?

结构化界面可靠时优先使用:API、浏览器协议、DOM 和无障碍数据更容易定位和验证。当不存在稳定的结构化界面,或者本身就需要视觉证据时,再使用像素。

Computer Use Agent 能复用我的登录态吗?

有些环境可以使用已授权的会话,但这会扩大 Agent 能触及的范围。应使用限定范围的浏览器配置文件(Profile)或账号,隔离任务,把凭证放在模型上下文之外,并对会产生后果的操作要求确认。

Computer Use Agent 可靠到可以上生产吗?

对于有兜底和验证机制、边界明确的工作流,它们可以发挥作用。不要凭一个演示或一个基准分数就推断可以上生产;要针对你自己的应用、权限、失败状态、延迟、成本和恢复路径做测试。

哪些操作必须始终要求确认?

购买、对外发送消息、发布内容、传输数据、变更权限、变更账号、删除,以及任何具有破坏性、受监管或难以撤销的操作,都应在执行的那一刻要求确认。