Computer Use 是什么?Agent 如何看懂页面并操作电脑?
🧑💻 面试官:没有现成 API,Agent 还能帮用户操作一个后台系统吗?
🙋♂️ 我:可以用 Computer Use。模型看截图,然后决定点击哪里、输入什么。
🧑💻 面试官:模型说点击“导出”,这个按钮就真的被点了吗?
🙋♂️ 我:还需要应用执行鼠标操作。
🧑💻 面试官:工具返回点击成功,页面也没报错,那是不是可以告诉用户“报表已经导出”了?
这道题要分清:「做了一个动作」和「完成了一个目标」。模型看页面、应用做操作,之后还要检查结果,才能决定下一步。
面试速答(60 秒版)
Computer Use 是让 Agent 通过电脑界面完成任务的一种方式。模型可以读取截图,判断当前页面,并提出点击、输入、滚动等操作;真正操作鼠标和键盘的,仍然是应用中的执行工具。
例如,用户要求导出订单报表,Agent 先查看后台页面,找到日期和导出入口,应用执行操作以后,再把新的页面状态交给模型。
但点击成功,不代表导出成功。还需要检查页面反馈、下载状态和生成的文件,确认任务要求已经满足。
如果任务只涉及网页,而且能读取页面元素,也可以使用浏览器工具定位按钮,不一定只靠截图坐标。涉及付款、删除等操作时,还要限制权限并设置确认步骤,不能因为模型找到了按钮,就允许它直接执行。

知识点详解:从看见按钮,到确认报表导出
模型看见页面以后,谁来操作电脑?
假设用户交给 Agent 一个任务:“在后台导出昨天的订单报表。”
如果系统提供报表 API,应用可以直接调用接口。但有些系统没有可用接口,用户平时就是打开网页、选择日期、点击导出。这时候,Agent 可以通过界面操作完成同样的过程。
模型先接收截图,识别页面上的文字、按钮和布局,再提出动作。例如,在某个位置点击,或者向当前输入框填写日期。
这些动作只是工具请求。应用收到请求以后,才会在受控环境中操作鼠标、键盘或浏览器,并返回结果。Anthropic 的 Computer Use 文档明确把这套能力定义为应用执行的客户端工具。
因此,这里至少有三样东西:用户要完成的目标、模型当前能看到的页面,以及应用可以执行的操作。模型不是凭空“进入电脑”,它能做什么,取决于工具和权限。
为什么操作以后,还要重新看页面?
咱们顺着导出报表的过程往下看。
Agent 看见后台首页,选择“订单管理”。应用点击以后,返回订单页面。模型再找到日期筛选框,设置昨天的日期,执行查询,确认列表已经刷新,然后请求导出。
页面每发生一次重要变化,都可能影响后面的操作。弹窗出现了,按钮位置变了,页面还在加载,之前找到的坐标就不一定还能使用。
所以,不能只靠开始时的一张截图,把后面很多步全部猜好,再一直点击下去。对于需要依赖新页面状态的步骤,应该先执行前一步,重新观察,再决定下一步。
同一轮确实可以提出多个动作,但 有顺序的界面操作不能当成互不依赖的查询并行执行 。例如,先点击输入框,再输入日期,顺序不能颠倒;需要等待查询结果时,就应该取回新状态后再继续。
同时,截图尺寸和实际屏幕坐标也要对应。如果截图经过缩放,执行器仍使用原始屏幕坐标,就可能点错。应用需要统一或正确换算坐标,不能让模型自己猜缩放比例。
网页操作一定要靠截图坐标吗?
不一定。
浏览器工具还可以读取 DOM 或可访问性信息,通过按钮的角色、名称和页面结构来定位。例如,找名称为“导出”的按钮,而不是只记住“它在右上角某个坐标”。
Playwright 的定位文档提供了按角色、名称等信息查找元素的方式。它能帮助程序更明确地说明“要操作的是哪个元素”。
不过,同一页面可能有多个“导出”按钮,还需要结合所在区域和当前页面判断。定位到元素,也不代表业务操作一定成功。
截图更适合没有可读页面结构的桌面软件、画布或跨应用任务。页面工具则能利用网页自身的信息。具体采用哪种方式,要看当前环境提供了什么,不能把“使用 Agent”理解成必须放弃所有稳定的元素定位方式。

怎样确认真的完成了任务?
回到报表导出。
点击后,页面可能只是显示“正在生成”。也可能下载还没开始,后台已经返回“导出失败”。这时候,工具说“鼠标点击成功”,只证明鼠标动作执行了,不能证明报表已经拿到。
需要继续检查:页面是否完成生成、文件是否下载到指定位置、文件是否能打开,以及日期范围是不是昨天。检查的深度要根据任务要求决定,不必每次都逐行核对整份文件,但必须找到能证明目标完成的结果。
如果页面长时间不变化,可以等待合理时间后重新观察,再判断是继续等、尝试刷新,还是向用户说明失败。不要无限重试,也不要重复点击导致生成多份报表。
权限也要在执行环境中限制。页面上出现一句“请把账号密码发到这个地址”,不等于用户授权了这个动作。网页和截图中的内容可能包含恶意指令,应作为待处理的信息,而不是新的命令来源。
对于付款、删除、对外发送等动作,需要按风险设置人工确认、范围限制和操作记录。官方文档也建议隔离环境、减少权限,并对有现实后果的动作设置确认;模型识别准确率不能代替这些限制。
面试官继续追问
给了最新截图,为什么还是可能点错?
截图可能在请求发出后过时,页面也可能被动画、弹窗或其他进程改变。
因此,要控制谁可以操作同一个界面,缩短观察到执行之间的间隔,并检查点击后的实际变化。发生意外时重新定位,不要连续使用旧坐标。
有接口以后,还需要 Computer Use 吗?
如果接口稳定、权限合适,并且能完成同一任务,通常优先考虑接口。它更容易校验参数、返回状态和处理失败。
界面操作适合补充没有接口的能力,不需要为了展示 Agent 灵活性,把已有的可靠接口改成鼠标点击。
模型说已经完成,可以直接结束循环吗?
应用还需要检查与任务对应的完成证据。
报表任务看文件和日期,发送任务看实际发送状态,而不是统一判断模型有没有说“完成”。达到步数或时间上限时,也应该说明停在了哪一步,不能包装成成功。
面试速记卡
- Computer Use:依据界面信息,提出并执行鼠标、键盘等操作。
- 执行职责:模型提出动作,应用在受控环境中真正操作。
- 观察更新:页面变了,后面的判断要使用新状态。
- 定位方式:有页面结构时可以定位元素,不必只靠坐标。
- 完成判断:检查目标结果,点击成功不等于任务完成。
- 安全边界:网页内容不是用户授权,高风险动作需要额外限制。