整理一篇学习笔记,把看到的一些要点和自己的理解都记下来。
文章目录
- 1 -> 引言
- 2 -> 为什么这一次比传统自动化更接近可用
- 3 -> App 仍在,界面开始退到第二排
- 4 -> AI 浏览器与 RPA 的差别有多大
- 5 -> 最容易被忽略的是结果验证
- 6 -> 哪些场景会最先被改变
- 7 -> 未来的软件入口,可能不再属于单个 App
1 -> 引言
浏览器正在从“人打开网页的工具”变成“Agent 操作数字世界的手”。用户不再要逐个进入网站、寻找菜单、复制信息,而是告诉 AI:比较几家供应商、填好申请表、整理发票、预约最合适的时间。Agent 看见页面,理解目标,点击、输入、等待并检查结果。
这类演示很容易让人得出一个激进结论:App 可能不再重要,未来所有软件都退到后台,人只和一个 AI 对话。
但如果把演示里的顺利路径带进真实干活,就会遇到另一幅画面:页面改版、按钮重名、登录过期、弹窗遮挡、验证码出现、网络超时,Agent 不清楚订单到底成功了一次还是两次。传统 RPA 曾经承诺自动操作所有软件,也被这些麻烦折磨多年。
AI 浏览器确实比 RPA 更聪明,却没有让数字世界突然变得确定。它改变的是自动化可以覆盖的范围,以及人使用软件的入口;它不会让底层 App、API 和业务规则消失。
2 -> 为什么这一次比传统自动化更接近可用
传统 RPA 通常依赖固定坐标、选择器或预先录制的操作流程。只要页面结构发生变化,脚本就可能失效。它适合高频、稳定、规则明确的后台操作,却很难处理描述模糊、页面多变、要临时判断的任务。
现代计算机使用 Agent 增加了三个能力。
首先是视觉和语义理解。Agent 不只寻找某个坐标,而是可以识别“提交订单”“选择日期”或“下载对账单”的意义。按钮位置变化后,只要界面表达仍然清楚,它仍有机会完成任务。
其次是动态规划。Agent 遇到缺少字段、页面异常或新的中间步骤时,可以重新判断,而不是立即报错。用户只给出目标,系统自行决定经过哪些页面。
最后是跨应用上下文。它能从邮件读取订单号,在浏览器查询物流,再把结果写进表格或发送消息。传统自动化也能做到跨系统,但通常要工程师提前定义每条路径;Agent 可以在运行时组合工具。
Google 在 2026 年把 computer use 直接集成到 Gemini 3.5 Flash,说明这项能力正从实验模型进入通用 Agent 基础能力。Google 的发布说明提到模型可以在浏览器、移动端和桌面环境中识别并执行动作。OpenAI、Anthropic 以及大量浏览器自动化公司也在推进相同方向。
变化的关键在于,自然语言目标与界面操作之间第一次有了相对通用的翻译层。
3 -> App 仍在,界面开始退到第二排
App 不只是用户看到的按钮和页面。它还包含数据库、权限、交易、业务规则、审计和协作状态。即使用户不再亲手打开应用,这些系统仍要保存事实并承担结果。
AI 浏览器更可能削弱的是“每个任务都必须由人进入专用界面完成”的模式。过去,员工需要学习十几个后台系统;未来,Agent 可以成为统一入口,底层 App 则更像服务和事实系统。人偶尔进入界面处理例外、查看全局和进行复杂判断。
这和搜索引擎没有消灭网站类似。搜索改变了人到达东西的路径,却没有替代东西本身。AI 界面可能减少用户在 App 里的停留时间,但应用仍然负责数据一致性、权限和履约。
甚至可以说,当 Agent 成为主要操作者,底层 App 的工程质量会更重要。人看到一个含糊报错,可能凭经验换个路径;Agent 如果拿不到结构化错误,就容易重复点击或错误推断。稳定 API、幂等操作、清楚状态和可撤销机制,会比漂亮动画更能决定软件是否适合 Agent。
4 -> AI 浏览器与 RPA 的差别有多大
把 AI 浏览器描述为 RPA 的终结者并不准确。两者解决的是同一类麻烦:在无法直接整合的系统之间,让机器代替人操作界面。差别主要在适应性和构建成本。
RPA 的优势是确定。一条经过测试的流程可以精确限制每一步,运行速度快,也容易预测资源消耗。它的弱点是脆弱和昂贵:流程稍变就需要维护,长尾异常难以覆盖。
AI 浏览器的优势是弹性。它能理解变化和处理非标准输入,部署一个新任务不一定需要写完整脚本。它的弱点是不确定:同一页面可能选择不同路径,复杂任务会消耗更多时间,错误也更难复现。
成熟系统不会只选其中一个。稳定、高频的路径仍然使用 API 或确定性自动化;AI 负责理解目标、处理长尾异常和选择流程;视觉点击作为没有接口时的最后手段。这种混合方式比让模型从头到尾“看图点鼠标”更可靠。
四种操作方式并不是新旧替代关系,而是一条从确定到灵活的降级链。系统应优先选择最容易验证的入口,而不是默认采用最像人的操作方式。
操作方式稳定性适应页面变化典型用途主要风险业务 API高不依赖页面查询、下单、状态修改接口权限过大或版本变化确定性 RPA中高低稳定后台、高频固定流程选择器变化导致流程中断DOM/可访问性树中中结构清楚的网页表单页面语义和实际状态不一致视觉操作较低较高无接口、长尾页面、临时流程误点、遮挡、难以复现
如果 API 已经存在,让 Agent 仍然逐页点击,通常是在用不确定性换取表面的通用性。反过来,旧系统完全没有接口时,视觉操作可以作为过渡层,但成功路径稳定后应逐步沉淀为更确定的集成。
5 -> 最容易被忽略的是结果验证
浏览器 Agent 的演示通常停在最后一个按钮被点击,但生产系统关心的是目标状态。
假设 Agent 购买一张机票。点击付款后页面超时,它该不该重试?如果第一次其实已经成功,第二次点击可能重复扣款。页面显示“正在处理”时,它应该等待多久?订单生成后,是看到一个绿色提示就算完成,还是必须在订单系统中确认编号,并检查邮件和支付状态一致?
这些麻烦不能靠视觉模型猜。每个有副作用的动作都需要幂等键、执行前检查和执行后验证。查询页面可以宽松,付款、发送、删除和提交则必须严格。
当服务端支持幂等键时,超时后的正确动作不是生成一个新请求,而是先查询同一业务意图是否已经成功。下面的伪代码保留同一个键,并把“网络没有返回”与“业务没有执行”区分开:
def submit_with_verification(client, intent, idempotency_key):
existing = client.find_by_idempotency_key(idempotency_key)
if existing is not None:
return existing
try:
response = client.submit(
intent,
idempotency_key=idempotency_key,
)
except TimeoutError:
response = client.find_by_idempotency_key(idempotency_key)
if response is None:
return {"status": "unknown", "needs_human": True}
return response
并不是所有网页系统都提供这样的查询能力。没有幂等支持时,Agent 应使用订单号、收件人、金额等业务字段核对状态;仍无法确认,就停在 unknown,而不是用一次盲目重试赌结果。
身份也是难点。Agent 使用的是谁的登录状态?它被授权访问哪些账户?浏览器 Cookie 往往包含比当前任务更大的权限,如果 Agent 遇到网页中的恶意提示,就可能把现有会话用于错误目的。权限应绑定任务和动作,而不是把用户整个浏览器配置交给模型。
此外还有人机交接。当验证码、双因素认证、法律确认或高度模糊的选择出现时,系统应该把准确上下文交给人,而不是重新讲一遍任务。好的交接会展示当前页面、已完成步骤、待决定问题和建议选项,人处理完后 Agent 可以继续。
衡量 AI 浏览器也不能只看“完成率”。还要记录平均动作数、重试次数、人工接管率、重复副作用、页面变化后的恢复能力,以及失败后是否能明确说明停在哪里。
6 -> 哪些场景会最先被改变
第一类是低风险、跨系统的信息干活。例如收集公开资料、下载报表、把多个后台信息整理成统一摘要。这些任务错误可发现,也通常不会直接对外产生承诺。
第二类是企业内部的遗留系统。很多旧软件没有现代 API,重新开发成本又高。AI 可以先作为适配层,减少员工重复操作,但前提是运行在受控账户和隔离环境中。
第三类是个人长尾任务。订票、比价、填表和取消订阅的流程各不相同,传统自动化很难为每一种需求编写脚本。Agent 的通用理解在这里有明显优势。
高金额交易、医疗法律决定、大规模消息发送和数据删除则应保持谨慎。这些任务可以让 Agent 准备材料、导航到最后一步,却不应该因为技术上能点击就默认自动完成。
对于软件公司,新的产品问题也出现了:是继续优化给人使用的界面,还是提供 Agent 原生入口?答案通常是两者都要。高价值服务应该提供结构化、可授权的 API;视觉界面用于人类理解和例外处理;Agent 可以在缺少接口时使用 computer use,但不应把它当成永久集成方案。
7 -> 未来的软件入口,可能不再属于单个 App
AI 浏览器不会让 App 消失,但会改变谁控制用户入口。今天用户打开某个应用,再在应用规定的流程里完成任务;未来用户先向个人 Agent 表达目标,由 Agent 决定调用哪些服务。应用可能失去一部分界面时间,却获得新的机器流量和交易机会。
这会推动软件从“让用户学会操作我”转向“让 Agent 能安全调用我”。产品竞争的一部分将从页面设计转到能力描述、数据质量、授权协议和结果可靠性。
AI 浏览器也不是 RPA 简单换皮。它把自动化从预定义流程扩展到动态目标,这是实质进步。但 RPA 留下的教训仍然有效:界面不是稳定接口,成功不能靠点击判断,异常处理和维护成本不会因为模型更聪明而消失。
未来最可靠的电脑操作 Agent,大概不是那个最像人一样到处点鼠标的系统,而是那个清楚什么时候使用 API、什么时候读取页面结构、什么时候才退回视觉操作,并且在每个关键步骤都能证明事情确实完成的系统。
感谢各位大佬支持!!!
互三啦!!!
本次分享就到这里。技术这东西越研究越有意思,后续有新的收获我也会继续更新。
评论 (0)
暂无评论