Skip to main content

为什么 Agent in browser 跑不通,Browser in agent 跑得通?

· 8 min read

AI 时代浏览器的角色正在反转 —— 过去三年「把 agent 塞进浏览器」(agent in browser,AI 浏览器)这条路线已经被验证为死胡同,OpenAI Atlas 不到 10 个月就宣告停服;新范式是「把浏览器塞进 agent」(browser in agent,内嵌浏览器),浏览器作为 agent 的工具组件存在。

  1. 范式反转:浏览器在 AI 时代从「容器」降级为「工具」。
  2. 根本原因:用户心智太窄,必须先有想法才打开浏览器;而 agent 时代用户常驻的是 agent。
  3. 新范式优势browser in agent 把浏览器变成按需工具,避免了独立 AI 浏览器的心智负担。
  4. 规律可推广:不局限于浏览器,凡是「agent 接管传统软件」都跑得通,凡是「独立 AI 垂直软件」都可能会重演 Atlas 结局。
  5. 趋势结论:用户的工作流以 agent 为中心,传统软件是被调用的工具。

一、Agent in browser 这条路,已经被事实否定

结论:过去三年把 agent 塞进浏览器这件事,从产品形态到公司命运都已经被否定。

三个标志性事件按时间排列:

时间产品结局
2024Monica、Sider AI 等浏览器插件增长见顶,AI 红利被通用 chatbot 稀释
2025-04The Browser Company 发布 Dia(Arc 团队做的 AI 浏览器)2025-09 公司被 Atlassian 以 6.1 亿美元收购
2025-10ChatGPT Atlas(OpenAI 自家浏览器)2026-08-09 宣布停止服务,上线不到 10 个月

三件事连在一起看,信号已经非常清楚:独立 AI 浏览器不是用户真正想要的形态。OpenAI 亲自下场做浏览器都没跑通,更别说其他玩家。

为什么 Atlas 撑不过 10 个月?

结论:浏览器本身的用户心智太窄,必须先有想法才会打开。

普通用户一天可能打开 100 次浏览器,但每次都是带着「我要搜 X / 我要看 Y / 我要买 Z」的具体意图来的。这种使用模式决定了:

  • AI 是辅助:在已有明确目标的前提下,AI 帮用户做摘要、改写、对比 —— 这是合理的。
  • AI 不是入口:用户不会因为「想跟 AI 聊聊」就专门去打开一个浏览器。ChatGPT 那种独立对话框才是入口形态。

OpenAI 把 ChatGPT 塞进浏览器,本质上假设「未来用户上网的第一步是问 AI」,但用户的真实路径是「先想到要做什么,再决定用哪个工具」。把 AI 当成浏览器的入口,是把因果关系搞反了

二、Browser in agent:把浏览器降级为工具

结论:新范式不试图替代浏览器,而是把浏览器内嵌到 agent 里,按需调用。

代表性产品是 Codex 这类桌面级 AI Agent:用户的主要工作区是 agent 本身,浏览器只是 agent 用来「看一眼」现实网页的工具组件。

这种范式能跑通,关键在于对齐用户习惯:

  • agent 是常驻:用户开电脑就开 agent,不需要额外心智负担。
  • 浏览器是按需:当 agent 需要查询某个网页、填某个表单、操作某个 SaaS 时,临时调用浏览器。
  • 融合而非替代:浏览器渲染的是真实网页,agent 在旁边看着内容做决策、做操作。
实战示例

agent 在写作过程中需要查一个外部数据源 —— 它可以直接打开浏览器访问该网站、读取页面内容、提取数据填回工作区,全程不需要用户手动切换窗口。

三、浏览器的真正价值:面包屑 + 接管繁琐操作

结论:浏览器在 agent 时代不是被取代了,而是被重新定位 —— 它的核心价值是「真实网页」和「可操作性」。

3.1 搜索质量:面包屑是 web search 给不出的

结论:浏览器渲染的网页自带面包屑,内容质量比 web search 高一个量级。

web search(无论哪家)本质上都是「纯文本 + URL 列表」。它的问题在于:

  • 看不到上下文:返回的片段是孤立的,关联信息要靠用户自己去点。
  • 结构被压平:网页原本的标题层级、章节关联、引用链条都被打散了。
  • 同义噪声大:纯文本搜索的 ranking 信号弱,容易被 SEO 农场污染。

浏览器渲染的真实网页则保留了所有这些结构 —— 标题、副标题、内链、外链、表格、列表,每一层都是网页之间的导航线索。这和 web search 给你的一段孤立纯文本片段不是一回事 —— 后者切掉了所有关联结构,只剩几行文字。

这就是为什么「用浏览器搜索」能搜到很多 web search 搜不到的相关内容 —— 因为真实网页本身就是一张图,而 web search 只给你图上的几个孤立节点。

3.2 操作能力:接管繁琐但简单的网页任务

结论:浏览器是 agent 接管人类繁琐操作的最自然载体。

人类每天有一大堆「必须上网做、但又不想做」的事:

  • 跨地区税务申报(不同国家的表单系统、字段命名、上传格式都不一样)
  • 各种后台的报表填写(周报、月报、合规报表)
  • 重复性回复(评论区、客服工单、用户群消息)

这些事情有共同特点:

  • 逻辑简单:规则明确,agent 看一眼就知道该填什么。
  • 操作繁琐:需要在多个页面之间跳转、上传文件、点击确认。
  • 容错率高:填错一次可以撤回,不会造成灾难性后果。
落地形态

agent 调用浏览器自动登录 SaaS 后台 → 读取所需数据 → 自动填表 → 截图留底 → 提交确认。整个过程用户只需要授权一次,剩下的全程自动化。

这种能力放在「独立 AI 浏览器」里会很尴尬 —— 用户得专门打开浏览器、等 AI 启动、再描述任务。但在 agent 内嵌浏览器的形态下,agent 顺手就把这些事办了,用户甚至不需要感知到浏览器的存在。

四、内嵌 vs 独立:选择已经很清楚

结论:内嵌浏览器不是过渡方案,而是终局形态。

独立 AI 浏览器路线(Atlas / Dia)失败的核心原因,是它把 agent 当成浏览器的入口。这相当于让用户为了偶尔喝一杯水而专门买一台咖啡机。

内嵌浏览器路线(Codex)则反过来 —— 浏览器只是 agent 工具箱里的一个组件,就像 IDE 里集成的终端、数据库 GUI 里集成的 SQL 编辑器。工具属性,没有心智负担。

判断标准很简单:用户的工作流是「先打开 X 再做 Y」还是「先有想法 Y 再去调 X」?

  • 前者适合独立 AI 浏览器,但用户的工作流从来不是这样。
  • 后者适合 agent 内嵌浏览器,用户始终在 agent 里,需要时调用浏览器

这一规律不局限于浏览器。Codex 这类 agent 把 Office、财务与工业软件都当成按需工具调用 —— 凡是「agent 接管传统软件」的组合都跑得通,凡是「独立 AI 垂直软件」都可能会重演 Atlas 的结局。结论一致:趋势是用户的工作流以 agent 为中心,传统软件是被调用的工具

更深一层的变化是用户角色本身的转变。过去人必须亲自驻守在工作流的某个节点上 —— 录入、核对、协调,每一步都不能出错;现在 AI 接管了这些底层操作,人类的管理边界和职责范围被大幅扩展 —— 需要的是能调度整条工作流的 Agent 大管家,而不是某个节点的细节工具


References

  1. 分享一下 Proma 内嵌浏览器的最佳实践 —— ErlichLiu, 哔哩哔哩
  2. OpenAI 旗下 ChatGPT Atlas 浏览器 8 月 9 日停止服务 —— 观点网, 2026-08-04
  3. 聊几句 Dia 浏览器被收购的事 —— 腾讯新闻, 2025-09-05