Skip to main content

106 posts tagged with "AI Agent"

View All Tags
· 4 min read

Claude Cowork 是 Claude Desktop 桌面 App 里的一个 Tab,本质和 Code Tab 差不多,主要面向非程序员——默认去掉了 GitHub、Preview、Diff、Terminal 等开发功能,换成了 VM 沙箱隔离执行、定时任务、MCP 办公套件集成这类知识工作场景更常用的能力

核心问题很简单:非程序员怎么用 Code Agent?

  1. Cowork 和 Code 共享同一 Agent 引擎,差异只在交互界面,零编程门槛。
  2. 授权文件夹后,Claude 自动规划并执行多步文件操作,破坏性操作需用户二次确认。
  3. macOS AVF 轻量 VM 隔离执行,Agent 循环自动拆解子任务并行处理。
  4. MCP 集成 Google、Office 等数十款工具,支持企业私有插件市场。
  5. Agent 的真正战场不是 IDE,是桌面。Agent 从开发者专属变成全员可用——AI 工具进入企业的关键一步。
· 6 min read

OpenSpec 解决了一个我在 AI 编码里反复踩的坑:你和 AI 达成的共识,/clear 之后全没了

  • 问题本质:AI 在长对话中遗忘早期约束,清空上下文后设计共识归零
  • OpenSpec 的解法:把共识写成结构化文档(proposal → spec → tasks),存进文件系统,不依赖对话记忆
  • 核心流程Propose → Apply → Archive,三步闭环,所有变更可追溯
  • Delta Spec 机制:改需求不重写规格,用 ADDED/MODIFIED/REMOVED 增量描述,自动合并
  • 和 Superpowers 的关系:OpenSpec 管"写什么",Superpowers 管"怎么写"——一个定方向,一个定纪律
  • 得物团队落地数据:10 天净增 25,546 行代码,研发提效 36%,关键是把规范写成 AI 的"可执行契约"
· 4 min read

agent-browser 把浏览器从"给人用的 GUI"变成了"给 AI 用的 API"。

  1. 定位:专为 AI Agent 设计的浏览器操控工具,自然语言输入、结构化结果输出。
  2. 两种实现:Vercel agent-browser 是 Rust CLI(二进制 7MB),browser-use 是 Python 框架。
  3. 核心差异:传统自动化写死每一步,agent-browser 是目标驱动——只关心"做到没有"。
  4. 底层原理:CDP 直连 + Accessibility Tree 快照,context 用量比完整 DOM 少 90%。
  5. 实际数据:WebVoyager 成功率 91.3%,单任务成本不到 $0.09。
  6. 2026 趋势:MCP 集成、本地优先、反 Bot 对抗升级三条主线。
· 5 min read

软件开发范式的底层逻辑变了——从瀑布到敏捷再到 AI 开发,不是在改进旧流程,而是把整个开发流程替换掉了。

  • 瀑布模型:靠前期规划,像从零攒一辆摩托,上线那天才知道对不对
  • 敏捷开发:靠快速反馈,从滑板迭代到摩托,但每一步仍然要人写代码
  • AI 开发:靠意图表达,你描述要什么,直接给你成品摩托
  • 核心转变在于驱动力的迁移:Plan → Feedback → Intent
  • 效率提升不是"AI 写代码更快",而是消灭了中间的等待和沟通成本

别再把 AI 当成"更快的程序员"——它在替换开发流程本身,不只是加速写代码这个动作。

· 4 min read

英伟达目前的企业级显卡主要分为两条产品线(注:两者本质上都是 GPU,只是市场定位不同):

训练卡

  • Ampere 架构:A100
  • Hopper 架构:H100 / H200 / H800(中国特供) / H20(中国特供)
  • Blackwell 架构:B100 / GB200 / B200

推理卡

  • Ada Lovelace 架构:L4 / L40 / L40S

此外,华为也有昇腾系列 NPU(如 2026 年发布的 950PR)作为替代方案。

选购建议:训练选 H100/H200,推理选 L40S,尝鲜等 B100。

· 4 min read

Agent 死循环不是极端情况,是给模型自由度必须付的代价。

  • 直接原因:工具调用失败后盲重试——不换参数,反复撞同一堵墙。
  • 深层原因:循环缺少收敛信号,Thought 和 Action 之间没有"该停了"的显式判断。
  1. 第一层防御max_steps 硬限制,两行代码兜住 80% 的翻车。
  2. 第二层防御:把 Finish 做成一个 Action,循环有了天然终止条件。
  3. 第三层防御system prompt 里写死"重试失败就换策略",主动避障。
  • 工程底线:step_id + 全局超时 + 连续重复 Action 检测,别信 Agent 能自己收敛。
  • 三层防御一起上,单靠任何一层都有盲区。
· 7 min read

ReAct 是默认范式但不是唯一解——选错工作模式比选错模型更致命。

  1. Function Calling:无推理链的直接工具调用,延迟最低,仅适合单步任务。
  2. Plan-and-Execute:先规划全局再逐步执行,长任务完成率高 2-3 倍,但无法动态调整。
  3. Reflection:生成 → 批评 → 修正循环,能自纠低级错误,代价是每轮多烧一倍 token
  4. Multi-Agent:多 Agent 分工或辩论,适合复杂任务,协调开销和成本是硬伤。
  5. Routing:先分类再分发到专精模型,成本可控但分类错误会连锁翻车。

最佳实践:确定性任务→Plan-Execute,开放探索→ReAct,质量敏感→加 Reflection,规模大→Multi-Agent。

· 5 min read

ReAct 不是"推理"和"行动"的简单拼接,是把两者编织成一条交替推进的链路:每一步推理都有观测反馈,每一步行动都有推理支撑。

  • 定义:模型交替生成"思考"和"行动",每次行动后把环境返回的观测结果注入下一步推理,形成闭环。
  • 与 CoT 的核心差异:CoT 在推理链中"脑补"事实,ReAct 通过外部工具或环境把推理接地——幻觉会触发不符预期的观测,反过来暴露推理错误。
  • 关键循环:Thought → Action → Observation → Thought,这个循环给 Agent 带来自我纠错能力——工具调错了?看返回就知道,下一步改。
  • Action Space 设计:工具描述、参数 schema、返回格式,这三样写不好,ReAct 的效果直接打对折。
  • 常见翻车:Agent 陷入重复 Action-Observation 死循环,没有收敛判断——需要加 max_steps 或让模型自己输出 Finish。
  • 适用场景:需要多步信息检索、代码执行、API 调用的任务。简单的单轮问答用 ReAct 是过度设计
· 7 min read

OpenClaw 自己没有"防锁屏"功能——让远程电脑一直在线不被系统休眠干掉,靠的是 操作系统层面 的电源管理配置。

  • 根本问题:macOS/Windows/Linux 默认都会在空闲时进入休眠,系统的电源管理策略会直接挂起进程,Gateway 连接中断,远程控制失效。
  1. macOS 解法sudo pmset -a sleep 0 全局禁休 + caffeinate -s 进程级防睡 + LaunchDaemon 系统级自启,三层叠加 才能保证锁屏后服务不掉。
  2. Windows 解法:电源计划设"从不睡眠"只是第一步,还要关混合睡眠、禁用 USB 选择性暂停、组策略禁用待机状态 S1-S3,否则 硬件省电策略会偷偷断网
  3. Linux 解法systemctl mask sleep.target suspend.target 从 systemd 层面禁掉休眠路径,配合 logind.conf 忽略合盖/电源键事件,GNOME 只关屏不睡眠。
  • 关键区分:LaunchDaemon(系统级,开机即跑)≠ LaunchAgent(用户级,登出即停),远程无人值守必须用前者。
  • 验证标准:锁屏 30 分钟后 Gateway 日志仍有新消息进来,pmset -g | grep sleep 全显示 0,才算配置成功。
· 8 min read

多模态模型的真正瓶颈不是 "看不清",而是 "指不准"

  1. Reference Gap(指代断裂):模型看到了目标对象,但在推理链中无法稳定引用"到底是哪一个"。"左边那个""他旁边的"这类自然语言描述在视觉空间里不是精确地址——场景越复杂、相似物体越多,语言变量就越容易在几步推理后漂移到另一个实体上。

  2. 解法:把边界框和坐标点变成推理链的中间变量。 每写下一个框 = 在草稿纸上钉一颗钉子,后续推理围绕这些坐标展开,不再依赖模糊的自然语言指代。论文将框和点定义为"视觉原语(Visual Primitive)"——本质上就是把人类"用手指点着数"的动作形式化到了 token 序列里。

  3. 工程压缩比 7056×:2916 patch tokens → 3×3 空间压缩 → 324 → CSA 注意力缓存压缩 → 81。语言模型 DeepSeek V4 Flash(284B/13B MoE)+ 从头训练 DeepSeek ViT,视觉 token 限制在 81–384,不靠无限堆 token。

  4. 数据说话:~90 个视觉缓存条目跑出 77.2 分,Gemini 3 Flash 用 1100 个拿 76.5 分。视觉 token 不是越多越好,关键是模型有没有办法把"这个对象"稳定地绑定到图像坐标上。