Skip to main content
· 8 min read

Agent 提前停下来的本质,是把「一轮回答结束」错认成「整个任务完成」。Pi 的 /goal 扩展把这层混淆拆开。

  1. 核心问题:一轮回答结束 ≠ 任务完成,普通 Agent 缺少独立完成判断机制。
  2. 目标弱化:长上下文里,初始目标被中间产物稀释,模型围绕当前成果回复。
  3. Goal 四步循环:保存完整目标 → 每轮重读提示词 → 必须调用 goal_complete → 未完成自动续跑。
  4. 两种判断方式Codex 工作模型自查 + 完成工具;Claude Code 独立评估模型判断。
  5. 适用任务四特征:结果明确、可验证、逐步收敛、不需要频繁人工决策。
  6. 任务描述四要素:结果、范围、验收方式、禁止操作。
  7. 能力边界:Goal 是持续执行保障层,正确性最终仍取决于模型和验证方法。
· 8 min read

企业级 Agent 落地,关键是「它能不能被改造」,不是功能多不多。

  1. 市场风向:底层接 Pi 的 Agent 产品越来越多,如 OpenClaw,MinimaxCode 等项目。
  2. 极简内核:4 工具(read / write 创建或覆盖 / edit 替换片段 / bash 执行)。
  3. 系统提示~370 token(约 150 行),主流最短。
  4. 企业扩展全生命周期都是可改写钩子。
  5. 可移植:插件本地到生产无缝,TS/Python SDK + RPC。
  6. 透明可审计:系统提示完全开放,能看清行为边界。
  7. 结论极简 = 透明 = 可控,是落地前提。
· 7 min read

Claude Code 2.0.74 加了 LSP(Language Server Protocol)支持,表面看只是多装几个插件,实际上是 AI 编程 Agent 第一次吃上了 IDE 沉淀了多年的语言理解能力

  1. 痛点:没 LSP 时,Claude Code 只能「全文搜索 + 模型逐处判断」——慢、错、烧 token
  2. 调用定位:从「grep 后让模型猜」变成「直接问 LSP 拿结构化结果
  3. 结构体方法:模型不必再读整个类型定义文件,LSP 一次性返回方法列表和签名
  4. 实时诊断:从「全量 build 才能知道哪里错」变成「输入即检查」,延迟从分钟级降到秒级
  5. 当前局限模型仍不主动调用 LSP,prompt 需显式触发
  6. 方向意义:Coding Agent 与 Language Server 之间,未来需要一个面向 Agent 的新协议层
· 9 min read

Skill 维护的核心是钉住 5 件事:成功标准、失败点、测试集、进化、版本。少一类,评估是空的。

  • 成功结果 / 过程 / 风格 / 效率,缺一类评估就漏
  • 失败:触发 / 环境 / 执行 3 类,每类独立观察、独立维护
  • 测试集:显式 / 隐式 / 上下文 / 副测试集,10-20 条就够
  • 进化:失败信号 → 候选补丁 → 新能力验证 → 基线回归 → 灰度
  • 版本:git 单一来源——commit / tag / push 三件套,不另起基础设施
  • 结论:Skill 进生产就是工作流资产——靠体感维护必然崩,按这 5 件事维护才能稳
· 10 min read

产品思维是把视角从"我有什么"换到"用户要什么",从卖货转向卖解决方案。

  • 本质:从功能/参数出发 → 从用户/场景出发,最终交付的是"解决麻烦的能力"而不是"货"。
  • 懂货 ≠ 懂产品:老板眼里的"参数堆砌"和产品人眼里的"解决方案",差的就是用户视角。
  • 质量是及格线:参数/成本/工艺只决定能否入场,不是护城河——消费品卖的是利益/感受/方案。
  • 长在场景里:脱离场景的参数毫无意义——火车上的充电宝和打游戏时的充电宝,是两件产品。
  • 靠减法:选定一个核心用户、一个核心痛点,敢于放弃 90% 的次要需求。
  • 服务延伸:付款那一刻关系才刚开始,多想一步的赠品比多花一块钱的功能更让人记住你。
  • 自带传播:好产品本身就是内容,PLG 把"产品即增长"做成了商业模型。
  • 底层是同理心:去感受焦虑、体验麻烦、理解渴望,别再自嗨。
  • 一句话:你卖的不是货,是解决问题的方案,以及背后"用户离不开你"的那一层。
· 9 min read

Electron 的渲染层不是"一个浏览器",是 Chromium + 多层抽象。

  1. Chromium 是底座:每个 Electron 版本绑定一个 Chromium 稳定版
  2. webContents 是核心抽象:每个渲染页面背后都有一个 webContents 实例
  3. <webview> 标签:在 renderer 里嵌入另一个 webContents
  4. webContentsView 是新版抽象:替代已废弃的 BrowserView
  5. webPreferences 是渲染配置:preload / contextIsolation / sandbox 等开关
  6. 系统 WebView 完全不同:WKWebView / WebView2 是 OS 提供的
· 8 min read

两种 agent 表面都"循环",但决定"什么时候退出循环"的主体完全不同——这才是它们真正的分野。

  1. 决策主体:ReAct 退出由 LLM 自己判断,Loop 退出由外部规则验证。
  2. 适用场景:ReAct 适合查天气这类 3 步内 完成的轻量任务,Loop 适合老代码升级这类需要客观验证的工程任务。
  3. 工程难点:Loop 每轮会清上下文重建 prompt,反馈机制与状态持久化是真正的门槛。
  4. 真实案例Claude Code 是 ReAct 框架 + Loop 思维的混合体——LLM 驱动主循环,但把判官能力下放给 Bash 工具的 exit code。
  5. 思想定位:Loop Agent 不是新模型,是承认 LLM 会幻觉出错,结合软件工程验证与 AI 生成能力的务实架构。
· 6 min read

Claude Code 连续工作几个小时不爆 context,不是因为「记性好」,是因为 它同时维护三个版本的历史,每次只把最该看的那一份喂给模型。

  1. 核心观点:成熟的 Agent 不止有「聊天记录」,而是把 UI 历史 / 接口视图 / 磁盘会话链 分成三层
  2. UI 历史:用户在终端看到的精简版,只保留关键节点。
  3. 接口视图:实际发给模型的那一份,叠加了 Prompt Cache 与压缩投影。
  4. 磁盘会话链:完整事实记录,永远不修改,恢复靠「投影」而不是「改写」。
  5. Resume 不是回放:恢复会话 = 在磁盘链上选投影策略重新生成接口视图。
  6. 压缩的本质:从无损丢消息升级为「按当前任务相关性重新切片」。
· 7 min read

Skill 装得越多效果越差;可视化是 5 分钟筛掉一个陌生 skill 的最快工具。

  1. 数量上限:相关研究显示 7-10 个 是单 agent 装 skill 的甜点,超过会显著掉效果
  2. 挑选两条件:取"充分理解"+"实际在用"的交集,任一不满足就别装
  3. 可视化筛选 Archscribe:把 SKILL.md 转可编辑 excalidraw + 动画 GIF,比逐字读快 5 倍
  4. 飞书 Coze 案例:五类功能各一张图,整体 5 分钟扫完
  5. 5 项硬指标:目录结构 / 触发条件 / 外部依赖 / 失败预案 / 不冲突,全过才装
· 6 min read

2026 年 AI Agent 的真正主战场不在 ChatGPT 这种对话框里,而在用户的桌面端 —— 直接接管点击、视觉验证、本地长 workflow 的能力,云端 Agent 暂时做不到。

  1. 方向转向:桌面端 Agent 率先爆发,2C 侧先于 2B,传统桌面软件进入"回光返照"窗口期。
  2. 核心优势:千人千面 + 极低使用成本 + 极低试错成本,云端 SaaS 不具备这种灵活度。
  3. 战场转移:Agent 取代的第一步是人在桌面的操作:点击、视觉验证、多软件长 workflow。
  4. 演进优先级:先跑通本地流程,云端 SaaS 那些传统优势后做再说;本地 + token key 已足够跑 MVP。
  5. 结论:个人 PC + AI 是 2026 年最被低估的应用形态,性价比远超云端订阅。
发文趋势
近 12 个月 · 共 171
91011121234567268