Skip to main content

129 posts tagged with "AI Agent"

View All Tags
· 7 min read

Pi 极简内核决定了所有"看起来复杂"的功能都靠外挂。

  1. 设计哲学:极简内核 + plugin + skills 双路径,所有可定制能力外挂
  2. 安装姿势:从官网 packages 列表复制命令,全局默认;加 -l 改为项目级
  3. 8 大常用插件:联网、并行子代理、MCP 适配器、BTW、Plan Mode、Goal、Dynamic Workflows、微信
  4. Skills 协议:放 .agents/skills/ 目录即生效,Playwright CLI 是典型用法
  5. Web UI:社区 star 数最高项目接管插件 / 技能管理面板
  6. Pi 自己写插件:内置开发知识,UI 定制、权限保护类插件都能跑通
· 8 min read

AI 时代浏览器的角色正在反转 —— 过去三年「把 agent 塞进浏览器」(agent in browser,AI 浏览器)这条路线已经被验证为死胡同,OpenAI Atlas 不到 10 个月就宣告停服;新范式是「把浏览器塞进 agent」(browser in agent,内嵌浏览器),浏览器作为 agent 的工具组件存在。

  1. 范式反转:浏览器在 AI 时代从「容器」降级为「工具」。
  2. 根本原因:用户心智太窄,必须先有想法才打开浏览器;而 agent 时代用户常驻的是 agent。
  3. 新范式优势browser in agent 把浏览器变成按需工具,避免了独立 AI 浏览器的心智负担。
  4. 规律可推广:不局限于浏览器,凡是「agent 接管传统软件」都跑得通,凡是「独立 AI 垂直软件」都可能会重演 Atlas 结局。
  5. 趋势结论:用户的工作流以 agent 为中心,传统软件是被调用的工具。
· 8 min read

Pi 把"一次会话"抽象成可遍历的工作单元,五大命令撑起完整的生命周期管理。

  1. 核心概念:Session 是 Pi 多轮对话的工作单元,三次问答 + 一次 /new 就是一段独立历史
  2. 启动与续接/new 新开、pi -c 续最近、pi -r 交互式挑选历史 session
  3. /tree 回退:Pi 特别的对话树设计,历史可跳到任意节点,从那里继续或开新分支,三选项可控制回退方式
  4. /fork vs /clone/fork 从单节点分叉只带之前历史,/clone 复制整棵会话树
  5. 代码回退/tree 只回退对话不碰文件,必须 git 配合才能回滚实际代码改动
  6. /compact vs /new:压缩省空间但模糊重点,清空彻底但丢弃中间细节
· 7 min read

只给四个工具不是减配,是把所有会因团队而异的东西都从内核里拿出去。

  • 默认工具只有 个:read / bash / edit / write
  • MCP、sub-agent、待办事项、权限弹窗一律不进核心
  • 理由:每个团队的权限规则都不一样,内置任何一套都是错的
  • 循环内核极简:模型决定动工具,工具返回结果,再交回模型
  • 内核之外开了三十多个插口,从会话启动到归档通知
  • 提示词只能写原则,tool_call 前的 Hook 代码才是停止键
  • 极简不等于省事,扩展继承运行账号的全部权限
· 9 min read

DeepSeek Harness 把 AI 编程工具的每个组件都做成可插拔插件——模型适配器、工具注册、日志,连 AI 循环本身都能换。

  1. 定位:可拆装重组的 Agent 平台骨架,"成品车" vs "开源引擎 + 配件市场"
  2. 核心:连 AI 循环都是插件,4 层可替换 + seam 设计一处替换全局生效
  3. 标志:日志即真相,AI 看到的字节从账本重算,runtime 断言强制
  4. 适合:平台团队 / 合规重行业 / 多模型 A/B 测试;普通用户用 Codex / Claude Code 扩展够用
  5. 现状:0.1.0-rc.5 Preview,可接入绝大数模型,第三方插件鱼龙混杂,权限过大
  6. 设计模式:可逆副作用 / 类型化事件 / 文档生成 + 完整性守卫 / 防御式加载 / UI 订阅事件
· 7 min read

Claude Code 跨会话消息把多 Agent 协作从「手动搬运上下文」推进到「自动通知对方」。

  1. 核心能力:一个会话可把文字摘要发给另一个会话,接收方在原任务里继续处理
  2. 三种模式互发摘要 / 双向问答 / Claude 主动通知 改动影响
  3. 关键约束:只传文字摘要,不传完整历史,也不传文件
  4. 使用姿势ListAgents 列出可达会话,SendMessage 按名称发送,prompt 触发即可
  5. 硬门槛:Claude Code v2.1.224+,支持 macOS 与 Linux
  6. 跨机器边界:跨机器或网页会话只能回复,不能主动发起对话
  7. 关键边界这不是会话迁移,要搬完整上下文仍需恢复原会话
  8. 方向意义:多 Agent 协作从「手动衔接」走向「自动通知」,是 Agent 协作从单点走向网络的关键一步
· 8 min read

Agent 提前停下来的本质,是把「一轮回答结束」错认成「整个任务完成」。Pi 的 /goal 扩展把这层混淆拆开。

  1. 核心问题:一轮回答结束 ≠ 任务完成,普通 Agent 缺少独立完成判断机制。
  2. 目标弱化:长上下文里,初始目标被中间产物稀释,模型围绕当前成果回复。
  3. Goal 四步循环:保存完整目标 → 每轮重读提示词 → 必须调用 goal_complete → 未完成自动续跑。
  4. 两种判断方式Codex 工作模型自查 + 完成工具;Claude Code 独立评估模型判断。
  5. 适用任务四特征:结果明确、可验证、逐步收敛、不需要频繁人工决策。
  6. 任务描述四要素:结果、范围、验收方式、禁止操作。
  7. 能力边界:Goal 是持续执行保障层,正确性最终仍取决于模型和验证方法。
· 8 min read

企业级 Agent 落地,关键是「它能不能被改造」,不是功能多不多。

  1. 市场风向:底层接 Pi 的 Agent 产品越来越多,如 OpenClaw,MinimaxCode 等项目。
  2. 极简内核:4 工具(read / write 创建或覆盖 / edit 替换片段 / bash 执行)。
  3. 系统提示~370 token(约 150 行),主流最短。
  4. 企业扩展全生命周期都是可改写钩子。
  5. 可移植:插件本地到生产无缝,TS/Python SDK + RPC。
  6. 透明可审计:系统提示完全开放,能看清行为边界。
  7. 结论极简 = 透明 = 可控,是落地前提。
· 7 min read

Claude Code 2.0.74 加了 LSP(Language Server Protocol)支持,表面看只是多装几个插件,实际上是 AI 编程 Agent 第一次吃上了 IDE 沉淀了多年的语言理解能力

  1. 痛点:没 LSP 时,Claude Code 只能「全文搜索 + 模型逐处判断」——慢、错、烧 token
  2. 调用定位:从「grep 后让模型猜」变成「直接问 LSP 拿结构化结果
  3. 结构体方法:模型不必再读整个类型定义文件,LSP 一次性返回方法列表和签名
  4. 实时诊断:从「全量 build 才能知道哪里错」变成「输入即检查」,延迟从分钟级降到秒级
  5. 当前局限模型仍不主动调用 LSP,prompt 需显式触发
  6. 方向意义:Coding Agent 与 Language Server 之间,未来需要一个面向 Agent 的新协议层
· 9 min read

Skill 维护的核心是钉住 5 件事:成功标准、失败点、测试集、进化、版本。少一类,评估是空的。

  • 成功结果 / 过程 / 风格 / 效率,缺一类评估就漏
  • 失败:触发 / 环境 / 执行 3 类,每类独立观察、独立维护
  • 测试集:显式 / 隐式 / 上下文 / 副测试集,10-20 条就够
  • 进化:失败信号 → 候选补丁 → 新能力验证 → 基线回归 → 灰度
  • 版本:git 单一来源——commit / tag / push 三件套,不另起基础设施
  • 结论:Skill 进生产就是工作流资产——靠体感维护必然崩,按这 5 件事维护才能稳