Skip to main content

129 posts tagged with "AI Agent"

View All Tags
· 8 min read

两种 agent 表面都"循环",但决定"什么时候退出循环"的主体完全不同——这才是它们真正的分野。

  1. 决策主体:ReAct 退出由 LLM 自己判断,Loop 退出由外部规则验证。
  2. 适用场景:ReAct 适合查天气这类 3 步内 完成的轻量任务,Loop 适合老代码升级这类需要客观验证的工程任务。
  3. 工程难点:Loop 每轮会清上下文重建 prompt,反馈机制与状态持久化是真正的门槛。
  4. 真实案例Claude Code 是 ReAct 框架 + Loop 思维的混合体——LLM 驱动主循环,但把判官能力下放给 Bash 工具的 exit code。
  5. 思想定位:Loop Agent 不是新模型,是承认 LLM 会幻觉出错,结合软件工程验证与 AI 生成能力的务实架构。
· 6 min read

Claude Code 连续工作几个小时不爆 context,不是因为「记性好」,是因为 它同时维护三个版本的历史,每次只把最该看的那一份喂给模型。

  1. 核心观点:成熟的 Agent 不止有「聊天记录」,而是把 UI 历史 / 接口视图 / 磁盘会话链 分成三层
  2. UI 历史:用户在终端看到的精简版,只保留关键节点。
  3. 接口视图:实际发给模型的那一份,叠加了 Prompt Cache 与压缩投影。
  4. 磁盘会话链:完整事实记录,永远不修改,恢复靠「投影」而不是「改写」。
  5. Resume 不是回放:恢复会话 = 在磁盘链上选投影策略重新生成接口视图。
  6. 压缩的本质:从无损丢消息升级为「按当前任务相关性重新切片」。
· 7 min read

Skill 装得越多效果越差;可视化是 5 分钟筛掉一个陌生 skill 的最快工具。

  1. 数量上限:相关研究显示 7-10 个 是单 agent 装 skill 的甜点,超过会显著掉效果
  2. 挑选两条件:取"充分理解"+"实际在用"的交集,任一不满足就别装
  3. 可视化筛选 Archscribe:把 SKILL.md 转可编辑 excalidraw + 动画 GIF,比逐字读快 5 倍
  4. 飞书 Coze 案例:五类功能各一张图,整体 5 分钟扫完
  5. 5 项硬指标:目录结构 / 触发条件 / 外部依赖 / 失败预案 / 不冲突,全过才装
· 6 min read

2026 年 AI Agent 的真正主战场不在 ChatGPT 这种对话框里,而在用户的桌面端 —— 直接接管点击、视觉验证、本地长 workflow 的能力,云端 Agent 暂时做不到。

  1. 方向转向:桌面端 Agent 率先爆发,2C 侧先于 2B,传统桌面软件进入"回光返照"窗口期。
  2. 核心优势:千人千面 + 极低使用成本 + 极低试错成本,云端 SaaS 不具备这种灵活度。
  3. 战场转移:Agent 取代的第一步是人在桌面的操作:点击、视觉验证、多软件长 workflow。
  4. 演进优先级:先跑通本地流程,云端 SaaS 那些传统优势后做再说;本地 + token key 已足够跑 MVP。
  5. 结论:个人 PC + AI 是 2026 年最被低估的应用形态,性价比远超云端订阅。
· 8 min read

Anthropic 的真正危机不是模型能力,而是商业模式——一手收客户的钱、一手偷客户的数据和 IP,等模型足够好那天,企业就会发现这是一笔血亏的交易。

  1. 指控核心:提供模型的公司会变成你的竞争对手,Figma、Cursor 都被吃过了
  2. 老剧本重现:微软靠 Windows 垄断吃掉合作伙伴、Google 用搜索流量做自家页面、OpenAI 在 YC 撒钱偷创新。
  3. 成本测算:实测用最强开源模型替代 Anthropic,成本降 90%+,代价只是慢 3 倍。
  4. 关键窗口6~12 个月,开源模型一旦越过能干活的门槛,闭源巨头就被绕开。
  5. NVIDIA 转向:英伟达模型免费送、靠芯片赚钱,帕兰提尔 + 英伟达 = "主权 AI" 已经在跑了。
· 8 min read

Graph Engineering 是 Loop Engineering 之后冒出来的下一个 AI Agent 工程热词——70% 是新瓶装旧酒,30% 是真东西

  1. 真变化:单 Agent 自迭代(Loop)升级为多 Agent 协同 + 治理(Graph),前者解决收敛,后者解决分工
  2. 关键术语:节点 + 边 + 状态,再叠加节点契约、调度、持久化、并发、恢复、权限、评估
  3. 触发事件:Peter Steinberger 7 月 18 日"还搞 Loop?该 Graph 了"推文两天 200 万浏览
  4. 三层架构:Harness(运行躯干)→ Loop(收敛循环)→ Graph(编排网络),90% 的 Agent 死在 1-2 层
  5. 踩坑提醒:单 Agent 任务硬上多节点是过度设计,先把 Loop 跑稳
  6. 判断标准:单 Agent 自我迭代无法收敛时加 Loop;多个 Loop 互相打架时再加 Graph
· 9 min read

Skill 存流程,Memory 存经历,事实没人存——这就是 Knowledge 必须单独留一层的原因。

  1. 层分工:Skill 管怎么做,Memory 管发生过什么,Knowledge 管事实是什么。
  2. 事实写进 Skill 会腐坏:流程半年一改,价目表一周一改,两者不能同一个生命周期。
  3. 事实写进 Memory 会被污染:一次错误结论会被当成「我记得」反复引用。
  4. Graph 不是没前途,是被误当成通用记忆层:独占场景只剩多跳关系和时序失效。
  5. 大多数公司不需要再抽一张图——业务库外键、CMDB、数据血缘早就是图。
  6. grep 替代 RAG 有三个前提:在文件系统上、目录有语义、术语是稳定字面量。
  7. 结论:知识组织的成本从检索侧前移到了写作侧。
· 7 min read

MCP 接 OAuth 2.1 不是"为了安全"四个字能打发的,它是 AI Agent 进企业生产环境的准入门槛。

  • 原生隐患:静态 API key 写死在配置文件里,大模型等于顶着管理员权限在跑。
  • 三宗罪:权限失控、提示词套话吐令牌、所有操作审计不到具体人。
  • 为什么是 2.1:砍掉隐式授权和密码模式,PKCE 从可选变强制。
  • 关键设计:令牌只活在客户端传输层,绝不进大模型上下文
  • 最大难点:Agent 推理跑到一半令牌过期,靠 401 静默刷新兜住思考链。
  • 规模化:DCR 让企业内上千个 MCP server 免手工注册凭证
· 6 min read

OpenAI 把 Codex 编排做成了语言无关的规范。

  1. 大要素:SPEC.md(规范) + elixir/(参考实现) + WORKFLOW.md(仓内配置)
  2. 定位升级:从「管 agent」升级到「管工单」
  3. 主循环:拉 tracker → 建 per-issue workspace → 跑 Codex app-server
  4. 边界:低密预览版,只跑受信环境,无内置沙箱
  5. 设计巧思:host 侧注入 tracker 凭据,主动从 Codex 子进程剔除
  6. License:Apache-2.0,可绕过 Elixir 按规范自实现
· 7 min read

Prompt 注入是 LLM 时代的新型安全威胁。

  • 本质:把恶意指令塞进用户输入,劫持 AI 的决策逻辑
  • 核心原理:指令优先级劫持 — 模型分不清系统规则和攻击代码
  • 三步攻击:识别 prompt 结构 → 构造 payload → 触发执行
  • 与 SQL 注入对比:同样利用边界混淆,攻击目标是 AI 语义,防御成熟度差 20
  • 防御要纵深:输入过滤 + prompt 分层 + 最小权限 + 上下文沙箱 + 输出检测 + 日志监控
  • 反直觉:AI 越智能,被攻破后破坏力越大