Skip to main content

3 posts tagged with "DeepSeek"

View All Tags
· 6 min read

裸装的 DeepSeek Harness 是毛坯房,介绍一些不错的插件补齐 Agent 该有的样子。

  1. 先装市场dsh-market 是入口,装完才谈得上装别的
  2. 补基础设施:侧边栏(文件 / 终端 / Git / 子任务)优先级最高
  3. 控成本:余额查询 + 限额熔断,涨价后这是刚需
  4. 加能力:视觉模型接入、会话跨工具双向迁移
  5. 做排查:上下文查看器暴露轮次 / 压缩 / token 构成
  6. 提效率@ 文件引用增强、Skills 管理、皮肤市场
  7. 生态现状:近千款插件重复率极高,筛选成本大于安装成本
· 9 min read

DeepSeek Harness 把 AI 编程工具的每个组件都做成可插拔插件——模型适配器、工具注册、日志,连 AI 循环本身都能换。

  1. 定位:可拆装重组的 Agent 平台骨架,"成品车" vs "开源引擎 + 配件市场"
  2. 核心:连 AI 循环都是插件,4 层可替换 + seam 设计一处替换全局生效
  3. 标志:日志即真相,AI 看到的字节从账本重算,runtime 断言强制
  4. 适合:平台团队 / 合规重行业 / 多模型 A/B 测试;普通用户用 Codex / Claude Code 扩展够用
  5. 现状:0.1.0-rc.5 Preview,可接入绝大数模型,第三方插件鱼龙混杂,权限过大
  6. 设计模式:可逆副作用 / 类型化事件 / 文档生成 + 完整性守卫 / 防御式加载 / UI 订阅事件
· 8 min read

多模态模型的真正瓶颈不是 "看不清",而是 "指不准"

  1. Reference Gap(指代断裂):模型看到了目标对象,但在推理链中无法稳定引用"到底是哪一个"。"左边那个""他旁边的"这类自然语言描述在视觉空间里不是精确地址——场景越复杂、相似物体越多,语言变量就越容易在几步推理后漂移到另一个实体上。

  2. 解法:把边界框和坐标点变成推理链的中间变量。 每写下一个框 = 在草稿纸上钉一颗钉子,后续推理围绕这些坐标展开,不再依赖模糊的自然语言指代。论文将框和点定义为"视觉原语(Visual Primitive)"——本质上就是把人类"用手指点着数"的动作形式化到了 token 序列里。

  3. 工程压缩比 7056×:2916 patch tokens → 3×3 空间压缩 → 324 → CSA 注意力缓存压缩 → 81。语言模型 DeepSeek V4 Flash(284B/13B MoE)+ 从头训练 DeepSeek ViT,视觉 token 限制在 81–384,不靠无限堆 token。

  4. 数据说话:~90 个视觉缓存条目跑出 77.2 分,Gemini 3 Flash 用 1100 个拿 76.5 分。视觉 token 不是越多越好,关键是模型有没有办法把"这个对象"稳定地绑定到图像坐标上。