Hermes 对决 OpenClaw、网络安全警钟、Agents 能做人类工作吗
本期要点:Hermes Agent 超越 OpenClaw、网络安全警钟持续敲响、TML-Interaction-Small 实时多模态交互、现有 Agents 基准与人工作分布严重不匹配。
编者按:教育应该帮助所有人成功
作者:Andrew Ng

哈佛大学投票把本科 A 等级限制在约班级人数的 20%。Ng 明确反对——这与他相信的教育理念严重相悖。教育应该保持高标准,但要全力支持 100% 学习者的成功,而不是少数人。
哈佛行政方是在反对大量学生反对的情况下做出此决定的,目的是遏制分数膨胀。分数膨胀确实存在——越来越多大学给 A 和 B 的比例越来越高,让 GPA 作为技能信号越来越弱。但与此同时,我们想让学生成功。
教育机构的核心问题应该是:目标是帮助学生成功,还是评判学生?两者都有价值,但 Ng 在教育领域的工作几乎完全聚焦于前者。
Ng 的教育哲学
- 相信应允许甚至鼓励重做直到成功
- 作业应该主要帮助练习和学习("练习题"),而非主要判断技能("评估题")
- GPA 不是判断应聘者的重要信号——筛选和面试流程能更准确判 断是否真正有能力
- 不需要扩大 GPA 分布来识别谁真正优秀
精英的两种定义:一种是限制招生、再限制 20% 学生能得高分;另一种是设高标准教精英技能,但努力帮助每个人成功。后者用"排除"之外的方式定义精英。
Hermes Agent 挑战 OpenClaw:自动生成技能成关键差异
Nous Research(纽约 AI 实验室)2 月开源的 Hermes Agent 在 OpenRouter 平台的日 token 消耗榜单上超越 OpenClaw。OpenClaw 是广受欢迎的 AI 代理,发明人后来加入 OpenAI。
核心差异:自动构建技能——当 Hermes Agent 长时间工作或修复错误并判定任务成功时,会调用工具创建一个新技能。这把"自我改进"作为核心代理能力凸显出来。
架构亮点
| 模块 | 设计 |
|---|---|
| 代理循环 | 装配提示(含记忆、技能、工具)→ LLM → 工具/技能调用 → 循环 |
| 技能格式 | 标准 SKILL.md(OpenClaw 兼容),可自动创建 |
| 技能策展 | Curator 后台系统:90 天未用技能自动归档,LLM 判断是否合并/保留 |
| 记忆 | 两个通用文件(用户偏好 + workflow 经验教训)+ 可搜索对话数据库 + 外部(Honcho) |
| 目标追踪 | 完成后调 judge 模型判断目标是否完成,未完成则继续循环 |
背后故事:代理能力是随 LLM 获得多步规划、反思、使用工具能力而涌现的。Anthropic Claude Code 和 OpenAI Codex 在 2025 年获得开发人员青睐;OpenClaw 在 2026 年初成为开源现象;Hermes Agent 等"Claw 类"代理在 2 月涌现,4-5 月随易用性和自我改进能力增强而加速流行。
开源、不绑定特定 LLM/消息平台/技能格式的代理特别有价值——可在现有消息渠道使用,受限于 harness 但能用到最好的模型。
TML-Interaction-Small:实时多模态交互新架构
Thinking Machines Lab(Mira Murati 创办,运营约 15 个月)的首个公开模型预告:实时同时处理音频、视频、文本输入并生成输出,不用等用户说完。
架构创新
- 交互模型:MoE Transformer(276B 总参数,每 token 激活 12B)
- 背景推理模型:异步运行,调用工具不影响对话
- 微回合(micro-turns):200ms 块级交错输入处理与输出生成,消除传统轮次的边界感
- 编码器无关早期融合:跳过 Whisper/视觉 Transformer 等大型预训练编码器,从头训练 transformer + 感知器 + 解码器
性能表现
| 基准 | TML-Interaction | 对比 |
|---|---|---|
| FD-bench V1(音频延迟) | 0.40 秒 | Gemini-3.1-flash-live 0.57,GPT-Realtime-2 1.18 |
| FD-bench V1.5(中断/插话处理) | 77.8 质量 | GPT-Realtime-2 xhigh 47.8 |
| Audio MultiChallenge(多轮对话) | 43.4% APR | GPT-Realtime-2 xhigh 48.5% |
| BigBench Audio(音频推理) | 96.5% | 与 GPT-Realtime-2、Gemini-3.1-flash-live 并列 96.6% |
对比:TML-Interaction-Small 的前后台模型联合训练,而 Vocal Bridge(AI Fund 投资组合公司)采用编排方法——实时语音模型通过工具调用把重查询委托给独立推理模型,再把输出织回对话。前者灵活但延迟受限于底层 API、基本上仍是轮次制、切换是编排而非学习。
网络安全警钟:LLM 助长工业级攻击
Google 安全研究报告:黑客已使用 LLM 识别此前未知漏洞,劫持了一个广泛使用的 Web 管理工具。研究人员认为犯罪分子原本计划大规模利用该技术,发现它阻止了更广泛的攻击。
LLM 增强攻击的四种方式
- 变形恶意软件:每次复制/感染时改写自身代码(解密例程、命令、子程序),逃过杀毒软件
- 逻辑漏洞识别:能推理代码意图,发现常规工具看不见的漏洞
- 混淆网络:AI 工具引导恶意流量穿过多个被攻陷的中介服务器
- 不安全 AI 基础设施:AI 工具/模型本身成为攻击入口
背景:Anthropic 警告 Claude Mythos Preview 能自动发现未知漏洞;英国 AISI 报告 Mythos 和 GPT-5.5 能可靠执行人类需 3 小时的攻击(前预测 1 小时)——显著长于此前的 Opus 4.6(30 分钟任务)。
专家确认 Mythos 是安全威胁和防御的明显进步。当下一轮补丁让网络更安全时,软件开发者需要投入更多主动防御研究。
Agents 基准与人工作分布严重不匹配
CMU 和 Stanford 研究者把 43 个代理基准(10,000+ 例子)映射到美国劳工统计,发现基准过度聚焦软件开发,与真实工作分布脱节。
关键数字
| 维度 | 基准覆盖 | 美国实际 |
|---|---|---|
| "计算机与数学" 职业 | 8,622 例子(最多) | 5.2M 员工 |
| "办公与行政支持" | 3,186 例子 | 18.2M 员工 |
| "管理" | 676 例子 | 11M 员工 |
| 工资支出(计算机) | $563.6B/年 | 远低于办公支持 $869.8B 和管理 $1,326.3B |
覆盖度:单个基准最多覆盖 <50% 工作活动 / <60% 技能。所有基准加起来覆盖 56.5% 工作活动、85.4% 技能。
当前基准聚焦软件工程合理——代理编码正在爆发!某种程度上软件工程是把代理 AI 应用到其他工作的孵化器,更广泛工作活动的基准会适时出现。
本期要点回顾:Hermes Agent 借自动构建技能超越 OpenClaw、TML-Interaction-Small 实时多模态交互、LLM 助长工业级网络攻击、Agents 基准与人工作分布严重不匹配——开源代理生态、实时交互架构、AI 安全、基准科学性四条主线。