Skip to main content

Hermes 对决 OpenClaw、网络安全警钟、Agents 能做人类工作吗

原文地址:https://www.deeplearning.ai/the-batch/issue-354

本期要点Hermes Agent 超越 OpenClaw、网络安全警钟持续敲响TML-Interaction-Small 实时多模态交互现有 Agents 基准与人工作分布严重不匹配

编者按:教育应该帮助所有人成功

作者:Andrew Ng

Hermes vs. OpenClaw, Cybersecurity Alarms Ring, Can Agents Do Human Work?

哈佛大学投票把本科 A 等级限制在约班级人数的 20%。Ng 明确反对——这与他相信的教育理念严重相悖。教育应该保持高标准,但要全力支持 100% 学习者的成功,而不是少数人。

哈佛行政方是在反对大量学生反对的情况下做出此决定的,目的是遏制分数膨胀。分数膨胀确实存在——越来越多大学给 A 和 B 的比例越来越高,让 GPA 作为技能信号越来越弱。但与此同时,我们想让学生成功

教育机构的核心问题应该是:目标是帮助学生成功,还是评判学生?两者都有价值,但 Ng 在教育领域的工作几乎完全聚焦于前者

Ng 的教育哲学

  • 相信应允许甚至鼓励重做直到成功
  • 作业应该主要帮助练习和学习("练习题"),而非主要判断技能("评估题")
  • GPA 不是判断应聘者的重要信号——筛选和面试流程能更准确判断是否真正有能力
  • 不需要扩大 GPA 分布来识别谁真正优秀

精英的两种定义:一种是限制招生、再限制 20% 学生能得高分;另一种是设高标准教精英技能,但努力帮助每个人成功。后者用"排除"之外的方式定义精英。


Hermes Agent 挑战 OpenClaw:自动生成技能成关键差异

Nous Research(纽约 AI 实验室)2 月开源的 Hermes Agent 在 OpenRouter 平台的日 token 消耗榜单上超越 OpenClaw。OpenClaw 是广受欢迎的 AI 代理,发明人后来加入 OpenAI。

核心差异自动构建技能——当 Hermes Agent 长时间工作或修复错误并判定任务成功时,会调用工具创建一个新技能。这把"自我改进"作为核心代理能力凸显出来。

架构亮点

模块设计
代理循环装配提示(含记忆、技能、工具)→ LLM → 工具/技能调用 → 循环
技能格式标准 SKILL.md(OpenClaw 兼容),可自动创建
技能策展Curator 后台系统:90 天未用技能自动归档,LLM 判断是否合并/保留
记忆两个通用文件(用户偏好 + workflow 经验教训)+ 可搜索对话数据库 + 外部(Honcho)
目标追踪完成后调 judge 模型判断目标是否完成,未完成则继续循环

背后故事:代理能力是随 LLM 获得多步规划、反思、使用工具能力而涌现的。Anthropic Claude Code 和 OpenAI Codex 在 2025 年获得开发人员青睐;OpenClaw 在 2026 年初成为开源现象;Hermes Agent 等"Claw 类"代理在 2 月涌现,4-5 月随易用性和自我改进能力增强而加速流行。

我们怎么看

开源、不绑定特定 LLM/消息平台/技能格式的代理特别有价值——可在现有消息渠道使用,受限于 harness 但能用到最好的模型。


TML-Interaction-Small:实时多模态交互新架构

Thinking Machines Lab(Mira Murati 创办,运营约 15 个月)的首个公开模型预告:实时同时处理音频、视频、文本输入并生成输出,不用等用户说完。

架构创新

  • 交互模型:MoE Transformer(276B 总参数,每 token 激活 12B)
  • 背景推理模型:异步运行,调用工具不影响对话
  • 微回合(micro-turns)200ms 块级交错输入处理与输出生成,消除传统轮次的边界感
  • 编码器无关早期融合:跳过 Whisper/视觉 Transformer 等大型预训练编码器,从头训练 transformer + 感知器 + 解码器

性能表现

基准TML-Interaction对比
FD-bench V1(音频延迟)0.40 秒Gemini-3.1-flash-live 0.57,GPT-Realtime-2 1.18
FD-bench V1.5(中断/插话处理)77.8 质量GPT-Realtime-2 xhigh 47.8
Audio MultiChallenge(多轮对话)43.4% APRGPT-Realtime-2 xhigh 48.5%
BigBench Audio(音频推理)96.5%与 GPT-Realtime-2、Gemini-3.1-flash-live 并列 96.6%

对比:TML-Interaction-Small 的前后台模型联合训练,而 Vocal Bridge(AI Fund 投资组合公司)采用编排方法——实时语音模型通过工具调用把重查询委托给独立推理模型,再把输出织回对话。前者灵活但延迟受限于底层 API、基本上仍是轮次制、切换是编排而非学习。


网络安全警钟:LLM 助长工业级攻击

Google 安全研究报告:黑客已使用 LLM 识别此前未知漏洞,劫持了一个广泛使用的 Web 管理工具。研究人员认为犯罪分子原本计划大规模利用该技术,发现它阻止了更广泛的攻击。

LLM 增强攻击的四种方式

  1. 变形恶意软件每次复制/感染时改写自身代码(解密例程、命令、子程序),逃过杀毒软件
  2. 逻辑漏洞识别:能推理代码意图,发现常规工具看不见的漏洞
  3. 混淆网络:AI 工具引导恶意流量穿过多个被攻陷的中介服务器
  4. 不安全 AI 基础设施:AI 工具/模型本身成为攻击入口

背景:Anthropic 警告 Claude Mythos Preview 能自动发现未知漏洞;英国 AISI 报告 Mythos 和 GPT-5.5 能可靠执行人类需 3 小时的攻击(前预测 1 小时)——显著长于此前的 Opus 4.6(30 分钟任务)。

我们怎么看

专家确认 Mythos 是安全威胁和防御的明显进步。当下一轮补丁让网络更安全时,软件开发者需要投入更多主动防御研究。


Agents 基准与人工作分布严重不匹配

CMU 和 Stanford 研究者把 43 个代理基准(10,000+ 例子)映射到美国劳工统计,发现基准过度聚焦软件开发,与真实工作分布脱节。

关键数字

维度基准覆盖美国实际
"计算机与数学" 职业8,622 例子(最多)5.2M 员工
"办公与行政支持"3,186 例子18.2M 员工
"管理"676 例子11M 员工
工资支出(计算机)$563.6B/年远低于办公支持 $869.8B 和管理 $1,326.3B

覆盖度:单个基准最多覆盖 <50% 工作活动 / <60% 技能。所有基准加起来覆盖 56.5% 工作活动、85.4% 技能。

我们怎么看

当前基准聚焦软件工程合理——代理编码正在爆发!某种程度上软件工程是把代理 AI 应用到其他工作的孵化器,更广泛工作活动的基准会适时出现。


本期要点回顾:Hermes Agent 借自动构建技能超越 OpenClaw、TML-Interaction-Small 实时多模态交互、LLM 助长工业级网络攻击、Agents 基准与人工作分布严重不匹配——开源代理生态、实时交互架构、AI 安全、基准科学性四条主线。