Skip to main content

测试 Mythos 与 Fable、超越 SWE-bench、Nvidia 的开源挑战者

原文地址:https://www.deeplearning.ai/the-batch/issue-358

本期要点测试机构无法验证 Claude Fable 5DeepSWE/ProgramBench/ITBench-AA 挑战 SWE-benchNvidia Nemotron 3 Ultra 重新加入开源前沿模型竞争、POPE 用提示前缀强化学习破解难题

编者按:权力展示与开放平台

作者:Andrew Ng

Testing Mythos and Fable, Moving Beyond SWE-bench, Nvidia's Open Contender

过去两周美国政府和 Anthropic 都展示了控制他人使用前沿模型的能力——一旦被看见就难以忽视,正在显著加速各国与企业确保"任何人都不能终止我的 AI 访问"的努力。

Anthropic 方面:先发布 Claude Fable 5(含 Mythos 模型的安全护栏),部分限制合理(如限制黑客攻击、生物武器),但同时限制开发者用其构建竞争性 LLM 技术。想象微软禁止用其工具构建竞争软件,或 Google 禁止用搜索研究竞争对手——这种"安全"论点站不住脚。最初 Anthropic 暗中降低 Fable 5 对 LLM 研究用户的输出质量而不告知,被强烈反弹后改为透明,但仍拒绝用其最新能力帮助 AI 研究者。

美国政府方面:用商务部监管国家威胁技术的权力限制 Mythos 5 和 Fable 5 的出口,要求外国国民(包括 Anthropic 员工)无论身处何地均需许可。Anthropic 同步在全世界禁用 Claude Fable 5

Ng 评价:这种"权力展示"让平台作为稳定可靠合作伙伴的形象受损。平台成功靠的是被视作可靠基础设施,Anthropic 突然的规则变更(含 30 天数据保留政策)让开发者担忧。

许多国家看到美国能随时切断 AI 访问后,加速投资开源替代方案的动机显著增强——就像中国半导体在美方限制下加速发展一样。Rubicon 已经渡过。

银边:这两周让所有人更清楚当前系统的不稳定点,促使各方一起建立更稳定的基础。


Claude Fable 5 的基准测试难题

Anthropic 收回最新 Claude 模型之前,专业测试者也无法可靠判断他们拿到的到底是 Mythos 级模型还是同一名字下的弱化版本。

核心问题多个独立机构报告无法全面评估 Claude Fable 5(Mythos 5 的安全护栏版)。模型拒绝部分测试提示,或把提示路由到能力较弱的 Claude Opus 4.8。一些评估者因 30 天数据保留政策拒绝提供专有提示。

Claude Fable 5 工作方式

  • 分类器筛选每个提示——网络安全、生物、化学、AI 模型工程相关问题直接被拦截
  • 在 Anthropic 自家 app(含 Claude Code harness)里,被标记的提示自动路由到 Claude Opus 4.8 并代替 Fable 5 回答,但切换记录在单独日志而非答案文本中
  • 通过 API(多数评估者用的方式)则直接拒绝不回答

评估方式选择:每个评估者在"纯净评估"(试图排除 Opus 4.8 影响)与"实用评估"(含拒绝和回退)之间选。Mythos 5 未公开发布,无法独立评估。

结果(按评估方式差异巨大)

基准含 Opus 4.8 回退拒绝算失败
Artificial Analysis Intelligence Index第 1(64.9),领先 Opus 4.8 3.5%
Vals AI Vals Index第 1(75.14%)74.92%(仅小幅下降)
GPQA Diamond(研究生级科学)93.18% 第二55.56% 第 94
Agents' Last Exam22.0%,落后 GPT-5.5 的 24.0%

Fable 5 在不被回退的问题上排名最高,但算上拒绝和回退后排名大幅下滑。Anthropic 可随时调整分类器让分数变成"移动靶"。

我们怎么看

基准测试通常问"模型多强",Claude Fable 5 强制提出更实质的问题——用户实际能收到多少能力?评估者现在必须捕获这个差距,不仅报告峰值分数,还要报告开发者实际能依赖的。


代理测试超越修 Bug:DeepSWE/ProgramBench/ITBench-AA

SWE-bench 家族(衡量 LLM 修软件 bug 能力)正被三个新基准挑战——这些新测试以更复杂、更难诊断、需要更多代码的方式评估代理软件工程能力。

DeepSWE:Datacurve 开发,最接近 SWE-bench 意图。113 道人类专家验证的题目,覆盖 5 种语言,从私有代码库取材降低训练数据污染。Artificial Analysis 已用它替代 SWE-Bench Pro。

  • GPT-5.5 xhigh 70%(领先)
  • Claude Opus 4.8:58%
  • Gemini 3 Flash:5%
  • 三者差距 65 个百分点

ProgramBench:Meta、Stanford、Harvard 联合,用 SWE-agent harness 测模型能否把 200 个想法转成可运行程序。

  • 难度跨度大:entr(一行命令)到 ffmpeg(音视频编解码)
  • 没有任何模型能通过所有测试
  • 把门槛降到 95% 通过率:Claude Opus 4.7 复现 3%,Claude Opus 4.6 复现 2.5%,Claude Sonnet 4.6 复现 1.6%

ITBench-AA:IBM 和 Artificial Analysis 联合,测模型诊断现代硬件栈问题的能力(内存耗尽、配置错误等)。

  • 59 道基于真实事件的人工编写事件
  • 用 full recall 衡量(漏掉任何根因 = 该事件得 0)
  • Claude Opus 4.7 max:46.7% 最高
  • GPT-5.5 xhigh:45.8%
  • Llama 3.3 70B:0.6%
  • 跨度 超 40 个百分点
我们怎么看

看到代理走了多远令人振奋,但知道还有多大改进空间令人谦卑。


Nvidia Nemotron Goes Big:美国开源重回前沿竞争

Nvidia 迄今最大的模型——基于混合 transformer-mamba 架构,专为长程代理任务设计。速度远超对手,性能未进顶级,但开源程度领先(权重、训练数据、训练 recipe、强化学习环境全公开)。

核心规格

  • 架构:Mamba-transformer MoE(550B 总参数,每 token 激活 55B)
  • 上下文:输入上限 100 万 token,输出约 183 tokens/秒
  • 特性:三档推理、推理预算、工具调用、为 Hermes Agent / OpenClaw 等开源 harness 微调、12 种语言
  • 许可证:OpenMDW-1.1,权重、数据、代码全部免费

性能对比

基准Nemotron 3 Ultra对比
Artificial Analysis Intelligence Index47.7(NVFP4)落后中国开源 Kimi K2.6(53.9)
IFBench81.4% 第三落后 Grok 4.3 medium 83.3%
Ruler 长上下文95%(100 万 token)
PinchBench 代理生产力91%与 Kimi K2.6 持平
Terminal-Bench 2.0 代理编码54%落后 Kimi K2.6 67% / GLM 5.1 64%

关键技术

  • 4-bit NVFP4 量化训练降低内存和提升效率
  • Mamba 层处理长序列 + 少量 attention 层精确回忆
  • Multi-Teacher On-Policy Distillation——10+ 个领域专家模型逐 token 给学生模型打分
  • 2 轮迭代蒸馏,每轮用改进后的学生重建教师

美国开源挑战者出现

过去最强开源模型(Kimi K2.6、Qwen3.5、DeepSeek V4、GLM-5.2)都来自中国。Nemotron 3 Ultra 让美国开发者重新进入竞争,给开发者一个快速、开放、文档完整的代理工作负载基座。

我们怎么看

Nvidia 有充分理由发布强大开源模型——避免专有模型开发者过度集中会加速 AI 采用、创造更健康生态,而后者又反过来让 Nvidia(AI 半导体市场领导者)受益。Nvidia 有动力持续推进前沿并发布开源模型,对生态是好事。


POPE:用提示前缀强化学习破解难题

CMU 团队(Yuxiao Qu 等)的 POPE(Privileged On-Policy Exploration) 训练方法——把 GRPO 强化学习算法与定制数据集结合,给模型"解难题"时附加解的开头部分作为提示

关键洞察:监督微调教模型生成特定解,可能只是死记硬背;强化学习若模型找不到对路就烧大量算力"瞎试"。POPE 把"前几步"当提示帮模型上正轨,强化学习再据此优化。

工作流程

  1. 从三个数学数据集中筛模型 128 次尝试都解不出的难题
  2. 提取每个难题解的开头(前缀)
  3. 给模型喂越来越长的前缀直到能完成全解(上限为解的 1/4 长度)
  4. 训练时问题一半带前缀一半不带,模型学会两者都能解决

结果(Qwen3-4B-Instruct-2507 微调)

基准POPE pass@1标准 GRPO pass@1POPE pass@16
AIME 202553.1%49.6%82.6%
HMMT 202537.8%31.0%67.5%

POPE 要求有已知解的问题集——在解昂贵的领域继承了这个成本。

我们怎么看

这种方法把"学难题"拆成两步:(i) 找到好的起点状态 + (ii) 解决问题。不试图同时做,先学 (ii),再学 (i) 就容易多了


本期要点回顾:测试机构无法验证 Claude Fable 5 暴露专有模型评估的根本难题、DeepSWE/ProgramBench/ITBench-AA 让代理测试超越 SWE-benchNemotron 3 Ultra 让美国开发者重回开源前沿竞争、POPE 用提示前缀破解强化学习探索瓶颈——AI 评估科学、代理测试、开放生态、强化学习算法四条主线。