测试 Mythos 与 Fable、超越 SWE-bench、Nvidia 的开源挑战者
本期要点:测试机构无法验证 Claude Fable 5、DeepSWE/ProgramBench/ITBench-AA 挑战 SWE-bench、Nvidia Nemotron 3 Ultra 重新加入开源前沿模型竞争、POPE 用提示前缀强化学习破解难题。
编者按:权力展示与开放平台
作者:Andrew Ng

过去两周美国政府和 Anthropic 都展示了控制他人使用前沿模型的能力——一旦被看见就难以忽视,正在显著加速各国与企业确保"任何人都不能终止我的 AI 访问"的努力。
Anthropic 方面:先发布 Claude Fable 5(含 Mythos 模型的安全护栏),部分限制合理(如限制黑客攻击、生物武器),但同时限制开发者用其构建竞争性 LLM 技术。想象微软禁止用其工具构建竞争软件,或 Google 禁止用搜索研究竞争对手——这种"安全"论点站不住脚。最初 Anthropic 暗中降低 Fable 5 对 LLM 研究用户的输出质量而不告知,被强烈反弹后改为透明,但仍拒绝用其最新能力帮助 AI 研究者。
美国政府方面:用商务部监管国家威胁技术的权力限制 Mythos 5 和 Fable 5 的出口,要求外国国民(包括 Anthropic 员工)无论身处何地均需许可。Anthropic 同步在全世界禁用 Claude Fable 5。
Ng 评价:这种"权力展示"让平台作为稳定可靠合作伙伴的形象受损。平台成功靠的是被视作可靠基础设施,Anthropic 突然的规则变更(含 30 天数据保留政策)让开发者担忧。
许多国家看到美国能随时切断 AI 访问后,加速投资开源替代方案的动机显著增强——就像中国半导体在美方限制下加速发展一样。Rubicon 已经渡过。
银边:这两周让所有人更清楚当前系统的不稳定点,促使各方一起建立更稳定的基础。
Claude Fable 5 的基准测试难题
Anthropic 收回最新 Claude 模型之前,专业测试者也无法可靠判断他们拿到的到底是 Mythos 级模型还是同一名字下的弱化版本。
核心问题:多个独立机构报告无法全面评估 Claude Fable 5(Mythos 5 的安全护栏版)。模型拒绝部分测试提示,或把提示路由到能力较弱的 Claude Opus 4.8。一些评估者因 30 天数据保留政策拒绝提供专有提示。
Claude Fable 5 工作方式
- 分类器筛选每个提示——网络安全、生物、化学、AI 模型工程相关问题直接被拦截
- 在 Anthropic 自家 app(含 Claude Code harness)里,被标记的提示自动路由到 Claude Opus 4.8 并代替 Fable 5 回答,但切换记录在单独 日志而非答案文本中
- 通过 API(多数评估者用的方式)则直接拒绝不回答
评估方式选择:每个评估者在"纯净评估"(试图排除 Opus 4.8 影响)与"实用评估"(含拒绝和回退)之间选。Mythos 5 未公开发布,无法独立评估。
结果(按评估方式差异巨大)
| 基准 | 含 Opus 4.8 回退 | 拒绝算失败 |
|---|---|---|
| Artificial Analysis Intelligence Index | 第 1(64.9),领先 Opus 4.8 3.5% | — |
| Vals AI Vals Index | 第 1(75.14%) | 74.92%(仅小幅下降) |
| GPQA Diamond(研究生级科学) | 93.18% 第二 | 55.56% 第 94 |
| Agents' Last Exam | — | 22.0%,落后 GPT-5.5 的 24.0% |
Fable 5 在不被回退的问题上排名最高,但算上拒绝和回退后排名大幅下滑。Anthropic 可随时调整分类器让分数变成"移动靶"。
基准测试通常问"模型多强",Claude Fable 5 强制提出更实质的问题——用户实际能收到多少能力?评估者现在必须捕获这个差距,不仅报告峰值分数,还要报告开发者实际能依赖的。
代理测试超越修 Bug:DeepSWE/ProgramBench/ITBench-AA
SWE-bench 家族(衡量 LLM 修软件 bug 能力)正被三个新基准挑战——这些新测试以更复杂、更难诊断、需要更多代码的方式评估代理软件工程能力。
DeepSWE:Datacurve 开发,最接近 SWE-bench 意图。113 道人类专家验证的题目,覆盖 5 种语言,从私有代码库取材降低训练数据污染。Artificial Analysis 已用它替代 SWE-Bench Pro。
- GPT-5.5 xhigh 70%(领先)
- Claude Opus 4.8:58%
- Gemini 3 Flash:5%
- 三者差距 65 个百分点
ProgramBench:Meta、Stanford、Harvard 联合,用 SWE-agent harness 测模型能否把 200 个想法转成可运行程序。
- 难度跨度大:entr(一行命令)到 ffmpeg(音视频编解码)
- 没有任何模型能通过所有测试
- 把门槛降到 95% 通过率:Claude Opus 4.7 复现 3%,Claude Opus 4.6 复现 2.5%,Claude Sonnet 4.6 复现 1.6%
ITBench-AA:IBM 和 Artificial Analysis 联合,测模型诊断现代硬件栈问题的能力(内存耗尽、配置错误等)。
- 59 道基于真实事件的人工编写事件
- 用 full recall 衡量(漏掉任何根因 = 该事件得 0)
- Claude Opus 4.7 max:46.7% 最高
- GPT-5.5 xhigh:45.8%
- Llama 3.3 70B:0.6%
- 跨度 超 40 个百分点
看到代理走了多远令人振奋,但知道还有多大改进空间令人谦卑。
Nvidia Nemotron Goes Big:美国开源重回前沿竞争
Nvidia 迄今最大的模型——基于混合 transformer-mamba 架构,专为长程代理任务设计。速度远超对手,性能未进顶级,但开源程度领先(权重、训练数据、训练 recipe、强化学习环境全公开)。
核心规格
- 架构:Mamba-transformer MoE(550B 总参数,每 token 激活 55B)
- 上下文:输入上限 100 万 token,输出约 183 tokens/秒
- 特性:三档推理、推理预算、工具调用、为 Hermes Agent / OpenClaw 等开源 harness 微调、12 种语言
- 许可证:OpenMDW-1.1,权重、数据、代码全部免费
性能对比
| 基准 | Nemotron 3 Ultra | 对比 |
|---|---|---|
| Artificial Analysis Intelligence Index | 47.7(NVFP4) | 落后中国开源 Kimi K2.6(53.9) |
| IFBench | 81.4% 第三 | 落后 Grok 4.3 medium 83.3% |
| Ruler 长上下文 | 95%(100 万 token) | — |
| PinchBench 代理生产力 | 91% | 与 Kimi K2.6 持平 |
| Terminal-Bench 2.0 代理编码 | 54% | 落后 Kimi K2.6 67% / GLM 5.1 64% |
关键技术
- 4-bit NVFP4 量化训练降低内存和提升效率
- Mamba 层处理长序列 + 少量 attention 层精确回忆
- Multi-Teacher On-Policy Distillation——10+ 个领域专家模型逐 token 给学生模型打分
- 2 轮迭代蒸馏,每轮用改进后的学生重建教师
美国开源挑战者出现
过去最强开源模型(Kimi K2.6、Qwen3.5、DeepSeek V4、GLM-5.2)都来自中国。Nemotron 3 Ultra 让美国开发者重新进入竞争,给开发者一个快速、开放、文档完整的代理工作负载基座。
Nvidia 有充分理由发布强大开源模型——避免专有模型开发者过度集中会加速 AI 采用、创造更健康生态,而后者又反过来让 Nvidia(AI 半导体市场领导者)受益。Nvidia 有动力持续推进前沿并发布开源模型,对生态是好事。
POPE:用提示前缀强化学习破解难题
CMU 团队(Yuxiao Qu 等)的 POPE(Privileged On-Policy Exploration) 训练方法——把 GRPO 强化学习算法与定制数据集结合,给模型"解难题"时附加解的开头部分作为提示。
关键洞察:监督微调教模型生成特定解,可能只是死记硬背;强化学习若模型找不到对路就烧大量算力"瞎试"。POPE 把"前几步"当提示帮模型上正轨,强化学习再据此优化。
工作流程
- 从三个数学数据集中筛模型 128 次尝试都解不出的难题
- 提取每个难题解的开头(前缀)
- 给模型喂越来越长的前缀直到能完成全解(上限为解的 1/4 长度)
- 训练时问题一半带前缀一半不带,模型学会两者都能解决
结果(Qwen3-4B-Instruct-2507 微调)
| 基准 | POPE pass@1 | 标准 GRPO pass@1 | POPE pass@16 |
|---|---|---|---|
| AIME 2025 | 53.1% | 49.6% | 82.6% |
| HMMT 2025 | 37.8% | 31.0% | 67.5% |
POPE 要求有已知解的问题集——在解昂贵的领域继承了这个成本。
这种方法把"学难题"拆成两步:(i) 找到好的起点状态 + (ii) 解决问题。不试图同时做,先学 (ii),再学 (i) 就容易多了。
本期要点回顾:测试机构无法验证 Claude Fable 5 暴露专有模型评估的根本难题、DeepSWE/ProgramBench/ITBench-AA 让代理测试超越 SWE-bench、Nemotron 3 Ultra 让美国开发者重回开源前沿竞争、POPE 用提示前缀破解强化学习探索瓶颈——AI 评估科学、代理测试、开放生态、强化学习算法四条主线。