GLM-5.1 战略思考、数据中心反抗加剧、人形机器人上岗
本期要点:GLM-5.1 专注长程任务可独立工作 8 小时、美国数据中心遭暴力反抗、人形机器人在工厂上岗、激活裁剪防止 LLM 角色漂移。
编者按:编码 Agents 加速不同类型软件工作的程度不同
作者:Andrew Ng

Ng 按加速程度排序软件工作类型:前端 > 后端 > 基础设施 > 研究。
前端开发(如为电商网站建产品描述页)大幅加速——代理精通 TypeScript、JavaScript、React、Angular;通过浏览器检查产物能很好闭环和迭代。LLM 在视觉设计上仍弱,但实现快。
后端开发(如构建 API 响应产品数据查询)较难——需要人类引导思考边界情况,后端 bug 可能导致非直觉的下游影响(如偶发返回错误结果的损坏数据库)。数据库迁移虽更易但仍需谨慎防数据丢失。
基础设施加速最少——LLM 对基础设施和复杂权衡的知识仍有限,Ng 很少在关键基础设施决策上信任它们。找基础设施 bug 需要深厚工程经验。
研究加速最少——涉及想新想法、形成假设、跑实验、解释修改假设、迭代直到结论。代理能加速写研究代码(Ng 也用代理编排和跟踪实验),但研究中的非编码工作占比大,代理帮助有限。
Ng 的启示:我现在要求前端团队比一年前显著更快实现产品,但对研究团队的预期没怎么变。
GLM-5.1 专注长程任务:可独立工作 8 小时
Z.ai 更新旗舰开源权重 LLM GLM-5.1,专为自主单任务工作最多 8 小时设计——能尝试方法、评估结果、不足时调整策略,循环数百次而非过早放弃。
核心规格
- 架构:MoE Transformer(754B 总参数,每 token 40B 激活)
- 上下文:输入 200K token,输出 128K token
- 特性:推理、函数调用、结构化输出
- 许可证:MIT,HuggingFace 开源权重
性能对比
| 基准 | GLM-5.1 排名 | 备注 |
|---|---|---|
| Artificial Analysis Intelligence Index | 开源第 1(51 分) | 落后 Gemini 3.1 Pro 57 / GPT-5.4 57 / Opus 4.6 53 |
| Arena Code 榜 | 第 3(1,530 Elo) | 落后 Opus 4.6(1,542/1,548) |
| SWE-Bench Pro | 第 1(58.4%) | 领先 GPT-5.4 57.7% / Opus 4.6 57.3% |
| CyberGym(网络安全) | Z.ai 测试中第 1(68.7) | 落后未独立验证的 Claude Mythos 83.1 |
| KernelBench Level 3 | 3.6x | 落后 Opus 4.6 4.2x |
| GPQA Diamond | 86.2% | 落后 Gemini 3.1 Pro 94.3% |
| AIME 2026 | 95.3% | 落后 GPT-5.4 98.7% |
关键创新:GLM-5.1 循环规划→执行→评估中间结果→评估方法直到判定完成。当前方法不够时转换策略,在 Z.ai 测试中跨多小时使用上千次工具调用。
价格上涨:API 价格比 GLM-5 高 约 40%,编码计划订阅翻倍。仍比闭源模型便宜(输入 $1.40/M 对 Opus 4.6 的 $5/M),但价差在缩小。
如果 GLM-5.1 在独立测试中"识别和跳出死胡同"的能力成立,它指向一个当前基准漏掉的训练目标:识别何时放弃失败方法。