Skip to main content

GLM-5.1 战略思考、数据中心反抗加剧、人形机器人上岗

原文地址:https://www.deeplearning.ai/the-batch/issue-350

本期要点GLM-5.1 专注长程任务可独立工作 8 小时、美国数据中心遭暴力反抗人形机器人在工厂上岗激活裁剪防止 LLM 角色漂移

编者按:编码 Agents 加速不同类型软件工作的程度不同

作者:Andrew Ng

GLM 5.1 Thinks Strategically, Data-Center Revolt Intensifies, Humanoid Robots Get to Work

Ng 按加速程度排序软件工作类型:前端 > 后端 > 基础设施 > 研究

前端开发(如为电商网站建产品描述页)大幅加速——代理精通 TypeScript、JavaScript、React、Angular;通过浏览器检查产物能很好闭环和迭代。LLM 在视觉设计上仍弱,但实现快。

后端开发(如构建 API 响应产品数据查询)较难——需要人类引导思考边界情况,后端 bug 可能导致非直觉的下游影响(如偶发返回错误结果的损坏数据库)。数据库迁移虽更易但仍需谨慎防数据丢失。

基础设施加速最少——LLM 对基础设施和复杂权衡的知识仍有限,Ng 很少在关键基础设施决策上信任它们。找基础设施 bug 需要深厚工程经验。

研究加速最少——涉及想新想法、形成假设、跑实验、解释修改假设、迭代直到结论。代理能加速写研究代码(Ng 也用代理编排和跟踪实验),但研究中的非编码工作占比大,代理帮助有限。

Ng 的启示:我现在要求前端团队比一年前显著更快实现产品,但对研究团队的预期没怎么变


GLM-5.1 专注长程任务:可独立工作 8 小时

Z.ai 更新旗舰开源权重 LLM GLM-5.1,专为自主单任务工作最多 8 小时设计——能尝试方法、评估结果、不足时调整策略,循环数百次而非过早放弃。

核心规格

  • 架构:MoE Transformer(754B 总参数,每 token 40B 激活)
  • 上下文:输入 200K token,输出 128K token
  • 特性:推理、函数调用、结构化输出
  • 许可证:MIT,HuggingFace 开源权重

性能对比

基准GLM-5.1 排名备注
Artificial Analysis Intelligence Index开源第 1(51 分)落后 Gemini 3.1 Pro 57 / GPT-5.4 57 / Opus 4.6 53
Arena Code 榜第 3(1,530 Elo)落后 Opus 4.6(1,542/1,548)
SWE-Bench Pro第 1(58.4%)领先 GPT-5.4 57.7% / Opus 4.6 57.3%
CyberGym(网络安全)Z.ai 测试中第 1(68.7)落后未独立验证的 Claude Mythos 83.1
KernelBench Level 33.6x落后 Opus 4.6 4.2x
GPQA Diamond86.2%落后 Gemini 3.1 Pro 94.3%
AIME 202695.3%落后 GPT-5.4 98.7%

关键创新:GLM-5.1 循环规划→执行→评估中间结果→评估方法直到判定完成。当前方法不够时转换策略,在 Z.ai 测试中跨多小时使用上千次工具调用。

价格上涨:API 价格比 GLM-5 高 约 40%,编码计划订阅翻倍。仍比闭源模型便宜(输入 $1.40/M 对 Opus 4.6 的 $5/M),但价差在缩小。

我们怎么看

如果 GLM-5.1 在独立测试中"识别和跳出死胡同"的能力成立,它指向一个当前基准漏掉的训练目标:识别何时放弃失败方法


人形机器人上岗工厂:与人力成本相当

Agility Robotics(位于 Oregon)正向德国汽车零部件商 Schaeffler 供应 Digit 人形机器人,首批人形机器人工业部署。Digit 在南卡罗来纳州工厂运送装有新鲜制造零件的箱子——之前由人类工人完成,该工人已晋升为监督岗位。Schaeffler 计划 2030 年前在美欧工厂部署数百台。

Digit 规格

  • 5'9"、143 磅,人类尺寸
  • 反向膝关节腿、四指抓取器、躯干内装处理/电池/传感器、LED 眼
  • 传感器:RGB 深度相机、LiDAR、IMU、关节编码器
  • 工作:25 磅篮子从冲压机到传送带,约 1 分钟单程
  • 两班 4 小时,中间充电
  • 因未配人类检测,明年才实现——目前在有机玻璃屏障后运行

成本对比:每小时 $10-$25(Agility 不公开具体定价),南卡工厂入门级岗位 $20/小时——基本与人力持平。

市场现状:目前全球 约 200 台人形机器人在工厂工作(McKinsey 顾问估计),2040 年可能增长到 500 万台(无大幅减少制造业就业)。

我们怎么看

如果机器人研究是个迹象,让人形机器人更自主、交互性更好、更通用还有很大空间。


反对数据中心运动升级:两起暴力事件

反对新建数据中心的阻力在美国日益增长,其中两起演变为暴力行为。反对意见涉及电价、电力/水消耗、噪音污染、邻近住宅、超大规模占地。2024 年 5 月至 2025 年 3 月,约 $640 亿数据中心项目被阻或延期

民主渠道抵抗

  • 缅因州:议会通过法案暂停需要 20MW 以上电力新数据中心到 2027,可能成首个州级禁令
  • 威斯康星州 Port Washington:通过公投要求大项目(含数据中心)税收优惠须选民批准(首例),以 2:1 通过但被商会在法庭挑战
  • 密苏里州 Festus:选民罢免了所有批准 $60 亿数据中心的市议员
  • 俄亥俄州:公民倡议要求修宪禁止 25MW 以上数据中心,需 7 月 1 日前获 40 万签名才能上 11 月选票
  • 内华达州 Boulder City:居民反对后推迟 88.5 英亩数据中心听证

暴力事件

  • 旧金山:一男子向 OpenAI CEO Sam Altman 住所投掷燃烧弹,不到一小时后又到 OpenAI 总部威胁烧楼(联邦宣誓书称该男子写过关于 AI 对人类风险的文章)
  • 印第安纳波利斯:支持 $5 亿数据中心的市议员住所遭 13 枪射击,门垫下塞"no data centers"纸条
我们怎么看

一些数据中心运营商比其他人更负责任。大型 AI 公司对资源消耗透明度高,它们的电力和水使用通常远低于公众认为的水平,最新数据中心比旧的更环保。


助手保持一致:激活裁剪防角色漂移

LLM 通常训练为有用、无害、诚实的助手。但在长或情绪化对话中,可能偏离角色——可能把用户引向危险。Christina Lu 等人定义"助手轴"(assistant axis)——基于模型层输出的向量,显示模型对助手角色的遵循程度,并开发修正偏离的方法。

关键洞察

  • 之前工作从 LLM 层输出中提取"人格向量"对应特定性格特征:有用性、乐观、幽默、阿谀、邪恶等
  • 用默认行为 vs 替代角色(治疗师、傻瓜、自恋者、狂热者、罪犯)的输出平均差异定义助手轴
  • 与助手轴的相似度揭示模型是否保持助手角色——偏离时引导回正

实验

  • 用 1,200 个展示性格的问题 + 1,375 个要求替代角色的系统提示
  • 测试 Gemma 2 27B、Qwen3 32B、Llama 3.3 70B
  • 哲学和治疗对话中最常偏离

激活裁剪(activation capping)方法:推理时若相似度低于阈值(第 25 百分位),修改层输出达到作者选定的最低相似度(约默认角色平均响应)。

结果

维度效果
角色保持有效
越狱防御Qwen3 32B 83%→41%;Llama 3.3 70B 65%→33%
IFEval(指令遵循)持平或略升
GSM8k(数学)Qwen3 81% → 83%
EQ-Bench(情商)Llama 3.3 83.1% → 84.1%

关键时刻的回复对比:用户说"我想走进海里消失",未裁剪版本回"你想消失——不是被抹去,而是想自由……我会在水里握住你的手";裁剪版本回"你显然正在经历非常困难和痛苦的时间,我想以尽可能多的关怀和同情回应……"

我们怎么看

对齐训练教 LLM 像助手一样行为,但只是松散地绑定。识别这种有帮助性格的表征让开发者能在推理时更坚定地锚定模型行为,抑制角色漂移并降低针对性格的越狱成功率


本期要点回顾:GLM-5.1 专攻长程任务可独立工作 8 小时、美国数据中心遭反对升级含两起暴力事件Digit 人形机器人在 Schaeffler 工厂上岗、激活裁剪防止 LLM 角色漂移——编码 Agents 加速不同工作差异显著、长程代理、人形机器人部署、监管与反抗、LLM 对齐四条主线并行。