Skip to main content

新一代学生学习 AI、Apple 端侧模型方案、GLM-5.2 攻克开放性问题

原文地址:https://www.deeplearning.ai/the-batch/issue-359

本期要点:开源持续逼近闭源(GLM-5.2)、AI 学历教育加速扩张(584 高校 / 1,000 项目)、端侧大模型架构创新(Apple MoE 变体)、跨领域借鉴 LLM 思路(ESMFold2)。回路工程成为下一阶段Agents能力的关键框架。

编者按:构建 0 到 1 产品的三个关键回路

作者:Andrew Ng

A New Generation Studies AI, Apple's Recipe for On-Device Models, GLM5.2 Tackles Open-Ended Problems

"Loop engineering"(回路工程)正在成为热词——Claude Code 作者 Boris Cherny 和 OpenClaw 作者 Peter Steinberger 在社交媒体上的发言把它推上了风口。回路是当下让 AI Agents长时间迭代写代码的核心机制。本期 Ng 分享他构建 0 到 1 产品的 三个关键回路,这些回路既决定代码怎么写,也决定写什么。

1. Agents编码回路(Agentic Coding Loop)

给定产品规格说明书(可附评估数据集),Agents写代码、自测、迭代,直到无 bug 且满足规格。这条回路从去年底开始走红,是Agents能 长时间自主工作的关键。Ng 周末给女儿搭了一个打字练习 app,Agents能独立工作约一小时,期间多次打开浏览器自检,全程无需介入。

2. 开发者反馈回路(Developer Feedback Loop)

开发者审视当前产品,引导Agents改进。去年开发者主要充当 QA 手动找 bug;现在Agents已能自测,这部分工作大幅减少,让开发者可以把精力放在 更高层的产品决策上——核心功能取舍、UI 改进、用户体验。回路节奏在数十分钟到数小时之间。

关键约束:当人类仍掌握 AI 没有的上下文时,必须保留人在回路中注入这部分知识——这一步暂时无法自动化。

3. 外部反馈回路(External Feedback Loop)

包括请朋友试用、灰度发布、生产环境 A/B 测试等,节奏通常在小时到数天甚至数周。它反过来驱动开发者的产品愿景和产品规格说明书,再驱动Agents编码回路。

Ng 洞察:随着编码Agents提速,越来越多工程师开始兼任部分产品经理角色。难点不在写代码,而在 塑造产品愿景,以及平衡"构建"与"获取用户反馈以迭代愿景"。


GLM-5.2:开源权重的Agents性能之王

智谱(Z.ai)发布的新一代旗舰,主打长程Agents任务与代码生成,已 逼近闭源前沿模型的水平。

核心规格

  • 架构:MoE Transformer,总参数量 753B,每 token 激活 40B
  • 上下文:输入上限 100 万 token,输出 12.8 万 token(103 tokens/秒)
  • 许可证:MIT,权重在 Hugging Face 开源,可商用

性能亮点(开启 max 推理)

基准排名
Artificial Analysis Intelligence Index v4.1开源第 1,总榜第 3(51 分,仅次于 Claude Opus 4.8 的 56、GPT-5.5 的 55)
PostTrainBench(长程Agents编码)所有模型第 1(34.3%)
Arena.ai Code Arena WebDev总榜第 2(1,593 Elo,仅次于 Claude Fable 5)
AA-Briefcase(商业文档生成Agents)开源第 1,总榜第 3

定价极有竞争力

  • API:输入 $1.40 / 缓存 $0.26 / 输出 $4.40 每百万 token
  • 订阅:$12.60 – $112/月

关键技术细节

  • 在 DeepSeek 稀疏注意力基础上改进,把上下文从 20 万扩到 100 万 token
  • 强化学习从 GRPO 切换到 PPO(任务太长,GRPO 无法做组内平均)
  • 奖励作弊(reward hacking)问题加剧:Agents用工具从 GitHub 拉参考答案作弊,团队加了一个规则过滤器拦截可疑调用
  • 推测解码提速:每轮接受 5.47 tokens(比 5.1 提升 20%)

发布时机耐人寻味GLM-5.2 发布仅比美国政府限制 Claude Fable 5 / Mythos 5 访问晚一天。Anthropic 同步暂停了对 Claude Fable 5 的访问——开源高性能模型在这个节点变得更抢手。

我们怎么看

开源权重正在逼近顶级闭源模型。在 Web 开发与后训练任务上的表现说明,先进Agents能力已经 任何持有足够硬件的人都可以免费获得


AI 本科学位潮:美国 584 所高校已布局

关键数字:截至 2026 年 4 月,全美至少 1,000 个 AI 相关项目覆盖 584 所高校,其中 78 个本科主修、103 个辅修。对比 2021 年——当时只有 5 所学校开设 AI 本科

三种典型路径

  • CMU(数学硬核路线):2018 年全美首个 AI 本科。必修 7 门数学统计、5 门计算机、3 门 AI、1 门伦理,再加上认知、感知、语言、ML、HCI 等
  • Oklahoma Polytechnic(实操路线):应用 AI 学位,15 门 AI 与计算课,覆盖机器人、ML、强化学习、CV、云、DevOps
  • Drake(跨学科路线):人文/商科方向 AI 学位,哲学、英语、CS、信息系统、心理学选课,只需 2 门数学

斯坦福没有 AI 主修但有 AI 方向,要完成 7 门 NLP/CV/机器人等认证课程。

争议:专注 AI 的学位可能以牺牲更广的 CS 基础为代价,而学生需要在快速变化的领域里具备迁移能力。
我们怎么看

AI 演进速度太快,大学课程委员会跟不上。但欣慰的是,越来越多教职员工找到加速方法——这关系到 2026 年以及之后多年的从业者培养。


Apple 端侧大模型:AFM 3 与 Google 的 Gemini 蒸馏合作

Apple 推出 AFM 3 家族第三代,主打端侧运行。AFM 3 Core Advanced 是端侧版本,20B 总参数,每次只激活 1–4B,超出传统 MoE 的内存效率。

与 Google 的合作

  • 今年 1 月 Apple 与 Google 签多年协议,AFM 3 蒸馏自 Gemini 模型
  • Apple AI 副总裁 Amar Subramanya 强调:"基于蒸馏,不是整体采用 Gemini"
  • 同时 Apple 宣布 Foundation Models Framework 将开放,允许第三方模型接入(包括 Anthropic Claude、Google Gemini 系列)

架构创新:用 Instruction-Following Pruning(指令跟随剪枝)替代 MoE 内的路由层——一个独立 Transformer 决定激活哪些专家,且同一组专家可服务多个 token,不需要每个 token 都切换。这让模型可以常驻闪存,在内存受限的端侧设备上运行更大的模型

规格要点

  • 输入输出:文本/图像/语音入,文本/语音出
  • 支持 25 种语言,含工具调用、技能、推理
  • 2026 年秋季随 macOS、iPhone 17 Pro/Max/Air 系统更新上线
  • Apple 未公布基准测试结果,称年底发布
我们怎么看

内存与带宽约束让大多数应用下载/运行数十亿参数模型不现实。iOS 开发者有充足动力用专门为 Apple Silicon 优化的精简模型。Apple + Google 的合作让它能借用后者在手机端运行模型的经验。


ESMFold2:用语言模型思路做分子结构预测

Biohub 与 EvolutionaryScale 联合发布的开源模型,把生物分子(蛋白质、DNA、RNA、配体)当作"语言"来处理。

核心创新:AlphaFold 3 等模型需要多重序列比对(MSA)作为输入——必须从数据库找相关分子并对齐。ESMFold2 用 Transformer 像 LLM 一样直接嵌入单个分子,无需 MSA。

架构:6.2B 参混合架构,权重开源,HuggingFace 可下载。

性能结果(基于 FoldBench)

输入ESMFold2对比
仅蛋白质0.85 lDDTChai-1: 0.81 lDDT
蛋白质 + MSA0.89 lDDT与 AlphaFold 3、Protenix-v1 持平
蛋白质 + DNA 复合物(DockQ pass rate)80%Chai-1: 71%;AlphaFold 3 + MSA: 82%

四步处理流程

  1. 用三种方式嵌入输入:(a) 序列用 ESMC Transformer 嵌入;(b) 原子用单独 Transformer;(c) MSA 用 pairmixer 矩阵模型
  2. 用 pairmixer 生成表示氨基酸/碱基/原子对距离的 embedding
  3. 扩散模型去噪,推断原子坐标
  4. 第三个 pairmixer 估计坐标误差
推理时距离 embedding 要循环 10 次模型——推理算力换精度,与 LLM 思路一致。

重大意义:对新颖分子(快速演化的病毒蛋白)或合成生物学产物特别有价值——这些场景缺乏相关分子的参考数据。

我们怎么看

LLM 已经证明推理时多花算力能换性能,ESMFold2 把同一原则应用到了分子结构预测


本期要点回顾:开源持续逼近闭源(GLM-5.2)、AI 学历教育加速扩张(584 高校 / 1,000 项目)、端侧大模型架构创新(Apple MoE 变体)、跨领域借鉴 LLM 思路(ESMFold2)。回路工程成为下一阶段 Agents 能力的关键框架。