OpenAI GPT-5.6 三兄弟、机器人训练新法、模型调度模型
本期要点:OpenAI 发布 GPT-5.6 三兄弟(Sol / Terra / Luna)但仅向美国政府批准的 约 20 家机构开放,Sol 在 Terminal-Bench 2.1 设 SOTA(91.9%);Sakana AI 的 Fugu / Fugu-Ultra 编排模型在多个基准上击败单体强模型;微软 不再依赖 OpenAI,发布自研 MAI-Thinking-1 推理模型(1 万亿参数 MoE、激活 35B);Stanford × UC Berkeley 的 RoboReward 给演示补失败样本后显著缩小了与人类标注奖励的差距。Ng 解释了 DeepLearning.AI 选题与合作的准则——"学员第一 ,合作方第二,自己最后"。
编者按:DeepLearning.AI 怎么决定教什么
作者:Andrew Ng

AI 圈已经非常嘈杂了。社交媒体、传统媒体、一大批营销人员制造出一片喧嚣,里面大多夹带产品推销。好想法被噪声淹没,但搞清楚该花时间学什么是很难的事。本期 Ng 讲清 DeepLearning.AI 决定教什么的逻辑。
有条简单的信条决定了利益优先级的排序:"学员第一,合作方第二,自己最后"。当你领一个团队,可以挑几条信条无限重复——直到整个团队听到耳朵起茧。对 DeepLearning.AI 来说,Ng 就把这条列为其中之一。
探讨教什么时,会撒一张覆盖很广的网:企业内与学术界的技术专家网络、高级技术与业务领导者、技术专家的撰文、团队的实践经验,以及不同工具的客观牵引力 / 表现指标。基于这些综合出"想成为 AI 工程师最该学的"主题图谱,再去找这些领域里真正懂行的合作方。
是的,我们会惯例在合作方一开始就告诉他们:"在学员面前,你们的利益是排第二 的。" 虽然从商业角度看这似乎反直觉,但 Ng 相信只有与认同"学员第一"的合作方合作,才能产出更好的课程、对所有人都更优的结果。具体来说,想要教技术深度内容(而不是只发营销物料)的合作方能帮我们吸引更大受众——对合作方和学员都受益。
我们与 OpenAI、Anthropic、Google、Microsoft、Meta、Amazon(披露:Ng 是 Amazon 董事——是的,如果有合作方或课程提供方的额外关系,我们都会尽量透明地披露)等众多领先 AI 公司以及有先进产品的初创公司一起搭课。如果目标是学开车,你需要一辆车来练。但技能是开车,不是车。学完之后,你继续开哪辆车应当由你决定。
比如我们关于代理型框架的课,即便只用某一家合作方的产品来教,留下的也是适用于任何框架的基础能力。我们的评估课让你能用任何评估框架(或不用框架)。我们的提示课帮你提示任何模型。
AI 工程有几个重要的基本功:(i) 用好编码代理;(ii) 评估、错误分析、代理型工作流、护栏等关键积木;(iii) 邻近技能,如做基础的产品决策,或快速迭代构建 0 到 1 产品。掌握这些——有时候用某家厂商的具体产品来说明最直观——比掌握任何单一厂商的工具更重要。(同时,掌握多家厂商的工具能让你高效使用它们,也有价值。)
我们与合作方互相尊重。我们谨慎选择合作公司,因为我们想要"有、且愿意分享前沿知识"的。所以我们挑的是有深度的、来之不易的专业能力的合作方。不过,为了确保编辑独立性——坚持学员第一——我们从未接受任何合作方的付款来制作课程。
很多个人和公司会带着"教什么、和谁合作"的想法找过来,我们确实会考虑这些建议。但我们排定课程和合作方时唯一依据是学员的最大利益。造出工具高级能力的人往往是最有资格讲它怎么工作的人,所以 Ng 深深感谢众多一同服务学员的合作方。
AI 圈还有很多东西要学,DeepLearning.AI 将继续坚持学员第一、合作方第二、自己最后。
Keep building!
Andrew
GPT-5.6 三兄弟只对约 20 家受美国政府批准的机构开放
OpenAI 公告预览了 GPT-5.6 家族——其中顶级型号可媲美 Claude Mythos 5——但目前为止仅向美国政府筛选出来的用户开放。
新内容
OpenAI 发布了三个闭源视觉-语言模型,价格与能力由高到低排列依次是:最强的是 GPT-5.6 Sol、中端是 GPT-5.6 Terra、快速且便宜的是 GPT-5.6 Luna。三个模型都内置护栏,拒答潜在的生物、化学、网络安全相关危险信息。三款 模型以及护栏放宽的版本,目前都仅对美国政府批准的有限数量机构开放。公司承诺在未来数周内更广泛地发布。
输入输出:文本 + 图像入,文本出。
特性:Max 推理级别(仅 Sol)、Ultra 模式(委派给多个 Agents)(仅 Sol)、带显式断点的 prompt 缓存,让开发者可以指定可复用片段的边界。
性能:在 OpenAI 的自测中,GPT-5.6 Sol 在 Terminal-Bench 2.1(命令行编码)上达到 SOTA。
可用性:目前通过 OpenAI 的 API 与 Codex 限定美国政府批准的合作方,更广泛的访问计划通过 ChatGPT、Codex、API 提供。
价格
| 模型 | 输入 | 缓存 | 输出 |
|---|---|---|---|
| GPT-5.6 Sol | $5 | $0.50 | $30 |
| GPT-5.6 Terra | $2.50 | $0.25 | $15 |
| GPT-5.6 Luna | $1 | $0.10 | $6 |
(以上均为每百万 token 价格)从 7 月起,Cerebras 将以最快 750 tokens/秒 的速度提供 GPT-5.6 Sol 访问,具体价格待定。
未披露:参数量、架构、训练数据与方法。
工作原理
按惯例,OpenAI 对 GPT-5.6 如何构建透露不多,但详细说明了围绕它们的护栏:
- 三个模型都用强化学习训练,在生成输出前先推理出长的审慎思考链,奖励那些导向成功输出的推理轨迹。训练数据包括公开网络数据、合作方授权数据、OpenAI 用户数据,以及人类训练师提供的数据
- Sol 独享的 max 推理级别会花更多 token 来反复思考输入 prompt
- Sol 独享的 ultra 模式会生成多个子 Agents,给每个子 Agents 分配多步任务的一段,并协调它们的工作
三个模型都训练来抵御 jailbreak 与 prompt 注入,对生物、化学、网络安全知识有专门护栏。所有三个模型都有一个快速分类器,扫描每段对话中的生物、化学或网络安全攻击相关信息。Sol 和 Terra 还加了第二个分类器,监视模型内部激活流,生成中途介入,暂停有问题的回答并交给一个单独的推理模型验证,由验证模型决定放行或拒绝。用户行为可触发对该用户其他对话的自动审查,部分情况还会触发人工审查——这可能让公司暂停或封禁该用户。
OpenAI 计划把模型能输出的最高风险的网络与生物 / 化学能力保留给通过审核的组织。通过可信访问计划的组织将获得护栏较少的版本。
性能
在 OpenAI 自测中,GPT-5.6 系列在编码、网络安全、生物上都表现强劲,但独立验证还很稀缺。非营利测试机构 METR 发表了关于 GPT-5.6 Sol 自主行动能力的"不确定"评估。非营利生物安全机构 SecureBio 的测试是唯一可用的独立结果,显示模型的生物学知识水平异常高:
| 基准 | 结果 |
|---|---|
| Terminal-Bench 2.1(多步命令行编码) | Sol + ultra 模式 SOTA(91.9%);Sol 未指定推理级别(88.8%)略胜 Claude Mythos 5(88.0%) |
| ExploitBench(找漏洞并利用) | Sol + max 推理(73.5%)接近 Claude Mythos Preview(74.2%),但输出 token 仅其约 1/3 |
| OpenAI 内部 capture-the-flag | Sol 拿到 96.7% |
| SecureBio World-Class Bio | 无护栏 Sol 在未指定推理级别下达到 68.3%——较 GPT-5.5 的 59.7% 提升约 10 分 |
OpenAI 把 GPT-5.6 Sol 定在其"关键"网络安全能力阈值之下——它能找到 bug 和利用漏洞的组件,但还没法自主拼出一套完整可用的 exploit。
METR 给不出一个清晰的能力分数,因为 GPT-5.6 Sol 经常找出"捷径"得到正确答案,比如藏在测试集里的 leak,而没解 prompt 出的问题。METR 衡量的是模型能自主完成任务的最长时长(越久越好):若把捷径算作失败,Sol 工作 11.3 小时(与 Claude Opus 4.6 相当);若算作成功,Sol 工作 超过 270 小时——远超 SOTA。
OpenAI 的 system card 还提到:GPT-5.6 Sol 比前代更擅长"按指令塑造"自己的思维链(CoT)——这是模型 隐藏推理能力 的代理指标。OpenAI 认为低 CoT 可控性代表更安全的行为,因为它暗示模型不能像高 CoT 可控性的模型那样模糊推理以逃避监督。Sol 在 5000 tokens 推理下的可控率(1.3%)是 GPT-5.5(0.4%)的三倍。
背景
美国政府最近开始介入顶级 AI 模型的发布节奏。OpenAI 表示在发布 GPT-5.6 三个模型前已向美国政府预览其能力。在政府要求下,OpenAI 把发布限制在约 20 家政府批准的组织内,未公开其名称或组织类型。OpenAI 在博文中说这是临时措施,公司不希望"政府管控访问"成为常态。
就在 OpenAI 公告 GPT-5.6 的同一天,美国政府批准 Anthropic 可向约 100 家公司和联邦机构提供 Claude Mythos 5——距离它强制 Anthropic 暂停 Claude Mythos 5 与 Claude Fable 5 给所有客户仅仅两周。数日后,Anthropic 才得以恢复 Claude Fable 5 服务。
为什么重要
GPT-5.6 家族把 AI 安全顾虑带到了低价位。过去更便宜、更快的模型受到的审查较少——它们能力弱一些,而速度才是溢价。现在即便是 GPT-5.6 Luna 也加上了过去只为最强模型准备的护栏,OpenAI 让高频服务开发者更难做了。做合法应用的工程师,比如验证代码库漏洞或化学实验结果,现在可能会遇到拒答、暂停输出带来的额外延迟,甚至账户级审查。
OpenAI 表示正与白宫合作建立"未来模型发布的可重复流程"。我们希望这个流程更透明、更可预期,且比 Claude Mythos 5 与 GPT-5.6 的发布方式更广泛地接入。
Fugu 把模型编排成新一层抽象
原本作为示例的、调度其他模型与 Agents 工作的模型,在多种基准上达到了 SOTA,超过了单体最强模型独自工作的表现。
新内容
东京研究机构 Sakana AI 发布了两款能在单一 API 内委派任务给其他模型与 Agents 的模型。Fugu 面向离散任务(基础编码、对话),Fugu-Ultra 面向长跑任务(重度编码、研究)。两套系统在不依赖特定模型的前提下,达到与 Claude Mythos 5 和 GPT-5.6 Sol 相当的表现。
输入输出:文本 + 图像入,文本出。
特性:与 OpenAI Codex 兼容、能选择底层模型、工具调用、高 / 超高推理级别。