Skip to main content

OpenAI GPT-5.6 三兄弟、机器人训练新法、模型调度模型

原文地址:https://www.deeplearning.ai/the-batch/issue-360

本期要点:OpenAI 发布 GPT-5.6 三兄弟(Sol / Terra / Luna)但仅向美国政府批准的 约 20 家机构开放,Sol 在 Terminal-Bench 2.1 设 SOTA(91.9%);Sakana AI 的 Fugu / Fugu-Ultra 编排模型在多个基准上击败单体强模型;微软 不再依赖 OpenAI,发布自研 MAI-Thinking-1 推理模型(1 万亿参数 MoE、激活 35B);Stanford × UC Berkeley 的 RoboReward 给演示补失败样本后显著缩小了与人类标注奖励的差距。Ng 解释了 DeepLearning.AI 选题与合作的准则——"学员第一,合作方第二,自己最后"

编者按:DeepLearning.AI 怎么决定教什么

作者:Andrew Ng

OpenAI's GPT-5.6 Family, New Ways to Train Robots, Models Invoking Models

AI 圈已经非常嘈杂了。社交媒体、传统媒体、一大批营销人员制造出一片喧嚣,里面大多夹带产品推销。好想法被噪声淹没,但搞清楚该花时间学什么是很难的事。本期 Ng 讲清 DeepLearning.AI 决定教什么的逻辑。

有条简单的信条决定了利益优先级的排序:"学员第一,合作方第二,自己最后"。当你领一个团队,可以挑几条信条无限重复——直到整个团队听到耳朵起茧。对 DeepLearning.AI 来说,Ng 就把这条列为其中之一。

探讨教什么时,会撒一张覆盖很广的网:企业内与学术界的技术专家网络、高级技术与业务领导者、技术专家的撰文、团队的实践经验,以及不同工具的客观牵引力 / 表现指标。基于这些综合出"想成为 AI 工程师最该学的"主题图谱,再去找这些领域里真正懂行的合作方。

是的,我们会惯例在合作方一开始就告诉他们:"在学员面前,你们的利益是排第二的。" 虽然从商业角度看这似乎反直觉,但 Ng 相信只有与认同"学员第一"的合作方合作,才能产出更好的课程、对所有人都更优的结果。具体来说,想要教技术深度内容(而不是只发营销物料)的合作方能帮我们吸引更大受众——对合作方和学员都受益。

我们与 OpenAI、Anthropic、Google、Microsoft、Meta、Amazon(披露:Ng 是 Amazon 董事——是的,如果有合作方或课程提供方的额外关系,我们都会尽量透明地披露)等众多领先 AI 公司以及有先进产品的初创公司一起搭课。如果目标是学开车,你需要一辆车来练。但技能是开车,不是车。学完之后,你继续开哪辆车应当由你决定。

比如我们关于代理型框架的课,即便只用某一家合作方的产品来教,留下的也是适用于任何框架的基础能力。我们的评估课让你能用任何评估框架(或不用框架)。我们的提示课帮你提示任何模型。

AI 工程有几个重要的基本功:(i) 用好编码代理;(ii) 评估、错误分析、代理型工作流、护栏等关键积木;(iii) 邻近技能,如做基础的产品决策,或快速迭代构建 0 到 1 产品。掌握这些——有时候用某家厂商的具体产品来说明最直观——比掌握任何单一厂商的工具更重要。(同时,掌握多家厂商的工具能让你高效使用它们,也有价值。)

我们与合作方互相尊重。我们谨慎选择合作公司,因为我们想要"有、且愿意分享前沿知识"的。所以我们挑的是有深度的、来之不易的专业能力的合作方。不过,为了确保编辑独立性——坚持学员第一——我们从未接受任何合作方的付款来制作课程

很多个人和公司会带着"教什么、和谁合作"的想法找过来,我们确实会考虑这些建议。但我们排定课程和合作方时唯一依据是学员的最大利益造出工具高级能力的人往往是最有资格讲它怎么工作的人,所以 Ng 深深感谢众多一同服务学员的合作方。

AI 圈还有很多东西要学,DeepLearning.AI 将继续坚持学员第一、合作方第二、自己最后。

Keep building!

Andrew


GPT-5.6 三兄弟只对约 20 家受美国政府批准的机构开放

OpenAI 公告预览了 GPT-5.6 家族——其中顶级型号可媲美 Claude Mythos 5——但目前为止仅向美国政府筛选出来的用户开放。

新内容

OpenAI 发布了三个闭源视觉-语言模型,价格与能力由高到低排列依次是:最强的是 GPT-5.6 Sol、中端是 GPT-5.6 Terra、快速且便宜的是 GPT-5.6 Luna。三个模型都内置护栏,拒答潜在的生物、化学、网络安全相关危险信息。三款模型以及护栏放宽的版本,目前都仅对美国政府批准的有限数量机构开放。公司承诺在未来数周内更广泛地发布。

输入输出:文本 + 图像入,文本出。

特性:Max 推理级别(仅 Sol)、Ultra 模式(委派给多个 Agents)(仅 Sol)、带显式断点的 prompt 缓存,让开发者可以指定可复用片段的边界。

性能:在 OpenAI 的自测中,GPT-5.6 Sol 在 Terminal-Bench 2.1(命令行编码)上达到 SOTA。

可用性:目前通过 OpenAI 的 API 与 Codex 限定美国政府批准的合作方,更广泛的访问计划通过 ChatGPT、Codex、API 提供。

价格

模型输入缓存输出
GPT-5.6 Sol$5$0.50$30
GPT-5.6 Terra$2.50$0.25$15
GPT-5.6 Luna$1$0.10$6

(以上均为每百万 token 价格)从 7 月起,Cerebras 将以最快 750 tokens/秒 的速度提供 GPT-5.6 Sol 访问,具体价格待定。

未披露:参数量、架构、训练数据与方法。

工作原理

按惯例,OpenAI 对 GPT-5.6 如何构建透露不多,但详细说明了围绕它们的护栏:

  • 三个模型都用强化学习训练,在生成输出前先推理出长的审慎思考链,奖励那些导向成功输出的推理轨迹。训练数据包括公开网络数据、合作方授权数据、OpenAI 用户数据,以及人类训练师提供的数据
  • Sol 独享的 max 推理级别会花更多 token 来反复思考输入 prompt
  • Sol 独享的 ultra 模式会生成多个子 Agents,给每个子 Agents 分配多步任务的一段,并协调它们的工作

三个模型都训练来抵御 jailbreak 与 prompt 注入,对生物、化学、网络安全知识有专门护栏。所有三个模型都有一个快速分类器,扫描每段对话中的生物、化学或网络安全攻击相关信息。Sol 和 Terra 还加了第二个分类器,监视模型内部激活流,生成中途介入,暂停有问题的回答并交给一个单独的推理模型验证,由验证模型决定放行或拒绝。用户行为可触发对该用户其他对话的自动审查,部分情况还会触发人工审查——这可能让公司暂停或封禁该用户。

OpenAI 计划把模型能输出的最高风险的网络与生物 / 化学能力保留给通过审核的组织。通过可信访问计划的组织将获得护栏较少的版本

性能

在 OpenAI 自测中,GPT-5.6 系列在编码、网络安全、生物上都表现强劲,但独立验证还很稀缺。非营利测试机构 METR 发表了关于 GPT-5.6 Sol 自主行动能力的"不确定"评估。非营利生物安全机构 SecureBio 的测试是唯一可用的独立结果,显示模型的生物学知识水平异常高:

基准结果
Terminal-Bench 2.1(多步命令行编码)Sol + ultra 模式 SOTA(91.9%);Sol 未指定推理级别(88.8%)略胜 Claude Mythos 5(88.0%)
ExploitBench(找漏洞并利用)Sol + max 推理(73.5%)接近 Claude Mythos Preview(74.2%),但输出 token 仅其约 1/3
OpenAI 内部 capture-the-flagSol 拿到 96.7%
SecureBio World-Class Bio无护栏 Sol 在未指定推理级别下达到 68.3%——较 GPT-5.5 的 59.7% 提升约 10 分

OpenAI 把 GPT-5.6 Sol 定在其"关键"网络安全能力阈值之下——它能找到 bug 和利用漏洞的组件,但还没法自主拼出一套完整可用的 exploit。

METR 给不出一个清晰的能力分数,因为 GPT-5.6 Sol 经常找出"捷径"得到正确答案,比如藏在测试集里的 leak,而没解 prompt 出的问题。METR 衡量的是模型能自主完成任务的最长时长(越久越好):若把捷径算作失败,Sol 工作 11.3 小时(与 Claude Opus 4.6 相当);若算作成功,Sol 工作 超过 270 小时——远超 SOTA。

OpenAI 的 system card 还提到:GPT-5.6 Sol 比前代更擅长"按指令塑造"自己的思维链(CoT)——这是模型 隐藏推理能力 的代理指标。OpenAI 认为低 CoT 可控性代表更安全的行为,因为它暗示模型不能像高 CoT 可控性的模型那样模糊推理以逃避监督。Sol 在 5000 tokens 推理下的可控率(1.3%)是 GPT-5.5(0.4%)的三倍。

背景

美国政府最近开始介入顶级 AI 模型的发布节奏。OpenAI 表示在发布 GPT-5.6 三个模型前已向美国政府预览其能力。在政府要求下,OpenAI 把发布限制在约 20 家政府批准的组织内,未公开其名称或组织类型。OpenAI 在博文中说这是临时措施,公司不希望"政府管控访问"成为常态

就在 OpenAI 公告 GPT-5.6 的同一天,美国政府批准 Anthropic 可向约 100 家公司和联邦机构提供 Claude Mythos 5——距离它强制 Anthropic 暂停 Claude Mythos 5 与 Claude Fable 5 给所有客户仅仅两周。数日后,Anthropic 才得以恢复 Claude Fable 5 服务。

为什么重要

GPT-5.6 家族把 AI 安全顾虑带到了低价位。过去更便宜、更快的模型受到的审查较少——它们能力弱一些,而速度才是溢价。现在即便是 GPT-5.6 Luna 也加上了过去只为最强模型准备的护栏,OpenAI 让高频服务开发者更难做了。做合法应用的工程师,比如验证代码库漏洞或化学实验结果,现在可能会遇到拒答、暂停输出带来的额外延迟,甚至账户级审查

未来展望

OpenAI 表示正与白宫合作建立"未来模型发布的可重复流程"。我们希望这个流程更透明、更可预期,且比 Claude Mythos 5 与 GPT-5.6 的发布方式更广泛地接入


Fugu 把模型编排成新一层抽象

原本作为示例的、调度其他模型与 Agents 工作的模型,在多种基准上达到了 SOTA,超过了单体最强模型独自工作的表现

新内容

东京研究机构 Sakana AI 发布了两款能在单一 API 内委派任务给其他模型与 Agents 的模型。Fugu 面向离散任务(基础编码、对话),Fugu-Ultra 面向长跑任务(重度编码、研究)。两套系统在不依赖特定模型的前提下,达到与 Claude Mythos 5 和 GPT-5.6 Sol 相当的表现。

输入输出:文本 + 图像入,文本出。

特性:与 OpenAI Codex 兼容、能选择底层模型、工具调用、高 / 超高推理级别。

性能:Fugu 与 Fugu-Ultra 在 Terminal Bench 2.1、GPQA-Diamond、LiveCodeBench 上击败 Claude Fable 5、Claude Mythos Preview、GPT-5.5;Fugu-Ultra 在 CharXiv Reasoning、CTI-Realm 上同样击败上述三款,并在 SWE-Bench Pro、Humanity's Last Exam、LiveCodeBench Pro 上击败所有可用模型。

可用性:欧洲以外地区通过 Sakana API、OpenRouter、Vercel 等接入。

价格

套餐价格
Fugu按所选顶层模型的标准费率计费
Fugu-Ultra(含所有子模型与 Agents)$5/$30/$0.50 per 1M input/output/cached tokens;上下文 超过 272,000 tokens 时价格翻倍
Fugu-Ultra 订阅标准 / Pro / Max 套餐分别为 $20 / $100 / $200 每月(Pro 与 Max 分别允许 10× 与 30× 标准用量)

未披露:编排"配方"、数据集、架构、参数量。

工作原理

一篇技术论文把 Fugu 与 Fugu-Ultra 描述为同一家族的成员——模型被训练来调度代理型 worker。Fugu 强调速度,Fugu-Ultra 强调表现。两个模型都能调用多种 LLM——未披露的开源模型、Anthropic / Google / OpenAI 的闭源模型(包括 Claude Opus 4.8、Gemini 3.1 Pro、GPT-5.5),甚至 Fugu / Fugu-Ultra 自身。

接到 prompt 时,Fugu / Fugu-Ultra 会构建一个调用多种 LLM worker 的代理型工作流。对给定输入,Fugu 决定每一步该调哪个模型直到产出结果Fugu-Ultra 把输入切成子任务,设计一个以"产出结果"收尾的代理型工作流。对每个子任务,它会用一个模型来执行(可能是并行的)。它还能调用自身——这让它能进一步把子任务切成更细的子任务。

Sakana 在一个未披露的大型语言模型上做微调,让它完成编码、数学、语言理解、多步推理、代理型工具使用任务,从而构建了 Fugu 模型。对每一项有可验证输出的任务,Fugu 模型让所有 worker 模型都跑了很多遍团队根据每 worker 模型的成功完成率为其输出打分,并训练 Fugu 模型匹配这套分数分布。

监督微调之后,Sakana 用进化算法 sep-CMA-ES 训练 Fugu 模型——为定制代理型任务选择模型。作者指出,不同模型在完成任务的各个元素时各有所长。Sakana 训练 Fugu 模型在多种代理型框架(如 Claude Code、Codex、OpenCode)下、在固定步数内、选中能成功完成任务的模型。

Fugu-Ultra 使用 Conductor——一款协调代理系统的模型——把任务拆成子任务并协调多个 Agents 共同解决。Conductor 让每个 Agent 独立行动,在自己的子任务里调用它认为必要的工具,并且与其他 Agents 共享内存,所以每个 Agent 能看到其他 Agents 调过什么工具。

团队用强化学习算法 GRPO 在未披露的大型语言模型上训练 Fugu-Ultra,让它把池子里的 LLM 排列起来完成五步代理型工作流(由 Fugu-Ultra 自行生成)。他们把工作流扩展到任意步数,并把"产出与人类解法匹配的解"定义为成功。

结果

Fugu-Ultra 在 Sakana 自测的多项编码、推理、科学知识测试上达到 SOTA。其他类目里,它只落在当前未商用的模型(包括 Claude Fable 5)之后一点点。

基准Fugu-Ultra 表现
Terminal-Bench 2.1、LiveCodeBench、LiveCodeBench ProSOTA(软件工程任务)
SWE-Bench Pro仅次于 Claude Fable 5
GPQA-Diamond(研究生级科学知识)与 Fugu 一起 达到 95.5%——史上最高
SciCode(科学计算编码)Fugu 以 60.1 分拿到所有可用模型最佳,仅次于 Claude Fable 5;超过 Fugu-Ultra
AA-LCR(长上下文推理)Fugu SOTA
MCRv2(长上下文回填)Fugu / Fugu-Ultra 仅次于 GPT-5.5

背景

Sakana 此前探索过其他合并 AI 模型以汲取集体智能的路线,包括模型融合。但代理型编排仍是它最成功的路径。OpenRouter 此前展示过 Fusion——领先模型的组合可以击败单体模型,而巧妙混合低价模型也能逼近 SOTA,更划算。

为什么重要

美国政府近期限制 Claude Fable 5 与 GPT-5.6 访问的决定,激发了对"能调度其他模型与 Agents 的模型"的兴趣——开发者与组织希望降低对单一供应商或国家的依赖。甚至在 Anthropic 撤回 Claude Fable 5 通用访问前,许多组织就已不满公司新的数据保留要求。如果开发者完全掌控自己 orchestrator 模型池里的供应商,他们可以根据信息敏感度开关模型、降低成本,或服务任何运营功能

我们怎么看

模型编排是代理型工程的自然延伸——只是抽象层次更高,除了工具与子 Agents 外,还要切换多个模型。这允许一种新形式的竞争:开发者不再只消费某家公司的 API 来搭应用,而是把多家公司的模型调用起来,自己成为 API 提供方


微软不再依赖 OpenAI,从零自建推理模型

微软曾经是 OpenAI 的独家合作伙伴,至今仍大量转售其他公司的 AI 模型——这次它从零搭了自己的推理模型。

新内容

微软发布 MAI-Thinking-1——第一款不是从其他厂商的模型蒸馏或微调而来的推理模型。微软把 MAI-Thinking-1 描述为中量级模型,可媲美 Claude Sonnet 4.6。它引领了微软 Build 大会公布的 7 个 MAI 模型家族,其中包括已在 GitHub Copilot 与 VS Code 提供的小型编码模型 MAI-Code-1-Flash

输入输出:文本入(最高 256,000 tokens),文本出(最高 256,000 tokens)。

架构:Mixture of Experts,1 万亿参数总量,每次激活 350 亿参数

特性:函数调用、开发者指令(由开发者设置,在冲突时优先于用户 prompt)、与 OpenAI Chat Completions API 兼容。

性能:按微软自测,在 AIME 2025 数学基准上排第三。

可用性:通过 Microsoft Foundry 私有预览,更广泛的访问计划通过 Fireworks AI、Baseten、OpenRouter。

未披露:完整的数据集与数据提供商清单、价格。

工作原理

微软构建 MAI-Thinking-1 的方式是:先预训练一个基础模型,然后把几份分别微调成专门模型用作 teacher,再把它们蒸馏到一个 student,最后用强化学习教 student 推理。

预训练与中训练数据量分别为 30 万亿3.55 万亿 token,主要以人类生成内容为主,其中超过 50% 是代码。后训练数据包括超过 500 万道 STEM 题与超过 16 万道编码题。

微软主要在授权语料上预训练,避开合成数据。公司的论点是:用 AI 生成数据训练、或蒸馏自第三方 teacher 模型的模型,会继承 teacher 的设计选择、泛化能力差,直接训练则行为更易驾驭

补充训练数据上,微软爬取了约 1.2 万亿网页,过滤到 794 亿网页,另外从 Common Crawl(一个开源归档,其自身条款不授权其存储内容并要求用户自行承担使用风险)拉取 242 亿去重网页。

团队在这个基础模型上用强化学习训练了三个专家模型:一个专注 STEM 推理、一个专注代理型编码与工具调用、第三个主要专注助益性与安全性。三个模型不模仿其他模型的推理轨迹,而是生成原创的思维链,并对正确的数学解答、通过的代码测试用例、合理判断给予奖励

团队分两阶段合并三个专家模型:(i) 监督微调把它们蒸馏成一个模型;(ii) 一轮强化学习避免过度拒答、改善安全性与风格

结果

按微软自测,MAI-Thinking-1 在数学上最强,在研究生级科学与代理型编码上落后于其他模型(包括 Anthropic、DeepSeek、OpenAI 的模型)。在 AIME 2025(测试解决竞赛数学题能力)上:

模型得分
MAI-Thinking-197.0%
Claude Sonnet 4.695.6%
DeepSeek V3.293.1%
Claude Opus 4.699.8%

尚未发布独立评估或与更新模型的对比。

背景

微软长期依赖 OpenAI 的模型驱动 Copilot 等产品,其此前的自研模型也是建立在竞争对手模型之上。Phi 系列蒸馏自 OpenAI 的 GPT-4 与 GPT-5,MAI-DS-R1 则是 DeepSeek-R1 的微调版。2026 年 4 月这一格局被改写——微软与 OpenAI 修订了合作关系,微软对 OpenAI 模型的授权变为非独家,OpenAI 也获得自由可用任何云厂商服务其产品

为什么重要

在微软栈上的团队可以用上一个能力不俗的推理模型,而无需新增供应商或把数据搬出已有的工具。这可能会吸引微软 Azure 与 Copilot 的大量客户。微软表示计划基于 MAI-Thinking-1 与其兄弟模型所用的数据流水线造更多模型。

我们怎么看

公司立志训练一个完全可溯源的推理模型,但仍然大量依赖网络数据。别人也都这么做。迄今为止大语言模型的多数成功都建立在网络数据之上


更好的机器人奖励模型

用强化学习训练机器人时,手工设计的奖励函数费时费力,但通常比基于视觉-语言模型的通用奖励模型更有效。研究者造出了能缩小这一差距的奖励模型。

新内容

Stanford University 与 UC Berkeley 的 Tony Lee、Andrew Wagenmaker、Karl Pertsch 等人构建了 RoboReward——一款 40 亿参数80 亿参数尺寸的视觉-语言奖励模型家族。这些模型为多种机器人在多种任务上的表现给予奖励。作者还发布了用于训练与评测视觉-语言奖励模型的数据集与基准

核心洞见

流行的机器人动作文本-视频数据集主要包含成功动作示例,让模型很难学到成功与失败的差别。但可以通过重新标注正例来产生负例——例如,给一段"机器人把勺子放进锅里"的视频,把指令"把勺子放进锅里"换成"把勺子放在锅旁边"。还可以通过裁剪成功动作的视频来产生不完整尝试。

工作原理

作者构建了一个多样化的机器人动作数据集,每条样本包括:一条指令、一段机器人响应指令的视频,以及一个 1(失败)到 5(完成)的进度分。他们从两个已有的、单臂与双臂与人形机器人的数据集中收集视频,统一任务描述,用负例增强数据,再为样本分配进度分。

产生负例的流程

  1. GPT-5 mini 对一段成功响应指令的视频,描述 (i) 场景、(ii) 机器人动作、(iii) 场景与机器人的最终状态
  2. Qwen3-4B-Instruct-2507 拿到这份分析后,提案"会让视频进度分低于 5"的替代指令
  3. GPT-5 mini 分析这些替代样本,丢弃标签与视频不符的那些

作者还截断成功执行指令的视频,构造表示部分进度的负例。最后由 GPT-5 mini 给每个样本分配 1–4 的进度分。

作者对 Qwen3-VL 4B 与 Qwen3-VL 8B 做微调——给定视频与指令,预测进度分。进度分即作为奖励。

人工核验 2,831 条样本,构成名为 RoboRewardBench 的测试数据集。

结果

RoboReward 模型对 RoboRewardBench 中样本的奖励估计比机器人专用模型 Gemini Robotics-ER 1.5 与通用模型 GPT-5 更准。在真实机器人演示中,用 RoboReward 模型给的奖励训练比用先前奖励模型训练效果更好,但仍不如人类标注的奖励训练。

基准分数(MAE 越小越好)

模型MAE
RoboReward 8B0.665(最佳)
GPT-5 mini0.691
GPT-50.811
Gemini Robotics-ER 1.50.906
RoboReward 4B0.845(第 4 名)
Gemini 3 Pro0.851

真实演示中,一个用 RoboReward 8B 奖励训练的扩散 Transformer WidowX 机器臂胜过一个用 Gemini Robotics-ER 1.5 奖励训练的扩散 Transformer:

任务RoboReward 8B 训练Gemini Robotics-ER 1.5 训练人类标注奖励训练
把玩具捡起放在毛巾上50%10%75%
打开抽屉80%45%90%

为什么重要

视觉-语言奖励模型在训练机器人上一直备受期待,这个方法让它有效得多。在成功示范之外加上经核验的失败样本,作者训练出一个跨机器人类型、跨任务的通用奖励模型,缓解了对每个任务做专门工程的需要。

我们怎么看

发布基准和预训练奖励模型等于邀请社区直接改进奖励函数,而不是把它当作更好的通用模型的"副产物"。


本期要点回顾:OpenAI 发布 GPT-5.6 三兄弟(Sol / Terra / Luna)但仅向美国政府批准的 约 20 家机构开放;Sakana AI 的 Fugu / Fugu-Ultra 编排模型在多个基准上击败单体强模型;微软 不再依赖 OpenAI,从零自建 MAI-Thinking-1 推理模型(1 万亿参数 MoE、激活 35B);Stanford × UC Berkeley 的 RoboReward 给演示补失败样本后显著缩小了与人类标注奖励的差距。Ng 解释了 DeepLearning.AI 选题与合作的准则——"学员第一,合作方第二,自己最后"