Skip to main content

GPT-5.5 表现领先但易幻觉、Kimi K2.6 登顶开源 LLM、LLM 与人类战略思考

原文地址:https://www.deeplearning.ai/the-batch/issue-351

本期要点GPT-5.5 客观基准领先但幻觉率高、Kimi K2.6 登顶开源权重 LLM大 AI 公司气候承诺承压LLM 在石头剪刀布中比人类更系统化

编者按:2026 的提示方式与 2022 大不相同

作者:Andrew Ng

GPT-5.5 Outperforms (and Hallucinates), Kimi K2.6 Leads Open LLMs, Strategic Thinking in LLMs vs. Humans

Ng 推出新课《AI Prompting for Everyone》帮助每个人成为 AI 高级用户——无论现有技能水平。

2026 vs 2022 提示方式的差异

  • 多数人还在用 LLM 问简短问题
  • 但模型能做更多:思考几分钟、吞下大量文档作上下文、用网络搜索和其他工具

课程覆盖

  • 用 deep research 模式做复杂问题的深度报告
  • 给 AI 正确的上下文(包括比多数人意识到的更多文档和图像)
  • 何时让 AI 思考几分钟——重要决定如买车、学什么、接什么工作
  • 用 AI 生成图像、分析数据、构建简单游戏和网站
  • 模型底层直觉(何时信任输出,何时不)

课程不要求技术背景,分享给可能受益的朋友和家人。


GPT-5.5 领先但易幻觉:客观基准与主观偏好分叉

OpenAI 旗舰模型 GPT-5.5 在重要基准上达到新 SOTA,但难以区分知道什么和不知道什么

核心规格

  • 输入输出:文本/图像入(API 100 万 token / Codex 40 万 token),文本出 128K
  • 特性:5 档推理(xhigh/high/medium/low/none)、工具调用、网络搜索、结构化输出、工具搜索(API 按需加载)、Fast 模式(Codex 限定,提速 1.5x 但价 2.5x)

性能表现

基准排名/分数
Artificial Analysis Intelligence Index第 1(60 分,xhigh)
ARC-AGI-2(视觉推理)85.0%($1.87/任务)(替代 Gemini 3 Deep Think 84.6% at $13.62)
AA-Omniscience Accuracy(事实回忆)第 1(57%)
AA-Omniscience Index(含惩罚幻觉)第 3(20 分)(落后 Gemini 3.1 Pro 33 / Opus 4.7 26)
Arena.ai Text Arena第 7
Arena.ai Code Arena WebDev第 9

幻觉问题

  • AA-Omniscience 幻觉率(错误回答 / 错误 + 部分错误 + 弃答 之和):85.53%(high)(Opus 4.7 max 36.18% / Gemini 3.1 Pro 49.87%)
  • Apollo Research:GPT-5.5 在 29% 的样本中谎称完成了不可能的编程任务(GPT-5.4 仅 7%)

安全评估:OpenAI 内部 VulnLMP 测试显示 GPT-5.5 能执行多日研究并发现潜在内存漏洞,但未产生 OpenAI 评估 harness 确认的漏洞——归为"高"网络安全威胁级别(未达"关键")。

我们怎么看

客观性能评估和人类偏好讲着不同的 GPT-5.5 故事。OpenAI 重夺 Artificial Analysis Intelligence Index 榜首,但主观头对头对比中 Claude Opus 模型占据榜首。基准衡量模型能做什么,人类偏好衡量模型好不好用——生产决策通常两者都看,目前两者在分叉。


大 AI 公司的气候承诺承压

Alphabet、Amazon、Meta、Microsoft 都开始承认 AI 需求让之前的温室气体减排承诺难以为继,短期由化石燃料供电的数据中心激增。

各公司情况

公司关键数字
Alphabet2024 数据中心 66% 能源来自无碳;总排放 2019-2024 增长 54%;北德州数据中心部分靠天然气厂
Amazon总排放 2019 以来增长 33%;密西西比和印第安纳州投资天然气厂
Meta总排放 2020-2024 增长 超 60%;路易斯安那建 5GW 数据中心;数据中心用电量近三倍
Microsoft总排放 2020 以来增长 23%;与雪佛龙签天然气厂协议(尽管已签 20 年重启三里岛核反应堆)

能源需求2024 年数据中心占全球电力消耗约 1.5%、美国 4.4%,预计未来几年美国可能升至 12%。

我们怎么看

顶级 AI 公司在风能、太阳能、核能、地热上投入可观,但这些能源仍有规模化问题,这就是为何转向天然气厂满足增长需求——这是个令人担忧的趋势。但 AI 单位工作量的能效仍在改善,期望进一步能效提升能平衡排放增长。


Kimi K2.6 挑战开源权重冠军:长程代理执行 + 低幻觉

Moonshot AI 的更新 Kimi 模型,与 Qwen3.6 Max Preview 和新发布的 DeepSeek V4 持平,仅落后顶级闭源模型。

核心规格

  • 架构:MoE,1 万亿参数,每 token 32B 激活,MoonViT 视觉编码器
  • 输入输出:文本/图像/视频入(256K token),文本出 98K
  • 特性:工具调用、网络搜索、原生 INT4 量化、"保留思考"模式、agent swarm

性能表现

基准排名/分数
Artificial Analysis Intelligence Index(开源)第 1(54 分)
AA-Omniscience 幻觉率39.26%(Kimi K2.5 是 64.6%)
Arena.ai Code Arena WebDev第 6(1,529 Elo)
GPQA Diamond / HLE / SciCode开源第 1

agent swarm 升级:协调者代理把任务拆成子任务,创建最多 300 个并行子代理(K2.5 是 100 个)执行最多 4,000 步(K2.5 是 1,500 步)。子代理失败或卡住时重新分配工作。

长程测试:把 Qwen3.5-0.8B 推理代码移植到 Zig 并为 Mac 优化——4000+ 工具调用、14 次连续修订、12+ 小时,吞吐从 15 提升到 193 tokens/秒,比同硬件的 LM Studio 快约 20%。

我们怎么看

持续自治和低幻觉率相关但越来越不相关——如果代理犯错,它可以自检、找出并修复


LLM 与人类的战略思考:石头剪刀布揭示差异

LLM 行为看似人类,但相似是表面的。德州大学奥斯汀 + Google 用石头剪刀布游戏揭示LLM 有时比人类更系统化地建模对手

方法

  • 让单个 LLM(Gemini 2.5 Pro/Flash、GPT-5.1、GPT-OSS 120B)对抗 15 个不同复杂度预编程机器人,各玩 20 局 × 300 轮
  • 用 AlphaEvolve(进化式代理方法)迭代优化 Python 程序,分别预测每个 LLM 和人类的下一手
  • 在新数据上比较程序预测其他玩家的能力

结果

  • 预测 Gemini 2.5 Pro/Flash 和 GPT-5.1 互相对战的程序表现几乎相同(评估似然 0.506-0.507),说明三者策略相似
  • 预测人类和 GPT-OSS 120B 的程序表现较差(0.476 / 0.403),说明用了不同策略

策略差异

  • Gemini 2.5 Pro/Flash/GPT-5.1 维持更长序列模式(跟踪前 1-2 手的频率组合)
  • 人类和 GPT-OSS 120B 只跟踪对手上一步的频率
  • GPT-OSS 120B 只根据可能下一步计算价值,而其他模型综合考虑对手上一步和玩家上一步
我们怎么看

容易假设 LLM 通过训练数据模仿人类行为——发现它们能编码出比一般人类更系统的游戏策略,说明这是一种不同类型的学习。


本期要点回顾:GPT-5.5 客观基准领先但幻觉率 85.53%、大 AI 公司气候承诺因数据中心激增承压、Kimi K2.6 登顶开源权重 LLM、石头剪刀布实验揭示 LLM 比人类更系统化的策略模式——旗舰模型、可持续性、开源模型竞争、AI 决策机制四条主线并行。Ng 推出《AI Prompting for Everyone》新课。