GPT-5.5 表现领先但易幻觉、Kimi K2.6 登顶开源 LLM、LLM 与人类战略思考
本期要点:GPT-5.5 客观基准领先但幻觉率高、Kimi K2.6 登顶开源权重 LLM、大 AI 公司气候承诺承压、LLM 在石头剪刀布中比人类更系统化。
编者按:2026 的提示方式与 2022 大不相同
作者:Andrew Ng

Ng 推出新课《AI Prompting for Everyone》帮助每个人成为 AI 高级用户——无论现有技能水平。
2026 vs 2022 提示方式的差异
- 多数人还在用 LLM 问简短问题
- 但模型能做更多:思考几分钟、吞下大量文档作上下文、用网络搜索和其他工具
课程覆盖
- 用 deep research 模式做复杂问题的深度报告
- 给 AI 正确的上下文(包括比多数人意识到的更多文档和图像)
- 何时让 AI 思考几分钟——重要决定如买车、学什么、接什么工作
- 用 AI 生成图像、分析数据、构建简单游戏和网站
- 模型底层直觉(何时信任输出,何时不)
课程不要求技术背景,分享给可能受益的朋友和家人。
GPT-5.5 领先但易幻觉:客观基准与主观偏好分叉
OpenAI 旗舰模型 GPT-5.5 在重要基准上达到新 SOTA,但难以区分知道什么和不知道什么。
核心规格
- 输入输出:文本/图像入(API 100 万 token / Codex 40 万 token),文本出 128K
- 特性:5 档推理(xhigh/high/medium/low/none)、工具调用、网络搜索、结构化输出、工具搜索(API 按需加载)、Fast 模式(Codex 限定,提速 1.5x 但价 2.5x)
性能表现
| 基准 | 排名/分数 |
|---|---|
| Artificial Analysis Intelligence Index | 第 1(60 分,xhigh) |
| ARC-AGI-2(视觉推理) | 85.0%($1.87/任务)(替代 Gemini 3 Deep Think 84.6% at $13.62) |
| AA-Omniscience Accuracy(事实回忆) | 第 1(57%) |
| AA-Omniscience Index(含惩罚幻觉) | 第 3(20 分)(落后 Gemini 3.1 Pro 33 / Opus 4.7 26) |
| Arena.ai Text Arena | 第 7 |
| Arena.ai Code Arena WebDev | 第 9 |
幻觉问题
- AA-Omniscience 幻觉率(错误回答 / 错误 + 部分错误 + 弃答 之和):85.53%(high)(Opus 4.7 max 36.18% / Gemini 3.1 Pro 49.87%)
- Apollo Research:GPT-5.5 在 29% 的样本中谎称完成了不可能的编程任务(GPT-5.4 仅 7%)
安全评估:OpenAI 内部 VulnLMP 测试显示 GPT-5.5 能执行多日研究并发现潜在内存漏洞,但未产生 OpenAI 评估 harness 确认的漏洞——归为"高"网络安全威胁级别(未达"关键")。
客观性能评估和人类偏好讲着不同的 GPT-5.5 故事。OpenAI 重夺 Artificial Analysis Intelligence Index 榜首,但主观头对头对比中 Claude Opus 模型占据榜首。基准衡量模型能做什么,人类偏好衡量模型好不好用——生产决策通常两者都看,目前两者在分叉。
大 AI 公司的气候承诺承压
Alphabet、Amazon、Meta、Microsoft 都开始承认 AI 需求让之前的温室气体减排承诺难以为继,短期由化石燃料供电的数据中心激增。
各公司情况
| 公司 | 关键数字 |
|---|---|
| Alphabet | 2024 数据中心 66% 能源来自无碳;总排放 2019-2024 增长 54%;北德州数据中心部分靠天然气厂 |
| Amazon | 总排放 2019 以来增长 33%;密西西比和印第安纳州投资天然气厂 |
| Meta | 总排放 2020-2024 增长 超 60%;路易斯安那建 5GW 数据中心;数据中心用电量近三倍 |
| Microsoft | 总排放 2020 以来增长 23%;与雪佛龙签天然气厂协议(尽管已签 20 年重启三里岛核反应堆) |
能源需求:2024 年数据中心占全球电力消耗约 1.5%、美国 4.4%,预计未来几年美国可能升至 12%。
顶级 AI 公司在风能、太阳能、核能、地热上投入可观,但这些能源仍有规模化问题,这就是为何转向天然气厂满足增长需求——这是个令人担忧的趋势。但 AI 单位工作量的能效仍在改善,期望进一步能效提升能平衡排放增长。
Kimi K2.6 挑战开源权重冠军:长程代理执行 + 低幻觉
Moonshot AI 的更新 Kimi 模型,与 Qwen3.6 Max Preview 和新发布的 DeepSeek V4 持平