Skip to main content

新年特刊:Turing-AGI 测试提案、2026 科研与教育展望

原文地址:https://www.deeplearning.ai/the-batch/issue-334

本期要点Ng 提出 Turing-AGI 测试替代方案开源生态被多位研究者看好AI 从预测走向行动是 2026 关键转向AI 教育需与 AI 协作而非对抗

编者按:2026 是 AGI 之年吗?——Turing-AGI 测试提案

作者:Andrew Ng

New Year Special! Hopes for 2026 from David Cox, Adji Bousso Dieng, Juan M. Lavista Ferres, Tanmay Gupta, Pengtao Xie, Sharon Zhou

新年快乐!2026 会是 AGI 实现之年吗?Ng 提出新版本图灵测试——Turing-AGI Test

测试设计

  • 受试者(计算机或熟练专业人士)可访问带互联网接入和软件(浏览器、Zoom 等)的电脑
  • 裁判设计多日体验(通过电脑中介)让受试者执行工作任务
  • 例如:先培训(如呼叫中心接线员),然后要求完成任务
  • 计算机若能像熟练人类一样完成任务即通过测试

为何需要新测试

  • "AGI" 已变成炒作术语而非精确概念
  • 合理定义:AGI 是能做人类能做的任何智力任务的 AI
  • 炒作危害学生选专业和 CEO 投资决策
  • 原始图灵测试(欺骗人类裁判)不足以表明人类级智能
  • 当前 AI 开发目标是经济上有用的工作,而非欺骗裁判

Ng 愿景:若跑 Turing-AGI 测试竞赛所有 AI 系统都不达标,反而是好事——通过化解 AGI 炒作、减少泡沫风险、创造更可靠路径


2026 年 Agents 元年(编委视角)

编者视角

"组件已就位:AI 模型能生成连贯文本、图像、视频等数据;访问专有数据库;浏览网页。准备好迎接智能应用的寒武纪大爆发。"


David Cox:开源应胜出

IBM 研究院代表

核心立场我期待开源 AI 持续繁荣并最终获胜开放生态一直是真正创新的引擎,让社区建立在数十年进步之上。

类比 1990 年代开源之争某些公司的策略类似当年微软用免费 Windows 阻击 Linux

"假开源"现象所谓"开源"模型实际不公开训练集或方法。IBM 一直践行真开源——Stanford Transparency Index 评分 95%,领先第二名 23 分

Ng 注:IBM 以谨慎闻名,但谨慎是好事无聊即稳定,是可建造的基础


Adji Bousso Dieng:AI 应从效率工具转向科学发现催化剂

Princeton 大学 + CMU 研究者

2026 展望AI 从效率工具转向科学发现的催化剂

当前范式:过去十年深度学习主导范式是插值——模型擅长模仿训练数据分布,但对稀有样本(分布尾部)挣扎。AlphaFold 对稀有蛋白质的局限就是例子

核心问题:物理科学许多重大挑战(设计 de novo 蛋白质、发现新型 MOF 捕获 CO2)不能框定为监督学习

研究方向:超越最大化准确率和概率似然,提升多样性作为一等目标,而非仅视为公平性概念。在材料发现研究中,优化 Vendi Score 让标准搜索方法漏掉的稳定节能 MOF得以识别。


Juan M. Lavista Ferres:教育与 AI 协作而非对抗

Microsoft AI for Good 实验室首席数据科学家

核心观点:3 年多前 ChatGPT 发布,教育永远改变了

AI 检测器的失败:"如果生成式 AI 能写论文,我们就能建 AI 检测器识别它们"——这个希望是幻觉。检测器假设学生会提交原始模型输出,他们不会

军备竞赛问题:检测器可被用来训练规避系统,教育者面临无可信证据的裁决负担。传统的课外论文作为独立作者证明已失效

建议:真实能力演示、AI 素养、为 AI 设计而非对抗 AI 的作业


Tanmay Gupta:从预测到行动

Allen Institute for AI(AI2)研究者

2026 关键转向预测模型 ≠ 行动系统后者才是我们真正需要的

当前问题:过去十年我们在被动预测和生成建模上极为出色——为图像中的物体生成边界框和分割掩码。这些是代理任务——常被假设代表真实经济效用,这是谬误

2026 关键:AI 研究必须从解决这些代理任务果断转向对应的长期现实任务

优势:(1) 揭示短期基准上不可见的能力差距;(2) 真实任务展开在分钟、小时、月、年尺度,人类有跨周期整合多元信息的能力。


Pengtao Xie:多模态生物医学模型

加州大学圣地亚哥分校

当前问题:过去几年文本/图像/序列/图/时间序列联合推理的模型进展迅速,但在生物医学领域这些能力常碎片化

优先方向

  • 深度多模态集成(而非表面拼接):生物系统天然多尺度多视角
  • 可解释性:生物医学预测很少足够,需理解为何模型这样决策
  • 适应新任务的能力:多模态基础模型必须能适应数据有限、分布偏移、知识不全的领域
  • 整合到工作流:进度衡量不仅是基准,还有整合到生物医学工作流

Sharon Zhou:构建社区的聊天机器人

Hugging Face 共同创始人 + Lamini 创始人 + Stanford 教授

2026 愿景:AI 从与每个人 1:1 关系中走出来把人们聚在一起,用人类连接团结我们

互联网两极化:一端是AI slop 化,另一端是人类策展试图挡住 LLM。但不必对抗,可整合

新研究方向

  • 在更长上下文上后训练
  • 不同 RL 环境处理多人类上下文和目标
  • 模型架构创新:极 MoE(混合专家)有轻量级、部分共享的权重为每个人和你多维自我服务

Sharon 场景:凌晨 3 点,LLM介绍有共同问题的用户,加入对话讲笑话和提问,直到参与者交朋友、获得洞见。好奇心被分享时加速,有传染性


本期要点回顾:Ng 提出 Turing-AGI 测试替代炒作开源生态被多位研究者看好AI 从预测走向行动是 2026 关键转向AI 教育需与 AI 协作而非对抗。新年特刊 6 位研究者共同展望 AI 未来。