新年特刊:Turing-AGI 测试提案、2026 科研与教育展望
本期要点:Ng 提出 Turing-AGI 测试替代方案、开源生态被多位研究者看好、AI 从预测走向行动是 2026 关键转向、AI 教育需与 AI 协作而非对抗。
编者按:2026 是 AGI 之年吗?——Turing-AGI 测试提案
作者:Andrew Ng

新年快乐!2026 会是 AGI 实现之年吗?Ng 提出新版本图灵测试——Turing-AGI Test。
测试设计
- 受试者(计算机或熟练专业人士)可访问带互联网接入和软件(浏览器、Zoom 等)的电脑
- 裁判设计多日体验(通过电脑中介)让受试者执行工作任务
- 例如:先培训(如呼叫中心接线员),然后要求完成任务
- 计算机若能像熟练人类一样完成任务即通过测试
为何需要新测试
- "AGI" 已变成炒作术语而非精确概念
- 合理定义:AGI 是能做人类能做的任何智力任务的 AI
- 炒作危害学生选专业和 CEO 投资决策
- 原始图灵测试(欺骗人类裁判)不足以表明人类级智能
- 当前 AI 开发目标是经济上有用的工作,而非欺骗裁判
Ng 愿景:若跑 Turing-AGI 测试竞赛所有 AI 系统都不达标,反而是好事——通过化解 AGI 炒作、减少泡沫风险、创造更可靠路径。
2026 年 Agents 元年(编委视角)
编者视角
"组件已就位:AI 模型能生成连贯文本、图像、视频等数据;访问专有数据库;浏览网页。准备好迎接智能应用的寒武纪大爆发。"
David Cox:开源应胜出
IBM 研究院代表
核心立场:我期待开源 AI 持续繁荣并最终获胜。开放生态一直是真正创新的引擎,让社区建立在数十年进步之上。
类比 1990 年代开源之争:某些公司的策略类似当年微软用免费 Windows 阻击 Linux。
"假开源"现象:所谓"开源"模型实际不公开训练集或方法。IBM 一直践行真开源——Stanford Transparency Index 评分 95%,领先第二名 23 分。
Ng 注:IBM 以谨慎闻名,但谨慎是好事。无聊即稳定,是可建造的基础。
Adji Bousso Dieng:AI 应从效率工具转向科学发现催化剂
Princeton 大学 + CMU 研究者
2026 展望:AI 从效率工具转向科学发现的催化剂。
当前范式:过去十年深度学习主导范式是插值——模型擅长模仿训练数据分布,但对稀有样本(分布尾部)挣扎。AlphaFold 对稀有蛋白质的局限就是例 子。
核心问题:物理科学许多重大挑战(设计 de novo 蛋白质、发现新型 MOF 捕获 CO2)不能框定为监督学习。
研究方向:超越最大化准确率和概率似然,提升多样性作为一等目标,而非仅视为公平性概念。在材料发现研究中,优化 Vendi Score 让标准搜索方法漏掉的稳定节能 MOF得以识别。
Juan M. Lavista Ferres:教育与 AI 协作而非对抗
Microsoft AI for Good 实验室首席数据科学家
核心观点:3 年多前 ChatGPT 发布,教育永远改变了。
AI 检测器的失败:"如果生成式 AI 能写论文,我们就能建 AI 检测器识别它们"——这个希望是幻觉。检测器假设学生会提交原始模型输出,他们不会。
军备竞赛问题:检测器可被用来训练规避系统,教育者面临无可信证据的裁决负担。传统的课外论文作为独立作者证明已失效。
建议:真实能力演示、AI 素养、为 AI 设计而非对抗 AI 的作业。
Tanmay Gupta:从预测到行动
Allen Institute for AI(AI2)研究者
2026 关键转向:预测模型 ≠ 行动系统。后者才是我们真正需要的。
当前问题:过去十年我们在被动预测和生成建模上极为出色——为图像中的物体生成边界框和分割掩码。这些是代理任务——常被假设代表真实经济效用,这是谬误。
2026 关键:AI 研究必须从解决这些代理任务果断转向对应的长期现实任务。
优势:(1) 揭示短期基准上不可见的能力差距;(2) 真实任务展开在分钟、小时、月、年尺度,人类有跨周期整合多元信息的能力。
Pengtao Xie:多模态生物医学模型
加州大学圣地亚哥分校
当前问题:过去几年文本/图像/序列/图/时间序列联合推理的模型进展迅速,但在生物医学领域这些能力常碎片化。
优先方向
- 深度多模态集成(而非表面拼接):生物系统天然多尺度多视角
- 可解释性:生物医学预测很少足够,需理解为何模型这样决策
- 适应新任务的能力:多模态基础模型必须能适应数据有限、分布偏移、知识不全的领域
- 整合到工作流:进度衡量不仅是基准,还有整合到生物医学工作流
Sharon Zhou:构建社区的聊天机器人
Hugging Face 共同创始人 + Lamini 创始人 + Stanford 教授
2026 愿景:AI 从与每个人 1:1 关系中走出来,把人们聚在一起,用人类连接团结我们。
互联网两极化:一端是AI slop 化,另一端是人类策展试图挡住 LLM。但不必对抗,可整合。
新研究方向:
- 在更长上下文上后训练
- 不同 RL 环境处理多人类上下文和目标
- 模型架构创新:极 MoE(混合专家)有轻量级、部分共享的权重为每个人和你多维自我服务
Sharon 场景:凌晨 3 点,LLM介绍有共同问题的用户,加入对话讲笑话和提问,直到参与者交朋友、获得洞见。好奇心被分享时加速,有传染性。
本期要点回顾:Ng 提出 Turing-AGI 测试替代炒作、开源生态被多位研究者看好、AI 从预测走向行动是 2026 关键转向、AI 教育需与 AI 协作而非对抗。新年特刊 6 位研究者共同展望 AI 未来。