Skip to main content

Gemini 夺得领先、投资者对 Agents 恐慌、全球 AI 峰会召开

原文地址:https://www.deeplearning.ai/the-batch/issue-342

本期要点Gemini 3.1 Pro Preview 多基准 SOTASaaSpocalypse 软件股暴跌印度 AI Impact Summit 全球南方首次主办本地 AI 每瓦智能逼近云端

编者按:Skill Builder —— 帮你定位 AI 技能坐标

作者:Andrew Ng

Gemini Seizes the Lead, Investors Panic Over Agentic AI, Global AI Summit

DeepLearning.AI 发布 Skill Builder 工具——帮助用户识别 AI 技能强弱、给出下一步学习建议。对话式 AI 顾问,适合从初学者到构建复杂 agentic workflow 的高级用户。

功能设计

  • 告诉 Skill Builder 你的 AI 项目,它给出个性化反馈和提升路径
  • 对话后生成总结报告和下一步学习建议
  • Pro 会员获更详细的个性化反馈
  • 免费对所有人开放

Ng 学新技能时也常困惑"自己站在哪"——Skill Builder 解决这种"不知道自己不知道什么"的问题。


Gemini 3.1 Pro Preview:性能提升不靠推理成本

Google 更新旗舰 Gemini 模型,多项基准领先同时保持每美元性能优势。

核心规格

  • 上下文:文本/图像/PDF/音频/视频入(100 万 token),文本出 64K(108.6 tokens/秒)
  • 特性:工具使用、可调推理(low/medium/high)
  • 价格:API $2/$0.20/$12 每百万输入/缓存/输出 token(200K 以下上下文),200K 以上 $4/$0.40/$18

性能表现

基准Gemini 3.1 Pro Preview对比
Artificial Analysis Intelligence Index57 分第 1($892)领先 Opus 4.6(53/$2,486)/ GPT-5.2(51/$2,304)/ GLM-5(50/$547)
10 个子基准领先 6 个
Arena 编码榜第 7用户偏好头对头排名落后
GDPval-AA 代理40%落后 Sonnet 4.6 57% / GLM-5 45%
ARC-AGI-277.1%($0.96/任务)远超前代 31.1%,领先 Opus 4.6(69.2% / $3.47)

关键洞察:性能提升不是来自更多推理计算,而是来自模型质量改进——完成 Intelligence Index 用 token 数与前代持平但分数大幅提高。

我们怎么看

在 ARC-AGI-2 上 Gemini 3.1 Pro Preview(高推理)与 Gemini 3.1 Deep Think 的差距不到 10 个百分点,但价格只有 1/13。Deep Think 应该只用于最难的问题


全球 AI 峰会:从理论危险转向实际应用

第四届全球 AI 峰会(AI Impact Summit,2 月 16-20 日新德里)展现从理论危害担忧到在全球普及 AI 利益的明确转变。

关键事实

  • 首个在全球南方主办的全球 AI 峰会
  • 数十万参与者,100+ 国家代表
  • 印度、巴西、法国、西班牙、玻利维亚、毛里求斯、斯里兰卡领导人 + UN 秘书长 + 白宫 OSTP 主任 + Sundar Pichai / Sam Altman / Dario Amodei 等
  • 85+ 国签署《新德里 AI 影响宣言》(非约束性)——七大原则:AI 资源民主化、社会赋权、经济增长与社会公益、安全可信 AI、科学 AI、技能与教育培养、可持续 AI 系统

印度定位

  • Modi 推介印度为面向多元受众的平价科技力量
  • 印度自称全球第三大创业生态
  • 顶级 AI 公司扩张:Anthropic 和 OpenAI 分别在 Bengaluru / Mumbai 设办公室;OpenAI 与 Tata Consultancy Services 数据中心合作提供 ChatGPT Enterprise;Google 在 Visakhapatnam 建 AI hub

人权批评:国际特赦组织批评峰会未能解决 AI 治理缺口,称印度 AI 助长"大规模监控系统"。

投资规模

公司投资
Google$150 亿 / 5 年建 AI hub
Microsoft$175 亿 / 4 年云和 AI 基础设施
Amazon$350 亿(到 2030 年)
印度政府$11 亿国家风险基金投 AI 等高科技创业
我们怎么看

重要的是全球领导人持续对话。很高兴看到 AI 峰会持续举办且各国政府致力于让 AI 造福所有人


投资者对 Agentic AI 恐慌:SaaSpocalypse

大公司软件供应商股价暴跌,因投资者担忧 AI 系统可能侵蚀他们的业务。本周 Anthropic 与这些公司部分合作,股价部分反弹。

SaaSpocalypse 经过

  • S&P 软件与服务指数(含 Microsoft、Oracle、Salesforce、Workday)在 1 月 12 日到 2 月 23 日间损失 25%市值
  • 1 月 30 日 Anthropic 发布 11 个开源插件覆盖白领工作(日历管理、文档搜索、销售、财务分析、法律审查、产品管理等)——触发 2 月初暴跌
  • 4 天后指数跌 4%,抹去 $2,850 亿市值;JPMorgan 软件指数跌 7%;LegalZoom.com 跌近 20%、汤森路透 16%
  • 2 月 20 日 Anthropic 发布 Claude Code Security——网络安全应用,触发安全软件股进一步抛售

橄榄枝:2 月 24 日 Anthropic 宣布与 Docusign、FactSet、Google Gmail、Intuit、Salesforce 集成——新插件直接连接而非绕过它们的 SaaS 应用。SaaS 股价反弹但未恢复早前损失

我们怎么看

SaaS 不是死了,是变得 AI-native


本地 AI 能替代云吗?每瓦智能指标

大型 LLM 输出需求激增驱动数据中心大规模建设。Stanford + Together AI 研究者问:笔记本上跑的小模型能否有意义地减轻这种负担

关键洞察

  • 云系统通常比本地系统每用户更节能,但高性能小模型正让本地系统能效提升
  • 提出"intelligence per watt"(每瓦智能)指标——任务准确率除以功耗
  • 历史类比:PC 能做足够好工作且用相同或更少能源时,处理从大型机转向个人电脑

实验方法

  • 多种开源 LLM 跑在笔记本硬件和数据服务器硬件上
  • 对比新模型(Qwen3、GPT-OSS、Gemma3、IBM Granite 4.0,2025 末)+ 老模型(Mixtral-8x7B、Llama 3.1-8B,2023-2024)
  • 新处理器(Apple M4 Max、Nvidia H100)+ 老处理器(2018 Nvidia Quadro RTX 6000)
  • 100 万真实查询评估准确率 + 功耗

结果

指标结果
云系统每瓦智能仍领先
同模型在 B200 vs 本地芯片B200 高至少 1.4x
本地每瓦智能 2023-2025 提升5.3x
本地系统能正确回答查询比例88.7%(相对云系统)
模拟混合场景省电> 80%

最准确的本地模型(Qwen3-14B)落后 GPT-5、Gemini-2.5-Pro、Claude Sonnet 4.5 约 11-13 个百分点

我们怎么看

本地 AI 的话题常围绕隐私。每瓦智能上升带来引人入胜的经济论点


本期要点回顾:Gemini 3.1 Pro Preview 多基准 SOTASaaSpocalypse 软件股暴跌 25%印度 AI Impact Summit 全球南方首次主办本地 AI 每瓦智能 5.3x 提升——旗舰模型更新、SaaS 估值重构、全球 AI 治理、本地 AI 能效四条主线并行。Ng 发布 Skill Builder 帮用户定位 AI 技能坐标。