Gemini 夺得领先、投资者对 Agents 恐慌、全球 AI 峰会召开
本期要点:Gemini 3.1 Pro Preview 多基准 SOTA、SaaSpocalypse 软件股暴跌、印度 AI Impact Summit 全球南方首次主办、本地 AI 每瓦智能逼近云端。
编者按:Skill Builder —— 帮你定位 AI 技能坐标
作者:Andrew Ng

DeepLearning.AI 发布 Skill Builder 工具——帮助用户识别 AI 技能强弱、给出下一步学习建议。对话式 AI 顾问,适合从初学者到构建复杂 agentic workflow 的高级用户。
功能设计
- 告诉 Skill Builder 你的 AI 项目,它给出个性化反馈和提升路径
- 对话后生成总结报告和下一步学习建议
- Pro 会员获更详细的个性化反馈
- 免费对所有人开放
Ng 学新技能时也常困惑"自己站在哪"——Skill Builder 解决这种"不知道自己不知道什么"的问题。
Gemini 3.1 Pro Preview:性能提升不靠推理成本
Google 更新旗舰 Gemini 模型,多项基准领先同时保持每美元性能优势。
核心规格
- 上下文:文本/图像/PDF/音频/视频入(100 万 token),文本出 64K(108.6 tokens/秒)
- 特性:工具使用、可调推理(low/medium/high)
- 价格:API $2/$0.20/$12 每百万输入/缓存/输出 token(200K 以下上下文),200K 以上 $4/$0.40/$18
性能表现
| 基准 | Gemini 3.1 Pro Preview | 对比 |
|---|---|---|
| Artificial Analysis Intelligence Index | 57 分第 1($892) | 领先 Opus 4.6(53/$2,486)/ GPT-5.2(51/$2,304)/ GLM-5(50/$547) |
| 10 个子基准 | 领先 6 个 | — |
| Arena 编码榜 | 第 7 | 用户偏好头对头排名落后 |
| GDPval-AA 代理 | 40% | 落后 Sonnet 4.6 57% / GLM-5 45% |
| ARC-AGI-2 | 77.1%($0.96/任务) | 远超前代 31.1%,领先 Opus 4.6(69.2% / $3.47) |
关键洞察:性能提升不是来自更多推理计算,而是来自模型质量改进——完成 Intelligence Index 用 token 数与 前代持平但分数大幅提高。
在 ARC-AGI-2 上 Gemini 3.1 Pro Preview(高推理)与 Gemini 3.1 Deep Think 的差距不到 10 个百分点,但价格只有 1/13。Deep Think 应该只用于最难的问题。
全球 AI 峰会:从理论危险转向实际应用
第四届全球 AI 峰会(AI Impact Summit,2 月 16-20 日新德里)展现从理论危害担忧到在全球普及 AI 利益的明确转变。
关键事实
- 首个在全球南方主办的全球 AI 峰会
- 数十万参与者,100+ 国家代表
- 印度、巴西、法国、西班牙、玻利维亚、毛里求斯、斯里兰卡领导人 + UN 秘书长 + 白宫 OSTP 主任 + Sundar Pichai / Sam Altman / Dario Amodei 等
- 85+ 国签署《新德里 AI 影响宣言》(非约束性)——七大原则:AI 资源民主化、社会赋权、经济增长与社会公益、安全可信 AI、科学 AI、技能与教育培养、可持续 AI 系统
印度定位
- Modi 推介印度为面向多元受众的平价科技力量
- 印度自称全球第三大创业生态
- 顶级 AI 公司扩张:Anthropic 和 OpenAI 分别在 Bengaluru / Mumbai 设办公室;OpenAI 与 Tata Consultancy Services 数据中心合作提供 ChatGPT Enterprise;Google 在 Visakhapatnam 建 AI hub
人权批评:国际特赦组织批评峰会未能解决 AI 治理缺口,称印度 AI 助长"大规模监控系统"。
投资规模
| 公司 | 投资 |
|---|---|
| $150 亿 / 5 年建 AI hub | |
| Microsoft | $175 亿 / 4 年云和 AI 基础设施 |
| Amazon | $350 亿(到 2030 年) |
| 印度政府 | $11 亿国家风险基金投 AI 等高科技创业 |
重要的是全球领导人持续对话。很高兴看到 AI 峰会持续举办且各国政 府致力于让 AI 造福所有人。
投资者对 Agentic AI 恐慌:SaaSpocalypse
大公司软件供应商股价暴跌,因投资者担忧 AI 系统可能侵蚀他们的业务。本周 Anthropic 与这些公司部分合作,股价部分反弹。
SaaSpocalypse 经过
- S&P 软件与服务指数(含 Microsoft、Oracle、Salesforce、Workday)在 1 月 12 日到 2 月 23 日间损失 25%市值
- 1 月 30 日 Anthropic 发布 11 个开源插件覆盖白领工作(日历管理、文档搜索、销售、财务分析、法律审查、产品管理等)——触发 2 月初暴跌
- 4 天后指数跌 4%,抹去 $2,850 亿市值;JPMorgan 软件指数跌 7%;LegalZoom.com 跌近 20%、汤森路透 16%
- 2 月 20 日 Anthropic 发布 Claude Code Security——网络安全应用,触发安全软件股进一步抛售
橄榄枝:2 月 24 日 Anthropic 宣布与 Docusign、FactSet、Google Gmail、Intuit、Salesforce 集成——新插件直接连接而非绕过它们的 SaaS 应用。SaaS 股价反弹但未 恢复早前损失。
SaaS 不是死了,是变得 AI-native。
本地 AI 能替代云吗?每瓦智能指标
大型 LLM 输出需求激增驱动数据中心大规模建设。Stanford + Together AI 研究者问:笔记本上跑的小模型能否有意义地减轻这种负担?
关键洞察
- 云系统通常比本地系统每用户更节能,但高性能小模型正让本地系统能效提升
- 提出"intelligence per watt"(每瓦智能)指标——任务准确率除以功耗
- 历史类比:PC 能做足够好工作且用相同或更少能源时,处理从大型机转向个人电脑
实验方法
- 多种开源 LLM 跑在笔记本硬件和数据服务器硬件上
- 对比新模型(Qwen3、GPT-OSS、Gemma3、IBM Granite 4.0,2025 末)+ 老模型(Mixtral-8x7B、Llama 3.1-8B,2023-2024)
- 新处理器(Apple M4 Max、Nvidia H100)+ 老处理器(2018 Nvidia Quadro RTX 6000)
- 100 万真实查询评估准确率 + 功耗
结果
| 指标 | 结果 |
|---|---|
| 云系统每瓦智能 | 仍领先 |
| 同模型在 B200 vs 本地芯片 | B200 高至少 1.4x |
| 本地每瓦智能 2023-2025 提升 | 5.3x |
| 本地系统能正确回答查询比例 | 88.7%(相对云系统) |
| 模拟混合场景省电 | > 80% |
最准确的本地模型(Qwen3-14B)落后 GPT-5、Gemini-2.5-Pro、Claude Sonnet 4.5 约 11-13 个百分点。
本地 AI 的话题常围绕隐私。每瓦智能上升带来引人入胜的经济论点。
本期要点回顾:Gemini 3.1 Pro Preview 多基准 SOTA、SaaSpocalypse 软件股暴跌 25%、印度 AI Impact Summit 全球南方首次主办、本地 AI 每瓦智能 5.3x 提升——旗舰模型更新、SaaS 估值重构、全球 AI 治理、本地 AI 能效四条主线并行。Ng 发布 Skill Builder 帮用户定位 AI 技能坐标。