Skip to main content

ChatGPT 投放广告、苹果转用 Gemini、Nvidia 自动驾驶推理模型

原文地址:https://www.deeplearning.ai/the-batch/issue-337

本期要点ChatGPT 开始投放广告Apple 付 Google $10 亿用 Gemini 驱动 SiriNvidia Alpamayo-R1 自动驾驶推理模型FlashWorld 9 秒生成 3D 场景

编者按:超越增量效率 —— 工作流重设计

作者:Andrew Ng

Self-Driving Reasoning Models, ChatGPT Adds Ads, Apple's Deal with Google, and more...

Ng 在达沃斯世界经济论坛(WEF)写这封信,与许多 CEO 讨论 AI 用法。常见结论:"让一千朵花绽放"的许多自下而上 AI 项目未带来显著收益。更大的收获需要工作流重设计——从更宽的角度看流程的多个步骤,端到端改变它们如何协作。

例子:银行贷款流程

营销 → 申请 → 初步审批 → 最终审查 → 执行
  • 点方案:初步审批换 AI 自动(10 分钟代替 1 小时)——效率小提升,但非变革性
  • 变革方案:把贷款变成"10 分钟贷款"产品,吸引更多申请、最终发放更多贷款

Ng 观察:即使 AI 只应用于一步,初步审批,也需实施工作流重设计,改变营销、数字化申请路由、最终审查以处理更大流量。


ChatGPT 开始投放广告:传统横幅广告的新容器

OpenAI 开始测试在 ChatGPT 中显示广告——像极了老式网络横幅广告

覆盖范围

  • 仅美国免费和最低价套餐用户(Plus、Pro、Business、Enterprise 或 API 用户看不到)
  • 计划未来扩展到其他地区,测试更对话式广告
  • 仅 18+ 美国用户,桌面或移动端登录

展示细节

  • 与对话相关的广告出现在聊天底部,包括简短消息、图片、链接
  • 不影响聊天回复
  • 不出现在涉及健康/心理健康/政治的对话中
  • 不与广告商分享对话

收入背景

  • OpenAI 2025 年$200 亿收入,使用 1.9 GW 算力,成本估超 $90 亿
  • 预计 2029 年前资本支出 $1,150 亿(The Information)
  • 多线收入:订阅、电商、API
我们怎么看

OpenAI 涉足展示广告——久经考验的格式。真正聊天机器人原生的广告形态可能看起来大不相同


Apple 转用 Gemini:$10 亿/年换 Apple Intelligence 升级

Apple 与 Google 签多年协议,用 Gemini 模型驱动改造后的 Siri 和其他 AI 功能

核心数据

  • Apple 每年付 Google $10 亿(Bloomberg)
  • 协议结构为云计算合同而非许可(Financial Times)
  • 1.2 万亿参数 Gemini 模型(内部代号 Apple Foundation Models V10),专为 Apple 服务器修改
  • 更强 V11 模型将于年底推出,可能跑在 Google 服务器
  • 2026 年春季开始推出(iOS 26.4 + V10)

战略转变

  • Apple 放弃自建专有 AI 软件和基础设施
  • 继续提供 ChatGPT 接入(去年 12 月已整合)但 OpenAI 选择不为 Apple 提供模型(Altman 决定专注 Jony Ive 主导的"后智能手机"项目)
  • Siri 两版本:iOS 26.4 用 V10(分析屏幕图像),iOS 27 用 V11(语音/文本聊天 + 多步骤代理)

当前 Apple 处境

  • 2023 年构建 LLM 框架,做了内部用 chatbot "Apple GPT"
  • 2025 年 6 月 Siri 升级延期(未达内部质量标准)
  • 与 Google 合作让 iOS 设备短期内恢复提供竞争性 AI 能力

Nvidia Alpamayo-R1:自动驾驶推理降低碰撞

Nvidia 发布 Alpamayo-R1——自动驾驶视觉-语言-动作模型,用推理减少潜在碰撞

核心规格

  • 架构:Transformer 编码器(82 亿参数)+ 解码器(23 亿参数)
  • 输入:4 个摄像头 2 秒视频 + 文本命令 + 位置/旋转历史
  • 输出:推理文本 + 未来轨迹 6.4 秒(99ms 延迟,跑在 RTX Pro 6000 Blackwell)

关键技术

  • Cosmos-Reason1(视觉-语言模型)做推理
  • 扩散 Transformer生成车辆轨迹
  • 三阶段训练:跨领域(医疗、物流、零售、制造、自动驾驶)→ 8 万小时视频 + 推理标注 → RL 对齐推理与动作

结果(vs 无推理版本)

  • 75 个模拟场景中,遭遇"接近碰撞"概率从 17% 降至 11%
我们怎么看

链式思维推理对机器人有用。与早期 VLA 模型不同,Alpamayo-R1 不仅训练性能更好,还匹配动作与推理,让推理更有效且可解释


FlashWorld:9 秒生成 3D 场景

厦门大学 + 腾讯 + 复旦 联合开发的 FlashWorld——从文本或图像生成详细一致 3D 场景,以 Gaussian splats 表示。

核心技术

  • 结合2D 优先(多视角图像重建 3D)和3D 直接(直接生成 3D 表示)两种方法
  • 用预训练视频扩散模型(WAN2.2-5B-IT2V)作教师模型,让学生一步内复制其多步精炼

结果

维度FlashWorld对比
生成时间9 秒(H20 GPU)Wonderland 5 分钟(A100)/ CAT3D 77 分钟(A100)
WorldScore68.72WonderWorld 66.43 / LucidDreamer 66.32
细节能生成草叶和动物毛其他方法常模糊或缺失

局限:精细几何(如镜面反射)仍有挑战。

我们怎么看

3D 场景生成达到秒级是走向实时生成的一大步。在游戏和 VR 中,可能从预制任务变成动态运行时体验


本期要点回顾:ChatGPT 开始投放广告Apple 付 Google $10 亿用 Gemini 驱动 SiriNvidia Alpamayo-R1 自动驾驶推理模型FlashWorld 9 秒生成 3D 场景——广告变现、商业合作、机器人推理、3D 生成四条主线并行。Ng 在 WEF 强调 AI 工作流重设计超越增量效率。