ChatGPT 投放广告、苹果转用 Gemini、Nvidia 自动驾驶推理模型
本期要点:ChatGPT 开始投放广告、Apple 付 Google $10 亿用 Gemini 驱动 Siri、Nvidia Alpamayo-R1 自动驾驶推理模型、FlashWorld 9 秒生成 3D 场景。
编者按:超越增量效率 —— 工作流重设计
作者:Andrew Ng

Ng 在达沃斯世界经济论坛(WEF)写这封信,与许多 CEO 讨论 AI 用法。常见结论:"让一千朵花绽放"的许多自下而上 AI 项目未带来显著收益。更大的收获需要工作流重设计——从更宽的角度看流程的多个步骤,端到端改变它们如何协作。
例子:银行贷款流程
营销 → 申请 → 初步审批 → 最终审查 → 执行
- 点方案:初步审批换 AI 自动(10 分钟代替 1 小时)——效率小 提升,但非变革性
- 变革方案:把贷款变成"10 分钟贷款"产品,吸引更多申请、最终发放更多贷款
Ng 观察:即使 AI 只应用于一步,初步审批,也需实施工作流重设计,改变营销、数字化申请路由、最终审查以处理更大流量。
ChatGPT 开始投放广告:传统横幅广告的新容器
OpenAI 开始测试在 ChatGPT 中显示广告——像极了老式网络横幅广告。
覆盖范围
- 仅美国免费和最低价套餐用户(Plus、Pro、Business、Enterprise 或 API 用户看不到)
- 计划未来扩展到其他地区,测试更对话式广告
- 仅 18+ 美国用户,桌面或移动端登录
展示细节
- 与对话相关的广告出现在聊天底部,包括简短消息、图片、链接
- 不影响聊天回复
- 不出现在涉及健康/心理健康/政治的对话中
- 不与广告商分享对话
收入背景
- OpenAI 2025 年$200 亿收入,使用 1.9 GW 算力,成本估超 $90 亿
- 预计 2029 年前资本支出 $1,150 亿(The Information)
- 多线收入:订阅、电商、API
OpenAI 涉足展示广告——久经考验的格式。真正聊天机器人原生的广告形态可能看起来大不相同。
Apple 转用 Gemini:$10 亿/年换 Apple Intelligence 升级
Apple 与 Google 签多年协议,用 Gemini 模型驱动改造后的 Siri 和其他 AI 功能。
核心数据
- Apple 每年付 Google $10 亿(Bloomberg)
- 协议结构为云计算合同而非许可(Financial Times)
- 用1.2 万亿参数 Gemini 模型(内部代号 Apple Foundation Models V10),专为 Apple 服务器修改
- 更强 V11 模型将于年底推出,可能跑在 Google 服务器
- 2026 年春季开始推出(iOS 26.4 + V10)
战略转变
- Apple 放弃自建专有 AI 软件和基础设施
- 继续提供 ChatGPT 接入(去年 12 月已整合)但 OpenAI 选择不为 Apple 提供模型(Altman 决定专注 Jony Ive 主导的"后智能手机"项目)
- Siri 两版本:iOS 26.4 用 V10(分析屏幕图像),iOS 27 用 V11(语音/文本聊天 + 多步骤代理)
当前 Apple 处境
- 2023 年构建 LLM 框架,做了内部用 chatbot "Apple GPT"
- 2025 年 6 月 Siri 升级延期(未达内部质量标准)
- 与 Google 合作让 iOS 设备短期内恢复提供竞争性 AI 能力
Nvidia Alpamayo-R1:自动驾驶推理降低碰撞
Nvidia 发布 Alpamayo-R1——自动驾驶视觉-语言-动作模型,用推理减少潜在碰撞。
核心规格
- 架构:Transformer 编码器(82 亿参数)+ 解码器(23 亿参数)
- 输入:4 个摄像头 2 秒视频 + 文本命令 + 位置/旋转历史
- 输出:推理文本 + 未来轨迹 6.4 秒(99ms 延迟,跑在 RTX Pro 6000 Blackwell)
关键技术
- Cosmos-Reason1(视觉-语言模型)做推理
- 扩散 Transformer生成车辆轨迹
- 三阶段训练:跨领域(医疗、物流、零售、制造、自动驾驶)→ 8 万小时视频 + 推理标注 → RL 对齐推理与动作
结果(vs 无推理版本)
- 75 个模拟场景中,遭遇"接近碰撞"概率从 17% 降至 11%
链式思维推理对机器人有用。与早期 VLA 模型不同,Alpamayo-R1 不仅训练性能更好,还匹配动作与推理,让推理更有效且可解释。
FlashWorld:9 秒生成 3D 场景
厦门大学 + 腾讯 + 复旦 联合开发的 FlashWorld——从文本或图像生成详细一致 3D 场景,以 Gaussian splats 表示。
核心技术
- 结合2D 优先(多视角图像重建 3D)和3D 直接(直接生成 3D 表示)两种方法
- 用预训练视频扩散模型(WAN2.2-5B-IT2V)作教师模型,让学生一步内复制其多步精炼
结果
| 维度 | FlashWorld | 对比 |
|---|---|---|
| 生成时间 | 9 秒(H20 GPU) | Wonderland 5 分钟(A100)/ CAT3D 77 分钟(A100) |
| WorldScore | 68.72 | WonderWorld 66.43 / LucidDreamer 66.32 |
| 细节 | 能生成草叶和动物毛 | 其他方法常模糊或缺失 |
局限:精细几何(如镜面反射)仍有挑战。
3D 场景生成达到秒级是走向实时生成的一大步。在游戏和 VR 中,可能从预制任务变成动态运行时体验。
本期要点回顾:ChatGPT 开始投放广告、Apple 付 Google $10 亿用 Gemini 驱动 Siri、Nvidia Alpamayo-R1 自动驾驶推理模型、FlashWorld 9 秒生成 3D 场景——广告变现、商业合作、机器人推理、3D 生成四条主线并行。Ng 在 WEF 强调 AI 工作流重设计超越增量效率。