Skip to main content

Nvidia 发起开源攻势、OpenAI 与亚马逊合作、Grok 降低视频价格

原文地址:https://www.deeplearning.ai/the-batch/issue-346

本期要点Nvidia Nemotron 3 Super 美国开源重回前沿、OpenAI 与 AWS 合作有状态运行时Grok Imagine 视频定价 $4.20/分钟反 AI 联盟持续制造恐慌论调

编者按:反 AI 联盟的话术策略

作者:Andrew Ng

Nvidia's Open Salvo, OpenAI's Amazon Deal, Grok Cuts Video Prices, Recursive Language Models

Ng 担忧某些组织调查公众以找到任何能激起反对 AI 的说法,看公众对这些由说客或政客传播的信息如何反应。英国一项大型研究测试了不同恐慌性信息:

  • "AI 将导致人类灭绝"的说法已大体失败(几年前被反驳)
  • "AI 驱动的战争"和"环境担忧"更有共鸣——可能即将出现这类信息洪流
  • "失业"和"对儿童的伤害"是更能激发行动的信息

Ng 立场(避免一边倒):认真对待这些担忧(AI 战争确实可怕、确实有环境影响、确实有岗位流失、儿童保护确实重要),但反对把复杂议题单边化来服务特定组织利益的做法——例如大型 AI 公司用"AI 危险"为借口阻止与其竞争的开源项目自由分发

白宫提案:联邦先发权框架防止各州 AI 法规拼图阻碍 AI 发展。Ng 支持。


Nvidia Nemotron 3 Super:美国开源重回前沿

Nvidia 发布 Nemotron 3 Super 120B-A12B——速度领跑同尺寸类别的开源 LLM,是自去年 Meta 发布 Llama 4 以来美国公司发布的首个开源权重前沿模型

核心规格

  • 架构:Mamba-2/Transformer/MoE 混合架构,120B 总参数 / 每 token 激活 12B
  • 输入输出:文本入 1M token,文本出 1M token
  • 训练数据:25T token 20 种自然语言 + 43 种编程语言
  • 许可证:商业可用,但移除安全护栏或起诉 Nvidia 专利/版权时许可证失效

性能对比

基准Nemotron 3 Super对比
速度442 tokens/秒大幅领先 gpt-oss-120b 278 / Gemini 3.1 Flash-Lite 266
Artificial Analysis Intelligence Index36 分落后 Qwen3.5-122B 42,领先 gpt-oss-120b 33
RULER(100 万 token 检索)91.75%略超 Qwen3.5-122B 91.33%,远超 gpt-oss-120b 22.30%
PinchBench(代理任务)85.6%领先 Kimi K2.5(1T 参数)84.8% / GLM-5(744B)84.1%

关键技术

  • Mamba-2 层为主——比 attention 层线性扩展,处理长输入更省算力
  • LatentMoE:token 表示压缩到 1/4 后路由到 22 个专家,处理能力相当于 5-6 个传统专家
  • 多 token 预测(MTP)头:每前向预测多个 token,推理时起草+验证加速输出
  • NVFP4 4-bit 预训练(非后量化)
  • 微调数据由 DeepSeek V3.2 + Kimi K2 + Qwen3-Coder-480B 生成

Nvidia 计划 $260 亿 投入开源权重模型五年。

我们怎么看

Nvidia 计划$260 亿投入开源权重 + 中国开源模型(Kimi K2.5、GLM-5 等)越来越适配非 Nvidia 芯片——Nvidia 需要让美国开发者有理由继续用其硬件。谁能比设计 GPU 的公司更懂优化 GPU?


OpenAI 与 AWS 合作:Agents 状态基础设施

OpenAI 与亚马逊宣布"有状态运行时环境"——为 AI Agents 设计的计算基础设施。

核心交易

  • 亚马逊投资 OpenAI $150 亿,条件达成后再追加 $350 亿
  • 这是 OpenAI $1,100 亿融资轮一部分(含 Nvidia、SoftBank,估值 $7,300 亿
  • OpenAI 承诺消耗 2GW 亚马逊 Trainium 算力,扩展 $38 亿原协议$1,000 亿 / 8 年

架构意义

  • 无状态 API:每个请求独立,需传所有上下文
  • 有状态运行时:管理 agent 工作状态、记忆、工具连接、用户权限
  • 法律技术:Microsoft 独占 OpenAI 无状态 API,但运行时环境不算 API——可绕开 Azure 独占

OpenAI Frontier:AWS 是其独家第三方云提供商。客户在亚马逊买 Frontier 通过 Bedrock 服务,直接买通过 Azure。

Microsoft 与 OpenAI 现状:仍共享 OpenAI 知识产权,分润其他云合作收入。2025 年 10 月重组给 Microsoft 27% 股权 + 20% 收入分成,但取消云业务优先拒绝权。

我们怎么看

区分"有状态"与"无状态"可能是精妙的法律工程,但也反映了真实的技术转变。AI 应用走向自治时,agent 的基础设施可能和模型本身一样重要


xAI Grok Imagine 1.0:低价高质量视频生成

Grok Imagine 1.0 登顶 Artificial Analysis 视频榜,价格仅为竞品几分之一。

核心规格

  • 输入输出:文本/图像/视频入,视频+音频出(最长 15 秒 720p)
  • 能力:视频文本编辑、相机运动、物体增删改、风格迁移
  • 可用性:grok.com、X、App;API $4.20/分钟

性能表现

  • Artificial Analysis 视频榜:文生视频 + 图生视频双料第一(领先 Runway Gen-4.5、Kling 2.5 Turbo、Google Veo 3.1)
  • LM Arena 视频榜:图生视频第一(1,400 Elo),文生视频第四
  • IVEBench(视频编辑):击败 Runway Aleph 64.1% / Kling O1 57%

速度与价格对比

模型每段生成价格
Grok Imagine 1.0110.1 秒$4.20/分钟
Kling 2.5 Turbo89.2 秒$4.20/分钟
Vidu Q239.1 秒
OpenAI Sora 2 Pro448.4 秒$30/分钟

安全争议:X 用户滥用 Grok 生成真实人物(包括儿童)的非自愿性化图像,已在多国引发调查和禁令。

我们怎么看

图像生成从新奇变标配用了约两年,视频生成正在走类似路径。Grok Imagine 1.0 与已停服的 Sora 2 Pro 的七倍价格差距表明还有充足的降价空间


RLM 递归语言模型:长上下文的外部处理

LLM 处理长上下文常丢失细节或胡言乱语。MIT 团队提出递归语言模型(RLM)——通过外部环境管理长 prompt。

关键洞察

  • 把输入文本当作外部编程环境的持久变量
  • 模型写代码获取需要的文本块(如找关键词取周围段落)
  • 写代码可迭代,把长上下文任务拆解为子任务

工作流程

  • RLMs 用 Python REPL 环境读写任务
  • 系统 prompt 让根模型生成 Python 代码与 REPL 交互
  • 例如:检查 prompt 长度、找关键词、拆分为章节、调用不同子模型回答各部分
  • 子模型输出存为变量,根模型用中间结果构建最终输出

性能表现

基准RLM-GPT-5原 GPT-5
BrowseComp+91.3%0%(超出上下文限制)
OOLONG-PAIRS(32K token)58%接近 0%
OOLONG-PAIRS(1M token)~50%
我们怎么看

RLM 只关注当下需要的部分上下文。这类似人类处理长文档的方式——一节一节地读


本期要点回顾:Nvidia Nemotron 3 Super 美国开源重回前沿竞争、OpenAI 与 AWS 合作构建有状态运行时Grok Imagine 1.0 视频定价 $4.20/分钟反 AI 联盟持续制造恐慌论调——开源生态、Agent 基础设施、视频生成商业化、恐慌话术四条主线并行。Ng 提醒警惕过度监管的潜在危害。