Nvidia 发起开源攻势、OpenAI 与亚马逊合作、Grok 降低视频价格
本期要点:Nvidia Nemotron 3 Super 美国开源重回前沿、OpenAI 与 AWS 合作有状态运行时、Grok Imagine 视频定价 $4.20/分钟、反 AI 联盟持续制造恐慌论调。
编者按:反 AI 联盟的话术策略
作者:Andrew Ng

Ng 担忧某些组织调查公众以找到任何能激起反对 AI 的说法,看公众对这些由说客或政客传播的信息如何反应。英国一项大型研究测试了不同恐慌性信息:
- "AI 将导致人类灭绝"的说法已大体失败(几年前被反驳)
- "AI 驱动的战争"和"环境担忧"更有共鸣——可能即将出现这类信息洪流
- "失业"和"对儿童的伤害"是更能激发行动的信息
Ng 立场(避免一边倒):认真对待这些担忧(AI 战争确实可怕、确实有环境影响、确实有岗位流失、儿童保护确实重要),但反对把复杂议题单边化来服务特定组织利益的做法——例如大型 AI 公司用"AI 危险"为借口阻止与其竞争的开源项目自由分发。
白宫提案:联邦先发权框架防止各州 AI 法规拼图阻碍 AI 发展。Ng 支持。
Nvidia Nemotron 3 Super:美国开源重回前沿
Nvidia 发布 Nemotron 3 Super 120B-A12B——速度领跑同尺寸类别的开源 LLM,是自去年 Meta 发布 Llama 4 以来美国公司发布的首个开源权重前沿模型。
核心规格
- 架构:Mamba-2/Transformer/MoE 混合架构,120B 总参数 / 每 token 激活 12B
- 输入输出:文本入 1M token,文本出 1M token
- 训练数据:25T token 20 种自然语言 + 43 种编程语言
- 许可证:商业可用,但移除安全护栏或起诉 Nvidia 专利/版权时许可证失效
性能对比
| 基准 | Nemotron 3 Super | 对比 |
|---|---|---|
| 速度 | 442 tokens/秒 | 大幅领先 gpt-oss-120b 278 / Gemini 3.1 Flash-Lite 266 |
| Artificial Analysis Intelligence Index | 36 分 | 落后 Qwen3.5-122B 42,领先 gpt-oss-120b 33 |
| RULER(100 万 token 检索) | 91.75% | 略超 Qwen3.5-122B 91.33%,远超 gpt-oss-120b 22.30% |
| PinchBench(代理任务) | 85.6% | 领先 Kimi K2.5(1T 参数)84.8% / GLM-5(744B)84.1% |
关键技术
- Mamba-2 层为主——比 attention 层线性扩展,处理长输入更省算力
- LatentMoE:token 表示压缩到 1/4 后路由到 22 个专家,处理能力相 当于 5-6 个传统专家
- 多 token 预测(MTP)头:每前向预测多个 token,推理时起草+验证加速输出
- NVFP4 4-bit 预训练(非后量化)
- 微调数据由 DeepSeek V3.2 + Kimi K2 + Qwen3-Coder-480B 生成
Nvidia 计划 $260 亿 投入开源权重模型五年。
Nvidia 计划$260 亿投入开源权重 + 中国开源模型(Kimi K2.5、GLM-5 等)越来越适配非 Nvidia 芯片——Nvidia 需要让美国开发者有理由继续用其硬件。谁能比设计 GPU 的公司更懂优化 GPU?
OpenAI 与 AWS 合作:Agents 状态基础设施
OpenAI 与亚马逊宣布"有状态运行时环境"——为 AI Agents 设计的计算基础设施。
核心交易
- 亚马逊投资 OpenAI $150 亿,条件达成后 再追加 $350 亿
- 这是 OpenAI $1,100 亿融资轮一部分(含 Nvidia、SoftBank,估值 $7,300 亿)
- OpenAI 承诺消耗 2GW 亚马逊 Trainium 算力,扩展 $38 亿原协议$1,000 亿 / 8 年
架构意义
- 无状态 API:每个请求独立,需传所有上下文
- 有状态运行时:管理 agent 工作状态、记忆、工具连接、用户权限
- 法律技术:Microsoft 独占 OpenAI 无状态 API,但运行时环境不算 API——可绕开 Azure 独占
OpenAI Frontier:AWS 是其独家第三方云提供商。客户在亚马逊买 Frontier 通过 Bedrock 服务,直接买通过 Azure。
Microsoft 与 OpenAI 现状:仍共享 OpenAI 知识产权,分润其他云合作收入。2025 年 10 月重组给 Microsoft 27% 股权 + 20% 收入分成,但取消云业务优先拒绝权。
区分"有状态"与"无状态"可能是精妙的法律工程,但也反映了真实的技术转变。AI 应用走向自治时,agent 的基础设施可能和模型本身一样重要。
xAI Grok Imagine 1.0:低价高质量视频生成
Grok Imagine 1.0 登顶 Artificial Analysis 视频榜,价格仅为竞品几分之一。
核心规格
- 输入输出:文本/图像/视频入,视频+音频出(最长 15 秒 720p)
- 能力:视频文本编辑、相机运动、物体增删改、风格迁移
- 可用性:grok.com、X、App;API $4.20/分钟
性能表现
- Artificial Analysis 视频榜:文生视频 + 图生视频双料第一(领先 Runway Gen-4.5、Kling 2.5 Turbo、Google Veo 3.1)
- LM Arena 视频榜:图生视频第一(1,400 Elo),文生视频第四
- IVEBench(视频编辑):击败 Runway Aleph 64.1% / Kling O1 57%
速度与价格对比
| 模型 | 每段生成 | 价格 |
|---|---|---|
| Grok Imagine 1.0 | 110.1 秒 | $4.20/分钟 |
| Kling 2.5 Turbo | 89.2 秒 | $4.20/分钟 |
| Vidu Q2 | 39.1 秒 | — |
| OpenAI Sora 2 Pro | 448.4 秒 | $30/分钟 |
安全争议:X 用户滥用 Grok 生成真实人物(包括儿童)的非自愿性化图像,已在多国引发调查和禁令。
图像生成从新奇变标配用了约两年,视频生成正在走类似路径。Grok Imagine 1.0 与已停服的 Sora 2 Pro 的七倍价格差距表明还有充足的降价空间。
RLM 递归语言模型:长上下文的外部处理
LLM 处理长上下文常丢失细节或胡言乱语。MIT 团队提出递归语言模型(RLM)——通过外部环境管理长 prompt。
关键洞察
- 把输入文本当作外部编程环境的持久变量
- 模型写代码获取需要的文本块(如找关键词取周围段落)
- 写代码可 迭代,把长上下文任务拆解为子任务
工作流程
- RLMs 用 Python REPL 环境读写任务
- 系统 prompt 让根模型生成 Python 代码与 REPL 交互
- 例如:检查 prompt 长度、找关键词、拆分为章节、调用不同子模型回答各部分
- 子模型输出存为变量,根模型用中间结果构建最终输出
性能表现
| 基准 | RLM-GPT-5 | 原 GPT-5 |
|---|---|---|
| BrowseComp+ | 91.3% | 0%(超出上下文限制) |
| OOLONG-PAIRS(32K token) | 58% | 接近 0% |
| OOLONG-PAIRS(1M token) | ~50% | — |
RLM 只关注当下需要的部分上下文。这类似人类处理长文档的方式——一节一节地读。
本期要点回顾:Nvidia Nemotron 3 Super 美国开源重回前沿竞争、OpenAI 与 AWS 合作构建有状态运行时、Grok Imagine 1.0 视 频定价 $4.20/分钟、反 AI 联盟持续制造恐慌论调——开源生态、Agent 基础设施、视频生成商业化、恐慌话术四条主线并行。Ng 提醒警惕过度监管的潜在危害。