Skip to main content

字节 Seedance 2.0 上线、Nvidia 用 AI 设计芯片、机器人持续学习

原文地址:https://www.deeplearning.ai/the-batch/issue-352

本期要点字节 Seedance 2.0 进入 CapCut 触达 7.36 亿月活Nvidia 用强化学习设计芯片美国职场 AI 采用率达 50%、机器人用 LoRA+GRPO 解决灾难性遗忘。

编者按:不会有 AI 就业末日

作者:Andrew Ng

Seedance Makes A Splash, Nvidia's AI-Guided Chip Designs, Helping Robots Not Forget

Ng 明确驳斥"AI 就业末日"叙事——这种说法制造不必要的恐惧,是不负责任且有害的

为什么这种叙事流行?

  • 前沿 AI 实验室有强烈动机把 AI 说得更强大(极端叙事包括科幻式"AI 接管"导致人类灭绝)
  • SaaS 公司通常按用户年收 $100-$1000,但 AI 公司若能替代一名年薪 $10 万的员工(或让其效率提升 50%),定价 $10,000 都显得合理
  • 企业有动机把裁员包装成"AI 提效"的聪明故事(好过承认疫情期间过度招聘)

事实证据

  • 软件工程是受 AI 工具影响最大的行业,但软件工程师招聘仍然强劲
  • 美国失业率仍为健康的 4.3%
  • 历史类比:核电安全恐惧导致投资不足;60 年代"人口炸弹"导致严苛政策;膳食脂肪恐惧导致政府推广高糖饮食几十年

Ng 提出反向预测:会有 AI 就业大繁荣(jobapalooza)!AI 会创造更多优秀的 AI 工程师岗位,且 Ng 对整体就业市场乐观。AI 工程师的工作将与传统软件工程不同,且很多岗位会在传统开发者雇主之外的行业。


字节跳动 Seedance 2.0:视频生成的消费者分发

OpenAI 准备关停 Sora 的同时,字节跳动让其多模态视频生成模型触达数亿用户——Seedance 2.0 已加入 CapCut(剪映海外版)付费用户。

覆盖区域:东南亚、拉丁美洲、非洲、中东、部分欧洲、日本、美国。

核心规格

  • 输入输出:文本/图像/音频/视频入(最多 3 视频片段、9 图像、3 音频),同步视频音频出(4-15 秒,6 种长宽比)
  • 特性:多语言唇同步、环境音/音乐、单片段多镜头切换、提示控制镜头和光照、隐形水印

性能表现

  • Arena AI 视频榜:text-to-video 1,460 Elo 第一,image-to-video 1,454 Elo 第一
  • Artificial Analysis 视频榜:image-to-video 同步音频 1,182 Elo 第一

版权争议:发布后不久,一段含 Tom Cruise 和 Brad Pitt 形象的生成片段让好莱坞六大向字节施压要求停止用版权材料训练并阻止用户基于版权材料生成。争议未解决。

视频生成市场洗牌

厂商动作
OpenAI3 月宣布停掉 Sora app 和 API(DAU 从 100 万跌到 50 万,运营成本约 $100 万/天)
AlibabaHappyHorse-1.0 4 月初登顶多个视频类别;同期推出生成 3D 环境的 HappyOyster
Tencent同日开源更新版 Hunyuan 3D

关键数据:CapCut 月活 7.36 亿(移动端)——仅次于 ChatGPT,是第二大消费 AI 产品。

我们怎么看

OpenAI 撤出 Sora 揭示了一个残酷真相:以当前算力成本,AI 生成视频是昂贵的消费产品


Nvidia 如何用 AI 设计芯片

Nvidia 首席科学家 Bill Dally 在 GTC 大会与 Jeff Dean 对谈时披露:目标是用 AI 设计下一代 GPU,自己去滑两天雪等结果出来。当前进展与距离目标还有多远也一并说明。

5 个阶段应用 AI

  1. 布局组件(NVCell):遗传算法提议候选布局 + 强化学习修正设计规则违规。每次新工艺要重做 2500-3000 个 cell,NVCell 把原本 8 个工程师约 10 个月的工作压缩到单 GPU 过夜运行
  2. 设计算术电路(PrefixRL):强化学习设计 GPU 算术单元中的微观电路。生成的 64 位加法器面积比人类设计少 25%,Dally 说结果是"奇异的"配置,比人类设计好 20-30%
  3. 通用工程辅助(ChipNeMo / BugNeMo):基于 LLaMA 2(7B/13B)在 Nvidia 内部文档微调,回答硬件问题、生成芯片设计语言代码片段、汇总 bug 报告。适配后的模型在多种芯片设计任务上匹配或超过其 5 倍大小的通用基座
  4. 验证设计:这是最长阶段,Dally 团队正用 AI 压缩。
  5. 探索新布局

距离目标的差距从提示端到端设计 GPU 仍是遥远目标

更广趋势

  • 4 月 Verkoran(AI 芯片设计创业公司)论文:用代理 AI 系统按 219 字规范自主设计 1.48 GHz RISC-V CPU(≈2011 Intel Celeron)
  • 去年 Princeton + IIT Madras 用深度学习 + 进化算法生成无线通信电路
  • 2023 年 Google 描述用强化学习排列 TPU 表面组件
我们怎么看

从"AI 帮助初级工程师理解公司技术"到"AI 设计下一代 GPU"还有相当大的距离。Dally 愿意降低预期令人耳目一新。


美国职场 AI 采用率:半数员工用过 AI

Gallup 调查 23,700 名美国员工(2 月 4-19 日)发现:约半数美国员工去年在工作中至少用过几次 AI。

核心数据

维度数据
每天用 AI13%(2023 年仅 4%)
每周用几次28%(2023 年 11%)
公司引入 AI 工具40%
公司有清晰 AI 战略25%

使用 AI 的员工

  • 65% 报告生产力提升
  • 31% 报告工作方式改变
  • 仅 7% 不同意 AI 影响了他们的工作方式

关键因素管理层的支持显著影响员工行为和看法——有强力支持型管理者的组织中,员工更可能用 AI 且认同它改变了工作。

我们怎么看

虽然某些圈子流行预测 AI 导致大规模失业,但当前信号矛盾,有些显示 AI 在促进就业。例如 Brookings 2025 年研究发现投资 AI 的公司雇了更多员工。员工有无数机会通过创造性地应用 AI 来脱颖而出。


机器人持续学习:用 LoRA+GRPO 解决灾难性遗忘

神经网络学新任务时会忘记旧任务。UT Austin、UCLA、Nanyang Technological、Sony 联合提出的简单配方:把强化学习与 LoRA 结合,在机器人视觉语言模型上解决灾难性遗忘。

关键洞察

  • 大型预训练模型限制训练时遗忘的信息量(小更新不太可能干扰已有知识)
  • LoRA(通过加两个小矩阵的乘积调整权重)限制模型能改变多少 → 限制遗忘
  • On-policy 强化学习(如 GRPO)也限制更新,因为奖励的是模型自己生成的动作 → 限制遗忘

实验设置:在 LIBERO 基准的三个任务套件(含打开抽屉、移动物体到目标位置等)上顺序微调 OpenVLA-OFT 模型,每个套件 5 个任务。

结果(libero-spatial)

方法平均成功率遗忘程度
本文方法81.2%0.3pp 几乎无遗忘
Dark Experience Replay73.4%4.7pp
SLCA69.9%-0.6pp(性能略升)
Elastic Weight Consolidation66.1%0.7pp

在 5 个未训练任务上:57.1% 优于 EWC 52.6% 和 DER 55.2%。

局限性:作者为公平对比把 LoRA+GRPO 加到之前方法上,但之前方法并非为与这些技术结合而设计。

我们怎么看

机器人正快速进入新环境和场景。灵活的机器人将受益于能现场适应新任务的能力。


本期要点回顾:Seedance 2.0 触达 7.36 亿 CapCut 月活重塑视频生成市场、Nvidia 用 AI 设计自家芯片(NVCell/PrefixRL/ChipNeMo)、美国职场 AI 采用率达 50%、机器人用 LoRA+GRPO 解决灾难性遗忘——视频生成、芯片设计、职场 AI 采用、机器人持续学习四条主线并行。Ng 明确驳斥 AI 就业末日叙事。