Skip to main content

Claude Code 源码泄露、OpenAI 退出视频生成、Gemini 新增音乐生成

原文地址:https://www.deeplearning.ai/the-batch/issue-347

本期要点Claude Code 源码意外泄露OpenAI 宣布关停 SoraGoogle 发布 Lyria 3 音乐生成模型TTT-E2E 推理时训练保持长上下文速度恒定

编者按:语音 UI 普及度被低估

作者:Andrew Ng

Claude Code's Source Leaks, OpenAI Exits Video Generation, Gemini Adds Music Generation

语音 AI 改进迅速,但多数人仍未意识到语音 UI(用户界面)将变得多普遍。今天用键盘鼠标控制多数桌面和 Web 应用,未来希望能用语音操控——Ng 特别兴奋 AI Fund 投资组合公司 Vocal Bridge(CEO Ashwyn Sharma 领导)的工作。

语音 UI 的演进

  • 鼠标让点击成为可能;触摸/滑动催生新移动 app 类
  • 此前语音 UI 因高错误率或高延迟受阻,变得更可靠后会开启许多新应用

Ng 的应用实例:给女儿建数学测试 app(女儿爱猫,正确答案显示可爱猫图)。加语音 UI 后 app 友好地口头提问,她口头回答,减少摩擦改变体验感

Vocal Bridge 架构:前台 agent 实时与用户对话(保证低延迟)+ 后台 agent 管理复杂代理 workflow、推理、应用 guardrails、调用工具(保证高智能)。

Ng 的速度观察:从数学 app 非语音版本开始,用 Claude Code 加语音能力不到 1 小时。在 DeepLearning.AI 和 AI Fund 联合黑客松上,开发者构建了临床试验匹配器、对话式投资顾问、文本 agent 的交互式语音层等应用。


Claude Code 内部揭秘:源码意外泄露

流行的编码 agent Claude Code 内部工作原理突然被所有人看见。

泄露经过:3 月 30 日 Anthropic 发布版本 2.1.88 到 npm 时,意外包含了 source map 文件(用于解码混淆代码的翻译密钥)。区块链创业公司 Solayer Labs 实习生 Chaofan Shou 解码后发布到 X,暴露 512,000+ 行代码、1,900 个文件。Anthropic 立即从 npm 和 GitHub 移除,但已被 fork 40,000+ 次

Anthropic 发言人确认为"打包发布问题由人为错误导致,非安全漏洞",无用户/客户数据暴露。

Claude Code 架构

模块设计
工具40+ 独立模块(读文件、执行 bash、网页获取等),各自有权限门槛
子代理子代理群(swarm),由控制器代理委派权限和子任务,共享群记忆
记忆三层:(i) MEMORY.MD 索引(始终加载,含指针);(ii) Markdown 记忆文件(按需调用);(iii) JSON 记录文件(不加载,可搜索)
上下文压缩三阶段:(i) 本地截断缓存工具输出;(ii) 接近上下文限时生成 20K token 结构化总结;(iii) 压缩整个对话 + 最近访问文件(每文件 ≤5K token)+ 活跃计划 + 相关技能

未来功能迹象:source map 暴露 Anthropic 可能的方向(编译时标志为 false 的功能):

  • Kairos 子系统(希腊语"适时"):始终在线后台 agent,逻辑系统 autoDream 合并重复记忆、消除矛盾、解决推测、修剪记忆
  • 语音接口
  • Ultraplan 子代理:把资源密集任务送到云端
  • Buddy 角色:评论你的工作,可能提升参与度
  • "undercover 模式":让 agent 提交文件到公共 git 仓库不留痕迹
  • Claude 4.6 变体代号 Capybara(v8 比早期版有 30% 假/夸张声明,对比早期 16.7%——跳到结论而非克制)
  • 未发布模型代号 Numbat
我们怎么看

AI 社区合理担忧软件 agent 意外删除代码库或发布私人文件。人类也会


OpenAI 退出视频生成:Sora 关停

OpenAI 计划关停视频生成器 Sora,突然从视频市场撤退

关键事实

  • 4 月 26 日 Web/app 端关停,9 月 24 日 API 关停
  • Sora 团队转向世界模型和机器人等长期项目
  • OpenAI 将把浏览器、Codex、ChatGPT app 整合为单一桌面应用

Sora 现状

维度数据
视频长度25 秒(高清)
生成耗时每段几分钟,需远超文本/图像的算力
Sora 2 Pro 当前排名Artificial Analysis 文生视频榜 第 19 位
日活峰值100 万(移动 app 发布后),后跌至不到一半
亏损约 $100 万/天

定价层级:免费(邀请制,5 段 10 秒/天)/ ChatGPT Plus $20/月(15 秒 720p)/ Pro $200/月(Sora 2 Pro,25 秒 1080p)

背后的商业现实

  • Sora 大部分收入来自付费订阅
  • 已分流算力给代号 Spud 的新模型支持编码和企业产品
  • Sora 团队曾提议在 ChatGPT 内训练新视频生成模型——鉴于训练成本,选择直接砍掉视频生成

Disney 合作:2025 年底签的 $10 亿投资 + 授权角色训练计划因 Sora 关停实质上终止

我们怎么看

一个 AI demo(不管多令人印象深刻)足以确立领先地位的时代可能正在结束。领域成熟,可持续价值创造正成为首要任务。


Gemini 新增音乐生成:Lyria 3 进入数亿用户市场

Google 给 Gemini 和 YouTube 添加音乐生成器,让合成歌曲模型触达数亿用户

Lyria 3 规格

  • 输入输出:文本入,音频(30 秒)和文本(歌词)出;Gemini app 也接受图像/视频,转文本后传入
  • 架构潜在扩散模型
  • 特性:可指定乐器、风格、年代、人声风格、节奏、动态;8 种语言歌词;用 Nano Banana 生成封面;MP3/MP4 格式;水印输出
  • 可用性:Gemini app 18+ 用户免费(订阅者更高额度);YouTube Shorts 通过 Dream Track 免费

训练数据已授权音频 + 文本描述(与 Lyria 2 明显不同,后者据报道未经授权训练受版权录音)。

性能:Google 内部人工和自动评估显示 Lyria 3 比 Lyria 2 在音频质量和提示遵循度上更优

版权应对:模型输出与现有音乐对比避免侵权,但Google 承认方法不完美,邀请用户举报侵权输出。输入提示特定音乐家时,生成类似风格但不复制艺术家声音或声音

市场格局:Suno 和 Udio 因被三大唱片公司(Sony Music、UMG、Warner Music)起诉,2024 年 6 月起与 UMG 达成和解,改为修改现有授权录音而非从头生成。Sony 诉讼仍在进行。Google 紧接着收购 ProducerAI(前身 Riffusion)。

用户规模对比

平台用户量
Gemini(Lyria 3 可用)7.5 亿+
Suno约 200 万付费订阅
Udio约 330 万月活
我们怎么看

音乐生成在大型强势在位者主导的娱乐产业中找到定位。Lyria 3 仍生产原创音乐(Suno 和 Udio 涉版权诉讼的方向),但加了训练授权音乐等保护措施避免激怒版权方


推理时学习长上下文:TTT-E2E 让 LLM 速度恒定

LLM 处理更长上下文时通常变慢变不准,Astera Institute、Nvidia、Stanford、UC Berkeley、UCSD 联合方法让 LLM 保持准确率稳定且推理时间恒定

关键洞察

  • Transformer 通常关注整个上下文生成下一 token——每生成新 token 处理时间比上一 token 多
  • 替代:限制注意力到固定大小窗口(每 token 时间恒定),通过更新权重从上下文学习

TTT-E2E 工作机制

  • 3B 参数 Transformer,滑动窗口注意力固定 8K token
  • 双循环训练:(i) 内循环模拟推理时学上下文块;(ii) 外循环评估权重更新后的性能并调整权重
  • 内循环:1,000 token 块,每块 (i) 预测每 token,(ii) 计算下一 token 预测损失,(iii) 用损失计算最后四分之一网络全连接层的权重应如何变化
  • 外循环:用权重更新计算平均下一 token 预测损失,反向传播通过模拟权重更新序列,更新整个模型权重
  • 推理时只用内循环——处理时间与上下文长度无关

结果

对比项TTT-E2E 表现
短到长上下文准确率略超 vanilla transformer
长上下文准确率略超 transformer(除 Needle-in-a-Haystack 外
推理速度与 Mamba 2 / Gated DeltaNet 相当
8K-128K token 推理速度增长每 1K token +25ms 线性(vanilla 12-70ms)
128K token NIAH6%(vanilla transformer 99%)
训练延迟比 Mamba 2 / Gated DeltaNet 慢 4x
我们怎么看

推理时学习提供处理长上下文的比设计自定义注意力机制或循环架构更简单的方法。这工作重新框定问题为训练 vs 推理的权衡:推理时处理便宜且每 token 一致,但训练更慢。


本期要点回顾:Claude Code 源码意外泄露OpenAI 宣布 4 月关停 SoraGoogle 发布 Lyria 3 音乐生成模型TTT-E2E 推理时训练保持长上下文速度恒定——AI agent 透明度、视频生成商业现实、音乐生成版权博弈、长上下文架构四条主线并行。Ng 看好语音 UI 普及机会。