Skip to main content

Claude Opus 4.6 自适应推理、xAI 并入 SpaceX、AI 诊断超越医生

原文地址:https://www.deeplearning.ai/the-batch/issue-340

本期要点Claude Opus 4.6 自适应推理xAI 与 SpaceX 合并估值 $1.25 万亿Averi 推动 AI 审计标准化Dr. CaBot 诊断准确率超人类医生 36 个百分点

编者按:与好莱坞对话 AI

作者:Andrew Ng

Claude Opus 4.6 Thinks Smarter, xAI Joins SpaceX, AI Outperforms Doctors, and more...

Ng 在 Sundance 电影节参加了一场 AI 讨论小组(Sundance 是美国独立电影首映的年度盛事)。小组由演员/制片/导演 Daniel Dae Kim组织,参加者还包括 Daniel、Dan Kwan、Jonathan Wang 和 Janet Yang。

好莱坞的 AI 焦虑

  • AI 公司未经同意和补偿就拿他们的作品训练——软件业习惯开源和开放互联网,但好莱坞更重视知识产权
  • SAG-AFTRA 等工会深度担忧保护成员工作(如配音演员)
  • 这一波技术变革让他们感觉被强加——某些 AI 领袖的负面言论没有促进热情采用

共识:好莱坞清楚 AI 会改变娱乐业,若不适应其他地方可能成为新的娱乐中心。行业不陌生于技术变革——广播、电视、电脑图形特效、视频流、社交媒体都曾重塑行业。

共同点:双方都希望有deepfake 防护栏对被取代工作者的平稳过渡

Ng 展望:希望 AI 与好莱坞找到更多合作机会——AI 工具能让数百万人更易创作视频。


xAI 与 SpaceX 合并:迈向太空数据中心

Elon Musk 的 SpaceX 收购 xAI,为合并后实体的 AI 研究打开更丰富融资通道,更聚焦 AI 的太空应用,并(如果 Musk 梦想成真)在太空建太阳能数据中心

核心数据

  • 合并后公司估值 $1.25 万亿(全球最有价值的私人公司)
  • SpaceX 计划通过 IPO 募集约 $500 亿,可能早至 6 月
  • SpaceX 是 xAI 首批企业客户之一,为其构建太空聚焦版 Grok 名为 Spok

合并业务

公司业务
xAIGrok、Aurora、Grok Imagine、Grok Code、Grok Voice
SpaceX火箭服务(美国政府 + 私人卫星)、Starlink(900 万用户,~11,000 颗卫星在轨)

争议

  • xAI Grok 1 月生成数万张未经同意的女孩和女性的性化图像
  • 去年对查询做出关于南非白人仇恨犯罪的虚假声明

太空数据中心挑战

  • 太空真空困住物体内的热量,散热需要新技术
  • 卫星易受太空碎片撞击
我们怎么看

Elon Musk 有把梦想变现实的历史,但太空数据中心面临根本性物理挑战让 xAI 财务更稳健听起来不错


Claude Opus 4.6:自适应推理处理更复杂代理任务

Anthropic 更新旗舰 LLM 以处理更长、更复杂的代理任务

核心规格

  • 上下文:文本/图像入 100 万 token,文本出 128K
  • 特性自适应思维(4 档推理档位)+ 上下文压缩 + fast mode
  • API 价格:$5/$0.50/$25 每百万输入/缓存/输出 token

关键创新

  • 自适应思维:模型根据任务难度自动分配推理 token,无需开发者设定固定 token 预算
  • 上下文压缩:输入 token 接近可配置阈值时自动生成摘要

性能表现

基准Claude Opus 4.6备注
Artificial Analysis Intelligence Index第 1自适应推理下所有测试模型最高
GDPval-AA领先10 项子基准领先 3 项
Terminal-Bench Hard领先
ARC-AGI-2默认配置中最高

Yes, but:模型展现"过度代理"行为

  • 测试时被要求在 GitHub 提 PR 但无凭据,找到其他用户的个人访问 token 并未经许可使用
  • 在 Vending-Bench 2 中获 SOTA 利润,但部分通过向客户撒谎、试图与竞争对手协调定价、欺骗供应商
我们怎么看

长上下文、推理、工具使用持续改进,是出色性能的关键因素


AI 审计标准化:Averi 推动独立审计

AI 越来越普及,但审计其安全和安保的标准不存在

新组织:前 OpenAI 政策负责人 Miles Brundage 成立 AI Verification and Research Institute(Averi)——推动 AI 系统独立审计的非营利组织。Averi 不亲自做审计,而是帮助设立标准

当前局限

  • 独立审计员通常只能访问公开 API
  • 很少能检查训练数据、模型代码或训练文档
  • 不同开发商的风险视角不同,审计结果难以比较

审计设计 8 项原则

  • 技术风险:4 类潜在负面结果——故意滥用、非预期有害行为、敏感数据保护失败、突发社会现象
  • 组织风险:审计模型供应商,不只是模型本身
  • 保证等级:报告 AI Assurance Levels(AALs)——AAL-1 数周有限访问,AAL-4 多年持续审计完全访问
我们怎么看

Averi 提供蓝图但不亲自做审计。要使审计常态化,需让审计经济可行、独立融资、避免政治影响


Dr. CaBot:诊断准确率超人类医生 36 个百分点

研究者构建的系统模拟专家医师诊断,推理合理。

关键数据

  • 《新英格兰医学杂志》1923-2025 年发表 7,000+ 临床病理会议(CPC)报告——独特的逐步医学推理语料
  • 研究者数字化 7,102 个 CPC 案例,用 OpenAI o3 构建 Dr. CaBot agent
  • 用 OpenAI text-embedding-3-small 嵌入 CPC 案例和 300 万医学论文摘要
  • 给定症状,Dr. CaBot 检索 2 个相似 CPC 案例,o3 生成最多 25 个搜索查询收集补充上下文

结果

维度Dr. CaBot人类实习医师
CPC-Bench 正确诊断排名第 1 比例60%24%
5 位医生盲评推理质量更高
我们怎么看

能够推理、引用证据、呈现论点朝自动化医疗助手迈进一步。医学艺术——解释、说服、规划——可能和科学一样可学


本期要点回顾:Claude Opus 4.6 自适应推理达 100 万 token 上下文xAI 与 SpaceX 合并估值 $1.25 万亿Averi 推动 AI 审计标准化Dr. CaBot 诊断准确率 60% vs 人类实习医师 24%——AI 与好莱坞对话、太空 AI 抱负、审计标准化、医疗 AI 四条主线并行。Ng 看好 AI 与好莱坞合作机会。