Skip to main content

中国挫败 Meta Agents 收购、美国评估模型、AI 诊断乳腺 X 光

原文地址:https://www.deeplearning.ai/the-batch/issue-353

本期要点中国阻断 Meta-Manus 收购美国 NIST 将评估前沿模型GPT-Realtime-2 领跑语音转语音Google 乳腺 X 光 AI 在英国临床测试中表现优异

编者按:AI Andrew —— 我人格塑造的 AI 伴侣

作者:Andrew Ng

China Thwarts Meta's Agentic Ambition, U.S. Evaluates Upcoming Models, AI Diagnoses Mammograms

Ng 团队正在开发 AI Andrew——由 Ng 自己人格塑造的 AI 伴侣,邀用户试用它来探讨 AI、项目想法、职业决策等话题。

为什么难Ng 的沟通风格经过多年数千次互动塑造,从未尝试在代理工作流中编码化,结果发现很难——仍在迭代。

Ng 沟通的核心信念

  • 尊重个体:对几乎所有交谈者都心怀尊重,无论资历或人生阶段
  • 庆祝胜利:喜欢听别人分享大小成就
  • 共情重要事物:聚焦对方的梦想,不是别人对他梦想的期待
  • 技术精确:作为技术领导者承诺准确表达技术科学事务
  • 谨慎校准的自信表达不确定时倾向提问而非断言——许多 LLM 过度急于给建议而缺乏上下文

harness 组合:RAG + 多种大小模型 + guardrails + 大量评估 + 短长期记忆 + 离线代理循环(自动提议系统改进)。

仍有差距:内部测试者曾让 AI Andrew 幻觉爬过 Ng 没爬过的山,偶尔给出 Ng 质疑的建议。但许多用户报告从中获得洞见——希望用户把它当作可交流个人和职业事务的友好伴侣。


中国阻断 Meta-Manus 收购:技术民族主义升级

中国国家发展和改革委员会(NDRC)阻止了 Meta 拟议以最高 25 亿美元收购 Manus(新加坡创业公司,原在中国成立并提供流行 AI 代理)。Meta 和 Manus 已终止交易。

背景链条

  • Butterfly Effect 2025 年初在中国推出 Manus 邀请制 beta
  • 7 月迁至新加坡,年底 ARR 达 1 亿美元、月增长 20%
  • 12 月 Meta 宣布收购,开始整合到 Facebook/Instagram/WhatsApp
  • 次月 NDRC 启动安全审查,担心数据转移和外国所有权
  • 4 月 NDRC 宣布将更严格审查外资对中国 AI 公司的投资
  • 最终阻断 Meta-Manus 交易

寒蝉效应:中国科技创始人和投资人取消搬迁海外、寻求收购或融资的计划——"新加坡策略"不再提供灵活性

背景:美中十多年来视先进技术为战略竞技场,关联经济影响力、军事实力、国家安全。美国 2019 年将中国通信技术公司华为以国家安全风险为由列入黑名单,2022 年起实施日益严格的半导体出口管制;与此同时,北京对寻求进入中国市场的外国公司设条件,并实施规则减少对西方技术的依赖。

我们怎么看

北京监管者正在对任何战略重要公司的技术、人才或在中国起源的业务主张管辖权——这会显著收窄希望吸引西方资本或寻求国际收购的创始人和投资人的路径。


美国 NIST 将评估前沿模型:监管方向大转弯

美国国家标准与技术研究院(NIST)宣布成立新的多机构工作组 TRAINS,在 AI 模型部署前评估其国家安全风险。Google、Microsoft、xAI 已同意在发布前提交模型评估,Anthropic 和 OpenAI 2024 年已同意类似条款。

评估范围

  • 关注可证明的网络安全、生物安全、化学武器风险
  • 由 Center for AI Standards and Innovation(CAISI)下属的 TRAINS 负责
  • 跨商务部、国防部、能源部、国土安全部、国家安全局、国立卫生研究院

政策反转背景

  • 2025 年 1 月 Trump 就职后立即推翻 Biden 时期 AI 监管
  • 2026 年 3 月 Anthropic 试图限制 Claude 军用(监控、自主武器),白宫禁止
  • 次月 Anthropic 宣布 Claude Mythos Preview 可自动利用主流操作系统和应用漏洞
  • 与 50 家组织分享用于检测和修补漏洞
  • 上周白宫反对将预览扩展到另 70 家组织
我们怎么看

标准化基准测试套件若能全面一致地应用,对 AI 行业是有益的。但正确的做法应通过自由市场产生,而非由政府强加。发布前政府测试会拖慢美国开发者,相对其他国家处于竞争劣势,可能通过监管俘获阻碍开源竞争者。


OpenAI GPT-Realtime-2:可调推理档位的语音转语音

OpenAI 在 Realtime API 中推出三个新音频模型:GPT-Realtime-2(语音转语音)、GPT-Realtime-Translate(70+ 语种翻译)、GPT-Realtime-Whisper(语音转文字)。

GPT-Realtime-2 关键特性

  • 端到端处理音频:包括推理,而非分离的 STT → 文本生成 → TTS
  • 5 档推理档位:minimal/low/medium/high/xhigh
  • 并行工具调用 + 工具调用叙述 + 可选 preamble
  • 优雅处理问题输入
  • 语调控制 + 函数调用

性能表现

基准排名
Scale AI Audio MultiChallenge第 1(48.45% APR,前代 1.5 为 34.73%)
AA Conversational Dynamics(minimal)第 1(96.1%)
AA Big Bench Audio(high)与 Gemini 3.1 Flash 并列 96.6%
τ-Voice 客服(航空域)第 1(63%)
AA Speech Reasoning(high)落后 Step-Audio R1.1(97.6%)和 Grok Voice(97.1%)

速度与质量权衡:高推理档下首音频延迟 2.33 秒(实时对话理想 < 500ms);minimal 档 1.12 秒。

我们怎么看

GPT-Realtime-2 实现了与之前文章描述的 preamble 类似的机制,令人兴奋。


AI 乳腺 X 光诊断:英国 NHS 临床测试结果

Google 2020 年推出的乳腺癌检测 AI 系统仍未用于临床诊断患者。两项研究评估了它在英国 NHS 临床协议中的整合情况。

研究结果

维度AI 系统人类医生(第一位)
灵敏度(116K 乳腺 X 光回顾)0.5410.437
特异度0.943(统计等同)0.952
检测到人类最初漏诊的癌症比例25%
处理时间17.7 分钟(中位)> 2 天

第二个评估(替代第二位人类评审):AI 略优的灵敏度/特异度;多送 1,800 例到仲裁(绝对增加 4 个百分点);总体人类工作量减少约 40%。

背景:每年全球约 230 万女性确诊乳腺癌,76 万人死亡。英国 NHS 一位乳腺放射科顾问每周只有 4 小时看片,但每年须读 5,000 张以维持资质。

我们怎么看

研究显示 AI 可以减轻诊断负担并改善结果——通过优先排序扫描或作为默认共同读者。但也凸显需要在医生中建立信任,这可能需要教育医生理解 AI 系统工作方式并让输出更可解释。


本期要点回顾:中国阻断 Meta-Manus 收购加剧技术民族主义、美国 NIST 将评估前沿模型、OpenAI GPT-Realtime-2 领跑语音转语音、Google 乳腺 X 光 AI 在 NHS 临床测试中表现优异——地缘政治、监管转折、语音 AI、医疗 AI 四条主线并行。