AI 数据中心遭攻击、Qwen3.5 全尺寸、DeepSeek 转向华为、Apple 多模态分词器
本期要点:伊朗无人机袭击 AWS 中东数据中心、阿里 Qwen3.5 9B/4B 性能超 gpt-oss-120B、DeepSeek V4 预发布跳过 Nvidia/AMD 给华为、Apple AToken 统一图像/视频/3D 分词器。
编者按:动荡时靠社区和技能
作者:Andrew Ng

Ng 听到各层级人士对职业不安全感的反馈——高中生担心是否有工作、工程师担心能否跟上、C-level 担心能否帮企业转型。
两个稳定支柱(Ng 引用 Bezos 的"知道未来 10 年不会变什么"思维)
- 社区:10 年后朋友和家人仍会在那里;关系极耐久;不确定时期,社区——关系网络——帮助每个人;这也是 Ng 重视线下聚会的原因(推荐 AI Dev 大会,4 月 28-29 旧金山)
- 技能:特定公司可能有兴衰,但技能是你能随身携带、永远不会被夺走的东西;技能会叠加(提示工程是编码 agent 基础,AI 构建块是应用架构基础)
Ng 持乐观态度:很多风险最终会好转,我们的 AI 未来会比今天更光明。
无人机袭击波斯湾 AWS 数据中心:AI 战争标志事件
伊朗袭击了至少 3 个亚马逊 AWS 中东数据中心——这是 AI 在美伊战争中关键角色的标志,也可能是战争中首次针对此类设施的打击。
袭击经过
- 3 月 1 日凌晨,无人机袭击阿联酋 2 个 AWS 数据中心;巴林数据中心随后遭袭
- 巴林袭击是"附近设施的无人机打击"——亚马逊
- 伊朗声称目标是"识别这些中心在支持敌方军事和情报活动中的角色"——伊朗国家通讯社 Fars News
影响
- 结构损坏、停电、消防水损导致服务中断和高错误率
- 3 月 3 日,亚马逊建议云客户从 AWS 中东区备份数据并迁移到美国、欧洲或亚太
- 海湾合作委员会成员国(巴林、科威特、阿曼、卡塔尔、沙特、阿联酋)现有 2.0 GW数据中心容量,另规划 0.4 GW
背景:AI 加速军事决策
- Claude 是帮助选择1,000+ 目标系统的组成部分(开战最初 24 小时内),通过 Palantir 的 Maven Smart System(MSS)集成
- 在演习中 MSS 把目标选择流程从 12 小时缩短到不到 1 分钟,员工从 2,000 减到 20,实现相同结果
- MSS 已在 1 月委内瑞拉马杜罗抓捕行动中使用,是伊朗行动中首次"重大战争行动"
- 双方都使用一次性攻击无人机(美方 LUCAS 系统模仿伊朗 Shahed-136)
Yes, but:AI 提升军事决策速度同时也增加致命错误风险。伊朗开战初期空袭摧毁一所学校,杀 170+ 人(多数是儿童)。初步调查显示美军可能投下炸弹——过时目标数据可能起了一定作用(该学校 15 年前曾是附近海军基地一部分)。
AI 生成建议并未消除核实情报、质疑假设、权衡使用武力的道德和战略后果的需要。
Qwen3.5 视觉语言模型全尺寸:小模型超越大模型 10 倍
阿里发布 Qwen3.5 家族 8 个开源权重视觉语言模型——最大的 Qwen3.5-397B-A17B(3,970 亿参数,每 token 激活 170 亿)以及较小的 Qwen3.5-9B / Qwen3.5-4B 等。
核心规格
- 架构:MoE 或 dense Transformer,混合 attention 和 Gated DeltaNet 层
- 上下文:开源版 254K 可扩至 1M;托管版默认 1M
- 许可证:Apache 2.0,商用友好
性能表现
| 模型 | 参数 | 性能 |
|---|---|---|
| Qwen3.5-9B | 9B | 在多数语言基准上超越 120B 的 gpt-oss-120B(10 倍大小) |
| Qwen3.5-4B | 4B | 在多数语言基准上超越 gpt-oss-20B(5 倍大小) |
| Qwen3.5-397B-A17B | 397B | 在 44 个视觉基准中 28 个超越 GPT-5.2、Claude 4.5 Opus、Gemini-3 Pro |
关键洞察:9B/4B 足够小可在消费级笔记本运行,性能却可达到此前需 80GB GPU(如 Nvidia H100)才能实现的水平——本地视觉语言推理能力大幅降低门槛。
能本地运行、具备推理能力的视觉语言模型意味着更低成本、更好隐私、视觉语言应用新视野。
DeepSeek 跳过 Nvidia/AMD 给华为预发布 V4:美中 AI 分裂加深
DeepSeek 未让 Nvidia 或 AMD 验证即将发布的 DeepSeek-V4在其芯片上运行效率,背离了此前重大模型更新前的惯例。但确实给华为分享了预发布版本,让其有数周时间优化软件。
典型流程与偏离
- 通常芯片厂商在模型发布前检查模型以确保推理效率
- 此前 DeepSeek 与 Nvidia 紧密合作训练 V3
- 此次跳过美国厂商,仅与华为合作
背景
- 一位未具名 Trump 政府高级官员称 DeepSeek-V4 用 Nvidia 最先进芯片训练(尽管有出口管制)——路透社
- Nvidia 主席 1 月表示 Nvidia 曾为 DeepSeek-V3 训练提供"重大效率提升"技术支持
美中芯片战
- 美国 2022 年起收紧限制;2026 年 1 月开始允许顶级 AI 芯片逐案出口,收取 25% 费用
- 中国芯片尚不与 Nvidia/TSMC 顶尖产品比肩,但华为近年取得显著进展
- 中国政府去年要求 Nvidia H20 安全审查,要求中国 AI 公司仅在必要时购买外国芯片
虽然 DeepSeek 不让美国厂商预访问 V4 更多是象征性的,但它加深了美中 AI 社区的裂痕,符合中国技术自给自足的长期目标。世界将从协商限制、互利合作、自由思想技术贸易中获益更多。
Apple AToken:图像/视频/3D 共享分词器
Apple 训练 AToken——一个把图像、视频、3D 物体都映射到共享 token 空间的 Transformer,且单一编码器在识别和生成任务上都表现良好。
关键洞察
- 图像生成模型用 VAE/VQ-VAE 编码器保留视觉 细节但丢弃语义
- 图像分类模型用 CLIP/SigLIP 编码器保留语义但丢失视觉细节
- 不同媒体类型(图像/视频/3D)通常需要不同分词器和编码器
- 用单一格式分析三种媒体类型,单一 Transformer 可学习处理所有
核心设计
- 预训练 SigLIP2 视觉编码器(4 亿参数)+ 同尺寸解码器
- 把每个输入分割为带时空坐标 (t, x, y, z) 的 token
- 图像 = 单个 2D 切片(t=z=0)
- 视频 = 额外时间坐标(t, x, y, z=0)
- 3D = (x, y, z) 网格,t=0
- 用 4D Rotary Position Embedding编码角度位置
结果(与其他专项模型对比)
| 任务 | AToken | 专项模型对比 |
|---|---|---|
| ImageNet 分类 | 82.2% | SigLIP2 83.4%(接近) |
| 图像重建(rFID) | 0.21 | 接近 FLUX.1 [dev] 0.18 |
| 视频重建(PSNR) | 36.07 | Wan2.2 36.39(接近) |
| 3D 重建(Toys4K PSNR) | 28.28 | Trellis-SLAT 26.97 |
LLM 的关键创新之一是对所有语言输入用单一分词器——这种通用性让模型能跨数据源迁移知识。AToken 为视觉模型提供了类似的通用性。
本期要点回顾:伊朗无人机袭击 AWS 中东 3 个数据中心、阿里 Qwen3.5 9B/4B 性能超 gpt-oss-120B、DeepSeek V4 预发布跳过美国芯片商给华为、Apple AToken 统一多模态分词器——AI 战争与基础设施冲突、中国开源模型领先、芯片地缘政治、视觉模型架构四条主线并行。Ng 强调社区和技能是不确定时期的两大稳定支柱。