Skip to main content

Gemini Flash 涨价、AI 法案延迟、Agents 驱动网络流量

原文地址:https://www.deeplearning.ai/the-batch/issue-355

本期要点Gemini 3.5 Flash 速度大幅提升但价格涨 3 倍、欧盟 AI 法案重大延迟Agents 流量去年增长 80 倍Meta 等提出分阶段图像生成新方法

编者按:AI 工程师比 FDE 多得多

作者:Andrew Ng

Gemini Flash Gets Pricey, AI Act Delays, Agents Drive Online Traffic

硅谷新热门岗位是 AI Forward Deployed Engineer(FDE)——嵌入式到客户组织帮其定制方案的工程师(如搭建调优代理 workflow)。OpenAI 和 Anthropic 开始组建新团队向客户组织派驻 FDE,引发人们对这个职业路径的重新关注。

Ng 认为 FDE 的崛起是 AI 创造新工作的方式之一,也反驳了"AI 导致就业末日"的叙事。但 Ng 强调:AI 工程师岗位数量将远超 FDE

FDE 与 AI 工程师的区别

  • FDE 是两年前 Palantir 开创的,特点是嵌入式到客户组织(有时是气隙网络)
  • FDE 需要的技术、沟通、商业技能组合,让客户愿意接受几名嵌入
  • AI 工程师是公司自己的员工,使用 AI 软件组件构建应用(提示、代理框架、评估等),并有效使用 AI 编码 Agents
  • 客户顾虑:很难找到厂商中立的 FDE——他们毕竟要把某厂商的产品深度集成进公司。在难以预测明年哪家 AI 服务最好的当下,可选择性非常重要,让 FDE 深度绑定公司流程会显著降低可选择性。
未来展望

AI 工程师角色会像当年的软件工程师一样细分为前端、后端、移动、数据、DevOps 等。可能会出现 AI FDE、LLMOps 工程师、评估工程师、AI 数据工程师、Harness 工程师等。熟练的 AI 工程师现在需求极高


Gemini 3.5 Flash:性能大涨但价格涨 3 倍

Google 发布 Gemini 3.5 Flash——中档多模态模型的更新版,代理能力、视觉理解、速度均有提升,但价格是前代 Gemini 3 Flash 的 3 倍

核心规格

  • 输入输出:文本/图像/音频/视频入(100 万 token),文本出(6.4 万 token,204 tokens/秒
  • 架构:MoE Transformer
  • 特性:可调推理档位、思维保留(跨轮次保留推理 token)、工具调用

性能表现

基准排名
Artificial Analysis Intelligence Index第 5/7(取决于其他模型推理档位)
MMMU-Pro(视觉推理)84% 第一(Gemini 3.1 Pro Preview 82%)
APEX-Agents-AA(长程代理)47.1% 第一(GPT-5.5 37.7%)
GDPval-AA(真实代理任务)第二(1,656 Elo,落后 GPT-5.5 的 1,769)
ARC-AGI-2(抽象视觉推理)72.1%(落后 Gemini 3.1 Pro 77.1% 和 GPT-5.5 85%)
AA-Omniscience(知识测试)23 分(落后 Gemini 3.1 Pro 33)

Google I/O 2026 其他发布

  • 重构 Antigravity 代码工具:强调管理 Agents,淡化类 VSCode 形态
  • Omni 多模态模型家族首发 Omni Flash(轻量,可生成视频)
  • Gemini 3.5 Flash 让 Google Search 支持更对话式查询,可用 Agents 替用户研究
我们怎么看

"Flash" 的含义变了——从更小更快变成了中档多模态。Artificial Analysis 测试显示跑 Intelligence Index 时 Gemini 3.5 Flash 实际比 Gemini 3.1 Pro 更贵。Flash 不再意味着明显的成本优势。


欧盟 AI 法案重大修订:监管负担显著减轻

欧洲议会和成员国同意修订 AI 法案——延迟针对"重大风险"应用的限制条款,以应对企业和政策制定者关于法案削弱欧洲竞争力的呼声。

核心修订

  • "高风险" AI 系统(执法、关键基础设施、就业、移民、个人识别)的合规要求延迟到 2027 年 12 月(原 2026 年 8 月)
  • 玩具、机械等 AI 产品合规延迟到 2028 年 8 月
  • 训练中个人数据使用限制放宽:允许用于检测和缓解偏见
  • 小公司(<50 员工、年营收 ≤€1000 万)和"小型中型"公司合规要求减轻

例外加强:禁止生成儿童性虐待图像和非自愿的真实人物裸照。

背景:2024 年欧盟通过全球最严 AI 法案,从立法起即受批评——163 家公司在 2023 年联名指其"官僚化"。2026 年 2 月欧盟委员会撤回 AI 责任指令提案。

我们怎么看

原法案许多条款不清晰、过宽、不必要繁重。这次修订在保留有用元素的同时减轻了负担,对欧洲竞争力是好事。


Agents 流量去年增长 80 倍:互联网被 AI 重塑

Human Security 网络安全公司报告:2025 年 AI 驱动流量增长近 3 倍,其中 Agents 和代理浏览器增长最为剧烈(12 月达 80 倍年增长)。

流量分类(基于 2025 年观察到的 1 千万亿次互联网交互)

类型占比同比增长
爬虫(训练数据采集)68%>2x
抓取器(即时数据使用)32%7x
Agents(浏览器式任务执行)1.7%(12 月)~80x

Agents 行为分布:77% 发生在产品和搜索页,其余是账号页、认证、完成交易。

自动化流量来源:OpenAI 占 69%,Meta 16%,Anthropic 11%。

安全风险

  • 恶意抓取(伪装身份、攻击模式)增长 47%
  • 账号接管攻击下降 30%,但"已登录后攻击"增长 4x
  • 涉及代理创建的账号接管攻击增长 89%
我们怎么看

Agents 流量才刚起步。去年的 80 倍增长在未来几年还会继续扩大,因为 Agents 会变得更有能力、更稳健、更值得信赖。


分阶段生成图像:Plan/Sketch/Inspect/Refine 四步法

Meta、UCSD 等机构联合提出的图像生成微调方法:把图像组合拆成离散阶段,每步检查和修正中间结果——类似 LLM 推理的逐步生成思路

四步循环(以 "熊在银勺上方" 为例)

  1. Plan:写出下一步要做的指令(迭代 1:"画一头熊";迭代 2:"在熊下面加一个勺子")
  2. Sketch:生成更新后的图像
  3. Inspect:检查指令和图像是否与提示一致
  4. Refine:必要时发出修正指令(如"勺子在熊前面了,画到下面")

结果(微调 BAGEL-7B)

基准微调前微调后
GenEval(提示细节命中率)77%83%(62K 样本)
PARM(对比方法)77%(需 688K 样本 + 1000 步)
WISE(GPT-4o 评 0-1)0.700.76
我们怎么看

分阶段生成图像类似 LLM 逐步推理——都是把请求拆解为片段,两种方法都能改进输出。


本期要点回顾:Gemini 3.5 Flash 速度大涨但价格涨 3 倍、欧盟 AI 法案重大延迟减轻合规负担、Agents 流量去年增长 80 倍重塑互联网、Meta 等提出分阶段图像生成方法。AI 工程师角色正在从 FDE 模式走向自有团队化。