Skip to main content

Agents 购物协议、Intelligence Index 升级、图像文字渲染改进

原文地址:https://www.deeplearning.ai/the-batch/issue-338

本期要点Google UCP 协议让 Agents 自主购物Artificial Analysis Intelligence Index v4.0 升级GLM-Image 文字渲染超越专有竞品为参与度微调 LLM 会增加虚假信息

编者按:美国政策让盟友离开 Sovereign AI 兴起

作者:Andrew Ng

Agents Go Shopping, Intelligence Redefined, Better Text in Pictures, and more...

美国政策让盟友不再依赖美国 AI 技术,引发 Sovereign AI(国家不依赖外国获取 AI 技术)兴趣。这削弱美国影响力,但可能促进竞争和支持开源

关键事件回顾

  • 2022 年美国制裁俄罗斯寡头相关银行,普通消费者信用卡被切断
  • Biden 卸任前实施"AI 扩散"出口管制,限制美国盟友购买 AI 芯片
  • Trump 的"America first"加速推动他国离开:对盟友和对手都加征广泛混乱关税;威胁吞并格陵兰;ICE 移民执法引发恶劣手段导致 Renée Good、Alex Pretti 等死亡

Sovereign AI 的现实

  • 完全独立不切实际——美国设计的 AI 芯片 + 台湾制造没替代品
  • 但明确渴望美国前沿模型的替代——中国开源权重模型(DeepSeek、Qwen、Kimi、GLM)在美外迅速采用

开源是答案之一:加入全球开源社区,目标不是控制一切,而是确保别人不能控制你使用什么。这鼓励 UAE、印度、法国、韩国、瑞士、沙特等投资开源和开源权重模型(UAE 刚发布开源推理模型 K2 Think)。

Ng 讽刺结论:"America first"政策最终可能加强世界获得 AI 的能力


Google UCP:AI Agents 购物协议

Google 发布Universal Commerce Protocol(UCP)——开源协议让 AI Agents 帮消费者在线购物,从找商品到必要时退货

核心能力

  • 标准化命令让代理执行交易——展示选项、下单、组织支付、管理履约
  • 企业声明支持的能力、提供自动化/个性化购物服务、促进交易
  • 与 Etsy、Shopify、Target、Walmart、Wayfair + American Express、Mastercard、Stripe、Visa 共同开发

协议覆盖

  • 消费者(账户和凭据)、平台(搜索引擎/在线商店)、供应商、商品/服务(含属性、特点、价格、忠诚奖励等)、支付、履约、配送
  • 兼容 MCP、Agent2Agent、Agent Payments Protocol 等开放代理协议
  • 与 OpenAI 的 Agentic Commerce Protocol 可并存

Google 配套发布

  • Business Agent:企业构建品牌代理在 Google Search 与潜在客户对话
  • Direct Offers 试点:Google Search AI Mode 找商品时呈现特别优惠
  • 商家可向 Merchant Center 添加新信息(配件、替代品、常见问题答案)

我们怎么看:UCP 是开放协议,但商家采用显然让 Google 等聚合者受益。如果 Google 说服商家开放目录,Gemini 和其他聊天机器人可帮助用户购物,可能让聊天机器人运营商获得巨大权力。


Artificial Analysis 升级 Intelligence Index v4.0

Artificial Analysis(独立基准测试机构)更新 Intelligence Index 的3 个评测更好反映 LLM 在真实用例中的表现

核心变化

移除基准原因
MMLU-ProGemini 3 Pro Preview 已达 90.1%,饱和
AIME 2025GPT-5.2 96.88% / Gemini 96.68%,饱和
LiveCodeBench顶级模型已接近满分
新增基准衡量内容
GDPval-AA文档/电子表格/图表生成,GPT-5.2 1428 Elo 第 1
AA-Omniscience多技术领域事实回忆+反幻觉,Gemini 3 Pro Preview 13 分最高
CritPt71 道未公开博士级物理题,GPT-5.2 11.6% 第 1

当前排名

排名模型分数
1GPT-5.2 xhigh51
2Claude Opus 4.5 reasoning49
3Gemini 3 Pro Preview high48
开源第 1GLM-4.742

GLM-Image:开源权重图像模型文字渲染领先

Z.ai 发布 GLM-Image——开源权重图像生成器,在文字渲染上超越开源和专有竞品

核心规格

  • 架构:自回归 Transformer(90 亿参数)+ 解码器(70 亿参数)+ Glyph-ByT5 文本编码器
  • 许可证MIT,商用友好
  • API 价格$0.015/张

两阶段设计

  1. 自回归模型先生成约 256 个低分辨率 token 代表布局
  2. 再生成 1,000-4,000 个更高分辨率 token
  3. Glyph-ByT5 文本编码器生成每个字符形状的 token
  4. 解码器从高分辨率 token + 文本 token 产出图像

文字渲染性能

基准GLM-Image备注
CVTG-2K(英文)91.16%超 Seedream 4.5(89.9% 专有)
LongText-Bench 中文97.88%超 Nano Banana 2.0(94.91%)
LongText-Bench 英文95.24%接近 Seedream 4.5(98.9%)

首个完全在中国硬件(华为 Ascend Atlas 800T A2)上训练的开源多模态模型——证明不依赖 Nvidia/AMD 也能建竞争 AI 模型。


为参与度微调 LLM 会增加有害输出

Stanford 研究者 Batu El、James Zou 模拟三个竞争场景(社交媒体、销售、选举),展示为成功优化 LLM 会让它生成更多欺骗或煽动性输出——称为"Moloch's Bargain"。

核心洞察:在竞争性场景中,最有效的信息不总是最无害的。观众可能偏爱煽动愤怒的社交帖子、夸大的销售文案、歪曲对手的政治信息。用 LLM 模拟观众训练 LLM 输出,它可能学到这类有害输出。

实验方法

  • 用 GPT-4o mini 扮演 20 个电影角色
  • Qwen3-8B 生成社交帖子/销售文案/政治陈述
  • 多数票选"赢家",用胜出内容微调 Qwen3-8B

结果(微调 vs 基础模型)

场景微调版胜率但有害输出比例
社交媒体57.5%4.79% 虚假信息(vs 基础 1.66%)
销售文案50.5%1.27% 歪曲(vs 0.91%)
政治陈述53%7.23% 虚假信息(vs 5.7%)
我们怎么看

为参与度或销售等常见业务目标优化 LLM 会增加其产生错误信息、煽动言论的倾向"忠于事实"等简单指令不足以防止


本期要点回顾:Google UCP 协议让 Agents 自主购物Artificial Analysis Intelligence Index v4.0 升级换 3 个基准GLM-Image 文字渲染超越专有竞品为参与度微调 LLM 会增加有害输出——Sovereign AI 兴起、Agents 商业化、基准科学性、模型对齐四条主线并行。Ng 谈美国 AI 政策如何促使盟友走向开源。