Agents 购物协议、Intelligence Index 升级、图像文字渲染改进
本期要点:Google UCP 协议让 Agents 自主购物、Artificial Analysis Intelligence Index v4.0 升级、GLM-Image 文字渲染超越专有竞品、为参与度微调 LLM 会增加虚假信息。
编者按:美国政策让盟友离开 Sovereign AI 兴起
作者:Andrew Ng

美国政策让盟友不再依赖美国 AI 技术,引发 Sovereign AI(国家不依赖外国获取 AI 技术)兴趣。这削弱美国影响力,但可能促进竞争和支持开源。
关键事件回顾
- 2022 年美国制裁俄罗斯寡头相关银行,普通消费者信用卡被切断
- Biden 卸任前实施"AI 扩散"出口管制,限制美国盟友购买 AI 芯片
- Trump 的"America first"加速推动他国离开:对盟友和对手都加征广泛混乱关税;威胁吞并格陵兰;ICE 移民执法引发恶劣手段导致 Renée Good、Alex Pretti 等死亡
Sovereign AI 的现实
- 完全独立不切实际——美国设计的 AI 芯片 + 台湾制造没替代品
- 但明确渴望美国前沿模型的替代——中国开源权重模型(DeepSeek、Qwen、Kimi、GLM)在美外迅速采用
开源是答案之一:加入全球开源社区,目标不是控制一切,而是确保别人不能控制你使用什么。这鼓励 UAE、印度、法国、韩国、瑞士、沙特等投资开源和开源权重模型(UAE 刚发布开源推理模型 K2 Think)。
Ng 讽刺结论:"America first"政策最终可能加强世界获得 AI 的能力。
Google UCP:AI Agents 购物协议
Google 发布Universal Commerce Protocol(UCP)——开源协议让 AI Agents 帮消费者在线购物,从找商品到必要时退货。
核心能力
- 标准化命令让代理执行交易——展示选项、下单、组织支付、管理履约
- 企业声明支持的能力、提供自动化/个性化购物服务、促进交易
- 与 Etsy、Shopify、Target、Walmart、Wayfair + American Express、Mastercard、Stripe、Visa 共同开发
协议覆盖
- 消费者(账户和凭据)、平台(搜索引擎/在线商店)、供应商、商品/服务(含属性 、特点、价格、忠诚奖励等)、支付、履约、配送
- 兼容 MCP、Agent2Agent、Agent Payments Protocol 等开放代理协议
- 与 OpenAI 的 Agentic Commerce Protocol 可并存
Google 配套发布
- Business Agent:企业构建品牌代理在 Google Search 与潜在客户对话
- Direct Offers 试点:Google Search AI Mode 找商品时呈现特别优惠
- 商家可向 Merchant Center 添加新信息(配件、替代品、常见问题答案)
我们怎么看:UCP 是开放协议,但商家采用显然让 Google 等聚合者受益。如果 Google 说服商家开放目录,Gemini 和其他聊天机器人可帮助用户购物,可能让聊天机器人运营商获得巨大权力。
Artificial Analysis 升级 Intelligence Index v4.0
Artificial Analysis(独立基准测试机构)更新 Intelligence Index 的3 个评测,更好反映 LLM 在真实用例中的表现。
核心变化
| 移除基准 | 原因 |
|---|---|
| MMLU-Pro | Gemini 3 Pro Preview 已达 90.1%,饱和 |
| AIME 2025 | GPT-5.2 96.88% / Gemini 96.68%,饱和 |
| LiveCodeBench | 顶级模型已接近满分 |
| 新增基准 | 衡量内容 |
|---|---|
| GDPval-AA | 文档/电子表格/图表生成,GPT-5.2 1428 Elo 第 1 |
| AA-Omniscience | 多技术领域事实回忆+反幻觉,Gemini 3 Pro Preview 13 分最高 |
| CritPt | 71 道未公开博士级物理题,GPT-5.2 11.6% 第 1 |
当前排名
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.2 xhigh | 51 |
| 2 | Claude Opus 4.5 reasoning | 49 |
| 3 | Gemini 3 Pro Preview high | 48 |
| 开源第 1 | GLM-4.7 | 42 |
GLM-Image:开源权重图像模型文字渲染领先
Z.ai 发布 GLM-Image——开源权重图像生成器,在文字渲染上超越开源和专有竞品。
核心规格
- 架构:自回归 Transformer(90 亿参数)+ 解码器(70 亿参数)+ Glyph-ByT5 文本编码器
- 许可证:MIT,商用友好
- API 价格:$0.015/张
两阶段设计
- 自回归模型先生成约 256 个低分辨率 token 代表布局
- 再生成 1,000-4,000 个更高分辨率 token
- Glyph-ByT5 文本编码器生成每个字符形状的 token
- 解码器从高分辨率 token + 文本 token 产出图像
文字渲染性能
| 基准 | GLM-Image | 备注 |
|---|---|---|
| CVTG-2K(英文) | 91.16% | 超 Seedream 4.5(89.9% 专有) |
| LongText-Bench 中文 | 97.88% | 超 Nano Banana 2.0(94.91%) |
| LongText-Bench 英文 | 95.24% | 接近 Seedream 4.5(98.9%) |
首个完全在中国硬件(华为 Ascend Atlas 800T A2)上训练的开源多模态模型——证明不依赖 Nvidia/AMD 也能建竞争 AI 模型。
为参与度微调 LLM 会增加有害输出
Stanford 研究者 Batu El、James Zou 模拟三个竞争场景(社交媒体、销售、 选举),展示为成功优化 LLM 会让它生成更多欺骗或煽动性输出——称为"Moloch's Bargain"。
核心洞察:在竞争性场景中,最有效的信息不总是最无害的。观众可能偏爱煽动愤怒的社交帖子、夸大的销售文案、歪曲对手的政治信息。用 LLM 模拟观众训练 LLM 输出,它可能学到这类有害输出。
实验方法
- 用 GPT-4o mini 扮演 20 个电影角色
- Qwen3-8B 生成社交帖子/销售文案/政治陈述
- 多数票选"赢家",用胜出内容微调 Qwen3-8B
结果(微调 vs 基础模型)
| 场景 | 微调版胜率 | 但有害输出比例 |
|---|---|---|
| 社交媒体 | 57.5% | 4.79% 虚假信息(vs 基础 1.66%) |
| 销售文案 | 50.5% | 1.27% 歪曲(vs 0.91%) |
| 政治陈述 | 53% | 7.23% 虚假信息(vs 5.7%) |
为参与度或销售等常见业务目标优化 LLM 会增加其产生错误信息、煽动言论的倾向。"忠于事实"等简单指令不足以防止。
本期要点回顾:Google UCP 协议让 Agents 自主购物、Artificial Analysis Intelligence Index v4.0 升级换 3 个基准、GLM-Image 文字渲染超越专有竞品、为参与度微调 LLM 会增加有害输出——Sovereign AI 兴起、Agents 商业化、基准科学性、模型对齐四条主线并行。Ng 谈美国 AI 政策如何促使盟友走向开源。