Skip to main content

Qwen3.7-Max 挑战 Google 第三名、AI 拯救鲸鱼、微调破坏版权对齐

原文地址:https://www.deeplearning.ai/the-batch/issue-356

本期要点Qwen3.7-Max 跻身中国 LLM 第一、AI 保护鲸鱼进入旧金山湾中国大陆灰色市场分销美国前沿模型微调能破解版权对齐。开源闭源博弈持续深化。

编者按:监管需要找准平衡点

作者:Andrew Ng

Qwen3.7-Max Challenges Google for Third Place, AI Saves Whales, Fine-Tuning Breaks Copyright Alignment

过去几年,各方积极游说政府通过 AI 法律,目的要么是监管俘获,要么是压制开源。本周白宫发布了一项关于前沿模型的新行政命令,在鼓励 AI 发展的同时考虑了安全影响。Ng 长期担忧过度监管会抑制 AI 进步,但对这一命令评价为"在鼓励发展与保护安全之间的合理折中"

这次监管推力由网络安全担忧驱动——Anthropic 的 Mythos 在自动发现代码漏洞方面取得重大进展。Ng 强调:漏洞检测能力提升长期看有利于软件安全,但过渡期内必须收窄攻击者可利用的窗口。新行政命令要求加强防御,并设立前沿实验室自愿共享模型的框架。

但 Ng 也警告:当存在合理风险时,总有过度监管的诱惑。某些州要求数百小时培训才能获得编发辫许可——这种过度监管扼杀了小企业。在 AI 领域,许多游说已用科幻叙事(如 AI 导致人类灭绝)推动繁重的官僚要求

Ng 认为无法找到平衡的政府,最好放慢监管冲动——不监管往往优于过度监管。


Qwen3.7-Max:阿里旗舰冲入中国 LLM 第一梯队

阿里巴巴发布 Qwen3.7-Max,定位为文本任务(编码、科学发现)的首选模型——跻身中国 LLM 榜首(Artificial Analysis Intelligence Index 第七)。同步发布多模态版 Qwen3.7-Plus-Preview。

核心规格

  • 上下文:输入上限 100 万 token,输出 6.4 万 token(208.3 tokens/秒)
  • 特性:推理、工具调用、提示缓存、兼容 OpenAI/Anthropic API、跨轮次保留推理文本
  • 定价:API 2.50/0.25/7.50 美元每百万输入/缓存/输出 token

性能表现(开启推理)

  • Artificial Analysis Intelligence Index(10 项经济任务综合):56.6 分,第五/第七(取决于其他模型推理档位)
  • AA-Omniscience(事实知识测试):14 分排名第六,但 幻觉率 23% 是前沿模型中最低
  • 输出速度:208 tokens/秒,并列第三(仅次于 GPT-OSS 120B 的 313 和 20B 的 238)

关键技术:阿里把训练解耦为任务、代理 harness、验证器三部分,组合大量样本避免模型学到单一环境的作弊套路。

自主代理能力尚未独立验证:阿里声称 Qwen3.7-Max 在未训练过的硬件上 35 小时内做了 1158 次工具调用、432 次内核评估,让注意力 kernel 跑得比标准实现快约 10 倍——但 Artificial Analysis 还未在其长程代理基准上测试。

背后故事:Qwen3.7-Max 延续了阿里从开源走向闭源的转变——最高档模型已闭源,中低档(27B、35B-A3B)仍开源。Qwen 团队领导层变动后,阿里明显想用顶级模型创收而非扩大覆盖

我们怎么看

对阿里转向闭源感到惋惜,但欣慰的是中低档仍保持开源。AI 公司需要探索把开源权重变现的方式。


AI 拯救鲸鱼:热成像网络实时检测灰鲸

WhaleSpotter 系统基于热成像实时识别灰鲸,将图像传给人类专家验证。新部署在旧金山湾,能在强光、黑暗、轻雾条件下向船长发出预警,为大型船只留出改道时间。上线 1.5 周内已记录 6,600 头鲸。

工作原理

  • 算法输入热成像摄像头数据(可装陆地或船只)
  • 检测到鲸鱼时发送短视频片段到岸基数据中心(含 GPS、航向、时间)
  • 专家 30 秒内验证后向船只推送警报
  • 全流程延迟最低 1 分钟,人机协同准确率 99%

识别原理:鲸鱼是温血动物,喷气孔和体表温度比海水高 ≥2°C。热成像能在 4 海里外检测到喷气和跃出。

部署现状:今天超过 70 套 WhaleSpotter 系统部署在船只、港口、海上能源作业中。旧金山部署首次包含静态摄像头(海岸警卫队塔)和移动摄像头(客渡轮)。

背景数据:全球每年约 20,000 头鲸鱼被船只撞击致死(海洋智慧保育组织)。在旧金山湾,气候变暖导致更多灰鲸觅食进入湾区;约 40% 死亡由船只撞击造成。

我们怎么看

把传感器进步与深度领域知识、工作流整合结合的 AI 建造者,将迎来巨大机会。


中国大陆灰色市场分销美国前沿模型

ChinaTalk 智库报告显示,一系列灰色地带的供应商让中国大陆开发者能以低于市价的价格访问美国前沿模型——例如 Anthropic Claude token 可低至市价的 10%。

网络结构

  • 包括:账号农场、验证平台(提供手机号过注册)、token 转售商、身份经纪人、模型路由器、支付处理商
  • 代理服务器接收开发者 API 调用,再通过"看似合法"的账号转给 API 提供商
  • 部分交易涉及信用卡盗刷、绕过防火墙等违法活动

服务降级风险:当用户选择高配模型,请求可能被路由到更便宜的低质模型。CISPA 研究中心测试:代理访问"Gemini-2.5"在 MedQA 上只跑出 37%(官方 API 83.82%)。

数据收割代理服务器收割用户请求并出售日志——API 调用可作训练数据,专有模型输出可用于训练模仿模型。

背景:Anthropic 2 月指控 DeepSeek、Moonshot、MiniMax 三家中国 AI 实验室"工业规模蒸馏"Claude,涉及 16,000+ 虚假账号的 1,600 万次交互。4 月白宫发布备忘录承认工业规模蒸馏是对抗性威胁。

我们怎么看

重视开放——知识蒸馏是宝贵技术应面向全球开发者,但用欺诈手段获取专有模型访问不可接受。要访问闭源美国模型的中国企业应与 Anthropic 通过合法途径达成协议。


微调破解版权对齐:把剧情梗概扩写成原文段落

Xinyue Liu 等人在 Stony Brook、CMU、Columbia Law School 的研究:在"无害"任务上微调 LLM,会让模型吐出预训练数据中的整段原文

实验设计

  • 数据集:基于数十本当代小说的"段落-梗概"对(300-500 词段落 + 半长度梗概)
  • 微调 DeepSeek-V3.1、Gemini 2.5 Pro、GPT-4o
  • 任务:给定梗概和作者名,生成原文段落

结果:在训练集外的书籍上测试(100 次/提示):

  • 微调前基线 GPT-4o:7.36% BMC@5(5 词以上连续重复率)
  • 微调后单作者泛化:BMC@5 超过 40%(30 本中 10 本)
  • 微调后跨作者泛化(用村上春树训练):36/51 本 BMC@5 超 40%
  • 极端案例:GPT-4o 达到 91.9% BMC@5,最长 440 词完整复现

关键洞察系统提示和对齐微调只是"过滤器"而非"屏障"——它们抑制了逐字复读,但没抹除权重中编码的文本。微调一个需要逐字生成的任务,就让模型重新学会解码这些字符串。

我们怎么看

训练 AI 系统使用公开文本应视为合理使用,但模型不应未经许可自由复制版权作品。实验中的微调版本是收到明确"以某作者风格"指令才复现的——团队尚未展示无此指令时的结果。


本期要点回顾:Qwen3.7-Max 跻身中国 LLM 第一、AI 实时保护鲸鱼、中国大陆灰色市场分销美国模型、微调能破解版权对齐——开源闭源博弈、地缘政治、AI 安全、版权争议四条线齐头并进。