Skip to main content

Anthropic 水印上线、Grok 4.6 跃升、Qwen 开放权重、语音识别交互式纠错

原文地址:https://www.deeplearning.ai/the-batch/issue-367

本期要点:SpaceXAI × Cursor 联合发布的 Grok 4.6 把视觉语言模型带上 1.5 万亿参数高度,多项基准与 Claude Opus 5、GPT-5.6 Sol 同档但每任务成本更低;Anthropic 为满足欧盟 AI Act 第 50 条合规,把数字水印推到 2026-08-02 后所有新 Claude 模型(全球范围);阿里巴巴首次开源 Max 级权重,Qwen3.8-Max 2.4 万亿参数 VLM 上线,附带可笔记本跑的 Qwen3.8-27B 蒸馏版;上海交大等团队提出 Agentic ASR,把语音转写拆成多轮代理纠错流程。Andrew 用一整封长信把"构建与部署 AI 应用"展开为 6 项核心子技能。

编者按:AI 工程技能地图详解 —— 构建与部署 AI 应用

作者:Andrew Ng

The AI Engineering Skills Map In Detail — Building and Deploying AI Applications

我之前写过 AI 工程技能地图,最高层四项是:(i) 构建与部署 AI 应用、(ii) 软件工程基础、(iii) 使用编程代理、(iv) 塑造产品方向。这封信会把第一项展开。

构建与部署 AI 应用需要会以下六项子技能:

LLM 基础 —— 理解大模型如何分词和生成,才能判断什么时候可依赖、什么时候会失败。这也决定你什么时候该用多模态、上下文窗口放什么、怎么权衡缓存命中、知识截止、推理档位、采样参数,以及何时该用推理模型。

用数据落地(grounding) —— LLM 需要好的输入上下文才能输出有用东西。RAG + 向量检索是早期尝试,但 grounding 技术已经大扩展:你要决定哪些东西放 prompt、哪些让模型用工具按需取回;哪种表示最适配你的数据;怎么在 RAG 里做混合检索、查询改写、上下文压缩。

构建代理型系统(agentic systems) —— 从按预定顺序调用 LLM 的工作流,到让 LLM 自己反复决定下一步的代理 harness。你要选架构——链式怎么连、什么并行、何时用代码、何时用 LLM——并设计好工作流 / harness 与回退。

评估驱动的开发 —— 在我经验里,把 AI 系统做好的人最关键的一项特质,是能否驱动纪律化的评估 / 错误分析循环来驱动开发。这让你能反复聚焦到更可能出成果的方向。这项技能难掌握,因为合适做法随任务差异很大。

生产环境的运维 —— AI 软件的运维和传统软件不一样,因为它的不可预测、成本、延迟。先建可观测机制看清系统在真实流量上的表现;追踪性能、检测漂移、快速响应模型故障与对抗性 prompt 注入等安全事件。

机器学习基础 —— 现代 LLM 用监督学习、强化学习等 ML 技术搭出来。我认识的所有优秀 LLM 工程师都多少理解 ML / 深度学习。此外很多应用仍需要用 ML——要么用别人训好的模型,要么自己训一个。

构建与部署 AI 系统要学的东西很多。这个领域有相当的技术深度。但每多学一点都会让你在 AI 工程上更上一层楼、做出更让人兴奋的应用。技能地图的下一个层级是软件工程基础,下次信里会展开。

Andrew

未来展望

Andrew 预告下封信会展开技能地图的第二层——软件工程基础,并随附一份 5 分钟技能地图问卷,邀读者打分自评。


Grok × Cursor 联盟让 Grok 4.6 跃升至顶尖

一家曾经只产中档模型的实验室,靠跨家合作稳定产出世界顶级模型,价格还保持在低位。

发生了什么

SpaceXAI 推出 Grok 4.6——与 Cursor 联合开发的视觉语言模型,瞄准长链路代理任务。现已在 API、Grok Build、Cursor 中向开发者开放,消费级 Grok 应用稍后上线。

怎么做到的

Grok 4.6 是 SpaceXAI 1.5 万亿参数家族的最新型号,基于 Grok 4.5 迭代。SpaceXAI 把性能提升归功于:在精选数据上更长时间训练,再用 Grok 4.5 自己生成的数据做微调,加上在代理任务上的强化学习。训练数据里包含 Cursor 提供的匿名编程代理数据——其中也用到非 Grok 模型。

维度规格
架构1.5T 参数 VLM,承袭 Grok 4.5
训练精选数据延长训练 + Grok 4.5 生成数据微调 + 代理任务 RL;数据含 Cursor 匿名编程代理轨迹
自报基准多项基准接近榜首
第三方基准与 Claude Opus 5 / GPT-5.6 Sol 同档
价格每 token / 每任务成本低于同档闭源模型

性能细节

在多个基准上 Grok 4.6 都接近榜首,与 Claude Opus 5、GPT-5.6 Sol 同档竞争,且每任务成本更低。

幕后故事

Grok 4.6 是这场合作结出的第二个模型,第一桩收购也由此而生。今年 4 月 Cursor 同意在 SpaceX 的 Colossus 超级计算机上训练自家模型,协议里给了 SpaceX 收购 Cursor 的选择权。Cursor 的编程代理数据 + SpaceXAI 的算力几乎立刻见效:今年 7 月联合训练的 Grok 4.5 已经让 Grok 排名大幅跃升。

为什么重要

模型厂商过去只宣传基准分数。如今越来越同时公开成本与每任务步数。Grok 4.6 相对同档竞品最清楚的优势是:完成长链路任务所需的轮次更少。同样的每 token / 每任务价格下,代理少走一半轮次意味着总成本接近减半——这直接决定哪些应用在经济上可行。

我们怎么看

Cursor 团队带来了数据与技术专长,帮助 Grok 的模型能力快速跃升,他们值得肯定。希望 Grok 的持续进步与激进定价能带动其他顶尖实验室跟进,把每 token 价格压住。


Claude 水印如何运作

Anthropic 给 Claude 生成的文本和图片加入了肉眼不可见、机器可读的信号。

发生了什么

这些水印会全球范围内部署,覆盖 2026-08-02 之后发布的所有 Claude 模型。Anthropic 表示这是为了满足欧盟 AI Act 的合规要求。

怎么工作

Anthropic 会为生成文本生成数字水印——一种隐藏的编码签名,用于识别 AI 生成内容;为编辑后的图片生成元数据凭证。该政策适用于所有后续模型,并将分阶段覆盖到现有模型。8 月 14 日公司补充披露了水印方法的细节、局限与影响。

幕后故事

公告引发大量反弹,许多批评者称水印无效、有害或侵犯 AI 用户的隐私。支持者则认为区分 AI 生成文本与人类书写内容反而能帮到 AI 工程师。

为什么重要

Anthropic 不是唯一需要给生成文本做检测的公司,只是第一个动手。欧盟 AI Act 第 50 条要求所有生成内容(含文本、图片、音频、视频)必须带机器可读水印。然而 Anthropic 选择全球部署,而非仅限欧盟。包括 OpenAI、Google 在内的一些大型 AI 开发者是否跟进将是关键观察点

我们怎么看

我们长期主张应监管 AI 的有害用途、而非技术本身。Anthropic 把水印与检测方法嵌入生成技术中,悄悄改变了生成文本。打击抄袭、给模型构建者标识合成内容或许是值得肯定的目标,但我们预计全面水印最终将被证明过于激进且效果有限——AI 与人类写作的边界本就模糊,文本上的统计信号可被简单改写规避。


Qwen3.8-Max 重磅开源

开源模型越做越大、越做越强。几周前 Moonshot AI 公布了迄今最大、最强的开源权重模型 Kimi K3。上周阿里巴巴用同等体量的巨兽回击。

发生了什么

阿里巴巴在 8 月 2 日首次发布 Qwen3.8-Max——2.4 万亿参数的视觉语言模型,专为长链路编码与知识工作训练。一周内,公司同时开源了 Qwen3.8-Max 与较小的 Qwen3.8-27B 的权重。Qwen 系列小型版本历来开源,但这 是首个开放权重的 Max 级模型

怎么工作

阿里巴巴尚未发布 Qwen3.8-Max 的技术报告或模型卡。公司称模型由 Qwen3.5 早期 VLM 演进而来。发布说明重点提到:在代理任务上的强化学习,以及训练模型用自身的视觉能力做"自检"。

性能细节

独立评测显示 Qwen3.8-Max 在整体智能上 仅落后于少数顶级闭源模型与 Moonshot AI 的 Kimi K3。在前端编码、视觉、代理任务上也接近榜首,几乎所有基准都跨过 Qwen3.7-Max。但代价是 token 生成量比对手更多,把每任务成本推高。

幕后故事

Qwen3.8-Max 开放权重是 Alibaba 近期策略的重大转向。Max 系列自 2025 年 1 月发布以来一直仅通过 API 与 Qwen Chat 应用开放,权重只开放给较小的 Qwen3.6-27B 等型号。在 Alibaba 缺席顶级开源的同时,国内其他实验室——Kimi K3、DeepSeek V4 系列——填补了空缺。

为什么重要

一如既往,开放权重给了开发者更多选择:从自托管到使用 Alibaba 官方工具或 API。坦白说,能自部署 2.4 万亿参数模型的团队寥寥无几,真正红利会来自第三方托管商之间的价格竞争,以及像 Qwen3.8-27B 这样的蒸馏后代。开放权重也让开发者能挑选更优的微调或后训练方案。

我们怎么看

Qwen3.8-Max 开放权重版本未含完整能力是让人失望的——但能在笔记本上跑 Qwen3.8-27B 是个有趣的"安慰奖",即便它确实有"过度思考"的毛病。


语音识别引入代理交互

多数语音转文字系统一次性完成转写,无法纠错。研究团队造出能交互式纠错的系统。

发生了什么

上海交通大学、浙江大学、复旦大学与微软分拆公司 Xiaoice 的 Zixuan Jiang、Yanqiao Zhu、Peng Wang 等人,提出 Agentic ASR——把自动语音识别引擎和一个 LLM 配对,让 LLM 在每一轮对话中尝试检测并修正转写错误。

关键洞察

传统语音转写系统的纠错方法是把语音转文字模型 + 一个 LLM,让 LLM 重写输出。但这种系统纠错时只是把用户的纠错请求追加到现有转写后面。让 LLM 从头重写转写有引入新错误的风险,尤其当说的词很特别(如人名、术语)时。

Agentic ASR 把转写视为一个多轮精炼流程:用户先口述,然后可在后续轮次里确认或修正转写。

结果

作者在多语种语音转文字基准上评估。基准里没有"用户纠错后输出"的样本,作者用 LLM + TTS 模拟用户口述 → 纠错的过程来构造评估数据。

为什么重要

很多接语音输入的系统需要理解用户意图,而不是每个词。Agentic ASR 这一点做得很到位;在每词都重要的场景里,它让语音转写变得更稳健。随着依赖语音输入的 UI 越来越普及,这项能力会更关键。

我们怎么看

把纠错拆成"定位编辑点 → 理解要改什么 → 应用修改"这个工作流,很可能成为交互式任务(编辑文档、审查代码、迭代设计)的通用蓝本


本期要点回顾:SpaceXAI × Cursor 联手把 Grok 4.6 推上 1.5 万亿参数层级;Anthropic 借欧盟 AI Act 合规把水印推到全球所有新 Claude 模型;Qwen 首次开源 Max 等级权重,2.4 万亿 VLM 与 27B 蒸馏版同步落地;Agentic ASR 把语音转写拆成多轮代理纠错流程。Andrew 长信把"构建与部署 AI 应用"展开为 6 项核心子技能,下封会展开第二层软件工程基础。