Skip to main content

Kimi K3 重塑开源前沿、Muse Spark 价格战、Cloudflare 切断爬虫

原文地址:https://www.deeplearning.ai/the-batch/issue-363

本期要点:Moonshot 发布 Kimi K3,2.8 万亿参数 MoE 视觉-语言模型,Artificial Analysis 智能指数 57 分排开源第一、整体第三,权重将于 7 月 27 日开源;Meta 推出 Muse Spark 1.1 与首个付费 API Meta Model API,每任务成本 $0.26——仅次于 GPT-5.6 Luna;Cloudflare 上线 AI 流量控制系统,默认拦截训练爬虫与 Agent 爬虫,并提供按请求付费的爬虫变现工具;Stanford × Together AI 研究显示 LLM 在新闻检索任务中主要失败原因是检索而非智能本身,多语言与错误前提显著降低正确率。Andrew:少数前沿实验室散布"开源危险论"实为监管俘获,开源权重 + 开放训练才是真安全。

编者按:开放权重比安全护栏更安全

作者:Andrew Ng

Kimi K3 Redraws the Open Frontier, Muse Spark 1.1 Undercuts Competitors, Cloudflare Moves to Cut Off Crawlers

LLM 的护栏确实有用。对某些请求——比如详细的自我伤害或他人伤害指南、明显的犯罪行为——我们宁可让模型直接拒绝。但比起试图让 LLM "安全",我更倾向于强调让 LLM 的"使用"是负责任的。你能为一把锤子这类工具做的安全措施有限,它帮人或伤人更多取决于怎么用,而不是它本身怎么做。

但相当一部分 AI 安全工作已经不是关于安全了,而是靠渲染恐惧去追求监管俘获。正如 David Sachs 指出的:"没有理由让美国模型在中国模型处理自如的任务上受限。我们只会让自己更没竞争力。"

我相信开放权重模型,以及更广义上的开放性——即便有些公司错误地说它危险——能把阳光照进技术,最终让技术更安全。随着 GLM 5.2 发布与即将到来的 Kimi K3 权重公开,开放权重模型几乎追上闭源前沿模型。结果闭源模型厂商开始拼命游说,绞尽脑汁想给开放权重竞争对手使绊子。正如 Bill Gurley 指出的,开源是一种成熟的商业策略,不是要被许可和压制的危险物。


Kimi K3:把万亿级 MoE 的训练机制摊在阳光下

Moonshot 最新模型在发布一个月后超越了 GLM 5.2 与众多闭源对手,在许多基准上仅次于 GPT-5.6 Sol 与 Claude Fable 5。

发生了什么

Moonshot AI 推出 Kimi K3,一个 2.8 万亿参数的视觉-语言模型。公司立刻通过 API 上线,并承诺 7 月 27 日发布权重——这会让 Kimi K3 成为目前已知最大的开放权重模型。

维度规格
输入/输出文本 / 图像 / 视频输入上限 100 万 token;文本输出上限 100 万 token;62.0 token/秒
架构MoE Transformer,含 Kimi Delta Attention 层;2.8 万亿总参 / 896 个专家中 16 个激活(估计约 500 亿激活参数)
能力可调推理档(目前仅最高档且常开,低 / 高档即将上线);工具调用;结构化输出;自动上下文缓存
性能Artificial Analysis 智能指数 57 分(第三),开源第一;Arena.ai 的 Code Arena WebDev 第一
价格API $3 / $0.30(缓存) / $15 per 1M token;7 月 27 日发布权重;订阅从免费到 $199/月

它怎么做到的

Kimi K3 整合了 Moonshot 最近发表的两项架构改动:Kimi Delta Attention(降低长输入下的 attention 显存与算力)与 Attention Residuals(让每一层选择参考哪些早期层,而不是平等地叠加所有早期层)。Moonshot 说这些改动加上更稀疏的 MoE 设计、改进的训练与数据配方,让训练效率(同等算力下的模型提升)比上一代提升约 2.5 倍

Kimi Delta Attention (KDA) 用在每四层 attention 中的三层。KDA 是线性 attention 机制:不像标准 attention 那样把每个新 token 与所有先前 token 比较,它维护一个固定大小的 memory,随输入更新,对每个 memory 值决定何时覆盖旧信息。在 2025 年发布的实验模型 Kimi Linear 里,KDA 在 100 万 token 输入下降低 memory 用量最多 75%、输出速度最高 6 倍。

Attention Residuals 替代标准的残差连接来传递 transformer 层之间的信息。标准连接把每层输出等权重加到运行总和上,所以每层的单独贡献会随层数变多而稀释。Attention Residuals 在深度上做 attention——每层学习有选择地参考早期层的输出,很像标准 attention 有选择地参考早期 token。Moonshot 早期实验里使用 block 级 Attention Residuals 的模型匹配了标准残差模型的效果,但训练算力少 20%。

性能细节

在独立智能测试中,Kimi K3 超过了所有开放权重模型,整体上仅落后 GPT-5.6 Sol 与 Claude Fable 5。在 Arena.ai 编码相关榜单上 K3 排第一。

我们怎么看

2.8 万亿参数开放权重是个分水岭事件。Moonshot 不只是公开了权重,还公开了关键架构细节——Kimi Delta Attention + Attention Residuals 这套组合。这意味着下一代中国大模型团队不需要从零开始重新摸索 attention 与残差连接,可以基于这套公开设计迭代。开放权重对生态的杠杆效应往往比"参数大"本身更重要。


Meta 掀起价格战

靠 Llama,Meta 把自身定位为 OpenAI 的开源替代。靠新的闭源模型,Meta 现在把自己定位为低价高性价比的对手。

发生了什么

Meta 推出 Muse Spark 1.1——一个为 Agentic 任务训练的视觉-语言模型,同时开放 Meta Model API——公司首个模型付费访问通道。

维度规格
输入/输出文本 / 图像 / 视频输入上限 1048576 token;文本输出上限 131072 token;119 token/秒
能力工具调用;prompt caching;可调推理(无 / 极小 / 低 / 中 / 高 / 超高)
性能工具调用榜 MCP Atlas (Scale AI) 与 JobBench 第一;Artificial Analysis 智能指数低推理下与 GPT-5.6 Luna、GLM-5.2 打平
价格Meta AI 应用与 meta.ai 免费;Meta Model API 公测(仅美国,waitlist,初始 $20 信用);$1.25 / $0.15(缓存) / $4.25 per 1M token;web search $2.50 per 1000 查询

它怎么做到的

Meta 没披露 Muse Spark 1.1 的搭法,只透露训练重点:上下文管理、操作电脑、协调其他 Agent。模型在多种 Agentic 编码 harness 里训练——这些 harness 把模型与文件、工具、测试连起来,支持规划与子 Agent 编排。

模型对"被指挥"和"指挥他人"两个方向都做了训练。作为主导 Agent,它把任务分片并行派给子 Agent,缩短总完成时间。作为子 Agent,它严守被分配的角色,当决策超出权限时把控制权交回编排模型。

对于长任务,Meta 表示是模型本身——而非外壳软件——在调整输入上下文:从任务早期取出细节、压缩交换、保留后续步骤需要的信息。

电脑使用方面,模型被训练在自动执行(写脚本)与直接操作(点击 / 在虚拟键盘上输入)之间选择,取其中更快更简单的方案。它还能一轮发出多个动作,带来更好的速度与表现。

性能细节

Muse Spark 1.1 在 Agentic 工具调用基准上突出,但整体智能略低于顶级模型。在 Artificial Analysis 智能指数上:Muse Spark 1.1(超高推理)51 分,与 GLM-5.2、GPT-5.6 Luna(都设最高推理)打平,落后 Claude Sonnet 5(最高推理,53 分)。成本是它的杀手锏——每 Intelligence Index 任务 $0.26,仅高于 GPT-5.6 Luna($0.21/任务)。

Arena.ai Text Arena(盲测头对头人类打分):Muse Spark 1.1 第六(1490 Elo),落后 Claude Fable 5(1505)与 4 个 Claude Opus 版本,险胜 GPT-5.6 Sol(超高推理,1486)。

未来展望

Meta 的战略调整值得关注:从"开源旗手"到"低价闭源 + 开源双线"。开源 Llama 仍存在,但闭源 Muse Spark + Meta Model API 明显是要抢企业市场份额。对开发者而言这是好事——闭源 + 开源同时存在,议价能力回到买家手里。


Cloudflare 的爬虫监管升级

使用 Cloudflare 的网站发布者将很快能根据爬虫用途分别控制其访问——允许搜索索引但拦截 AI 训练或 Agent 活动。

发生了什么

Cloudflare——承载近 20% 互联网的内容分发网络——上线新的 AI 流量控制,默认拦截训练与 Agent 爬虫,同时允许搜索索引爬虫。它还宣布了一个变现工具,让客户能对特定访客(无论人还是爬虫)收取访问网页、数据集、API、Model Context Protocol 的费用。

它怎么工作的

Cloudflare 客户可以根据爬虫用途切换访问权限——为搜索、AI 训练、AI Agent 三类爬虫分别启停。多种用途的爬虫会受限于最严格的设置。比如 Googlebot、Applebot、Bingbot 这类既为搜索索引又为 AI 训练抓数据的爬虫,如果发布者选择拦截训练爬虫,它们都会被拦截。控制从 9 月 15 日起执行。

Cloudflare 定义三类爬虫:搜索爬虫(为搜索引擎索引内容,发布者历来欢迎,因为能带来搜索流量);Agent 爬虫(代用户执行任务,比如取数据、下单);训练爬虫(抓数据训练 AI 模型)。每类客户有三个选项:全部拦截 / 仅在有广告页拦截 / 允许。默认情况下,有广告的页面会拦截训练与 Agent 爬虫,继续允许搜索爬虫。

Cloudflare 还推出 BotBase——已知 Bot 与 Agent 的公开数据库,按行为分类,记录它们怎么使用网站内容。"Verified" 标签表示 Bot 运营者已经过身份验证、所声称的身份属实、遵守 robots.txt、不试图绕开发布者限制。

Cloudflare 的变现系统让发布者能按请求向访问在线数据的 AI Agent 收费。当 AI Agent 请求受保护的网页或 API 时,Cloudflare 在网络层做付费校验后再把请求转给发布者。工具尚未发布,客户可以加入 waitlist。

背景

AI Bot 在 Web 流量里占比越来越高;Cloudflare 表示超过一半(57.5%)的 HTTP 请求现在来自自动化系统而非人类。搜索流量价值被侵蚀到一定程度,部分发布者已经选择退出 Google 搜索,部分原因是它们不想 Google 的 Agent 绕过展示广告或拿内容训练。Cloudflare 新框架试图保留搜索的益处,同时给发布者对其他形式 AI 爬取更多控制。它奖励像 OpenAI 这样把搜索与训练爬虫分开的公司,惩罚 Google、Apple、Microsoft 这类不分开的。

我们怎么看

Cloudflare 把"AI 内容付费"从概念推到产品。未来 12 个月,"Agent 想读你的内容得先付钱"会从边缘实验变成主流商业。对内容发布者这是利好,对纯靠爬免费内容训练 AI 的厂商这是个成本压力。OpenAI 与 Anthropic 已经在认真谈内容授权协议——这波监管升级会加速这个趋势。


Web 检索是 LLM 回答新闻的最薄弱环节

大语言模型常常被用来搜集新闻。在这个任务上,研究者发现,找到相关报道的能力是最弱一环。

发生了什么

Stanford 与云平台 Together AI 的 Mirac Suzgun 与同事测试了 6 个热门 LLM(带 Web 搜索工具)回答日常新闻问题的能力。LLM 通常回答准确,特别是当问题本身就含准确信息且用英语提出时。当它们回答不准时,往往是因为检索到了不相关的文章。

关键洞察

LLM 回答"训练数据里没有的事实问题"的能力取决于至少三步:(i) 收到成型的问题;(ii) 检索到相关文档;(iii) 从中抽出事实。任何一步出问题都会降低输出质量。比如,包含错误事实的问题(假设名字错了)会让 LLM 难以答对。同样,检索到的文档不含必要事实更可能产出错误答案。如果 LLM 在文档所用语言上训练不足,就没法从检索到的文档里抽出事实。

它怎么工作的

作者在 2026 年 2 月 9 日至 22 日间每天做测试。他们根据 BBC News 报道用 6 种语言(阿拉伯、英、法、印地、俄、土耳其)提问。他们测试了 Google Gemini 3 Flash 与 Pro、xAI Grok 4、Anthropic Claude 4.5 Sonnet、OpenAI GPT-5 与 GPT-4o mini,都带 Web 搜索工具。

每天 Gemini 3 Flash 按当前新闻生成 25 道多选题(每种语言 150 道)。每题以"今天是 2026 年 2 月 10 日……"这样的时间上下文开头,提供 5 个潜在答案。正确答案是一个可验证的细节(数字、地点、引语等)。作者在三种形式上测试 LLM:(a) 5 选项多选题;(b) 引入一个错误前提的变体(比如错的参与者、时间线、细节)+ 加入"信息不足无法回答"作为潜在答案;(c) 原题不带潜在答案。

他们用 Claude Opus 4.7、GPT-5.4、Gemini 3 Pro 的多数票把错误输出按 8 类分类(检索失败、检索到相关源但与题目所用源细节不同、理解不到位、时间线错误等)。

结果

模型在成型英语问题上普遍高准确率。但 (i) 它们在其他语言上表现较差,特别是印地语;(ii) 大多数错误来自检索而非智能本身;(iii) 问题含错误前提时表现差。

回答未改动的多选题:前 4 个模型超过 90% 准确率——Gemini 3 Flash 95.6%、Grok 4 95.0%、Gemini 3 Pro 93.7%、Claude 4.5 Sonnet 90.4%。GPT-5 85%、GPT-4o mini 69%。在自由回答形式下,模型相对排名不变,但准确率下降 11-22 个百分点。

回答未改动的多选题:每个模型都在其他语言(特别是印地语)上表现最差。

未来展望

这条结论对 Agentic 系统设计有直接含义:升级模型智能的天花板被检索能力的天花板挡住。给 Agent 配更好的检索工具(多源回查、跨语言检索、对前提做一致性校验)比把模型再训大一倍可能更划算。


本期要点回顾:Kimi K3 公开 2.8 万亿参数 MoE 权重与架构细节,把开放权重的边界推到闭源前沿;Meta 的 Muse Spark 1.1 + Meta Model API 用 $0.26/任务撬动企业市场;Cloudflare 默认拦截 AI 训练与 Agent 爬虫、按请求付费变现;新闻检索任务里 LLM 主要瓶颈在检索而非智能。Andrew:开放权重 + 开放训练是比"安全护栏"更靠谱的安全路径。