Skip to main content

DeepSeek-V4-Flash 超越 Pro、史上最大 GitHub 爬取、工程化系统提示

原文地址:https://www.deeplearning.ai/the-batch/issue-365

本期要点:DeepSeek-V4-Flash-0731 通过新一轮 fine-tuning 反超自家旗舰 V4-Pro,在 Artificial Analysis 智能指数上拿到 50 分,距 GPT-5.6 Luna 仅 1 分,推理成本却只有约 1/3;Anthropic Claude Mythos Preview 攻破了 NIST 后量子签名候选 HAWK,HAWK 团队主动退出竞标;HuggingFace 发布 The Stack v3,史上最大的开源代码数据集,包含 173M 仓库、15.9 TB、4.9 万亿 token;Stanford 提出 SecureForge,用遗传算法自动优化系统提示,把 Python 代码的安全缺陷率打下去。Andrew 倡议把 token 当生产资料用,但反对无意义的 tokenmaxxing。

编者按:Tokenmaxxing 不是越多越好

作者:Andrew Ng

DeepSeek-V4-Flash Outshines Pro, The Biggest GitHub Crawl Yet, Engineering System Prompts for Safer Code

很高兴"tokenmaxxing"这个词开始流行——个人和企业都应该多花 token 来提升生产力。但这类建议给任何模型厂商都很难讲得出口。说清楚:我支持所有前沿 AI 实验室,它们在打造帮大家做出更好东西的惊人技术。但同时,我会让 DeepLearning.AI 继续保持中立、可信赖的信源角色,首要承诺是对那些想用 AI 创造的学员负责。

所以,请建设性地多花 token,但别做"为 token 而 token"的 tokenmaxxing。继续创造!

Andrew


DeepSeek-V4-Flash 再一次推动开源前沿

DeepSeek 的"小模型"靠新一轮 fine-tuning 跑赢了自家旗舰。这件事本身在性能曲线上是反直觉的。

发生了什么

新版本叫 DeepSeek-V4-Flash-0731,是 V4 系列里 Flash 型号的正式版,取代了 4 月发布的预览版。架构和参数总量都没动,靠一轮新 fine-tuning 在第三方测试中超过更大的 DeepSeek-V4-Pro,成本却只有同档闭源模型的零头。

维度规格
输入/输出文本输入上限 100 万 token;文本输出上限 38.4 万 token;122.7 token/秒
架构MoE Transformer,2840 亿总参 / 130 亿激活/token;可选推测解码模块让 checkpoint 升到 3040 亿
能力推理档位(低 / 高 / 最高)与无推理档;工具调用;上下文缓存
性能Artificial Analysis 智能指数 50 分,仅比 GPT-5.6 Luna(最高推理)低 1 分;位于 Pareto 前沿
价格权重 MIT 协议免费商用;API $0.14 / $0.0028(缓存) / $0.28 per 1M token

它怎么做到的

新版本在架构上没改,关键是 fine-tuning。DeepSeek 没解释这次 fine-tuning 跟上次有什么不同。

V4 系列架构的杀手锏是长输入成本低:Attention 层在两种 KV 压缩方案之间交替——一种每 4 个 token 压缩成 1 个条目并只关注最相关的条目;另一种每 128 个 token 压缩成 1 个并全量关注。DeepSeek-V4-Flash 在满输入长度下,KV 的计算量只要 V3.2 的 10%、显存只要 7%。

训练流程分两段:

  • 第一段:领域专家模型。团队为数学、编码、Agentic 任务等每个领域各训一个专家模型,先做监督微调,再用 GRPO(Group Relative Policy Optimization)做强化学习——奖励那些在同输入候选里得分更高的输出。
  • 第二段:on-policy 蒸馏。把多个专家合并成一个模型,让合并后的模型自己对训练提示写回答,然后训练把回答朝"对应专家会怎么写"方向修正。候选专家超过 10 个。

性能细节

在 Artificial Analysis 智能指数上:DeepSeek-V4-Flash-0731(最高推理)50 分,明显领先 4 月预览版(40)和更大的 V4-Pro(44),跟 Gemini 3.6 Flash(高推理)打平(50),比 GPT-5.6 Luna 和 GLM-5.2(都设最高推理,51)各低 1 分。

发布时还附带 DSpark 推测解码模块——一个小草稿模块一次提议若干 token,主模型一次性校验,比逐 token 解码快得多。

我们怎么看

小模型反超大模型这件事会越来越常见。MoE 已经让"总参数 / 激活参数"脱钩,fine-tuning 比预训练便宜得多,而推理成本压着所有厂商的神经。DeepSeek 的策略是"用 V4 系列的便宜架构 + 更精细的 fine-tuning"做出能跟 GPT-5.6 Luna 掰手腕但成本 1/3 的模型——这会持续挤压闭源旗舰的定价空间


Claude 攻破 NIST 后量子签名候选 HAWK

美国 NIST 一直在测试抗量子时代的加密算法替代品。受限发布的 Claude Mythos Preview 在候选签名方案 HAWK 上找到弱点。HAWK 的设计者随后主动退出了竞标——这场已经扛过两轮、约两年专家评审的方案就此终结。

发生了什么

Anthropic 上报了 Claude Mythos Preview 在两种加密算法上产出的新攻击:HAWK 和 AES。HAWK 是一项尚未被采用的提案,AES 上的攻击只针对故意削弱的 7 轮版本(学界用作练习靶),并非真实使用的 10 轮 AES-128。两者都不需要打补丁,也都不威胁现有生产代码。

HAWK 攻击细节

HAWK 是一种用于数字签名的提案方法——浏览器用它确认网站是真的。攻击细节里 Anthropic 描述:模型在多人协作的多代理 harness 里运行。主导方向的研究员背景是理论计算机科学,但没有专门做这类密码学的经验,Anthropic 把他的贡献描述为项目管理。关键思路来自两个 Agent 对同一问题的不同反应——第一个直接判为不可行,第二个找到了可利用路径。

针对较小安全等级的 HAWK-512:Claude 的攻击把"窃取密钥的估算成本"从 2¹⁵⁰ 降到最多 2¹⁰⁸。每降低一级工作量减半,这次降了万亿倍。两者都还远在现有破解能力之外,但新数字已经低于 HAWK 设计者声明的安全等级。

7 月 28 日下午,Anthropic 研究员 Stephen Weis 把攻击发到 NIST 用的公共邮件列表 pqc-forum,附带可恢复密钥的工作代码。攻击在 6 月已经私下同步给 HAWK 设计者。当晚密码学家 Daniel Apon 独立复核通过。第二天上午 HAWK 的首席设计师 Léo Ducas 代表团队回复:参数翻倍或换到更高阶的模都让 HAWK 不再有竞争力,团队决定退出。他感谢 Anthropic 的工作并祝剩余候选好运。

未来展望

HAWK 不是第一个倒在 NIST 后量子竞标末段的方案——2022 年的 SIKE 在单核机器上被一小时攻破。但 Claude 这类模型把"找漏洞"这一原本稀缺的密码学家工作开始变得相对易得。Anthropic 走的是负责任披露路径——先私下告知设计者,再公开并附验证代码。这是 AI 攻 / 防能力同时上行的早期信号。


史上最大的开源代码数据集 The Stack v3

开源代码数据集多年来没大更新,新的 GitHub 爬取给它做了一次彻底换血。

发生了什么

HuggingFace 的 Anton Lozhkov 与同事发布了 The Stack v3——为预训练大模型而做的 GitHub 公开代码快照。团队称这是史上最大、最新的开源代码数据集。与早期版本不同,v3 同时给出整仓库和单个代码文件,模型可以学到代码片段如何拼成完整代码库。

维度规格
范围仅源代码与 Jupyter notebook(不含 issue、PR、文档)
内容双版本:stack-v3-train(15.9 TB,约 4.9 万亿 token,713 种语言,1.73 亿仓库,去重 / 过滤 / 脱敏后);stack-v3-full(113.7 TB,770 种语言,2.24 亿仓库,原始数据供用户自过滤)
截止2025 年 8 月 7 日
许可Open Data Commons Attribution v1.0,免费下载、商用 / 非商用均可,需署名原仓库许可

关键改进

  • 直接爬 GitHub,不再像 v2 那样从 Software Heritage archive 拿文件
  • 跨语言去重:v2 是按语言各自去重的;v3 把所有语言一起跑,用 MinHash 估算相似度,按 70% 阈值聚类
  • 修了 v2 的 bug:v2 因 bug 误删了过多文件
  • 过滤非宽松许可:用 ScanCode 检测 LICENSE / COPYING / MIT.txt 等文件,把许可映射到同前缀的文件上;非宽松许可直接排除

爬取规则:默认分支最新 commit 的快照,不含 git 历史;跳过 > 5 MB、二进制文件、星数 <5 的 fork。原始爬取共 439 亿文件,过滤后保留 1.73 亿仓库。

我们怎么看

代码预训练数据进入"仓库级"时代。单文件让模型学会语法,仓库级让模型学会架构——这是 v3 相比 v2 最重要的差异。对做 Agentic Coding 的团队而言,仓库级数据让模型理解跨文件依赖的能力会显著提升。但 GitHub 爬取本身也有版权风险,HuggingFace 提供了 opt-out 通道。


SecureForge:自动工程化系统提示以降低代码漏洞

大模型能写有用代码,但常常夹带安全漏洞。研究团队做出一套能自动构建系统提示、降低 Python 代码漏洞率的方案。

发生了什么

Stanford 的 Houjun Liu、Lisa Einstein、John Jang 与同事提出 SecureForge——一种自动优化 LLM 系统提示以减少 Python 代码安全缺陷的提示方法。商用 / 非商用均可免费使用。

核心思路

直接跟 LLM 说"写安全代码"并不能阻止它写出有漏洞的代码。但可以四步定位"哪种请求容易产出不安全代码":(i) 让 LLM 生成编码请求;(ii) 把请求喂给编码 LLM;(iii) 用静态代码分析器判定输出是否有漏洞;(iv) 让 LLM 修改编码 LLM 的系统提示;(v) 重跑这条请求。多轮迭代后,系统提示能稳定降低不安全代码的比例。

实现细节

作者针对 10 个模型优化了系统提示:CodeLlama 7B、Qwen2.5-Coder 7B / 14B、Qwen3 30B-A3B、Kimi K2、Claude Sonnet 4.6、GPT-5.3 Codex、GPT-5.4、GPT-5.4 Mini / Nano。

数据准备:用 GPT-5.4 把 MITRE CWE 排名前 25 的漏洞转成"看起来无害的 Python 编码请求"。比如 CWE-89 SQL 注入,可能被改成"写一个 Python 函数按用户名查 SQLite 数据库"。每个 CWE 收 20 个会触发漏洞的请求,共 500 条,留一半评估。另一半扩展成 8 万条相似请求。

优化方法:GEPA 遗传算法。从通用系统提示起步,先在小批量请求上测,Semgrep 报告漏洞位置,GPT-5.4 据此重写提示。保留产生更少漏洞的版本作为下一代起点。

评估:用 GPT-5.4 生成每个请求的单元测试,确保代码真在做事,再用 Semgrep 抓漏洞。

未来展望

系统提示工程化是被严重低估的方向。当前行业实践里,系统提示常常是手写的几十行规则——没人能验证它们是否真的降低了漏洞率。SecureForge 用遗传算法 + 静态分析把这件事变成了可量化的优化问题。预计很快会出现针对其他语言(JavaScript、Go、Rust)的同类工具。


本期要点回顾:DeepSeek 用一轮 fine-tuning 让小模型反超自家旗舰,DeepSeek-V4-Flash-0731 重新定义了"小模型性价比";Anthropic Claude 攻破 NIST 后量子候选 HAWK,AI 攻防能力同时上行;HuggingFace 的 The Stack v3 把代码预训练数据推进到仓库级;Stanford 的 SecureForge 把系统提示变成可优化的工程对象。Andrew:支持 tokenmaxxing,但反对"为 token 而 token"。