Skip to main content

AI 思维链有什么用?

· 8 min read

AI 思维链 CoT,本质是 用 token 数换推理深度 的工程技巧。

  1. 为什么需要:单次前向传播算力固定,把思考过程外化成 token,变相扩容
  2. 起步阶段:Google 用程序生成"题目+步骤"数据,监督微调小模型学会推理。
  3. 自举阶段:STaR 让模型自己生成答案,只留结果正确的样本继续微调。
  4. 采样增强:Self-Consistency 多链采样,多数投票决定最终答案。
  5. PRM 路线:OpenAI 训练 verifier 给每一步推理打分,过程可监督。
  6. GRPO 路线:DeepSeekMath 用组内相对分数,只奖励结果对,把 CoT 推向 RL。
  7. 未来趋势:CoT 和工具调用、代码执行、搜索结合,持续催生新能力。

为什么要有思维链

把模型简化成一个黑盒:喂一个 prompt,吐一个 answer。整个过程是一次 前向传播,算力上限由模型结构决定。

这就带来一个尴尬的问题:同一个模型,面对"1+1=?"和"求偏微分方程的通解"消耗的算力是相同的。前者绰绰有余,后者远远不够。如果硬要一个固定容量的模型搞定所有问题,唯一的办法是把模型做大——参数翻 10 倍、训练数据翻 10 倍、GPU 翻 10 倍。

CoT 走了另一条路:算力不够,token 来凑

模型每生成一个 token,都要重新跑一次前向传播,并且这个新的前向传播可以 把之前所有 token 当作上下文 重新计算注意力。这意味着:

  • 直接吐答案:1 次前向传播,所有推理压力全压在模型容量上。
  • 输出"设 x = ...、代入 ...、化简得 ...":每个中间步骤都是一次完整的前向传播,推理空间从一次变成 N 次

所以思维链不是"让模型学会思考"的魔法,而是把模型容量不够的部分 转移到输出序列里,用更多 token 买更深的推理。代价就是贵、慢、费 token,但模型本身不用变大。

第一阶段:监督微调——给模型看"解题过程"

Google 2022 年发表的《Show Your Work》是 CoT 的开山之作。思路很朴素:

  • 用程序生成一堆数学题,每道题都带完整的解题步骤
  • 把这些数据喂给模型做监督微调。
  • 模型学会了"先写过程,再写答案"的输出模式。

效果立竿见影:在 GSM8K 这类小学数学应用题上,小模型加上 CoT 微调后,推理能力出现台阶式跃升,逼近当时的大模型。

这套范式的局限也很明显:推理数据完全靠人工或程序生成,覆盖范围窄、规模受限。题目一换风格,模型可能就不会写过程了。

第二阶段:自举——模型自己生成推理数据

既然"题目 + 推理 + 答案"这种数据难造,能不能让模型自己造?

STaR(Self-Taught Reasoner,2022)的做法:

  1. 拿一个 已经有 CoT 能力的模型(比如经过 Show Your Work 微调的)。
  2. 让它对一批新题目生成"推理 + 答案"。
  3. 最终答案对不对 作为筛子,只保留答案正确的样本。
  4. 把这些"题目 + 推理 + 正确答案"喂回模型继续微调。

听起来有点耍赖——模型自己出的题自己改,改完自己学。但仔细想这一步很关键:

  • 模型从来没见过人工标注的"好推理",它只见过 好答案
  • 假设"最终答案对 ⇒ 推理过程大概也对",这一步 假设虽然粗糙,但在数学题这类答案可验证的领域已经够用。
  • 不断迭代,模型的推理能力会 沿着答案正确的方向自我强化

从 STaR 开始,"推理数据"这个概念就和"人工标注"脱钩了。

第三阶段:采样增强——多条链多数投票

Self-Consistency(Google,2022)观察到一件事:

对一道难题,模型单次生成推理链往往翻车,但如果 采样 10 条链,这 10 条里有 6-7 条最终能撞到正确答案。

做法很简单:

  1. 对同一道题,用 较高的温度采样多条推理链
  2. 提取每条链的最终答案。
  3. 多数投票 选出出现频率最高的答案。

这套方法在 小模型上效果尤其明显——模型本身能力不强,但只要多条独立推理链的"正确答案"在统计上占多数,投票就能纠偏。大模型本身就强,这个加成就不那么显著。

本质上是把推理从"一次赌博"变成"多次博弈"。

第四阶段:强化学习——奖励推理过程

到 2023 年,思路变了:推理过程本身就是可以打分的东西

过程奖励模型(PRM)

OpenAI 的《Let's Verify Step by Step》训练了一个 verifier,专门给推理链的 每一步 打分:

  • 输入:题目 + 推理到第 N 步的中间状态。
  • 输出:这一步是否正确的概率。

训练完之后:

  • 让模型生成 N 条推理链,每条都被 PRM 逐步打分。
  • 每一步的分数加权 选出最佳推理链。
  • 或者直接把 PRM 分数当作 强化学习的奖励信号,反向训练主模型。

这套方法的问题是 过程标注太贵——要让人给每一步推理都打标签,成本远高于只标最终答案。

结果奖励 + 组内相对(GRPO)

DeepSeekMath(2024)换了个思路:不奖励过程,只奖励结果,但用"组内相对分数"做归一化,这就是 GRPO(Group Relative Policy Optimization)。

核心做法:

  1. 对一道题,让模型 采样一组答案(比如 16 条)。
  2. 给每条链的最终答案打分(对/错)。
  3. 这一组内答对的比例 当作 baseline,每条链的得分是它相对于 baseline 的优势。
  4. 用这个相对优势做策略梯度更新。

优势:

  • 不需要过程标注,只要最终答案可验证(数学、代码、客观题都行)。
  • 组内相对归一化天然抵消了"题目难度"的影响——难题大家都错,简单题大家都对,相对优势刻画的是"在同一道题里谁更好"

GRPO 让 CoT 的训练 从监督学习彻底转向强化学习,也是 DeepSeek-R1 能训练出强推理模型的底层方法之一。

现状与未来

CoT 已经从"输出格式"演化成"训练目标"。

  • 早期:CoT 是 怎么写 的问题,监督学习拟合"题目 → 推理 → 答案"的数据分布。
  • 现在:CoT 是 怎么训 的问题,强化学习用推理过程的好坏作为奖励信号反向塑造模型。
  • 未来:CoT 是 和什么结合 的问题。推理过程 + 工具调用、+ 代码执行、+ 搜索、+ 记忆,每一种组合都可能催生新的能力形态。

这也是为什么现在所有头部模型都在卷"长 CoT + RL"——大家意识到 推理不是预训练能学完的,必须在推理阶段持续优化。

CoT 的故事远没有结束。它从一个工程技巧起步,被验证、被自举、被采样、被强化,最终成为大模型获得复杂推理能力的核心范式。下一步会和什么计算形态结合,目前没人能给出确定答案——但可以确定的是,把推理过程外化成 token 这一招,到今天为止还没被任何更优雅的方案替代。


References

  1. Show Your Work: Scratchpads for Intermediate Computation with Language Models —— Jason Wei et al., 2021-12-01
  2. Self-Consistency Improves Chain of Thought Reasoning in Language Models —— Xuezhi Wang et al., 2022-03-21
  3. Training Verifiers to Solve Math Word Problems —— Karl Cobbe et al., 2021-10-27
  4. STaR: Bootstrapping Reasoning With Reasoning —— Eric Zelikman et al., 2022-03-29
  5. Let's Verify Step by Step —— Hunter Lightman et al., 2023-05-31
  6. DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models —— Zhihong Shao et al., 2024-02-05
  7. AI 思维链有什么用? —— 隔壁的程序员老王, 哔哩哔哩, 2026-09-19