AI 思维链有什么用?
AI 思维链 CoT,本质是 用 token 数换推理深度 的工程技巧。
- 为什么需要:单次前向传播算力固定,把思考过程外化成 token,变相扩容。
- 起步阶段:Google 用程序生成"题目+步骤"数据,监督微调小模型学会推理。
- 自举阶段:STaR 让模型自己生成答案,只留结果正确的样本继续微调。
- 采样增强:Self-Consistency 多链采样,多数投票决定最终答案。
- PRM 路线:OpenAI 训练 verifier 给每一步推理打分,过程可监督。
- GRPO 路线:DeepSeekMath 用组内相对分数,只奖励结果对,把 CoT 推向 RL。
- 未来趋势:CoT 和工具调用、代码执行、搜索结合,持续催生新能力。
为什么要有思维链
把模型简化成一个黑盒:喂一个 prompt,吐一个 answer。整个过程是一次 前向传播,算力上限由模型结构决定。
这就带来一个尴尬的问题:同一个模型,面对"1+1=?"和"求偏微分方程的通解"消耗的算力是相同的。前者绰绰有余,后者远远不够。如果硬要一个固定容量的模型搞定所有问题,唯一的办法是把模型做大——参数翻 10 倍、训练数据翻 10 倍、GPU 翻 10 倍。
CoT 走了另一条路:算力不够,token 来凑。
模型每生成一个 token,都要重新跑一次前向传播,并且这个新的前向传播可以 把之前所有 token 当作上下文 重新计算注意力。这意味着:
- 直接吐答案:1 次前向传播,所有推理压力全压在模型容量上。
- 输出"设 x = ...、代入 ...、化简得 ...":每个中间步骤都是一次完整的前向传播,推理空间从一次变成 N 次。
所以思维链不是"让模型学会思考"的魔法,而是把模型容量不够的部分 转移到输出序列里,用更多 token 买更深的推理。代价就是贵、慢、费 token,但模型本身不用变大。
第一阶段:监督微调——给模型看"解题过程"
Google 2022 年发表的《Show Your Work》是 CoT 的开山之作。思路很朴素:
- 用程序生成一堆数学题,每道题都带完整的解题步骤。
- 把这些数据喂给模型做监督微调。
- 模型学会了"先写过程,再写答案"的输出模式。
效果立竿见影:在 GSM8K 这类小学数学应用题上,小模型加上 CoT 微调后,推理能力出现台阶式跃升,逼近当时的大模型。
这套范式的局限也很明显:推理数据完全靠人工或程序生成,覆盖范围窄、规模受限。题目一换风格,模型可能就不会写过程了。
第二阶段:自举——模型自己生成推理数据
既然"题目 + 推理 + 答案"这种数据难造,能不能让模型自己造?
STaR(Self-Taught Reasoner,2022)的做法:
- 拿一个 已经有 CoT 能力的模型(比如经过 Show Your Work 微调的)。
- 让它对一批新题目生成"推理 + 答案"。
- 用 最终答案对不对 作为筛子,只保留答案正确的样本。
- 把这些"题目 + 推理 + 正确答案"喂回模型继续微调。
听起来有点耍赖——模型自己出的题自己改,改完自己学。但仔细想这一步很关键:
- 模型从来没见过人工标注的"好推理",它只见过 好答案。
- 假设"最终答案对 ⇒ 推理过程大概也对",这一步 假设虽然粗糙,但在数学题这类答案可验证的领域已经够用。
- 不断迭代,模型的推理能力会 沿着答案正确的方向自我强化。
从 STaR 开始,"推理数据"这个概念就和"人工标注"脱钩了。
第三阶段:采样增强——多条链多数投票
Self-Consistency(Google,2022 )观察到一件事:
对一道难题,模型单次生成推理链往往翻车,但如果 采样 10 条链,这 10 条里有 6-7 条最终能撞到正确答案。
做法很简单:
- 对同一道题,用 较高的温度采样多条推理链。
- 提取每条链的最终答案。
- 多数投票 选出出现频率最高的答案。
这套方法在 小模型上效果尤其明显——模型本身能力不强,但只要多条独立推理链的"正确答案"在统计上占多数,投票就能纠偏。大模型本身就强,这个加成就不那么显著。
本质上是把推理从"一次赌博"变成"多次博弈"。
第四阶段:强化学习——奖励推理过程
到 2023 年,思路变了:推理过程本身就是可以打分的东西。
过程奖励模型(PRM)
OpenAI 的《Let's Verify Step by Step》训练了一个 verifier,专门给推理链的 每一步 打分:
- 输入:题目 + 推理到第 N 步的中间状态。
- 输出:这一步是否正确的概率。
训练完之后:
- 让模型生成 N 条推理链,每条都被 PRM 逐步打分。
- 用 每一步的分数加权 选出最佳推理链。
- 或者直接把 PRM 分数当作 强化学习的奖励信号,反向训练主模型。
这套方法的问题是 过程标注太贵——要让人给每一步推理都打标签,成本远高于只标最终答案。
结果奖励 + 组内相对(GRPO)
DeepSeekMath(2024)换了个思路:不奖励过程,只奖励结果,但用"组内相对分数"做归一化,这就是 GRPO(Group Relative Policy Optimization)。
核心做法:
- 对一道题,让模型 采样一组答案(比如 16 条)。
- 给每条链的最终答案打分(对/错)。
- 用 这一组内答对的比例 当作 baseline,每条链的得分是它相对于 baseline 的优势。
- 用这个相对优势做策略梯度更新。
优势:
- 不需要过程标注,只要最终答案可验证(数学、代码、客观题都行)。
- 组内相对归一化天然抵消了"题目难度"的影响——难题大家都错,简单题大家都对,相对优势刻画的是"在同一道题里谁更好"。
GRPO 让 CoT 的训练 从监督学习彻底转向强化学习,也是 DeepSeek-R1 能训练出强推理模型的底层方法之一。
现状与未来
CoT 已经从"输出格式"演化成"训练目标"。
- 早期:CoT 是 怎么写 的问题,监督学习拟合"题目 → 推理 → 答案"的数据分布。
- 现在:CoT 是 怎么训 的问题,强化学习用推理过程的好坏作为奖励信号反向塑造模型。
- 未来:CoT 是 和什么结合 的问题。推理过程 + 工具调用、+ 代码执行、+ 搜索、+ 记忆,每一种组合都可能催生新的能力形态。
这也是为什么现在所有头部模型都在卷"长 CoT + RL"——大家意识到 推理不是预训练能学完的,必须在推理阶段持续优化。
CoT 的故事远没有结束。它从一个工程技巧起步,被验证、被自举、被采样、被强化,最终成为大模型获得复杂推理能力的核心范式。下一步会和什么计算形态结合,目前没人能给出 确定答案——但可以确定的是,把推理过程外化成 token 这一招,到今天为止还没被任何更优雅的方案替代。
References
- Show Your Work: Scratchpads for Intermediate Computation with Language Models —— Jason Wei et al., 2021-12-01
- Self-Consistency Improves Chain of Thought Reasoning in Language Models —— Xuezhi Wang et al., 2022-03-21
- Training Verifiers to Solve Math Word Problems —— Karl Cobbe et al., 2021-10-27
- STaR: Bootstrapping Reasoning With Reasoning —— Eric Zelikman et al., 2022-03-29
- Let's Verify Step by Step —— Hunter Lightman et al., 2023-05-31
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models —— Zhihong Shao et al., 2024-02-05
- AI 思维链有什么用? —— 隔壁的程序员老王, 哔哩哔哩, 2026-09-19