· 8 min read
AI 思维链 CoT,本质是 用 token 数换推理深度 的工程技巧。
- 为什么需要:单次前向传播算力固定,把思考过程外化成 token,变相扩容。
- 起步阶段:Google 用程序生成"题目+步骤"数据,监督微调小模型学会推理。
- 自举阶段:STaR 让模型自己生成答案,只留结果正确的样本继续微调。
- 采样增强:Self-Consistency 多链采样,多数投票决定最终答案。
- PRM 路线:OpenAI 训练 verifier 给每一步推理打分,过程可监督。
- GRPO 路线:DeepSeekMath 用组内相对分数,只奖励结果对,把 CoT 推向 RL。
- 未来趋势:CoT 和工具调用、代码执行、搜索结合,持续催生新能力。





