| 1 | Chain-of-Thought | 中间推理步骤为什么有效 |
| 2 | Self-Consistency | 多路径采样+多数投票 |
| 3 | ToT | 树搜索思维与test-time compute |
| 4 | ReAct | 推理+行动循环 |
| 5 | 涌现能力 | CoT为什么小模型不行 |
答:在prompt中给出包含中间推理步骤的示例,引导模型"一步一步思考"。有效原因:把复杂问题分解为子问题,每步只需要简单推理;中间结果作为"工作记忆",避免信息丢失;激活预训练时学到的推理模式。
想听:分解问题 + 工作记忆 + 激活推理模式,不只是"让模型多想想"
答:CoT只采样一条路径,结果不稳定。Self-Consistency采样多条推理路径(调高temperature),对最终答案做多数投票。核心观察:正确路径倾向于收敛到相同答案,错误路径则发散。零训练成本,纯推理期提升。
想听:多路径+多数投票,以及正确路径收敛的观察
答:CoT是单链推理(深度优先),ToT是树搜索(BFS/DFS)。ToT把推理组织成思维树,每个节点是一个思考状态,可以分支、评估、回溯。适合需要探索和规划的任务(如Game of 24),但成本是CoT的数十倍。
想听:单链 vs 树搜索,以及代价权衡
答:Thought→Action→Observation循环。Thought是推理(分析当前状态、规划下一步),Action是调用工具(搜索、计算等),Observation是工具返回结果。连接了推理能力(阶段四)和行动能力(阶段八Agent),是Agent架构的雏形。
想听:T-A-O循环 + 推理与行动的连接
答:CoT需要模型具备分解问题和中间推理的能力,这依赖足够的参数规模来存储和泛化推理模式。小模型(如GPT-2 1.5B)参数不足以支撑这种泛化,强行用CoT反而比直接回答更差。论文实验显示PaLM 540B效果最好,GPT-3 175B次之,小模型基本无效。
想听:参数规模决定推理能力的泛化
| 追问 | 应对要点 |
|---|---|
| "CoT需要训练吗?还是纯prompting?" | 纯prompting,无需训练。只需要在few-shot示例中给出推理步骤,模型就能模仿。这是它的核心优势。 |
| "Self-Consistency的成本怎么算?" | 采样N次(如40次),每次都要完整推理。成本是CoT的N倍,但可以并行。适合对准确率要求高、成本不敏感的场景。 |
| "ToT在工业上有用吗?" | 成本太高,工业上很少直接用。但test-time compute的思想(o1/R1)是它的延续:推理时花更多时间思考,而不是只靠训练时堆参数。 |
| "ReAct和Function Calling什么关系?" | ReAct是学术概念(2022),Function Calling是工业接口(2023)。ReAct的Action=调用工具,Function Calling把这标准化为JSON Schema。GPT-4的Function Calling可以看作ReAct的工业实现。 |
| 场景 | 推荐方法 | 理由 |
|---|---|---|
| 简单问答、分类 | 直接回答 | 不需要推理步骤 |
| 数学、逻辑推理 | CoT | 分解步骤提升准确率 |
| 高准确率要求 | CoT + Self-Consistency | 多路径投票更稳定 |
| 需要工具调用 | ReAct | 推理+行动循环 |
| 论文 | 面试关键词 | 关联考点 |
|---|---|---|
| Chain-of-Thought | 中间推理步骤 | 分解问题、工作记忆 |
| Self-Consistency | 多路径投票 | 采样+多数决 |
| Tree of Thoughts | 树搜索推理 | BFS/DFS、test-time compute |
| ReAct | 推理+行动 | T-A-O循环、Agent雏形 |
| STaR | 自举式推理 | 生成→筛选→再训练 |