§ 04阶段四 · 推理能力 面试指引

推理能力(Reasoning)· 面试高频考点

聚焦:CoT / Self-Consistency / ToT / ReAct / STaR 的面试高频考点

适用:AI算法岗、大模型应用岗、研究实习面试 | 阅读:10-15分钟

一、高频考点总览

1Chain-of-Thought中间推理步骤为什么有效
2Self-Consistency多路径采样+多数投票
3ToT树搜索思维与test-time compute
4ReAct推理+行动循环
5涌现能力CoT为什么小模型不行

二、必会问答

Q1: Chain-of-Thought的核心思想是什么?为什么有效?

答:在prompt中给出包含中间推理步骤的示例,引导模型"一步一步思考"。有效原因:把复杂问题分解为子问题,每步只需要简单推理;中间结果作为"工作记忆",避免信息丢失;激活预训练时学到的推理模式。

想听:分解问题 + 工作记忆 + 激活推理模式,不只是"让模型多想想"

Q2: Self-Consistency相比CoT有什么改进?

答:CoT只采样一条路径,结果不稳定。Self-Consistency采样多条推理路径(调高temperature),对最终答案做多数投票。核心观察:正确路径倾向于收敛到相同答案,错误路径则发散。零训练成本,纯推理期提升。

想听:多路径+多数投票,以及正确路径收敛的观察

Q3: ToT相比CoT有什么本质区别?

答:CoT是单链推理(深度优先),ToT是树搜索(BFS/DFS)。ToT把推理组织成思维树,每个节点是一个思考状态,可以分支、评估、回溯。适合需要探索和规划的任务(如Game of 24),但成本是CoT的数十倍。

想听:单链 vs 树搜索,以及代价权衡

Q4: ReAct的核心循环是什么?它连接了哪两个能力?

答:Thought→Action→Observation循环。Thought是推理(分析当前状态、规划下一步),Action是调用工具(搜索、计算等),Observation是工具返回结果。连接了推理能力(阶段四)和行动能力(阶段八Agent),是Agent架构的雏形。

想听:T-A-O循环 + 推理与行动的连接

Q5: 为什么CoT是涌现能力,小模型用不了?

答:CoT需要模型具备分解问题和中间推理的能力,这依赖足够的参数规模来存储和泛化推理模式。小模型(如GPT-2 1.5B)参数不足以支撑这种泛化,强行用CoT反而比直接回答更差。论文实验显示PaLM 540B效果最好,GPT-3 175B次之,小模型基本无效。

想听:参数规模决定推理能力的泛化

三、追问陷阱

追问应对要点
"CoT需要训练吗?还是纯prompting?"纯prompting,无需训练。只需要在few-shot示例中给出推理步骤,模型就能模仿。这是它的核心优势。
"Self-Consistency的成本怎么算?"采样N次(如40次),每次都要完整推理。成本是CoT的N倍,但可以并行。适合对准确率要求高、成本不敏感的场景。
"ToT在工业上有用吗?"成本太高,工业上很少直接用。但test-time compute的思想(o1/R1)是它的延续:推理时花更多时间思考,而不是只靠训练时堆参数。
"ReAct和Function Calling什么关系?"ReAct是学术概念(2022),Function Calling是工业接口(2023)。ReAct的Action=调用工具,Function Calling把这标准化为JSON Schema。GPT-4的Function Calling可以看作ReAct的工业实现。

四、实战建议

推理方法选型

场景推荐方法理由
简单问答、分类直接回答不需要推理步骤
数学、逻辑推理CoT分解步骤提升准确率
高准确率要求CoT + Self-Consistency多路径投票更稳定
需要工具调用ReAct推理+行动循环

面试前速查清单

论文面试关键词关联考点
Chain-of-Thought中间推理步骤分解问题、工作记忆
Self-Consistency多路径投票采样+多数决
Tree of Thoughts树搜索推理BFS/DFS、test-time compute
ReAct推理+行动T-A-O循环、Agent雏形
STaR自举式推理生成→筛选→再训练