| 1 | Agent核心思想 | 自主决策、工具使用、环境交互 |
| 2 | Toolformer | 自主学习使用工具 |
| 3 | ReAct | 推理+行动循环(T-A-O) |
| 4 | HuggingGPT | LLM控制器,分发任务给专家模型 |
| 5 | AutoGPT | 自主Agent的代表 |
答:Agent = LLM + 工具 + 记忆 + 规划能力。传统LLM是单轮输入→输出,Agent能自主决策、使用工具、与环境交互、多步推理。核心区别:LLM被动回答,Agent主动行动。
想听:不只是"调用API",而是自主决策+规划
答:模型自主学习何时调用什么工具、如何利用返回结果。流程:1)用少量示例生成工具调用候选;2)过滤无用调用(对loss无帮助的删除);3)微调模型学习工具使用。创新:无需人工标注,模型自己学会工具使用。
想听:自主学习 + 过滤无用调用
答:Thought(推理)→ Action(行动)→ Observation(观察)。每一步LLM先推理(思考下一步该做什么),再行动(调用工具),再观察(获取结果),循环直到完成。优势:推理过程透明可解释,减少幻觉(有事实依据),比纯推理更可靠。
想听:T-A-O三步循环 + 可解释性
答:LLM作为控制器,将用户任务分发给HuggingFace上的专家模型执行。流程:1)解析用户意图;2)选择合适的专家模型;3)分发任务;4)汇总结果。解决:单个LLM无法处理所有任务(如图像生成、语音识别),通过调度专用模型弥补能力短板。
想听:LLM控制器 + 专家模型调度
答:特点:完全自主的Agent,能自主规划、执行、反思,支持长程任务。局限:循环容易发散、成本高、错误会累积、缺乏人类反馈。实际上很多任务效果不如人工设计的Pipeline,但展示了Agent的可能性。
想听:完全自主 + 循环发散的局限
| 追问 | 应对要点 |
|---|---|
| "Agent和Workflow有什么区别?" | Workflow是预定义的流程图,步骤固定;Agent是LLM自主决策下一步,步骤不固定。Workflow更可控,Agent更灵活。 |
| "Toolformer怎么判断调用有没有用?" | 通过loss变化判断:如果工具调用后loss下降,说明有用;如果loss不变或上升,说明无用,应该过滤掉。 |
| "ReAct的Thought必须写出来吗?" | 是的,Thought是显式的推理步骤,让模型"想清楚再做"。比直接Action更可靠,但增加了token消耗。 |
| "Agent的错误累积怎么解决?" | 1)加入人类反馈(Human-in-the-loop);2)设置最大步数限制;3)自我反思(如Self-Refine);4)验证中间结果。 |
| "Function Calling和Toolformer有什么区别?" | Function Calling是模型输出结构化的函数调用,需要人工定义工具描述;Toolformer是模型自主学习工具使用,无需人工定义。 |
| 场景 | 推荐方案 | 理由 |
|---|---|---|
| 简单工具调用 | Function Calling | 实现简单,可控性好 |
| 需要推理+行动 | ReAct | 可解释,减少幻觉 |
| 复杂多步任务 | Agent框架 | 自主规划,灵活应对 |
| 多模型协作 | HuggingGPT | 调度专用模型,能力互补 |
| 论文 | 面试关键词 | 关联考点 |
|---|---|---|
| Toolformer | 自主工具学习 | 过滤无用调用 |
| ReAct | T-A-O循环 | 推理+行动+观察 |
| HuggingGPT | LLM控制器 | 专家模型调度 |
| AutoGPT | 完全自主Agent | 循环发散、成本 |