§ 10阶段十 · 评测基准 面试指引

评测基准(Evaluation)· 面试高频考点

聚焦:MMLU / HellaSwag / GSM8K / Big-Bench 的面试高频考点

适用:AI算法岗、大模型应用岗、研究实习面试 | 阅读:10-15分钟

一、高频考点总览

1LLM评测基准为什么需要专门的评测
2MMLU多任务知识评测、57个学科
3HellaSwag常识推理、对抗过滤
4GSM8K数学推理、小学应用题
5Big-Bench多样化评测任务集

二、必会问答

Q1: 为什么LLM需要专门的评测基准?传统NLP评测有什么问题?

答:传统NLP评测(如GLUE/SuperGLUE)已被"刷爆",无法区分不同模型的真实能力。LLM需要:1)覆盖更多能力维度(知识、推理、数学、代码);2)更难的题目(防止饱和);3)更多样的任务类型(不只是分类)。

想听:传统基准饱和 + 能力维度覆盖 + 防止刷榜

Q2: MMLU测什么?有什么特点?

答:MMLU(Massive Multitask Language Understanding)覆盖57个学科(从初中到研究生),共约15000道四选一选择题。测的是广泛的知识和推理能力。特点:覆盖面广、难度分级、是目前最主流的知识评测基准。

想听:57个学科 + 四选一 + 知识+推理

Q3: HellaSwag是怎么设计的?为什么它能有效区分模型能力?

答:HellaSwag是常识推理基准:给定一个场景描述,从四个候选中选出最合理的后续。关键设计:用对抗过滤(Adversarial Filtering)生成"对人类简单、对机器困难"的干扰项——干扰项由语言模型生成,但人类能轻松识别。这使得基准不会很快饱和。

想听:对抗过滤 + 对人类简单对机器困难

Q4: GSM8K测什么?为什么它被认为是数学推理的"金标准"?

答:GSM8K(Grade School Math 8K)是8500道小学数学应用题,需要2-8步推理。它被认为是金标准因为:1)题目需要多步推理,不是简单记忆;2)答案唯一可验证;3)难度适中(人类能做,但模型需要真正推理);4)是训练集无泄露的干净基准。

想听:多步推理 + 答案唯一 + 干净无泄露

Q5: Big-Bench有什么特别之处?

答:Big-Bench(Beyond the Imitation Game Benchmark)是200+任务的多样化评测集,涵盖语言理解、逻辑推理、数学、代码等。特别之处:1)任务来自人类设计,不是自动收集;2)包含"不可能"的任务(当前模型做不好);3)是Google的协作项目,社区贡献。

想听:200+任务 + 人类设计 + 协作项目

三、追问陷阱

追问应对要点
"MMLU的分数能代表真实能力吗?"不完全能。MMLU是知识测试,不能测推理、代码、对话等能力。高MMLU分数可能只是记忆了知识,需要结合其他基准综合评估。
"HellaSwag和MMLU有什么区别?"MMLU测知识(记忆型),HellaSwag测常识推理(推理型)。MMLU高分可能靠记忆,HellaSwag高分需要真正的理解。
"GSM8K的题目是不是太简单了?"对人类简单,但对模型不简单。需要多步推理、理解语义、做算术运算,很多模型仍然做不好。而且它能有效区分不同模型的推理能力。
"评测基准会泄露吗?"会。训练数据可能包含基准题目,导致分数虚高。所以需要:1)定期更新基准;2)用对抗过滤生成新题;3)用 held-out 测试集。
"Chatbot Arena和传统基准有什么区别?"Chatbot Arena是人类盲测(用户与两个模型对话,投票选好的),反映真实使用体验;传统基准是固定题目+自动评分,反映特定能力。两者互补。

四、实战建议

评测基准选型

能力维度推荐基准理由
知识广度MMLU57个学科,覆盖面广
常识推理HellaSwag对抗过滤,不易饱和
数学推理GSM8K多步推理,答案唯一
综合能力Big-Bench200+任务,多样化
真实体验Chatbot Arena人类盲测,反映实际使用

面试前速查清单

基准面试关键词关联考点
MMLU多任务知识57个学科、选择题
HellaSwag常识推理对抗过滤、四选一
GSM8K数学推理多步推理、应用题
Big-Bench多样化任务200+任务、社区贡献