| 1 | LLM评测基准 | 为什么需要专门的评测 |
| 2 | MMLU | 多任务知识评测、57个学科 |
| 3 | HellaSwag | 常识推理、对抗过滤 |
| 4 | GSM8K | 数学推理、小学应用题 |
| 5 | Big-Bench | 多样化评测任务集 |
答:传统NLP评测(如GLUE/SuperGLUE)已被"刷爆",无法区分不同模型的真实能力。LLM需要:1)覆盖更多能力维度(知识、推理、数学、代码);2)更难的题目(防止饱和);3)更多样的任务类型(不只是分类)。
想听:传统基准饱和 + 能力维度覆盖 + 防止刷榜
答:MMLU(Massive Multitask Language Understanding)覆盖57个学科(从初中到研究生),共约15000道四选一选择题。测的是广泛的知识和推理能力。特点:覆盖面广、难度分级、是目前最主流的知识评测基准。
想听:57个学科 + 四选一 + 知识+推理
答:HellaSwag是常识推理基准:给定一个场景描述,从四个候选中选出最合理的后续。关键设计:用对抗过滤(Adversarial Filtering)生成"对人类简单、对机器困难"的干扰项——干扰项由语言模型生成,但人类能轻松识别。这使得基准不会很快饱和。
想听:对抗过滤 + 对人类简单对机器困难
答:GSM8K(Grade School Math 8K)是8500道小学数学应用题,需要2-8步推理。它被认为是金标准因为:1)题目需要多步推理,不是简单记忆;2)答案唯一可验证;3)难度适中(人类能做,但模型需要真正推理);4)是训练集无泄露的干净基准。
想听:多步推理 + 答案唯一 + 干净无泄露
答:Big-Bench(Beyond the Imitation Game Benchmark)是200+任务的多样化评测集,涵盖语言理解、逻辑推理、数学、代码等。特别之处:1)任务来自人类设计,不是自动收集;2)包含"不可能"的任务(当前模型做不好);3)是Google的协作项目,社区贡献。
想听:200+任务 + 人类设计 + 协作项目
| 追问 | 应对要点 |
|---|---|
| "MMLU的分数能代表真实能力吗?" | 不完全能。MMLU是知识测试,不能测推理、代码、对话等能力。高MMLU分数可能只是记忆了知识,需要结合其他基准综合评估。 |
| "HellaSwag和MMLU有什么区别?" | MMLU测知识(记忆型),HellaSwag测常识推理(推理型)。MMLU高分可能靠记忆,HellaSwag高分需要真正的理解。 |
| "GSM8K的题目是不是太简单了?" | 对人类简单,但对模型不简单。需要多步推理、理解语义、做算术运算,很多模型仍然做不好。而且它能有效区分不同模型的推理能力。 |
| "评测基准会泄露吗?" | 会。训练数据可能包含基准题目,导致分数虚高。所以需要:1)定期更新基准;2)用对抗过滤生成新题;3)用 held-out 测试集。 |
| "Chatbot Arena和传统基准有什么区别?" | Chatbot Arena是人类盲测(用户与两个模型对话,投票选好的),反映真实使用体验;传统基准是固定题目+自动评分,反映特定能力。两者互补。 |
| 能力维度 | 推荐基准 | 理由 |
|---|---|---|
| 知识广度 | MMLU | 57个学科,覆盖面广 |
| 常识推理 | HellaSwag | 对抗过滤,不易饱和 |
| 数学推理 | GSM8K | 多步推理,答案唯一 |
| 综合能力 | Big-Bench | 200+任务,多样化 |
| 真实体验 | Chatbot Arena | 人类盲测,反映实际使用 |
| 基准 | 面试关键词 | 关联考点 |
|---|---|---|
| MMLU | 多任务知识 | 57个学科、选择题 |
| HellaSwag | 常识推理 | 对抗过滤、四选一 |
| GSM8K | 数学推理 | 多步推理、应用题 |
| Big-Bench | 多样化任务 | 200+任务、社区贡献 |