§ 40阶段十 · 评估 MMLU

MMLU 精读笔记

论文: Measuring Massive Multitask Language Understanding

作者: Dan Hendrycks(UC Berkeley)、Collin Burns(Columbia)、Steven Basart(UChicago)、Andy Zou(UC Berkeley)、Mantas Mazeika(UIUC)、Dawn Song(UC Berkeley)、Jacob Steinhardt(UC Berkeley)

机构: UC Berkeley 等

ArXiv: 2009.03300(ICLR 2021)

代码: github.com/hendrycks/test

精读状态: ✅ 已完成

所属阶段: 阶段十 Evaluation(MMLU → HellaSwag → BIG-bench → GSM8K)


阅读导航

章节状态主题
Title & Authors57 学科多选题基准的提出者
Abstract大模型尚未掌握的知识广度与校准缺陷
1 IntroductionGLUE/SuperGLUE 迅速被刷爆,缺真正的「理解」评测
2 Related Work预训练范式与既有 benchmark 的局限
3 A Multitask Test57 任务构建与四大学科分组
4 ExperimentsGPT-3/UnifiedQA 规模与学科表现
5 Discussion互联网即训练集、对齐缺口与局限性
6 Conclusion结论
延伸讨论会话问答

Title & Authors

要点: Dan Hendrycks 团队(UC Berkeley 为主)于 2020 年提出,ICLR 2021。标题直译「衡量大规模多任务语言理解」,是今天几乎所有 LLM 榜单的「标配」57 学科多选题基准。

精读

这是「评估范式」的奠基论文,而不是「模型」论文。前面九个阶段我们读的都是「让模型变强」的工作——Transformer 改架构、Scaling 加数据、RLHF 改行为、CoT 提推理、LoRA 省算力、CLIP 接视觉……到了阶段十,我们换一个视角:怎么知道模型到底行不行?这篇 MMLU 就是回答这个问题的标尺之一,也是后来 GPT-4/Claude/LLaMA 发布必报分数的「高考」。它改写了行业用什么来定义「更强」。

作者线值得记住:Dan Hendrycks 是 AI 安全与评测方向的关键人物,后来还做了 ETHICS(对齐人类价值观)、很多分布偏移/异常检测的基准。这篇与阶段三对齐线一脉相承——他在结尾就明确说「模型在道德和法律上表现差,是对齐的最大隐患」。所以 MMLU 不只是能力测试,也是安全测试。

「Massive Multitask」是标题的核心主张。 以往 benchmark 要么考语言技巧(GLUE),要么考常识(HellaSwag),覆盖窄。这篇直接端出 57 个学科,从小学算术到美国律师资格考试,把「理解」定义成「人类会学的一堆真实学科知识」。一个直观类比:之前的标准像「考拼音和造句」,MMLU 像「直接发一套涵盖语数英政史地物化生的综合卷」。


Abstract

We propose a new test to measure a text model's multitask accuracy. The test covers 57 tasks including elementary mathematics, US history, computer science, law, and more. To attain high accuracy on this test, models must possess extensive world knowledge and problem solving ability. We find that while most recent models have near random-chance accuracy, the very largest GPT-3 model improves over random chance by almost 20 percentage points on average. However, on every one of the 57 tasks, the best models still need substantial improvements before they can reach expert-level accuracy. Models also have lopsided performance and frequently do not know when they are wrong. Worse, they still have near-random accuracy on some socially important subjects such as morality and law. By comprehensively evaluating the breadth and depth of a model's academic and professional understanding, our test can be used to analyze models across many tasks and to identify important shortcomings.

精读

「57 个任务」是卷面规模。 这些不是 57 道小题,而是 57 个学科领域(abstract algebra 抽象代数、professional law 职业法律、clinical knowledge 临床知识……),每个领域有一百来道选择题。所以它测的是「知识面广度」+「专业深度」的组合。

「随机概率」是基准线。 多选题四选一,瞎蒙就是 25%。这给了全文一个最简明的标尺:模型是不是真的会,先看它有没有稳稳超过 25%。

三个核心发现,请记住这三句话,后面全文都在展开它们:

规模有用但不够: 最大的 GPT-3(175B,论文里的 X-Large)才比瞎蒙高约 20 个百分点(即约 43.9%),远没到专家水平。注意这是 2020 年的 GPT-3,当时已是天花板,却连「刚及格」都谈不上。

偏科严重(lopsided): 模型不是「 uniformly 差」,而是某些科目接近随机、某些科目还行,没有一门真正精通("does not excel at any single subject")。这像极了考前只刷了部分题库的学生。

不知道自己错(uncalibrated)+ 道德/法律这类社会关键科目近乎瞎蒙: 这是全文最尖锐的警告——模型「自信地错」,且在「什么合法、什么道德」这种人命关天的问题上最弱。结合阶段三对齐线,这是个可怕的组合:模型越能说会道、越自信,越可能在价值观问题上胡来。

Abstract 最后一句点出本文方法论价值: 它不是要造一个「谁第一」的擂台,而是提供一把能「定位模型短板」的手术刀。这正是评测论文的初心——测量是为了诊断,不是为了排名。


1 Introduction

要点: 现有 benchmark(GLUE、SuperGLUE、各种常识集)最快一年就被刷到人类水平,说明它们没抓住「真正的理解」。论文主张:用人类在真实世界里会去学的学科知识来考模型,且只在 zero-shot / few-shot 下测,更接近「考人」的方式,也能暴露预训练到底学到了什么。

精读

第一段:benchmark 被快速刷爆。 GLUE(2018)出一年内模型超人类;SuperGLUE 跟进,又是大约一年到人类水平;常识类基准(HellaSwag、Physical IQA、CosmosQA)也眼看着逼近人类。作者判断很直白——「这些基准没抓住语言理解里重要的那部分」。类比:题库一旦公开,学生(模型)专门刷这堆题,分数虚高,真换个没见过的场景就露馅。

第二段:根因——预训练喂进去的东西远多于旧 benchmark 考的东西。 Transformer 在海量文本(维基、成千上万本书、无数网页)上预训练,顺带看到大量专业领域信息,可旧 NLP 基准根本不测这些。于是核心问题被抛出:当前模型到底从预训练里「学并应用」了多少跨领域知识?这是之前没人系统量过的开放问题。

第三段:处方——把评测改成「考学科」,且只用 zero-shot / few-shot。 两层含义:① 覆盖人类会学的 57 个学科,从小学到专业级,测「世界知识 + 解题能力」组合;② 故意不让模型在测试集上微调,好处一像考人(人不是先把考题背一遍再来答),好处二避免模型靠数据集里的「虚假线索(spurious cues)」刷分。细粒度 + 广覆盖,刚好用来定位「知识盲区」。

第四段:实测结果 + 反直觉发现。 few-shot 模型在 13B 以内基本等于瞎蒙(25%),但 175B 的 GPT-3 一下子跳到 43.9%。不过 GPT-3 不像人类专家「有哪门特别拿手」,而是偏科:最好科目接近 70%,好多科目还接近随机(呼应 Abstract 的 lopsided)。

第五段:三个危险信号,是全文立论的落脚点。 ① 进步虽可喜,但 SOTA 模型在「学并应用预训练知识」上仍吃力;② 接近随机的科目里既有计算重的(物理、数学),也有关乎人类价值的(法律、道德)——后者尤其令人担忧,因为未来模型「懂不懂什么合法、什么道德」至关重要;③ 更糟的是 GPT-3 的「自信度」和实际正确率能差到 24%,说明它根本不知道自己不知道。最后收束:本测试能跨任务分析模型的「集合性质」、追踪重要短板——再次点明「测量是为诊断」。

贯穿全文的新概念——calibration(校准): 可先理解为「一个人说自己有几分把握,是不是真有几分把握」。比如模型答一道题时「自信 90%」,结果实际只有 66% 对,那就是没校准、过度自信。后面 Section 4 会用数字专门打它的脸。


要点: 分两小块——预训练范式(模型从预训练被动学到大量专业知识,但没人系统量过跨领域懂多少;few-shot 能力使「纯考不练」的评测成为可能)与既有 benchmark 的局限(常识集天花板太低、NLG 难客观打分、旧 QA 基准太易或太窄)。

精读

Pretraining: 当时 NLP 主流是在海量文本上预训练,模型被动接触各种专业主题信息。Petroni 2019 已发现预训练知识多到能当「知识库」,但没人系统量过它跨真实领域到底懂多少——MMLU 填这个空。方法转折:过去靠 fine-tune 下游任务,GPT-3 证明可 few-shot 直接上手;正因能 zero/few-shot,作者才敢设计「纯考不练」的卷子,排除靠数据集虚假线索刷分。

Benchmarks: ① 常识基准(HellaSwag/Physical IQA/CosmosQA)只考小孩都有的基础推理,天花板太低;本文反其道放进需专门学习的硬核专业科目(法律/医学/高数)。类比:别人考「认不认识猫」,MMLU 考「能不能过医师资格考试」。② NLG 评测(图灵测试思路)极难客观打分、缺标准指标,故本文退一步用朴素多选题分类准确率。③ 旧 QA 基准要么小学级(模型早很强)、要么只考阅读理解语言层;MMLU 覆盖远超语言理解的硬核学科。

贯穿 Section 2 的对照: 本文把「理解」从「语言技巧/小孩常识」重定义成「人类会专门去学的真实学科知识」。这个定义 shift 是 MMLU 成为行业标尺的根本原因——它考的不是「像不像人说话」,而是「像不像一个受过教育的人」。


3 A Multitask Test

要点: 57 个学科任务(=Atari 游戏数)由学生从公开真实考题手工收集,按 Elementary→Professional 分级;总量 15,908 道,测试集 14,079(每科≥100);人类参照=群众 34.5% / 专家 ~89.8%;分 Humanities / Social Science / STEM / Other 四组展示。

精读

总览: ① 57 这个数字是刻意对标 Atari 游戏总数,暗示「用一组多样任务刻画通用智能」。② 数据来源是真·考试题(GRE、USMLE 医师执照考、大学课程题、牛津读物题),非 toy 题,是人类社会真实用来筛选专业人才的题。③ 难度分级(同科按 Elementary/High School/College/Professional)让 MMLU 同时测广度与深度。④ 数据量三数:总 15,908;few-shot 开发集每科 5 道;验证集 1,540;测试集 14,079、每科≥100(比大多数考人试卷都长)。⑤ 人类水平两参照点(所有模型分数都应对照它):普通群众(AMT 标注员)34.5%、专家(各考试 95 分位)估算 ~89.8%;能力坐标=瞎蒙 25%→普通人 34.5%→专家 ~90%,模型过 34.5% 才算强于群众、近 90% 才算真专家。⑥ 收尾点题:模型在互联网文本预训练,本卷测「它从海量语料榨出多少真实世界知识」,考好需全能+知识广+专家级解题力=长期标杆。

3.1 Humanities

定性分析非科学实证,含法律/哲学/历史。法律最难最典型——把规则套复杂情境还要带限定与解释;哲学含逻辑谬误、形式逻辑、著名论证,以及来自 ETHICS 数据集的「道德情境」题(测日常道德直觉);历史跨时空。▶ 关联阶段三:法律/道德在 Abstract 被点名「模型最差」,此处交代其重要性=理解并遵守规则是约束开放世界模型的关键。

3.2 Social Science

研究人类行为与社会,含经济/社会/政治/地理/心理。经济题需世界知识+定性+定量推理混合;含冷门能测预训练边界的 security studies;特意点出心理学对细腻理解人类尤重要。

3.3 Science, Technology, Engineering, and Mathematics(STEM)

物理/计算机/数学。Conceptual Physics 是 Physical IQA 常识基准的硬核升级版;数学小学到大学分级、大学级需推理链+抽象知识;公式用 LaTeX/`*`/`^` 编码;点出 STEM 需实证方法、流体智力(举一反三推理力)、程序性知识。

3.4 Other

长尾学科,含最难 Professional Medicine(执业医学,需多年学习);商业(金融/会计/营销);全球事实(各国贫困率/识字率/预期寿命=准确世界模型必需)。


4 Experiments

要点: 指标=分类准确率;被测 GPT-3(few-shot,四尺寸 2.7B→175B)与 UnifiedQA(迁移);few-shot prompt 固定每科 5 示例、取 A/B/C/D 最高概率。Table 1 核心:规模有阈值(仅 175B 跳到 43.9%)、UnifiedQA 11B 反超 175B GPT-3、偏科、计算类最弱、知识顺序反人类、置信度与正确率差 24% 未校准。

精读

4.1 Setup

4.1 Setup: 指标为全题全学科分类准确率。GPT-3 用论文的四尺寸命名 Small / Medium / Large / X-Large(对应 OpenAI API 的 Ada / Babbage / Curie / Davinci engine 档,engine 名为外加信息、论文未用);UnifiedQA 基于 T5 text-to-text,在别的 QA 集微调过,此处不再微调直接测迁移准确率。few-shot prompt 设计:开头固定「The following are multiple choice questions (with answers) about [学科].」,结尾固定「Answer: 」,对 A/B/C/D 四 token 概率取最高当预测;每科用固定 5 道示例保一致可复现。

4.2 Results

4.2 Results — Table 1(四大学科加权准确率 %): 随机基线 25.0;RoBERTa 27.9 / ALBERT 27.1 / GPT-2 32.4;UnifiedQA 平均 48.9(人文45.6/社科56.6/STEM40.2/其他54.6);GPT-3 Small 25.9 / Medium 24.9 / Large 26.0 / X-Large 43.9(人文40.8/社科50.4/STEM36.7/其他48.8)。

六点发现:规模有阈值:GPT-3 三个小尺寸都在瞎蒙线 ~25% 晃,仅 175B 跳到 43.9%(比随机高近 19 点);zero-shot 最大模型也 ~37.7%。跨领域知识需大到一定规模才「涌现」。② 微调以少胜多:UnifiedQA 最大 11B 反而超过 175B few-shot GPT-3(48.9 vs 43.9),最小 60M 也有 29.3%——光堆参数不够,相关任务微调同样关键。③ 偏科 lopsided:GPT-3 最好科(US Foreign Policy)69%、最差(College Chemistry)26%;UnifiedQA 最好(Marketing)82.5%;无任一科达专家 ~90%。④ 计算/程序性题最弱:最低 10 科中 9 个是强调数学或计算的 STEM;推测 GPT-3 易学陈述性知识(是什么)、难学程序性知识(怎么做);Figure 7-8 经典例=GPT-3「知道」PEMDAS 运算顺序却不「会用」,背得出规则套不到真实题——「大模型数学弱」最早系统证据之一。⑤ 知识顺序反人类:College Medicine 47.4% / College Math 35.0% 反高于 Elementary Math 29.9%;预训练语料里大学级文本更像它见过的语言,结构与人完全不同、盲区也不同。⑥ Calibration 未校准:平均置信度≠实际正确率,zero-shot 下差达 24%,Elementary Math RMS 校准误差 19.4%,few-shot 稍好仍不准——「很自信地错」,部署危险信号。


5 Discussion

要点: 三主题——多模态基准展望;「互联网即训练集」主张改训练范式让人式学习;模型局限(价值观/计算弱/无专家级)+ 亲自验证加专业数据也难补。

精读

Multimodal Understanding: 文字能承载海量概念,但很多重要概念主要靠图像/声音/物理交互传递;GPT-3 纯文本缺模态,故 MMLU 是纯文本格式。建议模型能处理多模态时 benchmark 也应跟进(如「Turk Test」=AMT 上需灵活格式多模态理解的真实任务)。▶ 先见之明:今天多模态评测(阶段九 GPT-4V 系统卡)正沿此方向。

The Internet as a Training Set(方法论野心): 旧 benchmark 都要大题库训练,MMLU 故意不提供→假设知识来自「读互联网海量文本」(预训练)。把预训练重理解为一种「训练本身」:下游评测=展示「人类读同样文本后 pick up 的知识」。由此主张未来模型应更多在预训练阶段学而非靠少量练习题刷:Professional Law 有 164 卷法律百科但可用模拟题<5,000 道,「只靠几套模拟题学完法律体系」不现实。评测格式刻意不同于预训练呈现格式,排除同分布虚假线索、也利于收集更广任务。

Model Limitations: ① 价值观类最弱(Professional Law / Moral Scenarios)——对齐人类价值必须强,呼应阶段三。② 计算弱:Elementary Mathematics 等 plug-and-chug 题差。③ 无单科达专家水平、平均才刚过瞎蒙。④ 补救尝试失败:专门收集 ~2,000 道 Professional Law 题微调 RoBERTa-base 仅 32.8%;再在 160 万份法律案例摘要继续预训练也只 36.1%——加高质量专业文本有帮助但远不足。⑤ scaling 未必解:当时认知 size×10 需 data×5(Kaplan 2020),冷门学科文字数据本身成瓶颈。


6 Conclusion

要点: 收束——用 57 分级学科在广度深度上超旧基准;模型刚能进步但偏科、无单科精通、未校准、道德法律尤弱;测试帮研究者定位短板。

精读

一句话收束: 本文提出测「模型从预训练里学并应用知识」的测试,以 57 个分级学科在广度深度上都超过旧基准。结论=模型刚能有意义进步、但偏科、无单科精通、未校准、在道德法律上尤弱。这份 expansive 测试能帮研究者精确定位模型短板、看清 SOTA 真实能力。

核心带走三点:评估范式 shift:把「理解」从语言技巧重定义为「人类专门学的真实学科知识」,成行业标尺。② 能力坐标:瞎蒙 25%→普通人 34.5%→专家 ~90%;2020 年 175B GPT-3 才 43.9%,且偏科、自信地错。③ 安全维度:道德/法律近随机 + 未校准=对齐最大隐患,与阶段三一脉相承。


延伸讨论

Q:论文中的测试,对当下大模型是否已是「小儿科」级别?

结论:平均分已近专家、区分度报废,但「小儿科」判断需打三个折扣。

① 数字演变: 2020 年天花板是 175B GPT-3 的 43.9%,离专家线 ~89.8% 差一半;如今 GPT-4(2023)5-shot 约 86.4%、Claude 3.5 / Gemini 1.5 Pro / Llama 3.1 405B 普遍 87–90%+,2026 年前沿模型已超/贴近当年「专家水平」。从「达不达得到专家平均分」这个原定目标看,基本被攻克。

② 折扣一——已饱和,不再是区分器: 头部模型全挤在 85–90%+ 一小段,MMLU 分不出 GPT-4 与 Claude 谁强。因此学界造了更难后继基准:MMLU-Pro(选项 4→10、加硬推理题)、GPQA(研究生级科学)、Humanity's Last Exam。准确说法=被「做穿」而非题简单,是模型与数据迭代 6 年的结果。

③ 折扣二——数据污染嫌疑重: 题目来自 GRE/USMLE/牛津读物等公开网源(Section 3),今天模型在近全互联网预训练,极可能直接见过原题。论文附录 B.2 当年用「问题熵与正确率不相关」证伪背题,但那是 2020 年模型尚未见这些网页时;该保证今已基本失效。高分数里「真理解」vs「见过答案」存疑。

④ 折扣三——只考最浅一层: MMLU 是四选一、无需推理链、纯文本、无工具的闭卷选择题,完全不测推理深度/多步规划(阶段四)、Agent/长上下文/多模态(阶段六/八/九)、安全对齐(论文最担心的道德法律到今天仍最弱)、鲁棒性/校准/「自信地错」(Section 4.2 至今未解)。它测的是知识广度下限,今天关心的是能力上限。

一句话: 对前沿模型 MMLU 已非难度门槛(平均分近专家),但作为评测工具已退役——饱和+可能污染+只测浅层选择题,行业换更硬尺子。论文最该记住的不是分数表,而是评估范式 shift 与那句警告:道德/法律近随机又自信地错=对齐最大隐患,到 2026 仍尖锐。

Q:当前这篇论文是否已过时?它在大模型评测领域的地位?

结论:论文本身不过时(范式奠基),过时的是它作「SOTA 区分尺」的功能。地位=大模型知识评测的 ImageNet。

① 是否过时——分两层: 作为学术贡献不过时且奠基——它定义的不是 2020 年分数,而是方法论(57 真实学科 + 双 human 锚点 34.5%/~90% + 强制 zero/few-shot 不微调排除虚假线索 + 把 calibration 当正式指标),整套被行业照搬,是被吸收成常识而非被推翻。作为测当前最强模型的工具确实老了(上轮已确认:头部饱和 85–90%+、可能污染、只考四选一浅层,分辨 GPT-4/Claude 已失效)。反直觉点:论文最该记住的警告反而更锋利——道德/法律近随机+自信地错=对齐最大隐患,到 2026 模型能写码能过律师题,但 calibration 差、价值观脆弱未根治,故「诊断价值」没过时、过时的只是「分数表」。

② 领域地位: a) 事实标配尺:~2022 起几乎每次大模型发布 tech report 头条指标之一都是 MMLU,实际接替 GLUE/SuperGLUE 成生成式 LLM「知识/理解」头号对标,相当于 CV 的 ImageNet 时刻(不是最难但是人人都报、人人可比)。b) 催生整个家族:MMLU-Pro(4→10 选项+硬推理救饱和)、MMMU(多模态版)、MMLU-Redux/Redux-CN(去污染+中文)、各类 -Pro/-Hard/领域版都挂 MMLU 姓→已从论文变「评测范式品牌」。c) 学术影响力:LLM 评测方向被引最高论文之一(数万级),后续 eval 必引;作者 Dan Hendrycks 成 AI 评测/安全核心人物,续作 HELM/ETHICS/MMMU 定义「怎么认真评测大模型」子领域。d) 公认局限:英语中心、四选一格式、闭卷无工具、不测推理过程/安全/鲁棒性、高度可污染——这些局限正是推动 GPQA、Humanity's Last Exam、安全/agent 基准的动因。

一句话定位: MMLU 不是过时旧 benchmark,而是大模型知识评测的 ImageNet——作「最强模型区分器」已退役,但作「定义评测范式+行业通用货币+催生一整个家族」的奠基论文地位稳固,且对齐/校准警告历久弥新。