术语表

共 78 条 · 9 类 · 释义为笔记口径的简化 ← 返回学习路线

基础概念18

Token 词元token

模型处理文本的最小单位,可能是字、词或子词;模型的世界里没有「词」,只有 token 序列。 §03 §01

Embedding 词嵌入embedding

把 token 查表变成向量的可训练参数层;「读懂一句话」的第一步是把字变成数字。 §01 §04

Softmaxsoftmax

把任意一组分数压成总和为 1 的概率分布;注意力权重和输出概率都靠它,且它使 FlashAttention 的分块计算成为可能。 §01 §17

Attention 注意力attention

每个 token 对其他 token 做「加权读取」:与谁相关就多看谁。Transformer 的核心机制。 §01

Multi-Head Attention 多头注意力MHA

并行跑多组低维注意力,每组关注不同侧面(语法、指代、位置),再拼接投影回来。 §01

Positional Encoding 位置编码PE

给 token 附加位置信息——注意力本身对顺序无感,位置要额外注入;正弦编码与可学习编码是两大路线。 §01 §24

Logitslogits

softmax 之前的原始打分;「四个选项取概率最高」就是在比较它们的 logits。 §40

Perplexity 困惑度ppl

语言模型预测下一个词的「平均犹豫度」,越低越好;衡量语言建模能力的标准尺。 §33 §03

Pre-training 预训练pre-training

用海量无标注文本做「下一词预测」,把语言规律与世界知识压进参数。 §04 §05

Fine-tuning 微调fine-tuning

在预训练权重上用有标注数据继续训练,让通用模型适配具体任务。 §02

SFT 监督微调supervised fine-tuning

用「指令 → 回答」格式的数据做监督微调,把续写机器变成听指令的助手;对齐流程的第一步。 §09 §08

Zero-shot / Few-shotzero-shot, few-shot

不给示例直接做题(zero),或在 prompt 里给几个示例再做题(few);示例只进上下文,不更新参数。 §03 §08

Self-supervised 自监督self-supervised

不需要人工标注,从数据自身构造监督信号(预测下一个词、补全被 mask 的词);预训练与 Toolformer 数据生产的基本盘。 §33 §03

Encoder-only / Decoder-onlyencoder-only, decoder-only

只用一半 Transformer 的两种架构:encoder-only 双向理解(BERT 系),decoder-only 自回归生成(GPT 系,今天主流 LLM 的选择)。 §03 §02

Autoregressive 自回归autoregressive

逐 token 生成,把已生成的内容拼回输入再预测下一个;所有 GPT 系模型的生成方式。 §01

Temperature 与解码策略temperature, greedy, beam search

采样前给 logits 除的温度系数:低温稳定、高温多样;配套的解码策略有贪心(每步取最大)与束搜索(保留多条候选路径)。 §03 §14

Cross-Entropy 交叉熵cross-entropy

衡量「预测分布与真实答案差多远」的标准损失函数;预训练目标与 Toolformer 的调用过滤用的是同一把尺。 §33

Scaling Law 缩放定律scaling law

性能随参数量、数据量、算力按幂律平滑提升的经验规律;训练算力 C ≈ 6 × 参数量 × token 数。 §04 §05

训练与对齐15

Instruction Tuning 指令微调instruction tuning

把多任务数据都包装成自然语言指令来微调,模型学会「听指令」,并泛化到没见过的任务。 §08 §37

RLHFRL from human feedback

人类反馈强化学习:SFT → 训练奖励模型 → PPO 优化三步法,ChatGPT 的对齐配方。 §09 §34

Reward Model 奖励模型RM

从人类偏好对比中学出的打分器,给回答排序,在 RL 阶段替人类当评委。 §09 §34

PPOproximal policy optimization

一种带「裁剪」的策略梯度强化学习算法,限制单步更新幅度以保稳定;RLHF 的引擎。 §09

KL 惩罚KL penalty

限制策略偏离参考模型太远的约束项,防止模型为刷分学歪;DPO 里的 β 就是它的旋钮。 §09 §10

DPOdirect preference optimization

绕过显式 RL:通过数学重参数化把「训 RM + 跑 RL」坍缩成一个偏好分类损失,直接在偏好对上训练。 §10 §12

RLAIFRL from AI feedback

用 AI 反馈替代人类标注做对齐,人类只提供原则;Constitutional AI 是源头。 §11

Reward Hacking 奖励黑客reward hacking

模型钻奖励模型的空子刷高分,而非真正变好;RLHF 头号陷阱,KL 惩罚的主要防范对象。 §09 §11

Alignment Tax 对齐税alignment tax

对齐训练后通用能力回退的代价;PPO-ptx 等混预训练梯度的方案用于缓解。 §09

Calibration 校准calibration

模型的自信程度与实际正确率是否匹配;「自信地错」是未校准,MMLU 把它当正式指标。 §40 §42

Catastrophic Forgetting 灾难性遗忘catastrophic forgetting

微调新任务时把预训练学到的旧能力覆盖掉;冻结部分权重(LoRA、BLIP-2 双冻结)的动机之一。 §38 §18

Data Contamination 数据污染contamination

测试题混进训练语料导致分数虚高;CLIP 的重叠分析是量化泄漏影响的原型。 §36 §40

Distillation 蒸馏distillation

用大模型的输出当教材训练小模型,把能力「抄」过来;Self-RAG 的 critic 由 GPT-4 蒸馏而来。 §31

Hallucination 幻觉hallucination

模型一本正经地编造事实;RAG、引用、验证器都是对症的缓解手段,但没有根治。 §29 §34

Emergent Abilities 涌现能力emergent abilities

某些能力在小模型上不存在、模型规模跨过某个门槛后突然出现;工具使用约在 775M 参数处涌现。 §33 §42

推理9

Chain-of-Thought 思维链CoT

让模型先写出推理步骤再给最终答案;靠 prompting 激活预训练中已有的推理模式。 §13

Self-Consistency 自洽性SC

同一道题采样多条推理路径,对最终答案做多数投票;免训练、纯推理期提升准确率。 §14

Test-time Compute 测试时算力test-time compute

推理阶段多花算力换答案质量(多次采样、搜索、验证);ToT、best-of-n 与 o1/R1 的共同思想。 §15 §34

Tree of Thoughts 思维树ToT

把推理组织成树搜索:每步生成多个候选、评估打分、支持回溯与剪枝。 §15

Verifier / PRM 验证器verifier, process reward model

给解答打正确性分的判别模型;细到每个推理步骤的是过程奖励模型(PRM),GSM8K 是这条路线的起点。 §43

ReAct 循环ReAct

「想—做—看—再想」的交替循环:Thought、Action、Observation 反复迭代直到得出答案;Agent 骨架。 §16

STaR 与自举bootstrap, self-training

模型自己生成解答 → 按对错筛选 → 回炉再训,用「自己的输出训练自己」;STaR 的过滤判据是答案对错,Toolformer 换成了损失下降。 §17 §33

Best-of-n / Rejection Samplingbest-of-n

同一道题独立采样 n 条,用奖励模型挑最好的一条;比跑 RL 便宜且常更有效,test-time compute 的祖先。 §34

In-context Learning 上下文学习ICL

靠 prompt 里的少量示例「现学」任务,不更新任何权重;few-shot 的能力来源。 §08 §36

效率9

LoRA 低秩适配low-rank adaptation

冻结原权重,用一对很小的低秩矩阵承载「改动量」,可训参数少几个量级且可合并回原权重、推理零延迟。 §18 §20

QLoRAqlora

把冻结基座量化到 4-bit(NF4)再挂 LoRA:单张 48GB 卡微调 65B 模型。 §20

Quantization 量化quantization

用更少 bit 近似存储权重(如 16-bit → 8/4-bit),换显存与带宽;代价是需要处理精度损失。 §21 §20

Outlier 特征离群值outlier features

隐藏状态里少数「数值特别大又特别关键」的特征维度,约 6.7B 规模起系统性出现,是量化掉点的元凶;LLM.int8() 把它们单独留在 16-bit。 §21

FlashAttentionflash attention

不改注意力的数学,改数据的搬运方式:分块计算 + 在 SRAM 里重算,不物化 N×N 中间矩阵;省显存、提速,长上下文的功臣。 §19

HBM / SRAMHBM, SRAM

GPU 显存大而慢、片上 SRAM 小而快;「计算 bottleneck 常在搬运」这一 IO 视角是 FlashAttention 的出发点。 §19

Tensor Parallel 张量并行tensor parallel

把单层的权重矩阵切开到多张卡同时计算,Megatron-LM 的开山方案;与流水线并行、数据并行互补。 §23

ZeRO 数据并行分片zero redundancy optimizer

数据并行下把优化器状态、梯度、参数逐级分片到各卡,消除显存冗余;配套的激活检查点用「重算」换显存。 §22

KV Cachekv cache

生成时缓存每个历史 token 的 K/V,避免每步重算整段注意力;是长上下文推理显存的大头,也是动态位置缩放的工程坑所在。 §27

长上下文8

RoPE 旋转位置编码rotary position embedding

用旋转把绝对位置写进 Q/K,使注意力分数天然只依赖相对距离;LLaMA 等主流 LLM 的位置编码标配。 §24

Context Window 上下文窗口context window

模型一次前向能「看见」的最大 token 数;窗口大 ≠ 用得好。 §28 §25

Needle in a Haystack 大海捞针NIAH

在长文本里埋一条事实、考模型能否找到的评测范式;Lost in the Middle 的键值检索是其极限版。 §28

插值 / 外推interpolation, extrapolation

扩上下文的两条路:把没见过的位置压缩回训练过的范围(内插,稳),或直接用超范围位置(外推,险);YaRN 的分析框架。 §27 §24

NTK-aware Scalingntk-aware

按「波长」区别对待 RoPE 的各频率维:高频保相对位置、低频拉绝对位置;YaRN 的构件之一。 §27

Ring Attentionring attention

把序列切到多设备、KV 块在逻辑环中传递并与通信重叠;上下文容量近似随设备数线性扩展。 §25

S²-Attnshifted sparse attention

训练时把长文切段做局部稀疏注意力、再移位拼接补信息;省算力,推理仍保持全注意力。 §26

U 形注意力u-shaped attention

长上下文里「开头结尾记得住、中间找不到」的位置偏置;RAG 重排与截断的实证依据。 §28

RAG5

RAG 检索增强生成retrieval-augmented generation

先从外部语料检索相关文档、拼进上下文再生成;知识可更新、可溯源,覆盖 Chunking → Embedding → Retrieval → Generation 全链路。 §29

Retriever / Generatorretriever, generator

RAG 的两件套:负责「找」的检索器(双塔编码 + 向量索引)和负责「写」的生成器;RAG 论文主张联合微调。 §29

Dense Retrieval / MIPSdense retrieval, MIPS

用向量内积找最相似文档(稠密检索),FAISS 等索引做最大内积搜索加速;REALM 让检索器在预训练中被端到端训出来。 §30

Reflection Tokens 反思令牌reflection tokens

Self-RAG 训进模型的自我评估标记:要不要检索、文档相关吗、有引用支撑吗;推理期可控的「自检」。 §31

Agentic RAGagentic rag

检索从「每次都做」变成模型多步决策的工具:查不查、查什么、结果够不够好、要不要换来源;CRAG 的质检流水线是其雏形。 §32

Agent3

Agent 智能体agent

让模型成为循环里的决策者:观察(读结果)→ 思考(规划)→ 行动(调工具)→ 再观察,直到完成任务;与「单次问答」的本质区别是多步与反馈。 §16 §33

Tool / Function Calling 工具调用tool use, function calling

把外部能力抽象成接口(Toolformer:文本进文本出;Function Calling:JSON Schema),由模型决定何时调用、传什么参数、结果如何接回。 §33 §35

Prompt Injection 提示注入prompt injection

用不可信内容(网页正文、工具返回值)劫持模型指令的安全风险;Function Calling 文档里「工具输出可能指挥模型」的警告即此。 §35 §34

多模态5

Contrastive Learning 对比学习contrastive learning

把配对的图文拉近、不配对的推远的表示学习;CLIP 用它把 4 亿图文对压进同一向量空间。 §36

Zero-shot 视觉分类zero-shot classification

类名当文本输入,图像与哪个类名最像就分给谁——分类器由文本塔「现造」,无需训练;CLIP 的王牌能力。 §36

Visual Instruction Tuning 视觉指令微调visual instruction tuning

用 GPT-4 生成的图文指令数据微调,让 LLM 学会「看着图听话」;LLaVA 的命名权贡献,连接件只是一个线性层。 §37

Q-Formerq-former

一组可学习的 query 从视觉特征里抽取固定 32 个向量的「摘要」,桥接冻结的视觉塔与 LLM;重架构路线的代表。 §38

System Card 与 Red-teamingsystem card, red-teaming

系统卡是模型发布时附的能力与风险评估文档;红队是发布前主动攻击自家模型找漏洞的流程,GPT-4V 系统卡是两者组合的范本。 §39 §11

评测6

Benchmark 基准benchmark

标准化考卷:固定数据集 + 固定指标;既是大模型的尺子,也是被「刷」和被污染的对象。 §40 §42

SOTAstate of the art

当前最好成绩;读论文时要问一句「哪个赛道内的 SOTA」——位置插值赛道内的 SOTA 不含系统级方案。 §27 §42

Human Baseline 人类基线human baseline

人类对照分数,判断「机器到没到人」的锚点;MMLU 的群众 34.5% 与专家 ~89.8% 是经典坐标。 §41 §40

Adversarial Filtering 对抗式过滤adversarial filtering

用模型自己筛数据、专留它分不清的样本来构造基准,让考卷随 SOTA 共同进化;HellaSwag 的方法论核心。 §41

Linear Probe 线性探针linear probe

冻结整个模型、只训一个线性分类头,用「一层线性层能读出什么」检验表示质量;CLIP 的主评测协议。 §36

Effective Robustness 有效鲁棒性effective robustness

分布外表现超出「由分布内分数可预测水平」的部分才算真鲁棒;CLIP 提出的 stricter 标准。 §36

ICP备案/许可证号:粤ICP备2026138155号