Reference · 术语表 Glossary
开源大模型术语表(中英对照)
本术语表是全部课程与练习的统一语言。每学透一个概念,它才会被收录进来并给出最准确的中文定义。目前收录第一课《开源 LLM 解剖图》所需的核心术语。
一、模型骨架
- Transformer Transformer
- 以自注意力(self-attention)为核心层、堆叠而成的神经网络架构,是所有现代大语言模型的骨架。 Transformer 模型、GPT 结构
- 自注意力 Self-Attention
- 让序列中每个 token 都能直接"看到"并加权聚合其他所有 token 信息的机制,是 Transformer 相对 RNN 的本质优势。 注意力机制、attention layer(泛指时)
- 查询 / 键 / 值 Query / Key / Value (Q/K/V)
- 自注意力的三个投影:Q 表示"我在找什么",K 表示"我能提供什么标签",V 表示"我携带的信息本体"。 QKV 矩阵(泛指时)
- 前馈网络 Feed-Forward Network (FFN)
- Transformer 层中注意力之后的逐位置全连接子层,存储大部分参数与"知识"。现代模型一律用 SwiGLU 变体。 全连接层、MLP(与 MoE 对照时)
- SwiGLU SwiGLU
- FFN 的门控线性单元激活变体:用 SiLU 函数对一个线性分支做门控再相乘。DeepSeek、GLM、Kimi 的标配。 ReLU 层、激活函数(泛指时)
- 均方根归一化 RMSNorm
- LayerNorm 的简化版:只除以均方根、不减均值。计算更省、训练更稳,现代 LLM 的默认归一化。 归一化层、LayerNorm(指现代模型时)
- 旋转位置编码 Rotary Position Embedding (RoPE)
- 通过对 Q/K 做旋转变换来注入相对位置信息的位置编码方式,天然支持外推到更长上下文。 位置嵌入、PE(泛指时)
二、注意力变体与 KV Cache
- KV 缓存 KV Cache
- 自回归推理时缓存历史 token 的 K/V 投影、避免逐步重算的显存结构。是推理显存的主要开销之一。 缓存、上下文缓存(泛指时)
- 多头潜在注意力 Multi-head Latent Attention (MLA)
- DeepSeek 提出的注意力压缩方案:把 K/V 投影到低秩潜在向量后缓存,大幅压缩 KV Cache 显存。DeepSeek-V3 与 Kimi K2 均采用。 潜在注意力、压缩注意力
- 分组查询注意力 Grouped-Query Attention (GQA)
- 让多个 Q 头共享一组 K/V 头的注意力变体,以轻微质量损失换取 KV Cache 缩减,是 MLA 之前的的主流压缩方案。 共享 K/V 注意力
- QK-Norm Query-Key Normalization
- 在计算注意力分数之前对 Q、K 向量各自做 RMSNorm,把向量模长约束住,从而限制内积(attention logits = QKT/√d)的数值范围、防止 softmax 饱和与训练不稳定的技术。出处 Henry et al. 2020(2026-09-14 由学员定位核实);大模型时代复兴,GLM-4.5 大模型启用(
use_qk_norm: true),106B 的 Air 未启用。 歧义警示:与 logit soft-capping(直接裁剪分数)不同——QK-Norm 归一化的是向量,不是分数。 注意力正则化、分数裁剪
三、混合专家(本课重点)
- 混合专家 Mixture-of-Experts (MoE)
- 把 FFN 替换为多个并行"专家"网络、每个 token 只激活其中少数几个的稀疏架构——用小部分计算代价承载大得多的总参数量。2026 年旗舰开源模型的共同选择。 专家网络(泛指时)、MoE 模型(泛指时)
- 路由专家 Routed Expert
- 由门控网络按 token 动态选择的专家,每个 token 只走其中 top-k 个(如 Kimi K2 的 384 选 8)。
歧义警示:技术文档中的 "# Experts (total)" 通常指路由专家数、不含共享专家——GLM-4.5 论文表格与 config.json 的n_routed_experts均如此(160),共享专家另列为 1。读不同来源时先确认统计口径。 小专家、动态专家 - 共享专家 Shared Expert
- 不经门控、每个 token 必经的专家,专门承载所有 token 的共性知识,与路由专家输出相加。 公共专家、全局专家
- 门控 Gate / Router
- 为每个 token 给所有路由专家打分并选出 top-k 的小网络,是 MoE 稀疏性的决策者。 路由器、调度器
- 总参数 / 激活参数 Total Params / Activated Params
- MoE 模型的一对关键数字:总参数是所有专家加总的规模(决定显存需求),激活参数是每个 token 实际用到的规模(决定单 token 计算量)。命名惯例写作
总参-A激活,如355B-A32B。 模型大小(指 MoE 时不带 A 数字的都是不完整表述)
四、训练与推理
- 多 token 预测 Multi-Token Prediction (MTP)
- 训练时让模型同时预测后续多个 token 的目标扩展,能 densify 训练信号;推理时可复用为投机解码的草稿模块。DeepSeek-V3 与 GLM-4.5 均采用。 多步预测、并行解码
- 混合思考模式 Hybrid Thinking / Non-Thinking
- GLM-4.5 起采用的推理开关:复杂问题先生成思维链(thinking)再作答,简单问题直接作答(non-thinking)。 思维链模式(泛指时)、深度思考(营销说法)
- 缩放定律 Scaling Laws
- 模型能力随参数量、数据量、算力幂律提升的经验规律,是训练前规划"用多大模型吃多少数据"的依据。 规模法则(直译)、大模型定律
五、分词 Tokenization(第二课)
- 分词器 Tokenizer
- 文本 ↔ token id 的双向翻译器。用 BPE 从语料库造好并冻结,模型与词表绑定发行;训练与推理只读不改。 编码器(泛指时)、词典
- 字节对编码 Byte Pair Encoding (BPE)
- 确定性统计算法:从字符起步,反复合并语料中频次最高的相邻对,直到词表达到目标大小。无梯度无权重,同语料可逐字节复现;产物 = 有序合并规则表(merges)+ token→id 词表(vocab)。(2026-09-14 依据学员问答证据由老师收录) 神经分词、训练分词模型
- 字节级 BPE byte-level BPE
- 先把文本转 UTF-8 字节流再跑 BPE 的工业变体:任何输入必有 token 表示,彻底消除 OOV。词表记号 Ġ 表示空格、Ċ 表示换行。 字符级 BPE(术语混用)
- 词表 Vocabulary (vocab)
- token 字符串 → 整数 id 的映射表;其行数决定嵌入矩阵与输出分类头的宽度。GLM-4.5 约 15.2 万、Kimi K2 为 16 万、早期 Llama 2 仅 3.2 万——词表大小直接决定多语言文本的推理成本。 字典、embedding 表(后者是词表驱动的权重矩阵)
- 特殊 token Special Tokens
- 注册在词表里的控制符号:BOS/EOS/pad、聊天模板标记等,用于标记文档边界与对话结构。如 GLM 的
eos_token_id: [151336, 151338]。 保留字(误导)
收录规则
术语表只收你已理解的词——每学完一课,我会邀请你用自己的话给新术语下定义,定义合格才录入并在此后所有课程中统一使用(QK-Norm 由老师给出定义收录,依据是学员完成的出处核实与论文/config 分歧发现)。SFT、RLHF、GRPO、DPO 等后训练术语将在第三阶段课程中收录。