Lesson 0001 · Phase 1 地基 · 约 30 分钟

开源 LLM 解剖图:DeepSeek · GLM · Kimi

读完本课你将能:看懂任何开源模型的参数命名,指出三大旗舰各自的架构创新点

你的使命是读懂这些模型的底层原理。读懂的第一步不是钻进公式,而是先拿到一张地图:这些模型由什么组成、彼此差在哪里、创新发生在哪个部件上。本课就是这张地图。

一、2026 年开源旗舰格局

先看一张对照表。所有数据都来自官方仓库、config.json 或技术报告原文(链接在文末)——包括你亲手验证填上的两个格子。我们不填没有一手来源的数。

维度 DeepSeek-V3 GLM-4.5 Kimi K2
发布方 深度求索 智谱 Z.ai 月之暗面 Moonshot
参数(总-激活) 671B-A37B 355B-A32B(Air: 106B-A12B) 1T-A32B
架构 MoE 稀疏 MoE 稀疏 MoE 稀疏
注意力机制 MLA GQA + partial RoPE + QK-Norm MLA
MoE 专家配置 256 路由 + 1 共享 160 路由 + 1 共享(选 8) 384 路由选 8 + 1 共享
上下文长度 128K 128K(4.6 起 200K) 128K
训练亮点 FP8 全程训练 + MTP 混合思考 + MTP MuonClip 优化器,15.5T tokens
开源协议 MIT MIT Modified MIT
关键观察 三家厂商、三份独立的技术路线,最终却落在了同一组选择上:MoE 稀疏架构 + 32B 级激活参数 + 128K 长上下文。而且收敛得更细:GLM-4.5 论文的三方对照表显示,四家模型(含 Air)每 token 激活的路由专家数全部是 8——专家总数从 128 到 384 随意伸缩,但每个 token 消化的专家数锁死在同一档。这不是巧合——这就是当前"性能/成本"权衡的最优解附近。看懂"为什么大家都在这里会师",比记住数字重要得多。

二、共同骨架:拆开一个现代 LLM

把 DeepSeek-V3、GLM-4.5、Kimi K2 的外壳都拆掉,里面是同一个 Transformer 骨架。从下往上看:

输入文本"把这句中文翻译成英文……"
Tokenizer 分词文本 → token id 序列(BPE 算法,第 0002 课深入)
Embedding 查表每个 token id → 一个可学习向量;位置信息由 RoPE 在注意力层注入
× N 层(K2: 61 层)
RMSNorm → 自注意力 Attentiontoken 之间交换信息。创新聚集地①
DS: MLA K2: MLA GLM: GQA
RMSNorm → FFN / MoE逐 token 独立计算,知识的仓库。创新聚集地②
DS: MoE GLM: MoE K2: MoE
LM Head 输出向量 → 词表上每个 token 的概率。DeepSeek/GLM 在此挂 MTP 附加头

每个 Transformer 层 = "token 之间通信"(注意力)+ "每个 token 独立思考"(FFN/MoE)。这两半的分工,决定了创新集中爆发的两个位置:

三、三个名字,三个创新锚点

DeepSeek-V3 —— 效率极致主义

671B 总参数,每个 token 只激活 37B。三个关键词:MLA(把 KV Cache 压到极小)、DeepSeekMoE(256 个路由专家加 1 个共享专家的精细切分)、FP8 全程训练(在 2048 块 H800 上用低精度算力完成大模型训练的开源首例)。它证明了:架构效率可以替代蛮力算力。

GLM-4.5 —— 推理与智能体均衡

355B-A32B,另有轻量版 Air(106B-A12B)。特色是混合思考:同一个模型提供 thinking(先生成思维链再作答)和 non-thinking(直接作答)两种模式,按需切换。全系挂载 MTP 层用于推理加速。它的小兄弟 GLM-4.6 把上下文拉到 200K,GLM-4.7 则把这条路走到 coding/agent 场景的深水区。注意它的注意力选择:没有跟 DeepSeek/Kimi 的 MLA,而是 GQA + partial RoPE + QK-Norm(这个事实由你从论文原文一手验证)——同为"压缩 KV Cache",两条技术路线的分岔值得在注意力课上深挖。

Kimi K2 —— 万亿规模的暴力美学

1T 总参、32B 激活,是表中唯一破万亿的开源模型。384 个路由专家每 token 选 8 个(外加 1 个共享专家)。它最独特的是MuonClip 优化器——把学界新优化器 Muon 推到万亿规模并加上稳定性技术,在 15.5T tokens 上零训练崩溃跑完。它为 agentic(工具调用、自主执行)场景做了特化训练。

读懂命名法 355B-A32B 读作"总参数 355B,激活 32B"——A = Activated。以后你看到任何开源模型的名字,先找"A 前面的数"和"A 后面的数",模型的真实体量和推理成本就都在里面了。练习:Kimi K2 用这个格式应该写成什么?下面第 2 题见。

四、检索练习

不看上文,凭记忆作答。答错没关系——被纠正的记忆才记得牢

五、本周深读任务(一手来源)

主推资源 · 本周必做
  1. 验证作业(20 分钟):打开 Kimi K2 官方仓库的 Model Summary 表,逐行核对本课表格里 Kimi 的每一个数字。读一手来源的习惯,从这里开始建立。
  2. 填空作业(30 分钟):从 GLM-4.5 仓库或其技术报告找出两个"待验证"格子的答案。 ✓ 已完成(2026-09-14):注意力 = GQA + partial RoPE + QK-Norm;MoE = 160 路由 + 1 共享、每 token 选 8(论文表格,经 config.json 交叉核对)。DeepSeek-V3 与 Kimi K2 的专家配置也顺带从同一张表得到了交叉印证。
  3. 周末主听(1.5 小时)CS336 (Spring 2026) 第 3 讲 Architectures——斯坦福视角下的现代 LLM 架构选择,与我们今天的内容互相印证。

任何读不懂的地方——表格里的术语、没见过的缩写、甚至"为什么要这样做"的直觉疑问——直接在对话里问我。我是你的老师,追问是最好的学习方式。