Lesson 0001 · Phase 1 地基 · 约 30 分钟
开源 LLM 解剖图:DeepSeek · GLM · Kimi
你的使命是读懂这些模型的底层原理。读懂的第一步不是钻进公式,而是先拿到一张地图:这些模型由什么组成、彼此差在哪里、创新发生在哪个部件上。本课就是这张地图。
一、2026 年开源旗舰格局
先看一张对照表。所有数据都来自官方仓库、config.json 或技术报告原文(链接在文末)——包括你亲手验证填上的两个格子。我们不填没有一手来源的数。
| 维度 | DeepSeek-V3 | GLM-4.5 | Kimi K2 |
|---|---|---|---|
| 发布方 | 深度求索 | 智谱 Z.ai | 月之暗面 Moonshot |
| 参数(总-激活) | 671B-A37B | 355B-A32B(Air: 106B-A12B) | 1T-A32B |
| 架构 | MoE 稀疏 | MoE 稀疏 | MoE 稀疏 |
| 注意力机制 | MLA | GQA + partial RoPE + QK-Norm | MLA |
| MoE 专家配置 | 256 路由 + 1 共享 | 160 路由 + 1 共享(选 8) | 384 路由选 8 + 1 共享 |
| 上下文长度 | 128K | 128K(4.6 起 200K) | 128K |
| 训练亮点 | FP8 全程训练 + MTP | 混合思考 + MTP | MuonClip 优化器,15.5T tokens |
| 开源协议 | MIT | MIT | Modified MIT |
二、共同骨架:拆开一个现代 LLM
把 DeepSeek-V3、GLM-4.5、Kimi K2 的外壳都拆掉,里面是同一个 Transformer 骨架。从下往上看:
每个 Transformer 层 = "token 之间通信"(注意力)+ "每个 token 独立思考"(FFN/MoE)。这两半的分工,决定了创新集中爆发的两个位置:
- 注意力层的痛点是推理时 KV Cache 吃显存 → DeepSeek 用 MLA 压缩它;
- FFN 层的痛点是参数量被计算量锁死 → 三家全部用 MoE 拆解它。
三、三个名字,三个创新锚点
DeepSeek-V3 —— 效率极致主义
671B 总参数,每个 token 只激活 37B。三个关键词:MLA(把 KV Cache 压到极小)、DeepSeekMoE(256 个路由专家加 1 个共享专家的精细切分)、FP8 全程训练(在 2048 块 H800 上用低精度算力完成大模型训练的开源首例)。它证明了:架构效率可以替代蛮力算力。
GLM-4.5 —— 推理与智能体均衡
355B-A32B,另有轻量版 Air(106B-A12B)。特色是混合思考:同一个模型提供 thinking(先生成思维链再作答)和 non-thinking(直接作答)两种模式,按需切换。全系挂载 MTP 层用于推理加速。它的小兄弟 GLM-4.6 把上下文拉到 200K,GLM-4.7 则把这条路走到 coding/agent 场景的深水区。注意它的注意力选择:没有跟 DeepSeek/Kimi 的 MLA,而是 GQA + partial RoPE + QK-Norm(这个事实由你从论文原文一手验证)——同为"压缩 KV Cache",两条技术路线的分岔值得在注意力课上深挖。
Kimi K2 —— 万亿规模的暴力美学
1T 总参、32B 激活,是表中唯一破万亿的开源模型。384 个路由专家每 token 选 8 个(外加 1 个共享专家)。它最独特的是MuonClip 优化器——把学界新优化器 Muon 推到万亿规模并加上稳定性技术,在 15.5T tokens 上零训练崩溃跑完。它为 agentic(工具调用、自主执行)场景做了特化训练。
355B-A32B 读作"总参数 355B,激活 32B"——A = Activated。以后你看到任何开源模型的名字,先找"A 前面的数"和"A 后面的数",模型的真实体量和推理成本就都在里面了。练习:Kimi K2 用这个格式应该写成什么?下面第 2 题见。
四、检索练习
不看上文,凭记忆作答。答错没关系——被纠正的记忆才记得牢。
五、本周深读任务(一手来源)
- 验证作业(20 分钟):打开 Kimi K2 官方仓库的 Model Summary 表,逐行核对本课表格里 Kimi 的每一个数字。读一手来源的习惯,从这里开始建立。
填空作业(30 分钟):从 GLM-4.5 仓库或其技术报告找出两个"待验证"格子的答案。✓ 已完成(2026-09-14):注意力 = GQA + partial RoPE + QK-Norm;MoE = 160 路由 + 1 共享、每 token 选 8(论文表格,经 config.json 交叉核对)。DeepSeek-V3 与 Kimi K2 的专家配置也顺带从同一张表得到了交叉印证。- 周末主听(1.5 小时):CS336 (Spring 2026) 第 3 讲 Architectures——斯坦福视角下的现代 LLM 架构选择,与我们今天的内容互相印证。
任何读不懂的地方——表格里的术语、没见过的缩写、甚至"为什么要这样做"的直觉疑问——直接在对话里问我。我是你的老师,追问是最好的学习方式。