课程 · 科普 / 马克的技术工作坊 / 10:31

Token 到底是什么?

揭秘大模型背后的“文字压缩术” —— 从 Context Window 到 BPE 训练全流程
观看原视频 本 deck 由 video2slides 索引文档渲染 · 时间角标可跳回原片对应时刻
01 / 19
01

开场:40 万 Token 之问

Context Window 代表模型一次能处理的最大信息量,但它的单位是 Token 而非字——Token 是什么、怎么生成,是本片要讲透的问题。

00:00 – 00:37
02 / 19
Context Window 与 40 万 Token 代理画质
01 · 开场

Context Window 的单位是 Token,不是字

GPT-5.2 的 40 万 context window 指 40 万个 Token;Token 与字、词的关系少有人讲清。

「它代表了模型一次能够处理的最大信息量」—— 00:03
00:18
03 / 19
02

大模型的基本工作原理

模型只认数字,人与模型之间必须有翻译官 Tokenizer,负责编码(文字→数字)与解码(数字→文字)。

00:37 – 03:06
04 / 19
大模型只认数字 代理画质
02 · 工作原理

模型只认数字:翻译官 Tokenizer

大模型本质是巨大的数学函数,输入输出全是数字;Tokenizer 站在人与模型之间,负责编码与解码两个环节。

「这个翻译官的名字就叫做 Tokenizer」—— 00:53
00:41
05 / 19
编码环节:切分
02 · 工作原理

编码环节:切分 + 映射

编码分两步:先把问题切成最小单位 Token(示例切出 4 个),再把每个 Token 映射为一一对应的 Token ID——硬币的正反面。

「第一步,切分」—— 01:30
01:36
06 / 19
解码环节全流程
02 · 工作原理

模型运算与解码环节

Token ID 列表交给模型运算,吐出的 Token ID 再由 Tokenizer 解码映射回文字;解码无需切分。切分与映射如何实现?这要从 Tokenizer 的训练说起。

「这次发挥作用的就是解码环节了」—— 02:17
02:33
07 / 19
03

Tokenizer 的训练过程(BPE)

Tokenizer 是训练出来的:以 BPE 为例,从训练材料统计共现,迭代合并高频相邻字,产出词表与合并规则两个核心组件。

03:06 – 07:42
08 / 19
Unigram 与 BPE
03 · 训练过程

Tokenizer 是训练出来的:Unigram 与 BPE

训练远比大模型训练简单;Google 多用 Unigram,OpenAI 和 Anthropic 多用 BPE,本片以 BPE 演示。

「Tokenizer 其实是被训练出来的」—— 03:09
03:09
09 / 19
词表初始化
03 · 训练过程

词表初始化:单字入表,Token ID 只是编号

所有出现过的单字进词表,逐个分配 Token ID;Token ID 无语义,与 Embedding 无关,仅需保证一对一。

「它就是个编号而已」—— 04:20
04:14
10 / 19
单字词表映射
03 · 训练过程

单字词表可用但低效:目标是词级 Token

单字词表已是简易 Tokenizer,但 9 字输入远慢于 4 词输入;把常见词收进词表才是最佳方案,方法是找规律。

「让这些常见的词作为 Token 才是最佳方案」—— 05:19
05:07
11 / 19
BPE 训练完毕:词表与合并规则 代理画质
03 · 训练过程

BPE 迭代合并:智能 → 人工 → 人工智能

扫描统计共现频率,最高者合并并同步更新词表与合并规则;合并产物可继续参与合并,训练完毕后核心组件即词表 + 合并规则。

「它的核心组件就是词表和合并规则」—— 07:34
07:31
12 / 19
04

Tokenizer 的使用过程

回到运行流程:编码阶段先按合并规则完成切分、再查词表完成映射;解码只做反向映射。

07:42 – 09:27
13 / 19
04 · 使用过程

编码·切分:逐条应用合并规则

STEP 1

把用户问题先拆成一个一个的单字。

STEP 2

按训练所得合并规则的顺序逐条套用:智+能→智能,人+工→人工。

STEP 3

合并可叠加:人工+智能→人工智能;喜+欢→喜欢,马+克→马克。

STEP 4

「马克喜欢人工智能吗」9 个字最终切分为 4 个 Token。

「再把之前训练好的合并规则拿过来」—— 08:01
07:45
14 / 19
映射查词表
04 · 使用过程

编码·映射与解码:查词表

映射即查词表取 Token ID(马克→35、喜欢→36);解码反向查表,36 映射回“喜欢”,全流程闭环。

「发现 36 对应的是“喜欢”这两个字」—— 09:17
09:05
15 / 19
05

Token 与字数的换算关系

Tokenizer 既是翻译机也是压缩机;1 Token ≈ 1.5–2 个汉字或 0.75 个英文单词,40 万 Token ≈ 60–80 万汉字。

09:27 – 10:31
16 / 19
40 万 Token ≠ 40 万字
05 · 换算关系

Tokenizer 是压缩机:9 字变 4 Token

常在一起的字被合成一个 Token,输入更少、训练与推理效率更高——回答了开头 Token ≠ 字的疑问。

「它还是一个压缩机」—— 09:41
09:31
17 / 19
05 · 换算关系

换算法则:1 Token ≈ 1.5–2 汉字

1.5–2

1 个 Token 大概能代表的汉字

4 / 0.75

≈ 4 个英文字母,或 0.75 个英文单词

60–80 万

40 万 Token 的 Context Window 约合的汉字量(≈ 30 万英文单词)

「一个 Token 大概能够代表 1.5 到 2 个汉字」—— 09:59
09:57
18 / 19
回顾

Token = 文字的压缩单位

Tokenizer 用词表 + 合并规则完成编码与解码;它既是翻译机,也是压缩机。
回看原视频 马克的技术工作坊 · 用最通俗的语言,讲最硬核的技术
19 / 19
← → 翻页 · 空格下一页 · E 编辑文字