交互式讲解 · 语言模型

大语言模型,其实只在做一件事:预测下一个词

它没有记住答案,也不会检索数据库。它把文字拆成 token,为每一个可能的下一个 token 计算概率,然后一次一个地续写。下面这个演示,正是这个过程本身。

正在生成
今天天气

核心直觉

模型是一个巨大的概率函数

给定到目前为止的所有文字,模型输出「下一个 token 应该是什么」的概率分布。训练的全部意义,就是通过海量文本反复调整数十亿个参数,让这个分布越来越接近真实语言的规律。

原理全景

把「预测下一个词」拆开:它为何有效,又受制于什么

从训练到生成,再到能力与边界——这些机制共同解释了为什么模型能流畅写作,却也会自信地编造事实。

token 概率分布的抽象可视化
机制 · 概率

「幻觉」不是 bug,而是概率生成的副作用

当上下文里没有足够线索时,模型仍会选出概率最高的续写——它优化的是「像不像真话」,而不是「是不是真的」。

预训练示意图
机制 · 训练

预训练:从海量文本里自学语言规律

把互联网规模的文本反复喂给模型,让它通过「遮住下一个词再猜」不断调整参数,无需人工标注答案。

自回归循环示意图
机制 · 生成

自回归:一次只写一个词,再回头看

每生成一个 token,就把它接回输入,作为预测下一个 token 的依据。你看到的逐字浮现,正是这个循环。

Transformer 架构示意图
机制 · 架构

Transformer:并行地读完整段话

不同于逐字阅读的旧模型,注意力机制让每个位置同时参考全序列,再堆叠几十层不断精炼理解。

位置编码示意图
机制 · 架构

位置编码:让模型分得清词序

注意力本身对顺序不敏感,「猫追狗」和「狗追猫」需要额外的位置信息来区分先后。

上下文窗口示意图
机制 · 上下文

上下文窗口决定它能「看多远」

模型每次只能处理固定长度的 token。超出窗口的内容会被截断,也就被「遗忘」。

temperature 采样曲线
机制 · 采样

Temperature 调节确定与创造

低温让输出更稳定可预测,高温带来更多样也更冒险的表达;Top-p / Top-k 则限定候选范围。

指令微调与 RLHF 示意图
机制 · 对齐

指令微调 & RLHF:从「会续写」到「会听话」

预训练只让模型会接话。再用人类示范与偏好反馈微调,它才学会遵循指令、变得有用且更安全。

规模与涌现示意图
机制 · 规模

规模定律与涌现能力

参数、数据、算力越大,效果越好;到某个规模,推理、翻译等能力会突然「涌现」出来。

知识截止示意图
边界 · 时效

知识截止:它停在训练那一刻

模型的知识是训练时的快照,不会自动更新。要获取最新信息,需要联网检索或外部工具补充。

无状态记忆示意图
边界 · 记忆

无状态:它本身并不「记得」你

模型每次只是读入当前这段上下文。所谓「记忆」,其实是把历史对话重新塞回输入里造成的效果。

术语表

几个反复出现的词

把常见术语放在一起,方便随时回查。按「基础概念 → 架构与训练 → 生成与使用」大致排序。

Token
文本被切分后的最小处理单元,可能是一个完整词、词根或几个字符。模型的输入输出都以 token 计。
词表(Vocabulary)
模型认识的所有 token 的集合,每个 token 对应一个整数编号,规模通常在数万到十几万之间。
嵌入(Embedding)
把 token 编号映射成的高维向量,让「意思相近」变成「距离相近」,是后续计算的基础。
参数(Parameter)
模型在训练中学到的可调数值,规模从数十亿到上万亿不等,共同决定了它的行为。
Transformer
当前主流的模型架构,核心是让每个 token 通过注意力机制关注上下文,并堆叠多层。
注意力(Attention)
为每一对 token 计算关联权重的机制,决定当前词在多大程度上「参考」句中其他词。
预训练(Pretraining)
用海量文本以「预测下一个词」自监督学习的第一阶段,让模型掌握通用语言规律。
微调 & RLHF
在预训练之后,用人类示范与偏好反馈进一步训练,让模型学会遵循指令、更有用也更安全。
上下文窗口(Context Window)
模型单次能处理的最大 token 数量。超出的内容会被截断,也就被「遗忘」。
推理(Inference)
模型完成训练后,实际根据输入逐个生成 token 的运行过程。
Logits & Softmax
模型对每个候选 token 输出的原始分数(logits),经 softmax 归一化成概率分布。
Temperature
采样前缩放概率分布的参数:低温更确定稳定,高温更多样也更冒险。
Top-p / Top-k
两种截断采样策略:只在累计概率前 p 或概率最高的 k 个候选里采样,过滤长尾噪声。
幻觉(Hallucination)
模型生成流畅但不真实的内容。它优化的是「像不像真话」,而非「是不是真的」。
知识截止(Knowledge Cutoff)
模型知识停留在训练数据的时间点,之后的事件需靠联网检索或外部工具补充。
提示词(Prompt)
提供给模型的输入文本,包括指令、上下文与问题,直接影响输出质量。

理解了原理,就能更好地使用它