第 04 步 · 预测与采样
从概率分布里,挑出下一个 token
经过多层计算,模型为词表里的每一个可能 token 输出一个概率。最后一步,是按这个分布「采样」出一个 token,接回输入,再预测下一个。拖动 temperature,观察分布如何从确定变得发散。
Temperature 与采样
海面上升起一轮
温度越低,越倾向选概率最高的词;温度越高,冷门选项也有机会。
确定与创造之间的旋钮
模型原始输出的是每个 token 的分数(logits),经过 softmax 变成概率。Temperature 就作用在这一步:它在 softmax 之前缩放分数。
- 低温(→0):分布变尖锐,几乎总是选最高概率的词,结果稳定但可能单调。适合事实问答、代码。
- 高温(→1.5+):分布变平坦,罕见词也有机会被选中,结果更有创意但也更容易跑偏。适合头脑风暴、写作。
为什么会「幻觉」
注意:模型优化的是「下一个 token 像不像真话」,而不是「是不是真的」。当上下文缺少事实线索时,它依然会自信地采样出一个流畅的续写——这正是幻觉的来源,而不是某个可以简单修复的 bug。
循环,直到结束
选出的 token 被接回输入序列,模型再预测下一个,如此逐 token 循环,直到生成一个特殊的结束标记或达到长度上限。你在对话框里看到的逐字浮现,正是这个过程。