第 04 步 · 预测与采样

从概率分布里,挑出下一个 token

经过多层计算,模型为词表里的每一个可能 token 输出一个概率。最后一步,是按这个分布「采样」出一个 token,接回输入,再预测下一个。拖动 temperature,观察分布如何从确定变得发散。

Temperature 与采样

海面升起一轮

温度越低,越倾向选概率最高的词;温度越高,冷门选项也有机会。

确定与创造之间的旋钮

模型原始输出的是每个 token 的分数(logits),经过 softmax 变成概率。Temperature 就作用在这一步:它在 softmax 之前缩放分数。

  • 低温(→0):分布变尖锐,几乎总是选最高概率的词,结果稳定但可能单调。适合事实问答、代码。
  • 高温(→1.5+):分布变平坦,罕见词也有机会被选中,结果更有创意但也更容易跑偏。适合头脑风暴、写作。

为什么会「幻觉」

注意:模型优化的是「下一个 token 像不像真话」,而不是「是不是真的」。当上下文缺少事实线索时,它依然会自信地采样出一个流畅的续写——这正是幻觉的来源,而不是某个可以简单修复的 bug。

循环,直到结束

选出的 token 被接回输入序列,模型再预测下一个,如此逐 token 循环,直到生成一个特殊的结束标记或达到长度上限。你在对话框里看到的逐字浮现,正是这个过程。