大语言模型的下一个词预测机制

当一个语言模型回答问题时,它并没有在"调取"某条事实,而是在根据已经出现的文字,逐步推算下一个最可能出现的词。这个被称作下一个词预测的机制,是当前生成式语言模型最核心的运作方式。理解它,是理解模型能力边界的起点,也是理解它为何会流畅地说错话的关键。

模型从海量文本中学到的,并不是一个个孤立的知识条目,而是词语之间的搭配规律、句子的组织方式,以及常见表达在特定语境下的出现概率。当输入一段文字后,模型会对词表中所有可能的下一个词给出一个概率分布,再从中选出或采样出一个词,把它拼接到已有文本之后,然后以更新后的序列为基础继续预测。整段回答,就是这样一个词接一个词、逐步续写出来的结果。

续写不等于查证

这种机制可以类比成一个读过极多书、语感极好的人,在不翻书的情况下凭印象接话。他清楚"这类问题通常会这样回答",于是顺着语言的惯性往下说。当他确实知道答案时,输出既通顺又正确;当他其实并不确定时,语言惯性依然会推着他给出一个"听上去对"的答案。模型的问题正在于此:它优化的目标是语言上的连贯,而不是事实上的真伪。通顺和正确,本就是两件事。

正因为如此,模型往往倾向于补全出一个格式工整的回答,而不是停下来承认不知道。在它学到的语言模式里,给出一个具体答案通常比留白更符合对话的习惯。错误的输出和正确的输出,可能拥有同样肯定的语气、同样规范的格式。

概率机制决定了薄弱环节

把握了这个机制,就能预判它在哪些场景更容易出问题。需要精确事实的任务,比如具体日期、数字、引用来源,高度依赖准确记忆,而预测机制并不保证记忆的精确;训练数据中本就稀少的冷门话题,模型缺乏可供续写的稳定模式,只能靠猜测补齐;多步推理的任务中,任何一步接错,后续的续写都会沿着错误方向越走越远。相对地,解释通用概念、改写文字、整理结构这类更依赖语言组织能力的任务,预测机制反而发挥得更稳。

认识到输出是"预测"而非"检索"的产物,也就明白了一个判断原则:模型的流畅与自信,来自它对语言模式的拟合程度,与内容是否属实没有直接关系。它没有一个独立机制告诉你哪部分其实没有把握。因此,面对任何可验证的具体信息,把语言表现与事实核查分开看待,始终是使用这类工具时最稳妥的习惯。

文章版权归作者所有,未经允许请勿转载。

本文链接:https://www.chatcpt.com.cn/thread/next-token-prediction/

参与讨论

0 条评论