为什么AI会一本正经地编造答案

当一个语言模型被问到某位作家在某一年获得了什么奖项,它可能流畅地给出颁奖机构、获奖理由,甚至补上一句恰到好处的评价。整段回答语气笃定、格式工整,唯一的问题是:这件事从未发生过。这种"说得越顺、越像真的"的编造,正是生成式模型最值得警惕的特性,而要理解它为什么会"一本正经",关键在于看清模型究竟在做什么。

它在接话,而不是在查证

当前的生成式语言模型,核心机制是根据已经出现的文字预测下一个最可能出现的词,再逐词续写。它从大量文本中学会了词语搭配、句子结构和常见知识的表达习惯,却并不具备一个独立的"核实此事是否为真"的环节。这意味着,模型追求的是语言上的通顺与合理,而通顺和正确是两件事。

可以把它类比成一个读过极多书、语感极好的人,在不翻书的情况下凭印象答题。当他确实知道答案时,回答既流畅又准确;当他其实没有把握时,语言的惯性仍会推动他补全出一个"听上去对"的答案。模型的训练目标是尽量满足提问、把话说完整,因此面对自己并无可靠信息的问题,它往往不会停下来承认不知道,而是直接给出一个格式漂亮的回答。

为什么自信不等于可信

真正让人上当的,是错误答案常常和正确答案拥有同样的语气、同样的格式、同样的笃定。流畅度会掩盖事实性的缺陷,而模型没有任何机制主动提示"这部分我其实不确定"。所以用"读起来顺不顺、专不专业"来判断可靠性,这个直觉在面对 AI 时会直接失效——语气自信只说明语言组织得好,附带的"出处"和数据本身也可能是一并编造出来的。

幻觉的分布并不均匀。需要精确事实的问题(具体日期、数字、冷门细分话题)、要求提供引用或出处的场景,以及把多个真实片段组合推理的任务,最容易出错;而解释通用概念、改写、整理结构这类更依赖语言能力的任务,风险相对可控。

把语言模型当成高效但需要复核的助手,而不是无条件信任的权威,是面对这一特性最务实的态度。对任何关键事实独立查证、把复杂问题拆成小步、在不同来源之间交叉比对,这些方法不能让幻觉彻底消失,却能把被误导的风险压到可接受的范围。需要清楚的是,再精巧的提问方式也只能降低概率,而无法改变"预测语言"这一本质,因此独立核实的习惯始终不能省。

文章版权归作者所有,未经允许请勿转载。

本文链接:https://www.chatcpt.com.cn/thread/why-ai-hallucinates/

参与讨论

0 条评论