检索增强生成(RAG)的回答质量,往往先由“找到了什么资料”决定,而不是由模型如何组织语言决定。外部资料筛选的目标,不是把尽可能多的文本塞进上下文,而是为当前问题挑出相关、可信、可核查且足以支撑回答的证据。
首先要判断相关性。资料与问题共享关键词,不代表真正回答了问题;筛选时应关注它是否覆盖问题中的对象、条件和时间范围。比如问题询问某项规则在特定情境下是否适用,只有谈论该规则、且涵盖该情境的材料才有直接价值。宽泛背景可以辅助理解,但不应挤掉关键证据。
其次要评估来源与适用范围。资料应能说明发布者、形成时间、适用对象及其边界。权威性不是脱离问题的固定标签:正式文件适合核对规则,实践说明可能更能解释操作方式,但二者不能互相替代。若材料适用范围不明,或把局部经验写成普遍结论,就应降低其作为回答依据的权重。
筛选还要处理时效与冲突。不同资料可能对应不同时间、版本或定义,不能只因措辞相似就合并成同一结论。应保留必要的时间背景,并检查来源之间是否真的矛盾,还是讨论范围不同。冲突无法消解时,模型应呈现差异与不确定性,而不是挑选一段最顺耳的文字。
最后,相关资料需要保留可追溯的出处和足够上下文。只截取一句话,容易丢掉限定条件;整份长文全部送入模型,又可能让关键证据淹没在噪声中。较稳妥的筛选单位,是能独立表达一个事实或判断、同时保留其适用条件的片段。这样既便于模型引用,也便于读者回到原文核验。
因此,RAG 的资料筛选应围绕“这段内容能否支撑当前判断”展开。相关性决定是否纳入,来源与边界决定可信程度,出处和上下文则决定答案能否被检查。
文章版权归作者所有,未经允许请勿转载。
本文链接:https://www.chatcpt.com.cn/thread/rag-document-selection/
参与讨论
暂无评论,快来发表你的观点吧!