TAG

#RAG

共 13 篇文章

上下文位置偏置:为什么大模型对长文档中间信息“视而不见”?

本文以长文档问答为场景,解释大模型对上下文不同位置信息利用率差异的现象,即“Lost in the Middle”问题。分析注意力分布与训练数据截断等成因,对比截断、重排、检索增强等缓解策略,并讨论在RAG流水线中的工程取舍,帮助读者理解并应对长上下文利用的挑战。

RAG-Fusion 与混合检索:多路召回如何通过倒数排名融合提升检索质量?

以企业知识库问答为场景,解释 RAG-Fusion 如何结合向量检索与 BM25 等多路召回,通过倒数排名融合(RRF)合并结果,并对比重排序(Rerank)的差异。分析 RRF 的数学原理、参数敏感性(k 值)、融合策略对召回率和精度的影响,讨论在 RAG 流水线中的部署位置与性能开销。

提示注入如何穿透 RAG 检索上下文:从间接注入到防御性提示的失效边界

本文以企业知识库问答为场景,剖析间接提示注入如何通过检索到的文档内容劫持模型行为,对比其与直接注入的差异,拆解攻击载荷的构造原理,并解释提示隔离、输入过滤、权限控制等现有防御为何失效,最后给出可操作的检测与缓解策略。

Graph RAG 如何通过知识图谱增强大模型的多跳推理与事实一致性

本文以医疗问答为场景,解析 Graph RAG 如何通过知识图谱的结构化信息解决传统 RAG 在多跳问答中的推理断裂与幻觉问题。内容涵盖图构建、实体链接、图检索与推理路径生成,对比向量检索与 Text-to-Cypher,并讨论索引更新、查询延迟与领域迁移的工程权衡。

重排序模型在 RAG 中的精度-延迟权衡:交叉编码器与双编码器的对比

本文聚焦 RAG 检索后重排序阶段,以多路召回融合为场景,对比交叉编码器(如 BGE-reranker)与双编码器在精度和延迟上的差异。通过分析级联架构、模型蒸馏与批处理优化,解释重排序如何缓解“中间丢失”问题,帮助读者在工程实践中做出权衡。