LLM-as-Judge 位置偏见:为什么答案顺序会影响评分以及如何缓解
本文以自动评估问答系统为场景,解释 LLM-as-Judge 中位置偏见(答案顺序影响评分)的成因,分析注意力机制与训练数据的影响,对比交换位置、多次采样、校准评分等缓解策略,并讨论评估偏差对模型迭代决策的误导风险。
共 2 篇文章
本文以自动评估问答系统为场景,解释 LLM-as-Judge 中位置偏见(答案顺序影响评分)的成因,分析注意力机制与训练数据的影响,对比交换位置、多次采样、校准评分等缓解策略,并讨论评估偏差对模型迭代决策的误导风险。
在自动评估问答质量时,用大模型当裁判会引入位置偏见和冗长偏好,导致评分随答案顺序或长度变化,扭曲模型对比结果。本文以企业知识库问答评估为场景,剖析这两种偏差的成因,对比交换位置、校准评分等缓解策略,并讨论它们对排行榜和迭代决策的误导风险。